﻿课程数据分析｜综合课程作品集
版本：2026-09-20-portfolio-v1

作品围绕多源数据清洗、统计口径、时间序列验证与商业决策展开。以下列出六组案例的输入、方法、结果与适用范围。表格、图表和计算代码随包提供。

数据与分析范围
62个CSV、XLSX及RDS文件按SHA-256归并为39份不同数据资产，共40张数据表。全部完成行列数、字段类型、缺失值与重复候选检查；其中六组提供详细计算结果。其他材料的结构检查不等于完成其全部模型分析。
4份RDS数据分别为Chicago 186行1列、Energy 4,107行24列、Price 46行3列、Stock 4,107行24列，列数不含时间索引。数值无缺失，时间索引有序且不重复。Chicago有101条数值相同的额外记录，但日期不同，因此保留。解析保留xts时间索引与多变量ts的tsp属性；原指数模型不在本包计算范围内。

一、沉船档案｜加权覆盖率与缺失分析
输入：wreck_inventory.csv，共17,981条记录。
方法：按十年汇总记录数、坐标记录数和不同分类数；坐标覆盖率=该十年有坐标的记录数/该十年总记录数。3,303条缺失年份的记录单独列示。
结果：3,564条有坐标，整体覆盖率19.82%。1910年代共1,271条记录，按记录数加权的覆盖率49.57%；直接平均各年覆盖率为29.41%，相差20.15个百分点。21个十年分组会受百分比汇总方式影响。
解释：年份的样本量不同，不能直接平均百分比。覆盖率衡量档案完整性，不用于推断地区沉船风险或真实事故率。
结果文件：02_wreck_decade_coverage.csv、02_wreck_coverage.csv、charts/wreck_coverage.svg。

二、游戏改编电影｜多值字段清洗与财务口径
输入：game_films.csv，共439行，其中1条为完全相同的Undated占位记录。主分析使用438条互异记录；记录数不等同于已核实的独立电影数。
方法：发行商字段按字面分隔符拆分，显式设置regex=False，清除首尾空格，并在每条电影记录内对同一机构只计一次。正则拆分会错误切开机构名称中的空格。
结果：Nintendo 38条、Capcom 31条、The Pokémon Company 28条、Sega 23条、Ubisoft 19条。
财务分析限定在相同美元符号的子集中；通过正值与预算上下限检查后，共60条可比较记录。未自行换汇，币种符号的地区含义以原来源为准。票房/预算是收入与预算比值，不等同于利润率。
结果文件：03_film_publisher_counts.csv、03_film_currency_coverage.csv、03_film_financial_summary.csv、charts/film_publishers.svg。

三、奥运历史数据｜参赛记录、人数与奖牌口径
输入：olympics.csv，共271,116条参赛记录，135,571名不同ID的运动员。
方法：参赛记录按行计数，人数按运动员ID去重；身高、体重与获奖状态分别处理。
结果：铁人三项为529条参赛记录、355名运动员、30条获奖记录，其中526条身高体重齐全。2016夏季奥运女性运动员占比45.03%，分母为该届不同运动员人数。
重复候选检查：1,385条字段完全相同的候选中，1,315条来自艺术竞赛。现有字段无法区分重复录入与不同作品，主分析保留原始口径，同时提供269,731条互异记录的敏感性口径。
解释：medal空值表示未获奖，与身高体重缺失的含义不同。团队项目会产生多条获奖运动员记录，不能直接汇总为官方国家奖牌榜。
结果文件：01_olympics_participation.csv、01_olympics_duplicate_candidates.csv、01_olympics_triathlon.csv。

四、Cass货运指数｜时间验证与基线比较
输入：cass_dspi_data.csv，2016-01至2026-04，共124个连续月。
方法：比较naive、seasonal_naive、seasonal_mean_3y、seasonal_trend_5y、drift五种透明基线。以52、64、76个月为三个训练截点，分别预测后24个月；验证窗口均不超过2024-04，以72个验证步的汇总RMSE选型。窗口有重叠，不将其视为72个独立样本。
结果：三年季节均值在验证阶段入选，验证RMSE=0.071196；2024-05至2026-04最终测试RMSE=0.140588、MAE=0.134678。预先固定的季节朴素基线最终RMSE=0.090818。所选模型未优于基线，历史验证优势未延续到最终区间；最终测试不再用于选型。
研究范围：这是既有历史快照的回溯分析。最终区间已出现在原有分析材料中，不构成前瞻盲测。比较范围不包含完整ARIMA/ARIMAX网格；未来DSPI可得性及历史修订版本未确认，因此没有将最终区间DSPI观测值直接用作未来输入。
预测文件：以2026-04为起点，输出2026-05至2028-04的24个月练习预测，范围0.959667至1.106000；不代表2026-09最新预测，未附未经检验的置信区间。
单位与来源：FRED官方Cass系列为1990年1月=1、月频、未季调；原始数据版权属Cass。公开包保留指标与派生预测，不再分发逐月历史观测。来源：https://fred.stlouisfed.org/series/FRGSHPUSM649NCIS 。
结果文件：04_cass_validation_folds.csv、04_cass_validation_models.csv、04_cass_final_test_metrics.csv、04_cass_revised_forecast.csv、charts/cass_validation.svg。

五、合成问卷｜模型标签下的回答分布
输入：synthetic_survey_data.csv，300条合成记录、6道1至5分题目；两个文件标签各150条。无缺失，RespondentID唯一，题目取值均在1至5之间。
方法：按文件中的模型标签分组，以每组150×6=900次题目回答为分母。中点回答定义为3分，极端回答定义为1或5分。
结果：GPT-4o标签的中点回答率44.89%、极端回答率6.33%；Claude Sonnet标签分别为32.22%和19.11%。12个题目均值与源汇总表一致。
解释范围：文件未附完整提示词、调用日志、确切模型版本与原始响应，名称仅作为文件组别标签。均匀分布20%的中点率不是已知的真人基准；这些结果不用于推断RLHF因果机制、真实人群分布或真人调查的显著性。
结果文件：05_synthetic_descriptives.csv、05_synthetic_distributions.csv、05_synthetic_model_summary.csv、charts/synthetic_midpoint.svg。

六、州营商环境｜PCA与偏好敏感性
输入：cnbc_2025_rev.csv，50州、10个名次字段，与ranked_states.csv逐州逐列一致。
方法：采用总体标准差做z标准化，通过SVD进行PCA；按指定权重计算综合分数，并为每个权重独立施加0.8至1.2倍的均匀扰动。固定随机种子20260920，共1,000个场景。
结果：前四个主成分解释79.8648%的方差；原权重下前三位依次为North Carolina、Virginia、Texas。前两州在全部扰动场景进入前三，Texas在85.5%的场景进入前三。Virginia技术创新原始名次为第8。
解释范围：入围比例描述指定偏好场景下的稳定性，不是统计置信概率。名次作为数值距离参与PCA属于探索性近似，综合分数不意味着客观唯一的最佳选址。本包包含PCA及权重分析，不包含K-Means聚类验证。
结果文件：06_states_pca_variance.csv、06_states_pca_directions.csv、06_states_preference_sensitivity.csv。

文件与复现
公开包含21份汇总CSV、4幅SVG图、字段字典、来源哈希、Python计算脚本、环境说明及验证结果。逐条原始记录不随包分发；完整复算需取得合法且匹配的输入快照，具体步骤见README_先看这里.txt。
其余数据的结构检查与处理范围见00_review_scope.csv。例如，Pregnancy的545条重复候选可能是不同人的相同特征，brands1的36条也不能据此直接删除；airquality的1,880个缺失值不按污染为零填补。

计算检查
verification.json记录86项通过、0项失败，涵盖快照维度、唯一键、时间连续性、分类取值、分母对账、发行商拆分、问卷均值、州分数、PCA方差与重构误差。它们验证计算一致性；各案例的来源、模型适用范围与业务解释仍以上文说明为准。
