课程数据分析|综合课程作品集 版本:2026-09-20-portfolio-v1 作品围绕多源数据清洗、统计口径、时间序列验证与商业决策展开。以下列出六组案例的输入、方法、结果与适用范围。表格、图表和计算代码随包提供。 数据与分析范围 62个CSV、XLSX及RDS文件按SHA-256归并为39份不同数据资产,共40张数据表。全部完成行列数、字段类型、缺失值与重复候选检查;其中六组提供详细计算结果。其他材料的结构检查不等于完成其全部模型分析。 4份RDS数据分别为Chicago 186行1列、Energy 4,107行24列、Price 46行3列、Stock 4,107行24列,列数不含时间索引。数值无缺失,时间索引有序且不重复。Chicago有101条数值相同的额外记录,但日期不同,因此保留。解析保留xts时间索引与多变量ts的tsp属性;原指数模型不在本包计算范围内。 一、沉船档案|加权覆盖率与缺失分析 输入:wreck_inventory.csv,共17,981条记录。 方法:按十年汇总记录数、坐标记录数和不同分类数;坐标覆盖率=该十年有坐标的记录数/该十年总记录数。3,303条缺失年份的记录单独列示。 结果:3,564条有坐标,整体覆盖率19.82%。1910年代共1,271条记录,按记录数加权的覆盖率49.57%;直接平均各年覆盖率为29.41%,相差20.15个百分点。21个十年分组会受百分比汇总方式影响。 解释:年份的样本量不同,不能直接平均百分比。覆盖率衡量档案完整性,不用于推断地区沉船风险或真实事故率。 结果文件:02_wreck_decade_coverage.csv、02_wreck_coverage.csv、charts/wreck_coverage.svg。 二、游戏改编电影|多值字段清洗与财务口径 输入:game_films.csv,共439行,其中1条为完全相同的Undated占位记录。主分析使用438条互异记录;记录数不等同于已核实的独立电影数。 方法:发行商字段按字面分隔符拆分,显式设置regex=False,清除首尾空格,并在每条电影记录内对同一机构只计一次。正则拆分会错误切开机构名称中的空格。 结果:Nintendo 38条、Capcom 31条、The Pokémon Company 28条、Sega 23条、Ubisoft 19条。 财务分析限定在相同美元符号的子集中;通过正值与预算上下限检查后,共60条可比较记录。未自行换汇,币种符号的地区含义以原来源为准。票房/预算是收入与预算比值,不等同于利润率。 结果文件:03_film_publisher_counts.csv、03_film_currency_coverage.csv、03_film_financial_summary.csv、charts/film_publishers.svg。 三、奥运历史数据|参赛记录、人数与奖牌口径 输入:olympics.csv,共271,116条参赛记录,135,571名不同ID的运动员。 方法:参赛记录按行计数,人数按运动员ID去重;身高、体重与获奖状态分别处理。 结果:铁人三项为529条参赛记录、355名运动员、30条获奖记录,其中526条身高体重齐全。2016夏季奥运女性运动员占比45.03%,分母为该届不同运动员人数。 重复候选检查:1,385条字段完全相同的候选中,1,315条来自艺术竞赛。现有字段无法区分重复录入与不同作品,主分析保留原始口径,同时提供269,731条互异记录的敏感性口径。 解释:medal空值表示未获奖,与身高体重缺失的含义不同。团队项目会产生多条获奖运动员记录,不能直接汇总为官方国家奖牌榜。 结果文件:01_olympics_participation.csv、01_olympics_duplicate_candidates.csv、01_olympics_triathlon.csv。 四、Cass货运指数|时间验证与基线比较 输入:cass_dspi_data.csv,2016-01至2026-04,共124个连续月。 方法:比较naive、seasonal_naive、seasonal_mean_3y、seasonal_trend_5y、drift五种透明基线。以52、64、76个月为三个训练截点,分别预测后24个月;验证窗口均不超过2024-04,以72个验证步的汇总RMSE选型。窗口有重叠,不将其视为72个独立样本。 结果:三年季节均值在验证阶段入选,验证RMSE=0.071196;2024-05至2026-04最终测试RMSE=0.140588、MAE=0.134678。预先固定的季节朴素基线最终RMSE=0.090818。所选模型未优于基线,历史验证优势未延续到最终区间;最终测试不再用于选型。 研究范围:这是既有历史快照的回溯分析。最终区间已出现在原有分析材料中,不构成前瞻盲测。比较范围不包含完整ARIMA/ARIMAX网格;未来DSPI可得性及历史修订版本未确认,因此没有将最终区间DSPI观测值直接用作未来输入。 预测文件:以2026-04为起点,输出2026-05至2028-04的24个月练习预测,范围0.959667至1.106000;不代表2026-09最新预测,未附未经检验的置信区间。 单位与来源:FRED官方Cass系列为1990年1月=1、月频、未季调;原始数据版权属Cass。公开包保留指标与派生预测,不再分发逐月历史观测。来源:https://fred.stlouisfed.org/series/FRGSHPUSM649NCIS 。 结果文件:04_cass_validation_folds.csv、04_cass_validation_models.csv、04_cass_final_test_metrics.csv、04_cass_revised_forecast.csv、charts/cass_validation.svg。 五、合成问卷|模型标签下的回答分布 输入:synthetic_survey_data.csv,300条合成记录、6道1至5分题目;两个文件标签各150条。无缺失,RespondentID唯一,题目取值均在1至5之间。 方法:按文件中的模型标签分组,以每组150×6=900次题目回答为分母。中点回答定义为3分,极端回答定义为1或5分。 结果:GPT-4o标签的中点回答率44.89%、极端回答率6.33%;Claude Sonnet标签分别为32.22%和19.11%。12个题目均值与源汇总表一致。 解释范围:文件未附完整提示词、调用日志、确切模型版本与原始响应,名称仅作为文件组别标签。均匀分布20%的中点率不是已知的真人基准;这些结果不用于推断RLHF因果机制、真实人群分布或真人调查的显著性。 结果文件:05_synthetic_descriptives.csv、05_synthetic_distributions.csv、05_synthetic_model_summary.csv、charts/synthetic_midpoint.svg。 六、州营商环境|PCA与偏好敏感性 输入:cnbc_2025_rev.csv,50州、10个名次字段,与ranked_states.csv逐州逐列一致。 方法:采用总体标准差做z标准化,通过SVD进行PCA;按指定权重计算综合分数,并为每个权重独立施加0.8至1.2倍的均匀扰动。固定随机种子20260920,共1,000个场景。 结果:前四个主成分解释79.8648%的方差;原权重下前三位依次为North Carolina、Virginia、Texas。前两州在全部扰动场景进入前三,Texas在85.5%的场景进入前三。Virginia技术创新原始名次为第8。 解释范围:入围比例描述指定偏好场景下的稳定性,不是统计置信概率。名次作为数值距离参与PCA属于探索性近似,综合分数不意味着客观唯一的最佳选址。本包包含PCA及权重分析,不包含K-Means聚类验证。 结果文件:06_states_pca_variance.csv、06_states_pca_directions.csv、06_states_preference_sensitivity.csv。 文件与复现 公开包含21份汇总CSV、4幅SVG图、字段字典、来源哈希、Python计算脚本、环境说明及验证结果。逐条原始记录不随包分发;完整复算需取得合法且匹配的输入快照,具体步骤见README_先看这里.txt。 其余数据的结构检查与处理范围见00_review_scope.csv。例如,Pregnancy的545条重复候选可能是不同人的相同特征,brands1的36条也不能据此直接删除;airquality的1,880个缺失值不按污染为零填补。 计算检查 verification.json记录86项通过、0项失败,涵盖快照维度、唯一键、时间连续性、分类取值、分母对账、发行商拆分、问卷均值、州分数、PCA方差与重构误差。它们验证计算一致性;各案例的来源、模型适用范围与业务解释仍以上文说明为准。