← 返回作品

我用数据,
研究这些问题。

从奥运参赛记录、沉船档案,到货运指数与选址分析。这里收录了我的六组课程案例,可以查看结果,也可以下载数据表和代码。

39份数据文件
6组分析案例
21份可下载汇总 CSV

2026 / 综合课程项目

六组案例,六个具体问题。

这些案例来自 2026 年的课程项目。我从清洗数据、确定统计口径开始,完成分析,再用图表解释结果。使用的工具包括 Python、R 和 SQL。

六组案例分别讨论档案覆盖率、货运指数预测、发行商统计、奥运参赛口径、合成问卷分布和选址偏好。每组都附有结果表与计算方法。

共检查了 39 份数据文件的结构,并从中整理出以下六组分析。下载包提供汇总结果和代码;从原始数据重新计算,需要另行取得对应的源文件快照。

01 / 分析案例

同一批档案,为什么算出两种覆盖率?

爱尔兰沉船档案共 17,981 条记录,但只有 3,564 条有坐标。按十年比较覆盖率时,需要考虑每年的记录量;直接平均各年百分比,会让样本量悬殊的年份获得同等权重。

1910 年代 · 年度百分比均值29.41%
同一十年 · 按记录数加权49.57%

我按十年汇总有坐标的记录数与总记录数,再计算覆盖率;跨年份的分类去重计数。3,303 条缺失年份的记录单独列出。这里衡量的是档案完整性,不是海域的沉船风险。

02 / 分析案例

验证中选出的模型,后来表现怎样?

我用三个时间起点的滚动验证比较五种基线方法,按统一口径选型,再查看最后 24 个月的测试表现。模型选定后,不再根据最后这段数据重新挑选。

验证选出的季节均值 · 最终 RMSE0.1406
季节朴素基线 · 最终 RMSE0.0908

RMSE 越小越好。这次,验证中选出的季节均值模型,在最后 24 个月输给了季节朴素基线。我把两组结果一起保留:验证时领先的方法,到了下一段时间未必仍然领先。

基于 2016-01 至 2026-04 的历史快照,属于历史回溯分析;最终区间已出现在既有分析材料中,不构成未来盲测。本案例比较五种透明基线,不包含完整 ARIMA 网格对比。预测文件是从 2026-04 出发的练习,单位为指数点,不是收益率或准确率。原始 Cass 数据版权属其提供方,公开包不附历史逐月原值。FRED 系列说明 ↗

03 / 分析案例

怎样把发行商名称拆对?

游戏改编电影数据中,同一条记录可包含多个发行商。处理这类字段时,需要区分字面分隔符与正则表达式,保留机构名称内部的空格。

我按字面分隔符拆分字段,再清理首尾空格,保留名称内部的空格。The Pokémon Company 因而作为完整名称计数,对应 28 条电影记录。每条电影内的相同发行商只计一次;439 行中的一条完全相同占位记录单独说明。

发行商前五名 电影记录数
Nintendo38
Capcom31
The Pokémon Company28
Sega23
Ubisoft19

财务比较限定在相同美元符号的记录子集中,未混合币种换算;票房与预算的比值不等同于利润率。

04 / 分析案例

529 条参赛记录,为什么只有 355 人?

奥运快照包含 271,116 条参赛记录。铁人三项对应 529 条记录、355 名不同运动员、30 条获奖记录,分别对应参赛人次、参与人数与获奖运动员记录三种口径。

另有 1,385 条字段完全相同的记录候选,其中 1,315 条来自艺术竞赛。现有字段不足以判断它们是否代表不同作品,因此保留原始口径,额外给出折叠相同行后的敏感性结果。

运动员人数按 ID 去重;团队项目的多条获奖运动员记录不能直接当成国家奖牌总数。

05 / 分析案例

从合成问卷中,观察回答分布。

300 条合成问卷中,每个文件标签各有 150 条记录、6 道题。按“1 或 5 分为极端回答”,以每组 900 次题目回答为分母,分布如下:

文件标签 GPT-4o · 极端回答率6.33%
文件标签 Claude Sonnet · 极端回答率19.11%

两组中点回答率分别为 44.89% 与 32.22%。材料未附完整提示词、调用日志和模型版本,因此模型名称仅作为文件组别标签。分析描述合成样本的分布,不据此推断 RLHF 因果关系或真实人群行为。

06 / 分析案例

换一组偏好,选址结果会变吗?

对 50 州、10 项名次数据进行标准化与 PCA,前四个主成分解释约 79.86% 的方差。加权评价前三位为 North Carolina、Virginia 与 Texas;各项原始名次保留用于解释综合分数。

在 1,000 个权重扰动场景中:North Carolina 与 Virginia 均进入前三,Texas 在 85.5% 的场景进入前三。这是指定偏好变化下的稳定性描述,不是统计置信概率,也不证明存在客观唯一的最佳州。

名次作为数值距离参与 PCA 只是探索性近似;本案例下载结果涵盖 PCA 与权重敏感性,不包含 K-Means 聚类验证。

打包带走

结果表、图表和代码,都在这里。

包内包含 21 份汇总 CSV、4 幅图、数据字典、完整质量报告、源文件哈希和计算代码。可以离线阅读;从原始输入复算需要自行合法取得对应快照,公开包提供汇总数据与分析方法。

已通过 86 项数据对账与完整性检查,覆盖唯一键、时间连续性、分类取值及统计分母。原始逐条记录未随网站公开。