我用数据,
研究这些问题。
从奥运参赛记录、沉船档案,到货运指数与选址分析。这里收录了我的六组课程案例,可以查看结果,也可以下载数据表和代码。
2026 / 综合课程项目
六组案例,六个具体问题。
这些案例来自 2026 年的课程项目。我从清洗数据、确定统计口径开始,完成分析,再用图表解释结果。使用的工具包括 Python、R 和 SQL。
六组案例分别讨论档案覆盖率、货运指数预测、发行商统计、奥运参赛口径、合成问卷分布和选址偏好。每组都附有结果表与计算方法。
共检查了 39 份数据文件的结构,并从中整理出以下六组分析。下载包提供汇总结果和代码;从原始数据重新计算,需要另行取得对应的源文件快照。
01 / 分析案例
02 / 分析案例
验证中选出的模型,后来表现怎样?
我用三个时间起点的滚动验证比较五种基线方法,按统一口径选型,再查看最后 24 个月的测试表现。模型选定后,不再根据最后这段数据重新挑选。
RMSE 越小越好。这次,验证中选出的季节均值模型,在最后 24 个月输给了季节朴素基线。我把两组结果一起保留:验证时领先的方法,到了下一段时间未必仍然领先。
基于 2016-01 至 2026-04 的历史快照,属于历史回溯分析;最终区间已出现在既有分析材料中,不构成未来盲测。本案例比较五种透明基线,不包含完整 ARIMA 网格对比。预测文件是从 2026-04 出发的练习,单位为指数点,不是收益率或准确率。原始 Cass 数据版权属其提供方,公开包不附历史逐月原值。FRED 系列说明 ↗
03 / 分析案例
怎样把发行商名称拆对?
游戏改编电影数据中,同一条记录可包含多个发行商。处理这类字段时,需要区分字面分隔符与正则表达式,保留机构名称内部的空格。
我按字面分隔符拆分字段,再清理首尾空格,保留名称内部的空格。The Pokémon Company 因而作为完整名称计数,对应 28 条电影记录。每条电影内的相同发行商只计一次;439 行中的一条完全相同占位记录单独说明。
财务比较限定在相同美元符号的记录子集中,未混合币种换算;票房与预算的比值不等同于利润率。
04 / 分析案例
05 / 分析案例
从合成问卷中,观察回答分布。
300 条合成问卷中,每个文件标签各有 150 条记录、6 道题。按“1 或 5 分为极端回答”,以每组 900 次题目回答为分母,分布如下:
两组中点回答率分别为 44.89% 与 32.22%。材料未附完整提示词、调用日志和模型版本,因此模型名称仅作为文件组别标签。分析描述合成样本的分布,不据此推断 RLHF 因果关系或真实人群行为。
06 / 分析案例
换一组偏好,选址结果会变吗?
对 50 州、10 项名次数据进行标准化与 PCA,前四个主成分解释约 79.86% 的方差。加权评价前三位为 North Carolina、Virginia 与 Texas;各项原始名次保留用于解释综合分数。
在 1,000 个权重扰动场景中:North Carolina 与 Virginia 均进入前三,Texas 在 85.5% 的场景进入前三。这是指定偏好变化下的稳定性描述,不是统计置信概率,也不证明存在客观唯一的最佳州。
名次作为数值距离参与 PCA 只是探索性近似;本案例下载结果涵盖 PCA 与权重敏感性,不包含 K-Means 聚类验证。
打包带走
结果表、图表和代码,都在这里。
包内包含 21 份汇总 CSV、4 幅图、数据字典、完整质量报告、源文件哈希和计算代码。可以离线阅读;从原始输入复算需要自行合法取得对应快照,公开包提供汇总数据与分析方法。
已通过 86 项数据对账与完整性检查,覆盖唯一键、时间连续性、分类取值及统计分母。原始逐条记录未随网站公开。