﻿输出数据字典

全部CSV使用UTF-8 BOM；数值保留为数值。比例字段share范围0到1，百分数需要乘100；percentage_points字段已乘100。缺失不写成0。表内未附个人观测样例。

00_dataset_audit.csv：dataset为原数据资产名，table为表名，rows/columns为结构尺寸，missing_cells为按读入布局计算的空值格数，exact_duplicate_candidates为全部字段相同的额外行数。候选重复不自动等于错误，Excel说明/空白列不自动等于业务缺失。
00_source_field_dictionary.csv：覆盖读取到的源字段；storage_type是读入类型，missing/share是文件内缺失，distinct_nonmissing为非空不同取值数。未有权威字典的业务单位明确不推断。
00_review_scope.csv：每种数据资产的具体审查范围与剩余限制。
source_snapshots.json：每份不同内容的数据文件SHA-256、字节数与同内容副本数；不含原始行。

01_olympics_participation.csv：一行=年份×夏/冬季。athlete_event_rows是原始记录数；exact_distinct_records是去除完全相同行后的敏感性口径；unique_athletes按该届id去重；female_athletes与female_athlete_share以不同运动员为分母；nocs为委员会代码数；medal_awarded_rows为medal非空记录，不是官方奖牌数。
01_olympics_duplicate_candidates.csv：一行=运动项目，extra_identical_records为该项目完全相同的额外记录候选。
01_olympics_triathlon.csv：一行=可用信息子集，rows和unique_athletes分别为记录数和不同运动员人数；medal_awarded_rows只计非空奖牌记录。

02_wreck_decade_coverage.csv：一行=十年，decade为十年起年。records、coordinate_records、unknown_classification_records分别为总记录、有坐标、分类Unknown记录；distinct_classifications直接从该十年原记录计算；coordinate_share=coordinate_records/records；original_*两列复现旧算法用于比对；share_correction_percentage_points=正确覆盖率减旧算法覆盖率的百分点差。
02_wreck_coverage.csv：所有记录、已知年份、未知年份三个总体的坐标覆盖。后三者中的已知与未知相加等于全部，不能把三行再次加总。

03_film_publisher_counts.csv：每行一个完整发行商名称。film_records是字面拆分后该机构参与的互异记录数，联合发行的记录会对多个机构计数，列合计不是电影总数。original_regex_token_count为旧正则拆分下恰好匹配这个完整字符串的词元数。
03_film_currency_coverage.csv：世界票房符号×预算符号的记录计数；Missing表示该币种信息不存在。
03_film_financial_summary.csv：筛选后子集的票房/预算中点比值均值和中位数，均为无量纲比值，不是利润率，也未按通胀调整。

04_cass_validation_folds.csv：每行模型×训练截点，sse为验证平方误差和，absolute_error_sum为绝对误差和；horizon为24个月。
04_cass_validation_models.csv：跨三个验证截点合计的误差与步数；validation_rmse=sqrt(sse/evaluated_steps)，validation_mae=absolute_error_sum/evaluated_steps。重叠日期保留作不同预测起点的评估步。
04_cass_final_test_metrics.csv：验证选出的模型与预先指定季节朴素基线，在相同最终24个月的RMSE/MAE。单位均为Cass指数点，不能当作百分比准确率。
04_cass_revised_forecast.csv：forecast_month为从2026-04快照末尾起24个月，forecast_index为派生点预测，model为验证选出的模型，training_snapshot_end说明起点，is_observed恒为False。指数单位1990年1月=1。真实未来值不含在此表。

05_synthetic_descriptives.csv：每行=源文件模型标签×题目，synthetic_rows为模拟受访者数，mean/median为1至5评分，sample_sd用ddof=1；midpoint_share是该题评分3占比。
05_synthetic_distributions.csv：每行=标签×题目×评分，count和share分母为该标签150行；一题五个评分比例和为1。
05_synthetic_model_summary.csv：每行一个文件组别标签，item_responses为150×6=900次回答；midpoint_share按评分3计，extreme_share按1或5计，均不代表真实人群比例。

06_states_pca_variance.csv：component为主成分序号，variance_share为方差比例，cumulative_variance_share为累计比例。
06_states_pca_directions.csv：标准化特征的单位长度主成分方向向量（不是相关系数型loading）；每个分量最大绝对系数被定向为正以便复现。符号本身没有价值判断含义。
06_states_preference_sensitivity.csv：weighted_rank_score为原权重与名次的乘积和，低分更优；weighted_order/equal_weight_order为最低名次法序位；equal_weight_average_rank为十维名次均值；top3_share_in_1000_weight_scenarios只描述固定随机种子的偏好扰动场景，不是人口抽样置信概率。
