输出数据字典 全部CSV使用UTF-8 BOM;数值保留为数值。比例字段share范围0到1,百分数需要乘100;percentage_points字段已乘100。缺失不写成0。表内未附个人观测样例。 00_dataset_audit.csv:dataset为原数据资产名,table为表名,rows/columns为结构尺寸,missing_cells为按读入布局计算的空值格数,exact_duplicate_candidates为全部字段相同的额外行数。候选重复不自动等于错误,Excel说明/空白列不自动等于业务缺失。 00_source_field_dictionary.csv:覆盖读取到的源字段;storage_type是读入类型,missing/share是文件内缺失,distinct_nonmissing为非空不同取值数。未有权威字典的业务单位明确不推断。 00_review_scope.csv:每种数据资产的具体审查范围与剩余限制。 source_snapshots.json:每份不同内容的数据文件SHA-256、字节数与同内容副本数;不含原始行。 01_olympics_participation.csv:一行=年份×夏/冬季。athlete_event_rows是原始记录数;exact_distinct_records是去除完全相同行后的敏感性口径;unique_athletes按该届id去重;female_athletes与female_athlete_share以不同运动员为分母;nocs为委员会代码数;medal_awarded_rows为medal非空记录,不是官方奖牌数。 01_olympics_duplicate_candidates.csv:一行=运动项目,extra_identical_records为该项目完全相同的额外记录候选。 01_olympics_triathlon.csv:一行=可用信息子集,rows和unique_athletes分别为记录数和不同运动员人数;medal_awarded_rows只计非空奖牌记录。 02_wreck_decade_coverage.csv:一行=十年,decade为十年起年。records、coordinate_records、unknown_classification_records分别为总记录、有坐标、分类Unknown记录;distinct_classifications直接从该十年原记录计算;coordinate_share=coordinate_records/records;original_*两列复现旧算法用于比对;share_correction_percentage_points=正确覆盖率减旧算法覆盖率的百分点差。 02_wreck_coverage.csv:所有记录、已知年份、未知年份三个总体的坐标覆盖。后三者中的已知与未知相加等于全部,不能把三行再次加总。 03_film_publisher_counts.csv:每行一个完整发行商名称。film_records是字面拆分后该机构参与的互异记录数,联合发行的记录会对多个机构计数,列合计不是电影总数。original_regex_token_count为旧正则拆分下恰好匹配这个完整字符串的词元数。 03_film_currency_coverage.csv:世界票房符号×预算符号的记录计数;Missing表示该币种信息不存在。 03_film_financial_summary.csv:筛选后子集的票房/预算中点比值均值和中位数,均为无量纲比值,不是利润率,也未按通胀调整。 04_cass_validation_folds.csv:每行模型×训练截点,sse为验证平方误差和,absolute_error_sum为绝对误差和;horizon为24个月。 04_cass_validation_models.csv:跨三个验证截点合计的误差与步数;validation_rmse=sqrt(sse/evaluated_steps),validation_mae=absolute_error_sum/evaluated_steps。重叠日期保留作不同预测起点的评估步。 04_cass_final_test_metrics.csv:验证选出的模型与预先指定季节朴素基线,在相同最终24个月的RMSE/MAE。单位均为Cass指数点,不能当作百分比准确率。 04_cass_revised_forecast.csv:forecast_month为从2026-04快照末尾起24个月,forecast_index为派生点预测,model为验证选出的模型,training_snapshot_end说明起点,is_observed恒为False。指数单位1990年1月=1。真实未来值不含在此表。 05_synthetic_descriptives.csv:每行=源文件模型标签×题目,synthetic_rows为模拟受访者数,mean/median为1至5评分,sample_sd用ddof=1;midpoint_share是该题评分3占比。 05_synthetic_distributions.csv:每行=标签×题目×评分,count和share分母为该标签150行;一题五个评分比例和为1。 05_synthetic_model_summary.csv:每行一个文件组别标签,item_responses为150×6=900次回答;midpoint_share按评分3计,extreme_share按1或5计,均不代表真实人群比例。 06_states_pca_variance.csv:component为主成分序号,variance_share为方差比例,cumulative_variance_share为累计比例。 06_states_pca_directions.csv:标准化特征的单位长度主成分方向向量(不是相关系数型loading);每个分量最大绝对系数被定向为正以便复现。符号本身没有价值判断含义。 06_states_preference_sensitivity.csv:weighted_rank_score为原权重与名次的乘积和,低分更优;weighted_order/equal_weight_order为最低名次法序位;equal_weight_average_rank为十维名次均值;top3_share_in_1000_weight_scenarios只描述固定随机种子的偏好扰动场景,不是人口抽样置信概率。