跳到正文
PRETRAINING FOUNDATION · DATA

训练数据工程不是“清洗率”,而是控制模型反复练习的分布

一条文档是否能解析、是否有权使用、是否值得占训练预算、是否与评测集重合,是四个不同问题。可靠的数据工程为每个问题建立独立契约,再把来源快照、规则、顺序、配比和产物固定下来。

01 · 先换一个视角

数据决定模型看见什么和看见几次,却不独自决定模型行为

训练样本通过目标函数产生梯度;来源、重复度和采样权重共同决定某类模式获得多少次更新机会。但最终行为还是数据、架构、训练目标、优化过程、后训练与推理时上下文的共同结果,不能把模型的一切能力或偏差都归因给一份语料表。

EXPOSURE

练什么、练几次

文档内容、Token 数、重复簇和领域采样权重共同形成实际训练分布;原始文件大小不等于被模型看到的比例。

RIGHTS + POLICY

该不该进入

来源链、许可标记、隐私、安全和内部政策是准入合同。公开可访问不自动等于可按任何目的使用。

TARGET FIT

是否值得预算

可读性、信息密度、语言与任务覆盖回答“是否适合当前目标”,不是脱离目标的单一宇宙质量分。

EVIDENCE

为什么这样选

人工审计、过滤器误差、数据统计、小模型消融和下游评测共同构成证据,任何一个分数都不够。

白话记忆

把预训练想成排课:数据源是教材候选库,权利与策略是准入,质量筛选是选教材,去重是不把同一页复印几万次,配比是课表,Loss 才是怎样评分。

02 · 端到端数据流

不要做一个“万能清洗器”,要让每道门输出可检查的合同

生产流水线可以因成本和数据形态而交错:有的先做 URL 去重再解析,有的先抽正文再做段落去重。顺序不是全球唯一答案;真正必须固定的是每道门的输入、规则版本、输出、拒绝原因和这次运行的确切顺序。

训练数据工程主流程:来源快照和文档身份进入解析规范化、权利隐私策略门、语料内部去重、质量与领域打分、冻结评测集污染检查、领域配比、Tokenizer 编码与确定性分片;审计侧保存运行清单、消融风险证据和发布清单。
主流程把“准入、重复、目标适配、评测边界”拆成独立合同;审计流记录每个版本为什么放行、拒绝或降权。具体项目可调整门的顺序,但不能省略顺序记录。 查看原图 ↗

先冻结来源快照与文档身份

保存内容 ID、抓取时间、源地址或数据包版本、父子 lineage 和原始内容哈希。网页以后变化或消失时,仍能说明这次训练处理的是哪一版字节。

解析质量会直接改变训练样本

菜单、脚注、代码缩进和表格若抽错,后续再精细的过滤也救不回来。FineWeb 在 28B Token、1.71B 参数消融设置中,WARC 配合 trafilatura 抽取优于直接使用 WET;这是该设置的证据,不是所有网页解析器的永久排名。

策略、质量、污染分别做决定

权利与隐私门回答“是否准入”,质量与领域门回答“是否适合目标”,污染门回答“能否继续用于某项冻结评测”。一篇文章可以写得很好,却因权利不清被拒绝;也可以合规可用,却不适合当前模型。

阈值需要多层证据校准

抽样人工复核误杀与漏放,按语言和来源看覆盖,再用固定 Token 预算的小模型消融或下游评测验证净收益。小模型实验很有力,但不是唯一合法证据,也不保证结论无损迁移到更大模型。

最后才编码、配比与确定性分片

冻结 Tokenizer、文档顺序、域权重、采样日程、随机数实现和文档到 shard 的映射。只保存 seed 和最终文件仍不足以复现一条有并行竞态或依赖版本漂移的数据流水线。

Checksum 的边界

校验和能证明“当前字节是否与登记产物一致”,不能证明内容真实、许可有效、隐私已清干净或处理链完整。它是产物身份,不是数据质量证书。

03 · 两条不能混用的检查

去重控制训练权重;污染检查保护某一版评测的解释力

两者都可能使用哈希、n-gram、MinHash 或语义检索,但集合、判定和处置不同。去重在训练候选内部找重复簇;污染检查把训练候选与先冻结的评测题、答案和元数据比较,并保存已确认、疑似与未命中的不同状态。

语料去重与评测污染检查的双流程:上层在训练语料内部用精确和近似指纹聚类、统计簇大小、按确定性规则保留或降权并报告剩余重复;下层把候选训练文档与冻结评测题、答案和元数据做多级匹配,复核通用短语、题目或答案泄漏、版本与数据切分,再分别暂准入、隔离或标记评测失效。
Corpus↔Corpus 的输出是“重复权重受控”,不是“绝对唯一”;Train↔Frozen Eval 的零命中只是“本次扫描未发现”,不是无泄漏证明。 查看原图 ↗
手算 · 先分清文档概率与 Token 权重

100 万篇文档中,20 万篇都带同一段广告模板

若每篇文档等概率抽取,抽到“含该模板文档”的概率是 20%;这不等于模板 Token 占全部 Token 的 20%。模板本身的 Token 占比应按 20 万 × 每份模板长度 ÷ 全语料 Token 总数 计算。无论哪种口径,它都会在很多 batch 中产生相似梯度,因此应报告重复簇大小、长度和实际采样质量,而不是只报“删了多少篇”。

真实案例 · 去重不是越激进越好

FineWeb 的全局 MinHash 从 96 个快照留下 4T Token,逐快照去重留下 20T

在该论文的 350B Token 消融里,全局去重只带来有限改善;最老快照中被保留的约 10% 反而比被删除的 90% 更差。改为每个快照独立去重后,抽样训练结果匹配 RefinedWeb。结论不是“永远按快照去重”,而是簇的保留规则会改变时间和来源分布,必须在真实预算下验证。

记忆与污染边界

Lee 等人在其语言模型实验中发现一条 61 词句子重复超过 6 万次,并报告去重使记忆式输出约降 10 倍;他们还清除了会影响标准数据集 4% 以上验证样本的训练—验证重叠。这些数字说明重复可能造成实际伤害,不是任意模型、语料和阈值都能复现的固定收益。黑盒补全或检索命中也只能形成污染嫌疑;要结合训练版本、匹配内容、时间线和分数变化解释。

04 · 质量与配比

“高质量”必须改写成:对哪个目标、按什么证据、牺牲了什么

可读性、事实可靠度、教育性、代码可执行性和对话自然度并不是同一轴;许可、隐私与安全更属于独立治理轴。一个分类器把数据排得很整齐,不代表它保留了少数语言、口语、专业格式和长尾观点。

HEURISTICS

规则过滤

字符比例、异常长度、重复行和模板密度便宜、可解释;对代码、诗歌、表格等特殊格式也容易误杀。

SCORER

模型打分

分类器或 LLM 能表达更复杂的目标,但会把标注规范、教师模型和训练语言的偏好扩散到全量语料。

COVERAGE

分层覆盖审计

按语言、来源、主题、时间与文档形态看保留率,避免全局平均提升掩盖某个重要子群被清空。

ABLATION

固定预算消融

对齐模型、Tokenizer、Token 数、优化配置和评测后比较;否则“数据更好”可能只是训练更多。

真实案例 · FineWeb-Edu 的“教育性”不是通用质量

46 万页由 Llama-3-70B-Instruct 打 0–5 分,再训练轻量分类器

作者用 41 万条合成标注训练回归头、5 万条留出,最终阈值 3 的验证 F1 为 82%。在 1.71B 模型、350B 训练 Token 的设置中,MMLU 从 33% 到 37%,ARC 从 46% 到 57%;与此同时,教育、历史等主题上升,商业、娱乐、旅行等主题下降。它证明目标筛选可有效,也同时展示“更好”会重写主题分布。

假设例子 · 配比不是原始文件大小

代码原始占比 8%,训练采样可设为 20%

固定总训练 Token 时,代码从 8% 提到 20%,意味着其他域合计少 12 个百分点的练习机会。应同时看代码、通用语言、数学和多语言留出集。DoReMi 在 The Pile 设置中用 280M 代理模型学习权重并迁移到 8B 模型,报告平均 few-shot 准确率提高 6.5 个百分点,并以约 1/2.6 的训练步数达到基线准确率;这是特定语料和训练协议的结果,不是可直接复制的万能配方。

05 · 合成数据

合成数据能重组和验证练习,不能凭空建立可信事实

每条合成样本至少要关联生成器版本、提示或源证据、采样配置、验证器和父文档。否则它只是另一批来源不明的文本,生成器的盲区、语言习惯和事实错误还会被规模化复制。

有源改写

把难读文档改成教程、问答或多难度版本,同时保留父文档。可追溯不等于语义不变,限定条件和不确定性仍要抽样核对。

生成—验证

为数学、代码和工具任务生成候选,再用执行器、单元测试或规则筛选。验证器只证明它检查的性质;测试通过不等于事实完整、方案最优或行为安全。

失败驱动练习

从当前模型的错误类型生成针对性样本。要保留独立留出集,避免围绕已有 benchmark 反复生产近似题,把评测本身变成训练目标。

来源与代际配额

标记人类原始、单轮改写、纯生成和递归生成,分别监控长尾覆盖、事实错误和风格集中,不能只保留一列 synthetic=true

2025 实证 · 只在论文设置内读数字

“约三成改写数据”不是行业常数

Kang 等训练超过 1000 个模型、使用超过 10 万 GPU 小时;在较大数据预算下,1/3 改写型合成 + 2/3 自然网页达到相同验证 Loss 可快 5–10 倍,而只用改写数据并不更快,纯教科书式生成在多个域的 Loss 更高。该研究是单轮生成、特定数据类型和规模的结果;验证 Loss 提速也不等于所有下游能力、安全性或事实性同比提升。

别把两种“模型坍塌”证据混在一起

Nature 2024 研究的是前代模型输出进入下一代、误差跨代递归累积,首先损失原分布尾部;Kang 等主要研究单轮 n=1 混合。前者不能推出“加入任何一条合成数据都会坍塌”,后者也不能排除多代反馈风险。保留可辨认的原始数据和代际 lineage,才有机会监控这个问题。

06 · 治理与复现

可审计版本不仅能重跑,还能解释、隔离、替换和追责

训练成本越高,越不能把数据版本写成一个目录名。真正的冻结对象包括来源快照、处理 DAG、代码与依赖、模型式过滤器、Tokenizer、混合日程、排除账本、文档到 shard 的映射,以及每道门的统计和证据。

PROVENANCE

来源链

内容 ID、源快照、采集时间、父数据集、转换步骤、权利与删除状态,让每个 Token 分片可回溯到候选文档。

RECIPE

配方链

处理顺序、代码 commit、配置、容器或依赖、模型打分器、阈值、seed、排序与采样日程。

ARTIFACT

产物链

Tokenizer、文档清单、域配额、shard 映射、字节数、Token 数和 checksum 共同标识真正喂给训练器的内容。

EVIDENCE

证据链

人工审计、误差矩阵、覆盖统计、去重报告、污染账本、消融、已知限制和责任 owner。

发布前最小追问

从一个 checkpoint 能否反查到一条文档的整条命运?

它来自哪版源快照?哪版解析器产生正文?权利、隐私和策略门为何放行?属于哪个重复簇、谁被保留?是否命中过哪版评测集?质量分和领域标签由谁生成?按什么权重与顺序被采样?进入哪个 shard、使用哪个 Tokenizer?任何一问只能答“应该是”,都还不是可审计版本。

删除语料 ≠ 模型已经遗忘

从候选库和未来 shard 删除一篇文档,只会改变后续构建;已训练 checkpoint 可能仍保留其影响。若目标是处理既有模型,需要明确选择重训、适用的 machine unlearning 方法、checkpoint 下线或其他控制,并用攻击与效用评测提供证据,不能拿“数据库已删”当完成证明。

自动过滤 ≠ 风险清零

Dolma 的 PII 规则明确只针对邮箱、IP 和电话号码,因此“通过该过滤器”不能证明没有姓名、地址或上下文身份信息。Data Provenance Initiative 审计 1800 多个文本数据集时,还观察到所研究托管站点 70% 以上许可缺失、50% 以上误标率;数据集页面的一列 License 不能替代逐级来源核验。具体权利判断应由适用法域和场景的专业流程完成。

RESEARCH LEDGER

一手来源与证据边界

优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。

R01
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining ResearchSoldaini et al. · ACL 2024

3T Token 开放语料的来源、解析、去重、有限范围 PII 过滤、版本差异与数据治理。

R02
The FineWeb Datasets: Decanting the Web for the Finest Text Data at ScalePenedo et al. · NeurIPS 2024

96 个 Common Crawl 快照上的抽取、去重和过滤消融,以及 FineWeb-Edu 的构建与偏移。

R03
Datasheets for DatasetsGebru et al. · CACM 2021

记录数据集动机、组成、采集、预处理、用途、分发、维护与风险的框架。

R04
Investigating Data Contamination in Modern Benchmarks for Large Language ModelsDeng et al. · NAACL 2024

检索与 Testset Slot Guessing 污染调查;黑盒信号可提示风险,但不能单独证明因果污染。

R05
Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and PitfallsKang et al. · EMNLP 2025

不同合成数据类型、混合比例和数据预算的大规模单轮训练实证。

R06
Deduplicating Training Data Makes Language Models BetterLee et al. · ACL 2022

语料重复、记忆式输出、训练—验证重叠与去重效果的受控实验。

R07
DoReMi: Optimizing Data Mixtures Speeds Up Language Model PretrainingXie et al. · NeurIPS 2023

用小型代理模型学习领域权重,再把配比迁移到更大模型的实验方法与结果边界。

R08
The Data Provenance Initiative: A Large Scale Audit of Dataset Licensing & Attribution in AILongpre et al. · 2023

1800 多个文本数据集的来源、许可与归属审计,说明托管页标签不能替代逐级 provenance。

R09
AI models collapse when trained on recursively generated dataShumailov et al. · Nature 2024

递归使用前代模型生成数据时,尾部分布逐代丢失的“模型坍塌”设定。

R10
Machine UnlearningBourtoule et al. · IEEE S&P 2021

区分删除未来训练源与移除已训练模型中数据影响;SISA 是特定遗忘框架,不是通用完成证明。