High-quality data is the fuel for modern deep learning model training. Most of the task-specific labeled data comes from human annotation. Lots of ML techniques can help with data quality, but fundamentally human data collection involves attention to details and careful execution. "Everyone wants to do the model work, not the data work."
高质量数据是现代深度学习模型训练的燃料。大多数任务特定的标注数据来自人类标注(分类任务、RLHF 标注等)。文中许多 ML 技术能提升数据质量,但从根本上说,人类数据采集需要对细节的关注和谨慎的执行。业界有个微妙共识:"每个人都想做模型工作,没人想做数据工作"(Sambasivan 等 2021)。提升数据质量有两个方向:标注者 ↔ 数据质量、数据质量 ↔ 模型训练。
这篇是 RLHF 与数据标注的"幕后真相"。一个反常识的事实:最先进的模型,其训练信号最终系于一群标注者的注意力和情绪。Lilian 作为 OpenAI 团队成员,反复强调数据工作被低估——"数据层叠(data cascades)"问题往往在模型上线后才暴露。读懂这篇,才会理解为什么顶级实验室都建有庞大的标注运营团队,以及为什么 RLHF 的成败常取决于数据而非算法。
采集人类数据涉及一系列运营步骤,每步都影响质量:
Vox populi, a Latin phrase, means the voice of people. A 1907 Nature paper tracked an event where people would guess the weight of an ox. The middlemost estimate ended up being very close to the true value. This is probably the earliest mention of how crowdsourcing would work out.
Vox populi(拉丁语"人民的声音")。1907 年《Nature》一篇同名短文记录:展览上一头肥牛被展出,人们竞猜其重量以赢奖,中位数估计值非常接近真实重量。作者感叹"这比预想中更证明了民主判断的可信度"——这大概是众包/群体智慧最早的记载。
近 100 年后,Callison-Burch(2009)用 Amazon Mechanical Turk 做机器翻译的非专家人工评估甚至创建新金标准译文。任务简单:给 Turkers 一句源文、一句参考译文和 5 个 MT 系统的译文,让他们从好到差排序,每任务 5 人完成。刷量垃圾标注者(spammers)不可避免,于是需用加权方案下调其权重:(1) 按与专家在 10 例金标准上的一致率加权;(2) 按与其余 Turker 在全量数据上的一致率加权。结论:专家与众包译文的相关性,高于专家与 MT 系统输出的相关性。
我们常假设存在单一真值并据此评估质量。多人多标后,可用加权平均(按"与他人一致频率"近似的能力分加权)聚合。常用度量:
κ = (p_o − p_e)/(1 − p_e),其中 p_o 是原始一致率、p_e 是偶然一致;修正了"偶然一致",但当某标签更普遍时修正可能被高估。MACE(Hovy 等 2013)用图模型估计某人是否像在随机标注的"垃圾标注者"。生成式模型中:θ_j 定义标注者 j 的可信度(不乱标的概率),ξ_j 定义其乱标时的行为;用 EM 或变分贝叶斯最大化边际似然,恢复答案时按 θ 估计做加权多数投票。
The aggregation depends on an assumption that there exists one underlying gold answer. However, in safety, social, or cultural areas, people can disagree and often this disagreement is valid.
上述聚合依赖一个假设:存在唯一底层金标准答案。但在安全、社会、文化等议题上,人们会有分歧,且这种分歧往往是合理的(valid)——这就回到了"该用严格规则还是拥抱多样性"的问题。Aroyo & Welty(2015)澄清了人工标注实践中的若干迷思,关键发现:
Rottger et al. (2021) formulated the difference into two contrasting paradigms: Descriptive (encourage annotator subjectivity, model many beliefs) vs Prescriptive (discourage subjectivity, consistently apply one belief).
Rottger 等(2021)把差异形式化为两种对立范式:
描述性范式能揭示重要效应:标注者身份(如非裔美国人、LGBTQ)是其在标注身份相关毒性内容时的统计显著因子(Goyal 等 2022)。Wang 等(2023)比较了信任与安全(T&S)专家与众包标注者对 AI 对话安全性的评估,发现一致率随语义主题剧烈波动——暴力/血腥主题高达 0.96,个人话题仅 0.25;极端与良性对话上一致率更高。
"描述性 vs 规范性"是处理主观标注的关键抉择,至今主导 RLHF 数据策略。大多数团队默认走规范性(定死规则、要求一致),因为它好做 QC、能直接喂模型;但在毒性、安全、政治等议题上,强行追求"唯一答案"会把真实的群体分歧当噪声洗掉,训出的模型可能对某些人群有偏见。现代解法(如 Jury Learning)正是描述性思想的工程化——显式建模"谁在标、怎么标",而不是抹平差异。
p_flip,据此调整标签分布,把稳定的观点与随机错误分离,得到去噪测试集。数据集建好后,许多方法能依据训练动态(training dynamics)识别错标样本。注意这里只关注"找出并排除可能错标的数据点",而非"如何用噪声数据训练模型"。
Influence functions is a classic technique from robust statistics to measure the effect of training data points by describing how the model parameters change as we upweight a training point by an infinitesimal amount.
影响函数是稳健统计学的经典技术(Hampel 1974),描述"把某训练点权重提升无穷小量"时模型参数如何变化,从而衡量该点的影响。Koh & Liang(2017)将其引入深度网络:移除某点等价于对其加权 ε = −1/n,因此 θ̂_{−z} − θ̂ ≈ −(1/n)·I_up,params(z)。用链式法则可得它对测试点损失的影响:
I_up,loss(z, z_test) = −∇_θ L(z_test, θ̂)ᵀ · Ĥ_θ⁻¹ · ∇_θ L(z, θ̂)。识别错标时可测 I_up,loss(z_i, z_i),近似"若从训练集移除 z_i 后对 z_i 的预测误差"。它能近似留一重训练而无需真的重训。难点是逆海森向量积难算,Grosse 等(2023)改用 EK-FAC 近似扩展到大模型。
Data Maps tracks two attributes during training: Confidence (mean model probability of the true label across epochs) and Variability (standard deviation of that confidence).
数据地图(Data Maps)(Swayamdipta 等 2020)追踪训练中两个属性:置信度(真标签的平均模型概率)和变异度(该概率的标准差)。难学样本(低置信、低变异)更可能被错标。他们在 WinoGrande 上注入 1% 翻转标签,重训后这些翻转样本移向低置信、略高变异区域——据此可训练一个仅用置信度的噪声分类器识别潜在错标实例。
但不能把所有难学样本都当错标:模糊(高变异)和难学(低置信低变异)样本对学习反而更 informative,对 OOD 泛化有益,甚至优于 100% 训练集。不可遗忘样本(Unforgettable examples)(Toneva 等 2019):若某样本的类标签在训练各 epoch 中始终一致,则一旦学会永不遗忘;噪声标签或视觉复杂的样本最易被遗忘。实证表明不可遗忘样本可安全移除而不损性能。AUM(Margin 面积)(Pleiss 等 2020)假设错标样本因泛化与(错误)预测在梯度上存在张力而 margin 更小,通过插入"假类"阈值样本(把部分样本标签改成不存在的第 C+1 类)取其 AUM 第 99 百分位作为阈值来识别错标。
NCV(噪声交叉验证)(Chen 等 2019)把数据集随机对半分,若某样本标签与"仅在另一半上训练的模型"预测一致则判为干净。INCV 迭代执行,逐步把更多干净样本加入可信集、移除更多噪声样本。
这一节把"找脏数据"的方法串成一条进化线:影响函数(理论严谨但算不动)→ 训练动态观测(数据地图/AUM,实用高效)→ 交叉验证(简单粗暴但有效)。最实用的洞见是 数据地图的二维图(置信度 × 变异度)——它不只是找错标,还能识别"哪些样本最值得学"。在 RLHF 偏好数据清洗中,这套"用模型自己的训练动态反查可疑标注"的思路被广泛复用。核心信念是:模型在训练中"犹豫不决"的样本,往往就是数据有问题的地方。