机器学习的传统范式是:人类标注数据,模型从中学习。这个过程的瓶颈很明显——高质量标注数据贵、慢、难扩展。
过去几年,研究界和工业界探索了另一个方向:让模型自己为自己的训练提供监督信号,减少对人工标注的依赖。这不是一个单一的技术,而是几种不同机制的集合,每种机制解决的是"信号从哪里来"这个问题的不同变体。
这篇文章讲五种具体的实现路径,每种都包含训练循环是什么样的。
一、自监督学习:从数据本身提取标注
最基础的一种。核心思路是:不需要人工标注,而是从数据本身构造监督信号。
BERT 的掩码语言模型(MLM)是最典型的例子。训练过程:
- 取一段文本,随机遮盖其中 15% 的词(替换为 [MASK] token)
- 让模型根据上下文预测被遮盖的词是什么
- 把模型的预测和原始词比较,计算交叉熵损失,反向传播更新参数
这里没有任何人工标注。原始文本本身就是"答案"——被遮盖的词就是正确标签。模型在预测"什么词被盖住了"的过程中,被迫学习语言的语法结构、语义关系和上下文依赖。
GPT 的自回归语言模型更简单:给模型前 N 个词,让它预测第 N+1 个词。每一段文本天然地提供了序列中每个位置的"正确答案",无需任何额外标注。整个 GPT 系列的预训练都基于这个原理——用互联网上的万亿 token 文本,让模型不断预测"下一个词是什么"。
自监督学习的关键洞察是:数据的内部结构本身就可以是监督信号。你不需要知道一段文字"说的是什么意思",只需要能验证"预测的词对不对"。这个验证是完全自动化的,可以无限扩展。
二、自博弈:用对弈结果训练自己
这条路径来自博弈论背景,AlphaZero 是最清晰的实现。
AlphaZero 的训练循环:
- 自我对弈生成数据:当前版本的模型和自己的一个副本下棋(围棋/国际象棋/将棋),记录每一步的棋局状态、走法选择、最终胜负结果
- 构造训练样本:以每个棋局状态为输入,以"该走法在蒙特卡洛树搜索中的访问频率"为策略标签,以最终对弈结果(+1/-1)为价值标签
- 训练模型:用这批自我对弈数据更新策略网络(预测最佳走法)和价值网络(预测当前局面的胜率)
- 替换旧模型:新模型和旧模型对弈,如果新模型胜率超过阈值(如 55%),用新模型替换旧模型,继续步骤 1
整个过程没有任何人类棋谱。监督信号来自对弈的胜负结果——这是一个客观的、二元的信号,不需要人工判断。AlphaZero 从完全随机走棋开始,几天内就超越了使用人类棋谱训练的 AlphaGo。
自博弈的关键条件是:任务必须有明确的客观反馈(赢了还是输了,对了还是错了)。数学证明、代码执行、棋类游戏都满足这个条件;开放式写作、对话质量等不满足。
三、合成数据:强模型给弱模型生成训练样本
这是 LLM 时代最实用的路径之一,核心思路是用一个更强的模型为更弱的模型生成训练数据。
Stanford Alpaca 的实现最直接:
- 从 InstructGPT 的论文里整理了 175 个种子指令样本(人工写的)
- 用这 175 条种子,让 text-davinci-003 生成更多"(指令, 回复)"对,总共生成了 52,000 条
- 用这 52,000 条合成数据,对 LLaMA-7B 做监督微调(SFT)
- 结果:一个参数量只有 GPT-3.5 百分之一的模型,在指令跟随任务上达到了接近的效果
生成高质量合成数据的 prompt 设计很关键。Alpaca 的生成 prompt 要求:生成的指令要多样(不同任务类型、不同语言、不同难度)、有明确答案、不重复现有指令。通过这些约束,尽量让生成的数据覆盖广泛的分布。
这条路径在工业界演化出了一个更系统的形态:知识蒸馏(Knowledge Distillation)流水线。
- 用大模型(教师)对一个任务生成大量高质量的(输入, 输出)对
- 用这些数据微调小模型(学生)
- 学生模型可以比直接用相同数量的人工数据训练的效果好得多——因为教师模型能生成比普通人标注质量更高的样本
Meta 的 LLaMA 系列、Mistral、很多国内的开源模型,都程度不同地使用了这条路径。
四、RLAIF:用 AI 模型代替人类打分
RLHF(人类反馈强化学习)是当前 LLM 对齐的主流方法,但它有一个明显的成本瓶颈:需要大量人工标注偏好数据(这个回答比那个回答好)。
RLAIF(AI 反馈强化学习)把人类评分员替换成另一个 AI 模型,训练循环变成:
- 对同一个问题,让被训练的模型生成多个回答(比如 4 个)
- 把这 4 个回答送给一个"评估模型"(通常是更大的模型),让它判断哪个更好,输出偏好排序或分数
- 用这些 AI 生成的偏好数据训练一个奖励模型(Reward Model)
- 用奖励模型的分数作为强化学习信号,用 PPO 或 DPO 等算法更新被训练模型的参数
Google DeepMind 的论文(2023)表明,RLAIF 在很多任务上的效果和 RLHF 相当,但成本低几个数量级——不需要雇用人工标注团队,评估速度快,可以按需扩展。
Anthropic 的 Constitutional AI(CAI)是更完整的 RLAIF 实现。它增加了一个步骤:在让模型生成回答之前,先给它一套"宪法"——一组原则,比如"回答应该无害、诚实、对用户有益"。模型先生成初始回答,再用宪法里的原则对自己的回答进行批判,然后基于批判修改回答。这个"生成-批判-修改"的循环本身就产生了训练数据:修改后的回答比初始回答更好,这是一个自动生成的偏好标签对。
五、STaR:错了重新想,想对了记下来
STaR(Self-Taught Reasoner,自我教导推理者)是 2022 年 Google 提出的方法,针对的是需要多步推理的任务(数学题、逻辑推理)。
训练循环:
- 给模型一道题,让它生成推理过程(Chain of Thought)和最终答案
- 对答案做自动验证——答案对了,把这道题 + 这条推理过程加入训练集;答案错了,进入步骤 3
- 给模型看正确答案,提示它"已知答案是 X,重新推导推理过程"——让模型逆向生成一条能得到正确答案的推理链
- 把逆向生成的推理过程也加入训练集
- 用这一轮收集的数据微调模型,得到新模型,再从步骤 1 开始
关键在于步骤 2:只有"答对了"的推理过程才被保留作为训练数据。这是一个自动的质量过滤器——模型不是在记住所有的推理,而是在积累那些"有效推理"的样本。随着迭代,模型能做对的题越来越多,训练数据的质量也在提升。
STaR 实验显示,在算术推理任务上,迭代 5 轮之后,模型的准确率从初始的约 10% 提升到约 40%,而这个过程只使用了 6000 道题的问题集,没有任何人工标注的推理过程。
这条路径本质上是:用"结果正确"作为监督信号,而不是用"推理过程正确"。结果正确性往往可以自动验证(数学题有标准答案),推理过程正确性则需要人工判断。
六、五条路径的共同结构
把这五条路径放在一起,会发现它们有一个共同的结构:
五条路径的区别在于"监督信号来源"这一环:
- 自监督学习:信号来自数据本身的内部结构(遮盖词 / 下一个词)
- 自博弈:信号来自对弈的客观结果(胜负)
- 合成数据:信号来自更强的模型(教师模型的输出即答案)
- RLAIF:信号来自另一个 AI 模型的偏好判断
- STaR:信号来自结果的可验证正确性(答案对不对)
选择哪条路径,取决于你的任务有什么性质:有没有客观可验证的结果?有没有比目标模型更强的模型可用?数据内部有没有可利用的结构?
七、总结
- 自监督学习:从数据内部结构构造标注——BERT 掩码预测、GPT 下一词预测。无需任何人工标注,可以无限扩展
- 自博弈:用对弈/竞争产生结果信号——AlphaZero 从零出发,用胜负训练策略网络和价值网络
- 合成数据:强模型给弱模型生成训练样本——Alpaca 用 GPT 生成 52K 条指令数据微调 LLaMA
- RLAIF:用 AI 代替人类做偏好评估——Constitutional AI 让模型对自己的输出批判并修改,产生偏好对
- STaR:错了重新推理,答对了的推理才进训练集——用结果正确性作为过滤器积累高质量推理数据
这五条路径都在解决同一个问题:如何在没有(或减少)人工标注的前提下,为模型的训练提供可靠的监督信号。它们的出现,是机器学习从"依赖人工标注"向"从数据和环境中自动获取信号"演化的缩影。