推理时计算:让模型「慢下来想」,而不是「更大更快」

过去几年,AI 能力的提升主要靠一件事:把模型做大。更多参数、更多训练数据、更多算力——这条路被称为"训练时扩展"(Training-Time Scaling),Scaling Law 描述了它的规律。

2024 年之后,一条新的路开始被认真对待:不增加模型大小,而是在推理时给模型更多计算资源,让它在给出答案之前多想一会儿。这条路被称为"推理时计算"(Test-Time Compute)或"推理时扩展"(Inference-Time Scaling)。

o1 和 DeepSeek-R1 是最知名的实现。但推理时计算的核心思路早于这些模型,理解它需要从更基础的地方说起。

一、为什么「多想一会儿」能有帮助

语言模型在默认情况下是这样工作的:给定输入,直接生成输出,每个 token 的生成基于之前所有 token 的概率分布,一次前向传播,结束。这个模式很快,但有一个内在限制:模型在生成答案时,用于思考这个问题的计算量是固定的——无论问题是"1+1 等于几"还是"证明黎曼猜想",模型处理它们花的计算量是一样的。

这和人类思考方式明显不同。人类遇到简单问题时直接反应("这是什么颜色?"——"红色"),遇到复杂问题时会慢下来,逐步推理,验证中间结论,甚至走错路之后回头重来。

推理时计算的核心思路是:给模型一个机制,让它在给出最终答案之前,花时间做中间推理步骤。这些中间步骤消耗额外的计算,但换来了更高质量的最终答案。

为什么这有效?从信息论角度看,对于困难问题,正确答案的"寻找难度"远高于"验证难度"——找到一个数学证明很难,但验证一个已有证明是否正确相对容易。给模型更多计算时间,相当于给它更多机会探索可能的推理路径,而不只是在第一次尝试时凭直觉猜一个答案。

二、Chain of Thought:最简单的推理时计算

Chain of Thought(CoT,思维链)是最早被系统研究的推理时计算形式。做法很简单:不让模型直接输出答案,而是让它先把推理过程写出来,再给出答案。

2022 年 Google 的论文展示,在数学和逻辑推理任务上,加上"Let's think step by step"这一句提示,模型的准确率有时能提升一倍以上。

为什么有效?有两个互补的解释:

1. 把复杂问题分解成简单子步骤。直接计算"23 × 47 = ?"对模型来说是一次很难的单步预测,但如果先写出"23 × 40 = 920,23 × 7 = 161,920 + 161 = 1081",每一步都是简单的,累积起来得到正确答案的概率高得多。

2. 中间步骤作为"工作内存"。语言模型的上下文窗口是它的工作内存。把推理过程写出来,就是在扩展工作内存——后续的推理步骤可以直接引用已经写出来的中间结论,而不是全部装在隐含状态里。

CoT 的局限是:它依赖单条推理路径,一旦这条路走错了,后续推理都在错误的基础上继续,无法自我纠正。

三、从单条路径到多路探索

为了解决 CoT 的单路径问题,一个自然的想法是:生成多条推理路径,从中选最好的。

问题输入 推理路径 A 步骤 1 → 2 → 3 → 答案 X 推理路径 B ✓ 步骤 1 → 2 → 3 → 答案 Y 推理路径 C ✗ 步骤 1 → 错误 → 答案 Z 验证/选择 奖励模型评分 最佳答案 答案 Y
多路探索:生成多条推理路径,用验证器选出最佳路径

Self-Consistency(自一致性)

最简单的多路探索方法:对同一个问题生成多条推理路径(通过调高采样温度增加多样性),然后对最终答案投票——最多条路径得出的答案,是最终答案。

这个方法在数学推理任务上很有效,原因是:错误的推理路径往往走向不同的错误答案,而正确路径趋向同一个正确答案。多数投票能过滤掉随机错误。

Best-of-N(取最优)

生成 N 条推理路径,用一个奖励模型给每条路径打分,选得分最高的。比投票更精细,因为奖励模型能评估推理过程的质量,而不只是最终答案。

研究发现,对于很多任务,Best-of-N 在 N 较大时能接近比当前模型大一个数量级的模型的效果——也就是说,用更多推理计算换来了本需要更大模型才有的能力。

更系统的探索方式:把推理过程建模成一棵树,每个节点是一个推理步骤,从根节点(问题)出发,探索多条分支,在探索过程中评估每个节点的价值,选择最有前途的路径继续深入。

这是 AlphaGo 和 AlphaZero 的核心机制(蒙特卡洛树搜索,MCTS)移植到语言模型领域的版本。

四、验证比生成容易:推理时计算的核心洞察

推理时计算能工作,依赖一个关键的不对称性:验证一个答案是否正确,往往比生成一个正确答案更容易

这在数学领域最直观。生成一个完整的数学证明极难,但验证一个已有证明每一步是否有效相对容易。围棋中判断一步棋好不好比下出一步好棋容易。密码学里验证一个哈希比找到碰撞容易得多。

这个不对称性意味着:即使一个模型无法直接生成正确答案,它也可能有足够的能力验证一个候选答案是否正确。如果这成立,推理时计算的流程就是:用生成能力产生多个候选,用验证能力筛选出最好的

这也解释了为什么奖励模型(Reward Model)在推理时计算里扮演核心角色——它就是那个"验证器"。

五、过程奖励模型(PRM):评估每一步

奖励模型有两种:

结果奖励模型(Outcome Reward Model,ORM):只看最终答案对不对。训练简单,但反馈粗糙——即使最终答案错了,也不知道是哪一步出了问题。

过程奖励模型(Process Reward Model,PRM):评估推理过程中每一个中间步骤的正确性,不只看最终答案。这提供了更细粒度的信号——可以找到推理链中第一个出错的节点,也可以在搜索过程中更早地剪枝掉错误的路径。

PRM 比 ORM 强大,但训练代价更高:需要对每个推理步骤标注"对"或"错",而 ORM 只需要标注最终答案。OpenAI 发布了一个专门针对数学推理的 PRM 数据集(PRM800K),包含了对数万条推理链中每个步骤的人工标注。

PRM 的作用不只是在推理结束后打分,更重要的是在树搜索过程中实时指导探索:走到某个中间步骤时,PRM 预测这条路径走到最后得到正确答案的概率,用这个概率决定是继续探索这条路还是回退尝试其他分支。

六、o1 和 DeepSeek-R1 做了什么

o1(OpenAI,2024 年 9 月)和 DeepSeek-R1(2025 年 1 月)是推理时计算目前最知名的工业实现。两者都没有完全公开技术细节,但从论文、技术报告和社区逆向工程来看,核心机制是类似的。

关键不在于推理时的搜索,而在于把长推理链的能力训练进了模型本身

具体来说:

训练阶段:用强化学习让模型学会生成长的、包含自我验证和回溯的推理过程。训练信号来自推理过程最终是否得到正确答案(而不是人工标注的每一步)。模型通过大量的强化学习迭代,自发学会了"想错了就重新来"、"先写出中间结论再继续"、"检查一下之前的推理是否有误"这类行为。

推理阶段:模型生成一段包含大量中间推理步骤的"思考过程"(在 o1 里这部分被隐藏,用户只看到最终答案;在 DeepSeek-R1 里默认可见,用 `...` 标签包裹),然后基于这段思考给出答案。

这和纯粹的推理时搜索(Best-of-N 或树搜索)不同——那些方法需要外部的搜索框架和奖励模型。o1/R1 把推理能力内化到了模型权重里,推理时不需要额外的搜索框架,只是模型自己在生成更长的输出。

DeepSeek-R1 的贡献在于公开了训练细节:它先用蒸馏(把 DeepSeek-R1 的推理数据用来训练更小的模型)加 GRPO(一种策略梯度强化学习算法)的组合来训练,展示了一个较低成本的路径来获得推理能力。

七、代价与适用场景

推理时计算不是免费的,它有明确的代价:

延迟增加。生成思维链意味着输出更多 token,用户等待时间更长。o1 的响应时间比普通 GPT-4 长得多,在某些复杂问题上需要等待几十秒甚至几分钟。

成本增加。更多 token = 更多 API 调用成本。对于简单问题,用 o1 是浪费。

效果提升不均匀。推理时计算对需要多步推理的任务效果显著:数学证明、复杂代码生成、需要多步逻辑推导的问答。对于事实检索、简单分类、创意写作,效果提升有限甚至没有。

使用推理时计算的经验法则:

  • 问题有明确的正确/错误答案,且需要多步推导 → 适合
  • 问题可以自动验证(数学题、代码能跑测试) → 尤其适合
  • 对延迟敏感(实时聊天、交互式应用) → 慎用
  • 问题答案主观或开放式 → 效果有限

八、更大的意义

推理时计算的出现,改变了一个长期以来的假设:AI 能力 ≈ 模型大小。

现在这个等式有了另一个变量:给定同一个模型,推理时花多少计算量,也会显著影响输出质量。这意味着:

更小的模型有时可以用更多推理计算来追赶更大的模型。在很多任务上,一个 7B 参数的模型配合 Best-of-64 采样,能接近一个不做推理扩展的 70B 模型。

计算资源的分配策略变得重要。同样的推理预算,是用来运行一个大模型跑一次,还是运行一个中等模型跑很多次再选最好的?这个问题现在有了实质性的工程意义。

训练和推理的边界模糊了。传统上,能力在训练时固化,推理时只是"使用"训练好的能力。推理时计算让推理阶段也成了"解决问题"的一部分,模型在推理时主动探索、验证、回溯。这更接近人类解决困难问题的方式。

九、总结

  • 核心思路:给同一个模型更多推理时计算,让它生成中间推理步骤,而不是直接输出答案
  • 为什么有效:验证比生成容易,多步推理把难问题分解成简单子步骤
  • 技术路径:CoT(单路径)→ Self-Consistency/Best-of-N(多路径+选择)→ 树搜索(系统性探索)
  • 关键基础设施:过程奖励模型(PRM)评估中间步骤,比结果奖励模型(ORM)更细粒度
  • o1/R1 的做法:把长推理能力训练进模型权重,推理时不需要外部搜索框架
  • 代价:延迟和成本都增加,只在需要多步推理的任务上有明显收益
  • 更大意义:AI 能力不再只取决于模型大小,推理时计算量也是一个可以独立调节的维度