What does the next training paradigm look like?
Dwarkesh Patel · YouTube · · 原文 ↗
TL;DR
RLVR 规模化是当前通往 AGI 的核心赌注,但「可验证」不等于「可训练」——计算机使用的迟缓揭示了「可磨性」(能并行重放)才是真正前提,而大量人类技能根本不具备此条件。下一范式必须解决持续学习:OPSD 能将稀缺的部署经验蒸馏为精准权重更新,「梦想」则让 AI 自建模拟器排练技能。终局中,AI 进步的主要引擎将从实验室训练转向全球用户的每一次交互——形成令人兴奋又可怕的集体学习飞轮。
全文总结
中心主张:当前以 RLVR 规模化为核心的训练范式虽取得了显著进展,但存在结构性边界——大量人类核心技能无法构建可磨(grindable)模拟器,且推理阶段的学习信号被系统性浪费。下一训练范式必须攻克持续学习:通过 OPSD 等技术将部署经验蒸馏回权重,并可能走向「梦想」(测试时训练)作为第四扩展轴,最终使 AI 改进的主要来源从训练转向部署。
章节精读
RLVR 赌注、可磨性鸿沟与持续学习之缺失
RLVR 规模化是通往 AGI 的核心赌注,但「计算机使用进展缓慢」揭示了一个结构性限制:仅有可验证性不够,还需要可构建确定性、可重置的模拟器进行大规模并行训练。大量人类核心技能缺乏这种条件,而 RLVR 的泛化能力——尤其是从短上下文训练到长上下文表现、从白领任务到现实世界创业——远未被证实。同时,当前范式浪费了部署阶段暴露的宝贵学习信号。
OPSD、梦想与持续学习的路线图
12:01持续学习的瓶颈不在架构而在损失函数——OPSD 通过将会话学习蒸馏为精准权重更新提供了一条路径;更投机的「梦想」方向可能成为第四扩展轴。未来路线图:RLVR → 真实部署 → 会话反馈 → 权重蒸馏 → 能力扩展,最终 AI 改进主要来自部署经验而非训练。
核心论点
- ▶ 2:59 原文证据
RLVR(可验证奖励的强化学习)是各大实验室通向 AGI 的核心赌注,但其适用性有一个被低估的结构性前提:领域不仅需要可验证,还必须「可磨」——能构建确定性、可重放、可并行 rollout 的模拟器
◆ 高作者通过「计算机使用进展缓慢」这一可观察异常现象切入:该领域可验证性很强(订单是否送达、场地是否预订),但进展远落后于编程和数学。原因在于编程可在容器化环境中并行运行数千个相同起点的 rollout,而计算机使用无法在亚马逊等真实网站上重放(会被封杀)。结论:仅可验证不够,还需要可磨(grindable)——可构建确定性、可重置的模拟器。
- ▶ 4:47 原文证据
大量核心人类技能(创业、诉讼、交易、政治操作)根本无法构建可磨模拟器,这意味着 RLVR 范式的覆盖范围有根本性边界——在这些领域,模型必须从稀缺、非结构化、模糊的真实世界交互中学习
◆ 高作者列举:从零创业、打赢官司、交易日盈利、赢得选举——这些都需要真实世界交互,外环验证需数月甚至数年,且无法通过扰动行为并行重放来隔离因果。作者将此定性为 RL 已知的「无重置、非稳态环境」问题。
- ▶ 7:50 原文证据
当前范式存在系统性浪费——推理算力占比巨大却无法反哺训练,而最宝贵的学习信号恰恰在部署中暴露;持续学习(将部署经验压缩回权重)是必须攻克的技术挑战
◆ 高30-50% 算力用于推理但不对模型改进产生贡献;模型在部署中接触到组织特异性隐性知识却无法利用;类比「天才研究生从未被允许实习」。同时指出上下文内学习的快速权重(KV cache)扩展性极差,且并非人类学习方式。
- ▶ 17:24 原文证据
三层递进的训练范式路线图:预训练创造基础智能 → RLVR 创造能广泛部署的智能体 → 广泛部署为持续学习创造条件——AI 改进将逐渐从「发布前训练」转向「部署后经验积累」
◆ 高作者为 2027-2028 描绘的路线图:RLVR 训练出基础智能体 → 投入真实世界工作 → 上下文窗口扩展到整周协作 → 周末评价反馈 → 蒸馏回权重 → 能力扩展到相邻领域 → 下一轮循环。每一层训练范式(预训练→RLVR→持续学习)都是下一层的前提条件。
- ▶ 19:09 原文证据
终局图景:AI 改进的主要引擎从实验室训练转向全球部署网络效应——每个用户的每次交互都在让所有人的 AI 变得更聪明,形成前所未有的集体学习飞轮
◆ 高每次交互让 AI 更聪明,不仅因为学习了你的历史会话,还因为学习了全球所有用户交互。作者用「可怕、令人兴奋」来形容这一前景,暗示其社会影响的双面性。
反方 / 不确定
- 跨用户学习引发严重的隐私和竞争问题——企业可能抵制
- 模型可能从用户交互中学到不良行为或偏见并放大
- ▶ 6:55 原文证据
RLVR 泛化能力可能并非无限——Dario Amodei 的言论暗示,短上下文 RL 训练未必泛化到长上下文表现,更遑论从受限环境泛化到开放世界
◆ 中引用 Dario Amodei 在播客中的话:「如果你在小上下文长度训练然后尝试在长上下文长度服务,可能会出现性能退化。」作者推断:若短→长的泛化都存在问题,从白领任务训练到现实世界创业的泛化更是巨大跳跃。但作者也承认「也许我过度解读了」。
反方 / 不确定
- 上下文长度泛化和任务分布泛化可能是不同机制,类比不一定成立
- 足够的规模化可能突破这些限制——Amodei 本人可能也相信规模化能解决
- ▶ 12:56 原文证据
OPSD(在策略自蒸馏)是当前最具潜力的持续学习技术——将稀缺真实世界经验中的所有信号挤压为微小而精准的权重更新,兼具 RL 的稀疏优势和监督学习的信号密度
◆ 中OPSD 鼓励基座模型匹配积累了完整会话上下文的「老兵模型」的预测分布,逐 token 提供密集监督信号。优势:(1) 不需外环可验证奖励;(2) 保留 RL 的稀疏更新特性——只修改对结果绝对必要的部分,不覆盖其他知识。对比 SFT 的缺陷:SFT 要求预测所有 token 等同于背诵全天对话。
反方 / 不确定
- OPSD 仍处于早期讨论阶段,尚未在大规模部署中得到验证
- 老兵模型的能力上限约束了蒸馏效果——如果上下文内学习本身有限,蒸馏也无法突破
- ▶ 15:32 原文证据
「梦想」(Dreaming / Test-Time Training)——AI 自建模拟环境进行排练——若成功,将成为继预训练、RL、推理时计算后的第四扩展轴,极大缓解真实世界数据稀缺问题
◆ 低类比 EfficientZero——对真实游戏每一步进行数十局脑内模拟。若 AI 能自建现实模拟器排练技能,可在相同时间获得数量级样本。这将形成第四扩展轴(测试时训练/梦想)。作者明确标注为「更投机」。
反方 / 不确定
- 为复杂现实世界构建有用模拟器本身可能就是 AGI-complete 的问题
- 模拟与现实之间的分布偏移可能严重限制迁移效果
待验证
建议行动
- 理解 RLVR 泛化边界:在自己关注的应用领域中评估是否有可构建的确定性、可重置模拟器;若没有,需考虑替代训练路径
- 关注 OPSD(on-policy self-distillation)论文与技术进展,评估能否用于将生产环境的会话经验蒸馏回模型权重
- 追踪「dreaming / test-time training」方向:模型自建仿真环境进行排练,可能成为继预训练、RL、推理时计算后的第四扩展轴
- 重新审视 AI 产品架构:推理阶段产生的 30-50% 算力当前被浪费,设计能捕获部署信号并反哺训练的系统
- 在评估模型能力时区分两层样本效率:训练时(极低)与会话内(在改善),据此判断应用场景是否适合当前范式