观澜 INSIGHT · 自动研读

What does the next training paradigm look like?

Dwarkesh Patel · YouTube · · 原文 ↗

TL;DR

RLVR 规模化是当前通往 AGI 的核心赌注,但「可验证」不等于「可训练」——计算机使用的迟缓揭示了「可磨性」(能并行重放)才是真正前提,而大量人类技能根本不具备此条件。下一范式必须解决持续学习:OPSD 能将稀缺的部署经验蒸馏为精准权重更新,「梦想」则让 AI 自建模拟器排练技能。终局中,AI 进步的主要引擎将从实验室训练转向全球用户的每一次交互——形成令人兴奋又可怕的集体学习飞轮。

全文总结

这是一篇关于 AI 下一训练范式的深度分析视频论文。作者 Dwarkesh Patel 的起点是各大实验室的核心赌注:通过在数千个多样化 RL 环境中训练 AI 完成数百万可验证任务,规模化 RLVR 将产生通用问题解决智能体(AGI)。但作者通过一个看似离题的观察揭示了该范式的结构性限制——计算机使用明明高度可验证,进展却远落后于编程和数学。深层原因是:仅有可验证性不够,还需要「可磨性」——能在确定性、可重置模拟器上运行大量并行 rollout。编程可以容器化,但亚马逊结账流程无法重放(会被封杀),而从零创业、打赢官司、赢得选举等大量核心人类技能根本没有可构建的模拟器。 这一限制的根源在于模型训练时的样本效率极低(仅为人类百万分之一),而世界多数领域的数据稀疏、非结构化且不可验证。实验室寄望 RLVR 泛化——在足够多容器化环境上训练出的智能体能直接胜任现实世界任意任务——但 Dario Amodei 关于「短上下文训练未必泛化到长上下文服务」的评论暗示这一泛化并非无限。 与此同时,30-50% 的算力用于推理却对模型改进毫无贡献,而最宝贵的学习信号恰恰在部署中暴露。解决方案需要持续学习:OPSD(在策略自蒸馏)将积累了完整会话上下文的「老兵模型」的预测分布蒸馏回基座权重,兼具 RL 的稀疏更新优势和监督学习的信号密度。更投机的方向是「梦想」——AI 自建模拟环境排练技能,可能成为第四扩展轴。作者描绘的 2027-2028 路线图是一个三层递进结构:预训练→RLVR→持续学习,最终 AI 改进的主要来源从发布前训练转向全球部署网络效应。

中心主张:当前以 RLVR 规模化为核心的训练范式虽取得了显著进展,但存在结构性边界——大量人类核心技能无法构建可磨(grindable)模拟器,且推理阶段的学习信号被系统性浪费。下一训练范式必须攻克持续学习:通过 OPSD 等技术将部署经验蒸馏回权重,并可能走向「梦想」(测试时训练)作为第四扩展轴,最终使 AI 改进的主要来源从训练转向部署。

章节精读

RLVR 赌注、可磨性鸿沟与持续学习之缺失

本章是全文的论点奠基,围绕一个核心张力展开:各大实验室押注 RLVR(可验证奖励的强化学习)规模化能通向 AGI,但作者通过「计算机使用为何进展缓慢」这一看似离题的切角,揭示了该范式的结构性限制。 关键逻辑链:(1) 计算机使用明明可验证(订的货到了吗?活动场地订了吗?),进展却远落后于编程和数学;(2) 深层原因是仅「可验证」不够,还须「可磨」(grindable)——能在确定性、可重置模拟器中运行数千并行 rollout;(3) 无法为亚马逊结账流程做千次并行重放,因为会被封杀;(4) 只有能构建高保真模拟器的领域,RLVR 才有效;(5) 大量人类核心技能——从零创业、打赢官司、赢得选举——根本没有可复现的模拟器,验证信号需要数月甚至数年的真实世界反馈,且无法通过扰动模型行为来隔离因果。 这一论证的力量在于,它并非从理论出发否定 RLVR,而是从一个具体、可观察的异常现象(计算机使用滞后)倒推出范式的「峡谷壁」——进展之河只能缓慢侵蚀的边界。 作者进一步引入 Dario Amodei 的引语作为外部证据:短上下文 RL 训练未必泛化到长上下文表现。如果连「短→长」的泛化都成问题,那么从「白领任务训练」到「现实世界创业」的泛化就是更大的跳跃。 关于持续性学习,作者用了一个有力的类比:我们有一个天才研究生,却不让它实习——只给课堂案例(RL 环境训练),而它在部署中接触的组织特异性隐性知识全被浪费。30-50% 的算力花在推理上,却对模型改进毫无贡献。 人类学习的对比也很有启发性:人类将经验压缩为直觉和全局认知「凿回权重」,而非像自学者症候群那样逐字记忆。但梯度更新的样本效率极低——Cursor Tab 需要每天 4 亿次请求学习同一件事,而现实世界的每个部署场景都是独特的,无法收敛到共享训练。

RLVR 规模化是通往 AGI 的核心赌注,但「计算机使用进展缓慢」揭示了一个结构性限制:仅有可验证性不够,还需要可构建确定性、可重置的模拟器进行大规模并行训练。大量人类核心技能缺乏这种条件,而 RLVR 的泛化能力——尤其是从短上下文训练到长上下文表现、从白领任务到现实世界创业——远未被证实。同时,当前范式浪费了部署阶段暴露的宝贵学习信号。

OPSD、梦想与持续学习的路线图

12:01
本章从「样本效率和持续学习是深度关联的问题」这一命题出发,展开技术解决方案和未来图景。 核心论证结构: **问题诊断**:上下文内学习的快速权重(fast weights via attention)样本效率高,但内存扩展性极差;而权重更新(梯度下降)内存高效但样本效率极低。需要中间表征的架构创新,但作者判断架构并非根本瓶颈——瓶颈可能在损失函数:如何根据单次会话学到的信息更新权重。 **OPSD 方案**:On-Policy Self-Distillation(在策略自蒸馏)是当前讨论较多的一种思路——鼓励基座模型在解决真实问题时,做出与积累了完整会话上下文的「老兵」模型相同的预测。这比 RLVR 有两个优势:(1) 不需要外环可验证奖励,只需模型能在上下文窗口内学会正确的东西;(2) 提供比朴素 RL 密集得多的监督信号——基于逐 token 概率差异而非整个轨迹的单一奖励信号。 作者特别指出 OPSD 对比监督微调(SFT)的优势:SFT 会让基座模型预测会话中所有 token——这相当于要求逐字背诵每天的对话记录,而不是提取少数真正有助于提升工作的洞察。RL 擅长将更新集中到对结果真正相关的内容,这种稀疏性是优势而非缺陷——它只做绝对必要的模型修改,避免覆盖基座模型的其他知识。OPSD 保留了这一特性。 **Dreaming 设想**:一个更投机但更宏大的方向。如果 AI 能自建现实模拟器来排练技能、尝试替代策略并强化有效行为,就能在相同时间获得数量级的模拟样本。EfficientZero 的先例:对真实游戏中的每一步,模型在脑内玩数十局模拟游戏。区别在于,为整个世界建模拟器远比模拟围棋困难。若成功,这将成为继预训练、RL、推理时计算后的第四扩展轴——「测试时训练」或「梦想」。 **2027-2028 路线图**:RLVR 先产生能在陌生问题上摸索迭代的基础智能体 → 投入真实世界工作 → 上下文窗口扩展到能容纳整周协作 → 周末给出好评/差评 → 通过 OPSD/ dreaming/未知技术将会话学习蒸馏回权重 → 下一轮模型在相邻领域变得更强。如此,AI 能力可从可验证领域逐步扩展到远超原始训练分布的范围。 作者描绘的终局:AI 改进的主要来源不再是发布前的训练,而是广泛部署后积累的海量经验——每次交互都让 AI 变得更聪明,不仅因为学习了你的历史会话,还因为学习了全球所有用户交互。这既是令人兴奋的,也是令人恐惧的。

持续学习的瓶颈不在架构而在损失函数——OPSD 通过将会话学习蒸馏为精准权重更新提供了一条路径;更投机的「梦想」方向可能成为第四扩展轴。未来路线图:RLVR → 真实部署 → 会话反馈 → 权重蒸馏 → 能力扩展,最终 AI 改进主要来自部署经验而非训练。

核心论点

  • RLVR(可验证奖励的强化学习)是各大实验室通向 AGI 的核心赌注,但其适用性有一个被低估的结构性前提:领域不仅需要可验证,还必须「可磨」——能构建确定性、可重放、可并行 rollout 的模拟器

    2:59 原文证据

    作者通过「计算机使用进展缓慢」这一可观察异常现象切入:该领域可验证性很强(订单是否送达、场地是否预订),但进展远落后于编程和数学。原因在于编程可在容器化环境中并行运行数千个相同起点的 rollout,而计算机使用无法在亚马逊等真实网站上重放(会被封杀)。结论:仅可验证不够,还需要可磨(grindable)——可构建确定性、可重置的模拟器。

  • 大量核心人类技能(创业、诉讼、交易、政治操作)根本无法构建可磨模拟器,这意味着 RLVR 范式的覆盖范围有根本性边界——在这些领域,模型必须从稀缺、非结构化、模糊的真实世界交互中学习

    4:47 原文证据

    作者列举:从零创业、打赢官司、交易日盈利、赢得选举——这些都需要真实世界交互,外环验证需数月甚至数年,且无法通过扰动行为并行重放来隔离因果。作者将此定性为 RL 已知的「无重置、非稳态环境」问题。

  • 当前范式存在系统性浪费——推理算力占比巨大却无法反哺训练,而最宝贵的学习信号恰恰在部署中暴露;持续学习(将部署经验压缩回权重)是必须攻克的技术挑战

    7:50 原文证据

    30-50% 算力用于推理但不对模型改进产生贡献;模型在部署中接触到组织特异性隐性知识却无法利用;类比「天才研究生从未被允许实习」。同时指出上下文内学习的快速权重(KV cache)扩展性极差,且并非人类学习方式。

  • 三层递进的训练范式路线图:预训练创造基础智能 → RLVR 创造能广泛部署的智能体 → 广泛部署为持续学习创造条件——AI 改进将逐渐从「发布前训练」转向「部署后经验积累」

    17:24 原文证据

    作者为 2027-2028 描绘的路线图:RLVR 训练出基础智能体 → 投入真实世界工作 → 上下文窗口扩展到整周协作 → 周末评价反馈 → 蒸馏回权重 → 能力扩展到相邻领域 → 下一轮循环。每一层训练范式(预训练→RLVR→持续学习)都是下一层的前提条件。

  • 终局图景:AI 改进的主要引擎从实验室训练转向全球部署网络效应——每个用户的每次交互都在让所有人的 AI 变得更聪明,形成前所未有的集体学习飞轮

    19:09 原文证据

    每次交互让 AI 更聪明,不仅因为学习了你的历史会话,还因为学习了全球所有用户交互。作者用「可怕、令人兴奋」来形容这一前景,暗示其社会影响的双面性。

    反方 / 不确定

    • 跨用户学习引发严重的隐私和竞争问题——企业可能抵制
    • 模型可能从用户交互中学到不良行为或偏见并放大
  • RLVR 泛化能力可能并非无限——Dario Amodei 的言论暗示,短上下文 RL 训练未必泛化到长上下文表现,更遑论从受限环境泛化到开放世界

    6:55 原文证据

    引用 Dario Amodei 在播客中的话:「如果你在小上下文长度训练然后尝试在长上下文长度服务,可能会出现性能退化。」作者推断:若短→长的泛化都存在问题,从白领任务训练到现实世界创业的泛化更是巨大跳跃。但作者也承认「也许我过度解读了」。

    反方 / 不确定

    • 上下文长度泛化和任务分布泛化可能是不同机制,类比不一定成立
    • 足够的规模化可能突破这些限制——Amodei 本人可能也相信规模化能解决
  • OPSD(在策略自蒸馏)是当前最具潜力的持续学习技术——将稀缺真实世界经验中的所有信号挤压为微小而精准的权重更新,兼具 RL 的稀疏优势和监督学习的信号密度

    12:56 原文证据

    OPSD 鼓励基座模型匹配积累了完整会话上下文的「老兵模型」的预测分布,逐 token 提供密集监督信号。优势:(1) 不需外环可验证奖励;(2) 保留 RL 的稀疏更新特性——只修改对结果绝对必要的部分,不覆盖其他知识。对比 SFT 的缺陷:SFT 要求预测所有 token 等同于背诵全天对话。

    反方 / 不确定

    • OPSD 仍处于早期讨论阶段,尚未在大规模部署中得到验证
    • 老兵模型的能力上限约束了蒸馏效果——如果上下文内学习本身有限,蒸馏也无法突破
  • 「梦想」(Dreaming / Test-Time Training)——AI 自建模拟环境进行排练——若成功,将成为继预训练、RL、推理时计算后的第四扩展轴,极大缓解真实世界数据稀缺问题

    15:32 原文证据

    类比 EfficientZero——对真实游戏每一步进行数十局脑内模拟。若 AI 能自建现实模拟器排练技能,可在相同时间获得数量级样本。这将形成第四扩展轴(测试时训练/梦想)。作者明确标注为「更投机」。

    反方 / 不确定

    • 为复杂现实世界构建有用模拟器本身可能就是 AGI-complete 的问题
    • 模拟与现实之间的分布偏移可能严重限制迁移效果

待验证

  • 7:03

    Dario Amodei 关于短上下文训练与长上下文服务之间性能退化的引语

    引语来自 Dwarkesh 与 Dario 的播客对谈,可在原节目中核实上下文

  • 7:50

    实验室 30-50% 算力用于推理,当前对模型改进无贡献

    比例可能因实验室和时段而异,需核实是否有公开披露支持

  • 9:53

    Cursor Tab 每天处理超过 4 亿次在线学习请求(预测哪些编辑被用户接受)

    具体数字需要核实来源——可能来自 Cursor 官方披露或估算

  • 16:02

    EfficientZero 在与人类相同时间(2小时)玩未见过的 Atari 游戏时可能击败新手

    基于特定实验设置,实际结果可能因游戏类型和数据效率定义而异

建议行动

  • 理解 RLVR 泛化边界:在自己关注的应用领域中评估是否有可构建的确定性、可重置模拟器;若没有,需考虑替代训练路径
  • 关注 OPSD(on-policy self-distillation)论文与技术进展,评估能否用于将生产环境的会话经验蒸馏回模型权重
  • 追踪「dreaming / test-time training」方向:模型自建仿真环境进行排练,可能成为继预训练、RL、推理时计算后的第四扩展轴
  • 重新审视 AI 产品架构:推理阶段产生的 30-50% 算力当前被浪费,设计能捕获部署信号并反哺训练的系统
  • 在评估模型能力时区分两层样本效率:训练时(极低)与会话内(在改善),据此判断应用场景是否适合当前范式

查看 Dwarkesh Patel 的更多分析 →

Dwarkesh Patel · What does the next training paradigm loo…