模拟学习
1 篇相关分析 · 8 条核心论点 · 更新于 2026年7月3日
围绕「模拟学习」,观澜 Insight 汇集了 1 篇来自 Dwarkesh Patel的研读分析,并抽取 8 条带出处的核心论点。代表性观点包括:大量核心人类技能(创业、诉讼、交易、政治操作)根本无法构建可磨模拟器,这意味着 RLVR 范式的覆盖范围有根本性边界——在这些领域,模型必须从稀缺、非结构化、模糊的真实世界交互中学习;三层递进的训练范式路线图:预训练创造基础智能 → RLVR 创造能广泛部署的智能体 → 广泛部署为持续学习创造条件——AI 改进将逐渐从「发布前训练」转向「部署后经验积累」;终局图景:AI 改进的主要引擎从实验室训练转向全球部署网络效应——每个用户的每次交互都在让所有人的 AI 变得更聪明,形成前所未有的集体学习飞轮。
代表论点
Dwarkesh Patel ·《What does the next training paradigm look like?》
▶ 4:47 查看出处作者列举:从零创业、打赢官司、交易日盈利、赢得选举——这些都需要真实世界交互,外环验证需数月甚至数年,且无法通过扰动行为并行重放来隔离因果。作者将此定性为 RL 已知的「无重置、非稳态环境」问题。
主题:模拟学习
Dwarkesh Patel ·《What does the next training paradigm look like?》
▶ 17:24 查看出处作者为 2027-2028 描绘的路线图:RLVR 训练出基础智能体 → 投入真实世界工作 → 上下文窗口扩展到整周协作 → 周末评价反馈 → 蒸馏回权重 → 能力扩展到相邻领域 → 下一轮循环。每一层训练范式(预训练→RLVR→持续学习)都是下一层的前提条件。
主题:模拟学习
Dwarkesh Patel ·《What does the next training paradigm look like?》
▶ 19:09 查看出处每次交互让 AI 更聪明,不仅因为学习了你的历史会话,还因为学习了全球所有用户交互。作者用「可怕、令人兴奋」来形容这一前景,暗示其社会影响的双面性。
主题:模拟学习
Dwarkesh Patel ·《What does the next training paradigm look like?》
▶ 7:50 查看出处30-50% 算力用于推理但不对模型改进产生贡献;模型在部署中接触到组织特异性隐性知识却无法利用;类比「天才研究生从未被允许实习」。同时指出上下文内学习的快速权重(KV cache)扩展性极差,且并非人类学习方式。
主题:模拟学习
- RLVR(可验证奖励的强化学习)是各大实验室通向 AGI 的核心赌注,但其适用性有一个被低估的结构性前提:领域不仅需要可验证,还必须「可磨」——能构建确定性、可重放、可并行 rollout 的模拟器高置信
Dwarkesh Patel ·《What does the next training paradigm look like?》
▶ 2:59 查看出处作者通过「计算机使用进展缓慢」这一可观察异常现象切入:该领域可验证性很强(订单是否送达、场地是否预订),但进展远落后于编程和数学。原因在于编程可在容器化环境中并行运行数千个相同起点的 rollout,而计算机使用无法在亚马逊等真实网站上重放(会被封杀)。结论:仅可验证不够,还需要可磨(grindable)——可构建确定性、可重置的模拟器。
主题:模拟学习
Dwarkesh Patel ·《What does the next training paradigm look like?》
▶ 12:56 查看出处OPSD 鼓励基座模型匹配积累了完整会话上下文的「老兵模型」的预测分布,逐 token 提供密集监督信号。优势:(1) 不需外环可验证奖励;(2) 保留 RL 的稀疏更新特性——只修改对结果绝对必要的部分,不覆盖其他知识。对比 SFT 的缺陷:SFT 要求预测所有 token 等同于背诵全天对话。
主题:模拟学习
分歧与反方线索
- 终局图景:AI 改进的主要引擎从实验室训练转向全球部署网络效应——每个用户的每次交互都在让所有人的 AI 变得更聪明,形成前所未有的集体学习飞轮
Dwarkesh Patel ·《What does the next training paradigm look like?》 · ▶ 19:09
- 反方:跨用户学习引发严重的隐私和竞争问题——企业可能抵制
- 反方:模型可能从用户交互中学到不良行为或偏见并放大
- OPSD(在策略自蒸馏)是当前最具潜力的持续学习技术——将稀缺真实世界经验中的所有信号挤压为微小而精准的权重更新,兼具 RL 的稀疏优势和监督学习的信号密度
Dwarkesh Patel ·《What does the next training paradigm look like?》 · ▶ 12:56
- 反方:OPSD 仍处于早期讨论阶段,尚未在大规模部署中得到验证
- 反方:老兵模型的能力上限约束了蒸馏效果——如果上下文内学习本身有限,蒸馏也无法突破
- RLVR 泛化能力可能并非无限——Dario Amodei 的言论暗示,短上下文 RL 训练未必泛化到长上下文表现,更遑论从受限环境泛化到开放世界
Dwarkesh Patel ·《What does the next training paradigm look like?》 · ▶ 6:55
- 反方:上下文长度泛化和任务分布泛化可能是不同机制,类比不一定成立
- 反方:足够的规模化可能突破这些限制——Amodei 本人可能也相信规模化能解决
- 「梦想」(Dreaming / Test-Time Training)——AI 自建模拟环境进行排练——若成功,将成为继预训练、RL、推理时计算后的第四扩展轴,极大缓解真实世界数据稀缺问题
Dwarkesh Patel ·《What does the next training paradigm look like?》 · ▶ 15:32
- 反方:为复杂现实世界构建有用模拟器本身可能就是 AGI-complete 的问题
- 反方:模拟与现实之间的分布偏移可能严重限制迁移效果
来源报告
- What does the next training paradigm look like?
Dwarkesh Patel
RLVR 规模化是当前通往 AGI 的核心赌注,但「可验证」不等于「可训练」——计算机使用的迟缓揭示了「可磨性」(能并行重放)才是真正前提,而大量人类技能根本不具备此条件。下一范式必须解决持续学习:OPSD 能将稀缺的部署经验蒸馏为精准权重更新,「梦想」则让 AI 自建模拟器排练技能。终局中,AI 进步的主要引擎将从实验室训练转向全球用户的每一次交互——形成令人兴奋又可怕的集体学习飞轮。
常见问题
关于「模拟学习」,有哪些值得看的分析?
观澜 Insight 收录了 1 篇相关研读分析,来自 Dwarkesh Patel,包括《What does the next training paradigm look like?》等。每篇都把音视频原文提炼为可形成判断的结构化报告。