知名播客主持人德瓦杰什·帕特尔邀请Zyphra的贝伦·米利奇、Thinking Machines的约翰·舒尔曼和Baseten的查理·奥尼尔三位AI研究者,围绕递归自我改进(RSI)展开讨论,三人虽存分歧但基本共识是当前技术路径存在多个未解瓶颈,RSI不会迅速发生,其中米利奇认为最大阻碍来自监管,舒尔曼指出模型“品味”和长期判断力远弱于人类,奥尼尔则认为关键卡点在于AI能否自主设定研究目标。
关于中国实验室的追赶,讨论指出蒸馏只需少量轨迹就能复制能力,是对抗中心化的主要力量,且前沿实验室与中国公司能买到同样的数据,真实世界用户分布比RL环境更重要,前沿实验室在RL环境上的优势可能没有想象中大。
关于强化学习,米利奇指出大量被归因于RL的成功实际来自中间训练,RL本身只是策略微调但信噪比远高于监督微调,奥尼尔则发现RL带来的主要泛化是时间跨度上的——模型学会了在更长任务上持续工作。
嘉宾对时间线的判断差异显著:AI成为全面远程工作者需一到三年,AI研究者实现10倍生产力提升需约两年,AI在所有领域超越顶级人类专家需三到十年;此外实验显示数据解释了约12倍计算效率提升而架构改进仅约3.7倍,蒸馏还带来“单一文化”隐忧,太多模型蒸馏Claude导致开源模型写法趋同。
