AI递归自我改进(RSI)的时间表,正成为业界最具争议的核心命题。
在播客主持人Dwarkesh Patel与三位AI研究者的深度对谈中,OpenAI联合创始人、现Thinking Machines首席科学家John Schulman预判:距离AI在所有可在计算机上完成的认知工作中全面超越顶尖人类专家,可能只需3至4年。与此同时,三人一致认为,在AI研究者生产力提升方面,两年内实现10倍效率提升具有相当的可信度。
然而,通往RSI的道路并非坦途。对话揭示出一个核心矛盾:当前AI体系在"做什么"方面已接近人类水平,但在"决定做什么"这一更高层次的目标设定能力上,仍面临根本性挑战。三位研究者的判断在多个关键问题上出现分歧,反映出这一领域深层的不确定性。
RSI的技术瓶颈在哪里
参与对话的三位研究者分别是:John Schulman、Zyphra首席技术官Beren Millidge,以及模型训练平台Baseten模型训练负责人Charlie O'Neill。
在被问及2036年若未出现"超级智能大爆炸"最可能的原因时,三人给出了不同侧重的答案。
Beren Millidge将其归结为"类莫拉维克悖论"的延续——AI可能在所有基准测试上表现卓越,但始终存在某种难以跨越的"仿真到现实的鸿沟"(sim-to-real gap),使其无法真正渗透现实世界。John Schulman则指向一个反复出现的周期:新模型发布时令人震撼,但使用一段时间后又开始"显得迟钝"。他认为,这一循环可能比预期重复更多次,因为模型在研究和工程领域仍受制于自身判断力的不足。
Charlie O'Neill提出了更深层的架构问题:当前以Transformer加强化学习为核心的范式,距离理论上"芯片可承载的最优学习者"究竟有多远?他以摩尔定律类比——这条增长曲线看似平滑,背后实则依赖无数离散的技术突破。如果AI想变得更聪明,光靠现有的技术路径(比如现有的大语言模型)已经不够了,必须发明出全新的底层技术;但尴尬的是,现有的AI可能根本没这个本事帮我们把新技术发出来,结果导致AI的发展直接撞上天花板、停滞不前。
人类最后的护城河
John Schulman认为,即便AI承担全部技术工作,定义"我们到底想要什么"将是人类最后坚守的阵地。他将这一能力称为对齐(alignment)的第一要素——"目标规格化",即确定正确目标应是什么,而非仅仅实现一个已给定的目标。"后训练团队需要大量人员,根本原因是模型在无数场景下的行为方式必须由人来判断。"
Charlie O'Neill进一步区分了两类研究:一类是目标清晰、可量化优化的"自动化研究";另一类是推动范式转变所需的"开放式科学"——在这类研究中,目标本身无法被预先指定。他以GPT的诞生为例:从DeepMind"通过游戏解决智能问题"的路径,到Alec Radford选择"预测大规模文本的下一个token",这一跳跃并非优化的产物,而是人类直觉的闪现。AI系统能否复现这类跳跃,目前没有人有答案。
Beren Millidge将这一问题提炼为RSI的核心挑战:"要让AI进入自驱动循环,它必须能提出目标、优化目标、判断结果,再提出新目标,并且这一循环长期不脱轨。"他警告,这或许是另一个版本的莫拉维克悖论——对人类而言最自然的自主性,对AI而言可能恰恰最难复制。
持续学习:模型能否从部署中进化
对话中一个反复被追问的问题,是推理计算是否应当反哺模型训练。Charlie O'Neill以Cursor的Composer为例,描述了一种更实时的闭环:模型每五小时评估一次在内部基准上的表现,若有改善则部署,若没有则丢弃该版本。
然而,当这一循环被放大到微观层面——针对单一企业、单一任务持续进行小批量更新时,问题便接踵而至。Charlie O'Neill指出,无论是监督微调(SFT)还是在线策略蒸馏,在迭代到数百次微更新后都会出现"灾难性遗忘"——模型开始丧失更早习得的通用能力。RL(强化学习,Reinforcement Learning)更新对模型权重的改动幅度极小,在保留通用能力方面表现更优,但正因如此,它能注入的新知识也十分有限。
Beren Millidge将问题归结为塑性(plasticity)与稳定性的根本张力:"如果你无限期地在同一个基模型上持续训练,它会在某个点渐近饱和。这就是为什么人们最终还是要重新训练新的基模型。"三人预计,这一循环将随时间加速:从每三个月发布一次新模型,到每周、每天,乃至每小时——届时,连续学习的问题才算真正得到解决。
强化学习为何奏效:超出预期的原因
在对话的技术核心部分,三人尝试解释强化学习为何比一年前业界的普遍预期更为有效。
Beren Millidge将答案分解为两个层面。首先是被严重低估的中间训练阶段(mid-training)——大量合成推理数据的注入,已将模型推进至最终强化学习检查点80%的位置。强化学习本身做的,是在这个高质量起点上进行策略微调,而非从零开始习得行为。更关键的是信噪比问题:SFT要求模型精确匹配训练数据中每一个推理token,大量"噪声比特"淹没了真正重要的信号;而RL只传递"答对了还是答错了"这一比特,使有效信号获得极大的放大。
Charlie O'Neill则以"量子相变"类比预训练的平滑损失曲线背后隐藏的离散跳跃。他认为强化学习同样如此:在单个任务上,模型可能经历从0.5%到90%通过率的相变,但当数十个任务的相变被平均,加之"时间跨度泛化"(horizon generalization)效应,便呈现为宏观层面的持续进步。
John Schulman则指出RL带来能力的同时也带来了多样性损耗——经过RL训练的模型会反复使用相同的叙事主题和人物名称,创意写作的分布宽度明显收窄。更值得警惕的是,由于大量开源模型都在蒸馏Claude,"所有开源权重模型都写得像Claude,有着相同的语言习惯",这种"单一文化的涌现"令他感到担忧。
时间线预测:从远程工作者到ASI
对话最后,三位研究者给出了一组快速预测。
实现全能白领远程工作者(能在一个月内无缝执行复杂项目、与他人协作的AI):Charlie O'Neill预计约一年,前提是任务环境有良好的程序化接口;若依赖浏览器操作,则约两年。Beren Millidge给出三年,理由是真实工作中仍存在大量零散的长尾任务。John Schulman认为大致一年内会出现可用版本,但"能做某些事很好,另一些事不那么好"。
AI研究者实现10倍生产力提升:John Schulman给出两年,Beren Millidge表示认同;Charlie O'Neill则认为需要5至10年——他的核心顾虑在于,自己消化信息、做出贝叶斯最优实验决策的能力,是真正的瓶颈所在。
实现全域认知工作超越顶尖人类专家(即ASI):John Schulman给出3至4年,认为AI研究是"对AI而言相对不那么难的任务,因为涉及大量代码和数学";Charlie O'Neill则说5至10年,并明确表示"自动化AI研究基本等价于ASI"——因为世界上太多任务需要持续学习和超长上下文整合,而这些能力目前仍是系统性短板;Beren Millidge认同5年区间,但提醒将存在大量"AI理论上能学但没人分配算力"的长尾领域,这些领域的突破将延迟更久。
以下为访谈内容全文,部分有删减:
Dwarkesh Patel:
今天,我和三位AI研究员朋友聊天,每次和他们交谈我都能学到很多。他们恰好也在一些相对开放的研究机构和公司工作,所以你们可以公开谈论一些事情。和我一起的是 Beren Millidge,他是 Zyphra 的CTO,该公司正在开发开源模型。John Schulman 是 Thinking Machines 的首席科学家,此前是 OpenAI 的联合创始人,并领导了催生 ChatGPT 的 RLHF 工作。还有 Charlie O'Neill,他是 Baseten 的模型训练负责人。
我的第一个问题是:如果到了2036年,我们并没有成千上万个疯狂的超级智能在到处运行、彻底改变世界,最可能的原因是什么?排除外生的政治冲击、战争,或者他们禁止AI之类的因素。从技术角度来说,2036年没有变成疯狂的异形超级智能世界,最可能的原因是什么?
Beren Millidge:
有一个经典的现象,几乎像莫拉维克悖论一样,我们认为AI“如果它能做这个,那就会非常了不起”。如果它能解决这些困难的数学问题,如果它能赢得国际象棋等等……然后它解决了这些东西,却没有那么大的影响力。显然,它有一定的影响力,但不是一切。
如果这种情况 somehow 持续下去,始终没有出现真正的泛化火花,我认为这可能导致AI在人们放入基准测试或环境中的一切任务上都极其擅长。但仍然存在某种持续的“仿真到现实”鸿沟,不知怎么地阻碍了一切。我认为这不太可能。实际上,我们已经在实践中看到了RL带来的这种泛化。但如果元学习的泛化真的难到荒谬,加上我们没有解决持续学习问题,而且这就是超级困难、不可能……那这将是我在这种情况下默认的场景。
John Schulman:
我同意这一点。人类现在相对于模型有很多优势。每次新模型出来,它会在某些领域追赶上来。但你最终会被模型较弱的环节所瓶颈,比如判断力较差的地方,或者模型无法足够好地自我检查。
有一个不断重复的循环:新模型出来,人们惊叹不已,说“这就是了。这就是AGI。”但用了一个月左右之后,它就开始显得笨了。这个循环可能就这样一直重复下去。很难预测它会重复多少次。
现在,你没有得到能力的爆炸式增长,因为你在尝试做研究和工程时仍然会被足够多地瓶颈住。即使模型能写的代码比人多得多,它也不会让你生产力提高100倍。所以也许这种循环比我们预期的要多。
Charlie O'Neill:
对我来说,问题在于“你可以在芯片上拥有的学习器”的全局最优解与 transformer + RL——基本上是当前的配方——之间有多大差距。人们想象,一旦你有一个在所有AI研究上都比所有人类都好的智能体,即使它只比所有人类好0.1%,那么你可以并行运行数十万甚至数百万个这样的智能体——而且随着芯片速度提升,你可以运行得快得多——这将压倒所有其他瓶颈。你最终会在自我改进方面达到非常快速的起飞。
我可以想象,如果我们继续沿着当前范式——基本上是自注意力、RL、扩大RL环境——的轨迹前进……想想摩尔定律发生了什么。我们有一条非常好的直线,持续了非常非常长的时间。但为了保持那条缩放定律,必须发生许多离散的不连续性和创新。LLM也发生了同样的事情。我们有预训练缩放定律,然后它遇到了收益递减。然后我们想出了RL并解决了那个问题,然后我们又得到了一条新的收益递减曲线,让它看起来像一条直线向上延伸。
所以,如果它需要另一个这样的不连续性来解决,我不确定当前用这些RL环境训练LLM的方法——即使是针对RSI的RL环境——是否能够发现那个不连续性。如果不能,我们可能会撞上一条渐近曲线。
Dwarkesh Patel:
但你认为这个不连续性会比2012年以来的任何事情都更难吗?
Charlie O'Neill:
如果我们知道那个答案,我们差不多就有能力实现它了。但也许我们应该区分:一个是添加到当前范式中的不连续性,它是累积的——有一些超越RL的东西我们必须发现,也许它们能够在那条直线上连接各个点——或者,还是那个问题,我们离全局最优解有多远?我们是否必须回头抛弃梯度下降和神经网络本身?我不认为,如果你继续扩大当前范式,一个LLM,无论你运行多少个LLM,如果差距太远,它一定能够发现那个不连续性。
Dwarkesh Patel:
唯一的希望真的是深度学习无法把我们带到至少能够主导人类研究和人类开发的AI,包括人类提出新范式等能力。或者,我不知道,也许人类也永远不会发现下一个学习架构。但就人类最终可能发现它而言……但看起来……如果你只看2012年至今的进展,然后继续下去——我知道这只是由大量计算扩展等推动的——如果它没有达到至少在研发领域主导人类的地步,那会很奇怪,尤其是在未来几年。
Ryan Greenblatt 最近上了播客。他提出了一个观点,我很好奇想听听你们的想法。你可以想象,随着AI变得越来越有能力,它们能够在模拟中取得进展,这些模拟激励它们不仅在AI研发上变得更好,而且在一般科学上也是如此。这是所有实验室都在瞄准的目标,许多初创公司也在瞄准。
另一个直觉泵是,如果你看自80年代以来国际象棋机器人的Elo分数。Elo随时间非常线性地增长。但当它们越过人类范围时,有一个巨大的不连续性,从人类专家总是赢AI,到人类专家永远赢不了AI,而Elo线性增长。
我同意你的观点,到目前为止,AI能力在世界上的最终经济影响并没有那么大。但那是因为它们相对于人类的Elo在缓慢上升。
Beren Millidge:
我同意这会很令人惊讶。这不发生的唯一方式是,正如你所说,它在某个点之前渐近地趋于平缓。因为在我看来,我们已经非常接近开始越过人类Elo分数的点了。所以我们需要在那之前渐近。这是在你提出的这个场景中——不知怎么地我们在2035年坐在这里,一切都正常——这发生的唯一方式。我认为另一种方式是AI受到戏剧性的监管。实际上,这在我看来是这个场景发生的最可能方式,而不是技术原因。
Charlie O'Neill:
我认为有不同类型的研究。有一种自动研究风格的研究,目标已经被非常清晰地指定,你在优化那个目标。我认为每个人都在想象,如果我们继续沿着让预训练损失下降、让我们的环境奖励上升的路径前进,那将带来改进。
但也许Ryan所谈论的是这种更加开放式的科学,它是范式转变所必需的,我们无法指定目标,AI也绝对无法指定那个目标。我们必须非常非常小心地为这些事情指定目标。
Dwarkesh Patel:
也许你的观点是,2012年以来发生的突破的本质是,我们发现了……2012年,人们并没有说……我假设,我不知道,你们当时在场。至少John,你当时在。但我没有。
Charlie O'Neill:
我当时在上小学。
Dwarkesh Patel:
实际上,John,我很好奇你的“岁月智慧”,或者说是“在战壕里”的智慧。想必,一个重大突破是意识到下一词预测是……你不会想到2014年nanoGPT speedrun是要优化的东西。但现在我们已经来到这个新范式,你会想到在那上面做speedrun,让AI变得非常擅长那个。
但也许有下一个需要优化的内循环,AI不会预见到。有一个收入的外循环或者其他什么,最终应该很强,但它是一个非常慢的外循环。
John Schulman:
事实上,我记得在OpenAI早期,有种直觉认为仅仅最小化对数损失不会让你达到智能。因为重要的部分在损失中占比如此之小,以至于会被噪声淹没。所以仅仅在下一词预测上训练语言模型不会学到你想让它学到的有趣东西。我们需要设计更好的目标,更加强调重要的东西。
你可以为此提出各种论据。你可以说,“哦,人类可能不会学习为环境中的一切建模。大多数人无法对他们看过的某个场景进行照片级逼真的再现。所以我们一定需要更好的目标。”但后来事实证明它就是能行。
Dwarkesh Patel:
正如你指出的,即使在当前的AI研究中,后训练基准的内循环也不一定转化为用户喜欢的东西。
John Schulman:
哦,是的。整个领域非常依赖泛化,很难预测你什么时候会得到泛化,或者你什么时候会得到某种分布外泛化。我们知道,如果你在你关心的任务上训练,你会做得更好。但最重要的进步往往是那些我们根本没有理由期待的泛化类型。
例如,仅仅在这个非常朴素的下一词预测目标上预训练,就能泛化到各种需要以某种深层方式理解输入的任务,或者从预训练中学习某种非常罕见且代表性不足的技能。然后还有从可验证任务到不太可验证任务的泛化,这也是一种先验上没有理由期待的泛化。
Dwarkesh Patel:
这是一个有趣的问题,因为一个直觉泵可以解释为什么你会看到某种奇点非常迅速地出现——甚至不用扩大AI进步的输入,不仅仅是AI劳动力——那就是在你运行每一个七位数的实验之前,你在AI劳动力上花费了等量的计算。所以你有了你们这些人的自动化版本,花一个世纪思考什么是最优实验,做小规模消融,发展出 literally 一个世纪的理论,甚至可以追溯到深度学习之前。
在你决定运行什么实验之前,你在做极其最优的实验设置。然后实验结束后,你花一个世纪思考发生了什么,以及下一个要运行的实验是什么。
John Schulman:
如果你足够努力地思考,你很可能事先就能预料到其中一些事情。可能存在某种非常聪明的方法来做小规模实验,让你建立理论,然后泛化到大规模实验。所以我预计我们远未达到研究能做到多好的天花板。
我可以想象一个未来,AI做大量的分析和理论构建,花费与实验本身相当的计算,做各种分析并围绕我们目前所看到的东西建立理论。
Charlie O'Neill:
我认为当目标被明确定义时,有非常具体的例子。所有思考能做的就是根据你形成先验后获得的比特来更新你的后验。你无法仅仅通过思考获得任何新比特。但当目标被明确定义,且有数据摆在那里时,我想在当前范式中会有很大的加速。
一个很好的例子是,如果你让AI思考Kaplan缩放定律。此时AI会注意到,“哦,他们只是取了这些中间检查点,没有考虑退火,所以这是错的。”那会在几年前就被抓住。我们会因为AI的那个观察而缩短一到两年的进展。
再次,一旦目标被明确定义,也就是更低的预训练损失或其他什么,有很多很多好例子表明,如果你多思考一下,你就能显著减少你已经做过的事情。比如muP,以及学习率如何随模型规模缩放,并意识到模型宽度在其中也很重要。我觉得你真的可以倒推出很多这些东西,砍掉很多低垂的果实。如果我们的目标只是“最大化我们当前的目标”,我会想象有10倍的加速。
但我不认为这能泛化到一开始就提出正确的目标。仅仅思考不一定能给你正确的目标。
Beren Millidge:
我认为这对任何来自当前AI的非常快速的RSI来说都是关键问题。AI能多好地泛化到学习它们自己的目标?要有任何自我推动的自动化循环,我们需要AI提出目标、优化它们、搞清楚,提出新目标,并让这在很长很长时间内任何时候都不失控。
回到莫拉维克悖论,可能存在一种莫拉维克悖论的情况,我们认为这种自主性和自我封装——我们可以自己想我们应该做什么,然后去做,并有这个循环——是超级容易的,因为我们总是这样做。显然,进化需要创造出能够长时间独立生存的生物。而这可能只是AI出于某种原因真的很难做到的事情,就像运动 stuff 真的很难但数学超级容易,尽管数学对我们来说超级难。
Dwarkesh Patel:
但时间跨度增加不是表明——
Beren Millidge:
是的,没错。这是另一种可能性,但我同意,没有明显的证据支持这一点。事实上,我们的智能体现在超级持久,做这件事相当容易,这算是反对这一点的证据。但如果这很难,这可能是我们没有得到这种立即起飞的原因之一。
Dwarkesh Patel:
如果你回顾2012年到现在——或者也许从你开始做研究到现在——自那时以来发生的所有创新中,包括纯工程的、纯概念的,哪一件看起来是人类在AI完全自动化AI研发之前最后必须做的事情?
Beren Millidge:
可能只是迭代地提出正确的问题。如果你能让AI做任何实验,你仍然需要决定做什么实验。现在我认为AI在这方面与编写实验代码相比还不太擅长。每当我们谈论研究时,它们提出一堆杂七杂八的东西,都是非常非常小的步骤。
Charlie O'Neill:
甚至从DeepMind的方法——“我们将通过学习以超人类水平玩游戏来解决智能”——到像Radford这样的一个随机研究员——“我将尝试预测非常广泛的数据的下一词”……即使Radford发现了这一点,人们也花了一段时间才决定扩大规模,因为我们必须提出缩放定律的想法,以及你可以非常可靠地预测这些事情的事实。
John Schulman:
我想说,人类最后的工作,或者说人类角色中持续最久的,是定义目标和决定我们真正想要什么。在这方面,比如决定AI助手应该如何行为,或者什么是有帮助的,或者当我们做RLHF时目标是什么,就是这样的事情。然后后来,定义宪法和模型规范是另一件事。即使AI能做所有技术工作,我们仍然需要做很多这样的事情,决定我们真正想要什么。
Dwarkesh Patel:
对齐是最后的工作。
John Schulman:
对齐算是答案。但对齐本身可以分解为目标规范,或者说搞清楚正确的目标应该是什么,然后实际实现或优化你定义的目标。我认为第一个在短期内不会消失。
如果我想到一个后训练团队,为什么需要很多人在团队里,就是因为有很多不同的领域你需要弄清楚模型应该如何行为。很难把整个事情自动化,因为必须有人思考模型在这个领域应该如何行为。
00:28:06 – 自动化的AI研究员将如何训练
Dwarkesh Patel:
我还有一个问题是,第一批能够自动化AI研发的模型实际上将如何训练。有一个玩具版本,就是Ryan所说的。你只是让GPT-8尝试构建GPT-3大小的模型,这些模型非常擅长内循环类型的挑战:击败需要持续学习的视频游戏,或者用最少的计算达到某个损失,等等。
但John,我认为你有一个有趣的观点,也许这不是实际发生的方式。所以我很好奇,到了你实际有能够自动化AI研发的AI的时候,它们可能是如何训练的?
John Schulman:
我们可能会做一些组合:从人类反馈中学习以吸收研究员的品味,以及创建大量涉及做多步研究项目的练习环境。人们实际上会做这两件事的某种组合,每次迭代修补上一次迭代中看起来最糟糕的东西。研究员会大量使用AI,并注意到它们有一些一致的弱点。这些东西要么通过收集人类反馈来修补,要么通过创建环境来修补。
Charlie O'Neill:
也许一个有用的思考方式是,我们回滚多少传承,然后从那里让自我对弈。在极限情况下,你想象只是给它们一个GPU,也许还有神经网络什么的,然后说,“好吧,弄清楚如何训练一个模型来做这些特定任务。”目前的工作方式是,我们一直走到传承的最边缘,说,“好吧,这里是Anthropic在过去几个月在他们的训练堆栈中发现的bug。我们会把这些变成环境。”你需要训练并在前沿上变得更好。所以你显然锁定了之前传承的所有历史。
但你可以想象一个世界,你回滚到GRPO之前之类的。然后你有环境试图让它发现RL模型的最佳形式,然后也许你回滚得越来越远……但我认为我们仍然会被计算瓶颈住,人们只会继续待在前沿,基本上把自上次模型版本以来发现的bug和任何改进变成训练环境。
Dwarkesh Patel:
这对在模型代际之间拥有非陈旧的新数据也非常好。再次,这基本上是AI实验室内的持续学习,通过环境和RLHF类型的东西将过去三个月的AI研究进展蒸馏回模型本身。
Charlie O'Neill:
而且这是蒸馏。这可能就是为什么我们中一些人觉得它是渐近的。你总是只是试图获取过去三个月的进展。那个进展当然是由AI贡献的,但它也仍然有人类在循环中。感觉你只是在不断地越来越接近人类研究员正在发现和能够做的事情。
Beren Millidge:
不过我要说的一件事是,显然如果你只是在轨迹上蒸馏,你永远无法超越它。但环境可以远远超越人类能做的。设计一个人类无法解决但AI显然仍然可以尝试解决的环境非常容易。那将是超越人类AI研究所能做的路径。
Charlie O'Neill:
你有关于RSI的例子吗,什么样的训练集?
Dwarkesh Patel:
Nanochat speedrun,但比人类speedrunner更快。
Beren Millidge:
我觉得特别是在AI研究中,定义目标非常容易。你可以说损失需要是1.3之类的,现在没有人类能做到。但这是一个极其可衡量、可验证的任务。如果AI做到了,那就太好了。
Dwarkesh Patel:
或者我不知道,构建一个1亿参数的模型击败Minecraft。那可能太容易了,但击败一个更复杂的游戏之类的。
Charlie O'Neill:
1亿参数的模型击败Minecraft,这不是很疯狂吗?我们称之为太容易了?想象一下如果你五年前这么说。
John Schulman:
我想说很多研究并不完全是这样,不是在一个明确定义的目标上爬山。更像是,我们有一个关于模型应该更好的某种方式的直觉。我们也有一些似乎朝这个方向走一点的算法的想法。所以让我们想出一个任务,旨在展示这种方法的生命迹象,看看我们是否得到那些生命迹象。如果我们得到了,我们可以制作越来越现实的任务版本。
Dwarkesh Patel:
它更多是由直觉引导的。内循环是测试那个直觉,而不是测试本身导致洞察。
John Schulman:
对。你不是直接优化你最终关心的目标或实际生产目标。你稍微放松你的目标。你说,“让我们在现实性轴上稍微放松一点,找到一些实际有效的方法,然后在方法成熟一点后再回到现实性。”
还有更偏向解释和发展理论的研究。通常我们在机器学习中没有那么有预测性的数学理论。但我们有很多关于正在发生的事情的更非正式的理论。
Beren Millidge:
想必模型会在所有这些任务的某种组合上训练。有些非常容易验证,有些是LLM作为裁判,或者只是问人类,“这看起来合理吗?”希望这些都能泛化到这些更难、更模糊、更朦胧的任务。它可能在一定程度上会。它是否能泛化到足以让循环变得自我封闭、完全不需要人类在循环中,还不清楚。
00:33:51 – 长视界RL会引出AGI吗?
Dwarkesh Patel:
也许退一步。这似乎是我对AI研究未来计划的理解。你告诉我你是否认为它会成功,或者你是否同意这个描述。赌注是,我们将在数百万个多样化环境、数百种不同领域中扩大RLVR训练。在另一端出现的是一个智能体,它学会了这些基本技能——或者低于基本技能——关于坚持、能够分类信息和上下文,最终端到端优化与其他智能体合作等。这样的智能体在上下文中将非常样本高效——你做了关于如何扩大上下文学习使其任意长的研究,但你继续扩大。最终出来的东西基本上像一个可以连续工作一周或一个月的即插即用远程工作者。
首先,你同意这是实验室正在下的赌注吗?其次,这足够吗?基本上学习如何在数据中心内的这些模拟中学习,然后部署到现实世界,但实际上不从现实世界部署中学习……只从数据中心模拟环境中学习这些元技能。
Charlie O'Neill:
我认为现在很难区分实验室的努力有多少用于直接的RSI, versus 制造他们可以继续部署以收集收入来资助下一次大训练运行的通用智能模型。
对于后者,是的,那可能只是他们正在下的赌注。非常清楚,这些环境在过去几年中的走向模式。Anthropic的环境传承是一个很清晰的例子。首先,我们只关注编程,我们会变得非常非常擅长那个。然后,从编程中获得的任务视界——这可能是最容易获得的数据,可以创建环境,以及他们自己的内部东西可以变成环境——然后我们要泛化。
我们要接下来做金融,在RL训练中 literally 有那么多Excel数据和所有那些东西。然后是PowerPoint。这是工作经济的长尾。那似乎非常有效。很多其他实验室,甚至开源实验室,现在已经意识到那是正确的赌注。
Dwarkesh Patel:
但从中得出的含义是什么?当Dario上播客时,我问他的事情是,如果你真的期望模型在在职学习能力上像人类一样,你为什么要试图烘焙所有这些与PowerPoint等工作的技能?你不就期望模型在部署时能够学会这些吗?
有几种不同的解释。一种是我们期望模型很快达到那里,但它们还没有,所以为什么不把这些技能摊销到模型训练中?另一种是我们不专注于让它非常擅长广泛部署的工作。我们只是让它非常擅长RSI。这只是我们获得收入的一种方式,以便我们可以把它倒回一个真正擅长做RSI开发的模型中。然后一旦奇点发生,另一端出来的东西将非常擅长所有对当前一代模型来说似乎是瓶颈的事情。
John,我不知道你是否对如何理解为什么这些模型中有这么多任务特定知识有看法,如果路径是这种泛化的话。
John Schulman:
如果模型在上下文中学习足够好,那么理论上,你不需要在金融上训练它们。它们可以即时阅读所有书籍并弄清楚如何在适当的司法管辖区做一切。你可以争辩说,你需要做很多领域特定的训练只是为了让它们更高效。即使它们足够聪明可以在飞行中弄清楚,你仍然可能想要做一堆RL并把所有这些直觉烘焙到权重中,这样模型在运行时会更高效。
在实践中,模型提供商似乎确实在逐个领域地尝试加强模型在最高价值领域的能力。我会说这是模型为什么变得好得多的答案之一。只是因为模型提供商已经覆盖了很多高价值领域和最常见的技能类型。
Beren Millidge:
另一件事是,同时做两件事并不那么昂贵。模型是巨大的。就参数而言,它们可以轻松负担学习一切。可能会有一些迁移。即使金融不特定,信息对RSI也很重要。只是关于如何弄清楚什么重要、如何有品味、如何做长视界工作的一般元学习可能具有泛化性。
世界上也没有那么多RSI数据。它很难生成,需要很多努力。所以如果你能在这个其他数据中摊销,你就能从中得到一些迁移。你已经有大量的计算和大量的参数空间,所以为什么不同时做那个,以及显然的销售模型的直接商业意图?
John Schulman:
我要补充的是,有一个问题是这种当前的仿真到现实范式是否会永远占主导地位。你看看现实世界的任务是什么样的。然后你尝试创建一堆可以在数据中心模拟的环境,你可以对它们做RL。显然,这非常成功。但它有很多弱点,因为很多事情就是很难模拟,特别是如果它们涉及与一堆人类实时互动。所以有一个问题是仿真到现实是否会永远占主导框架。
Beren Millidge:
我认为只要样本效率低,仿真到现实就必须是主导框架,因为现在你需要成千上万次与人类的互动。没有人会坐在那里成为RL训练的循环中。所以我们现在必须模拟那个来获得你需要的样本。但显然,如果样本效率大幅提高,你会期望从部署中学习成为更大的部分。
John Schulman:
不过你也可以做其他事情。你可以离策略学习,所以你可以取所有轨迹,即使不重新模拟一切,你也可以潜在地从中学到东西。
Dwarkesh Patel:
我想多问一下这个,因为很奇怪,你有50%的计算花在推理上,而这并没有直接帮助模型变得更好。你期望数字心智最终拥有的一个关键优势是,不像人类有50年的现实世界经验,模型将通过其所有实例,在经济中所有经济相关工作中获得数百万年的部署经验。现在,那个数据在有意义的意义上并没有帮助模型变得更好。
看起来如此明显,最终模型应该能够从这个数据中学习。一旦它们这样做了,你就会有某种感觉像是广泛部署的智能爆炸的东西,因为模型正在所有这些部署实例中吸收如此多的信息。你期望这种蜂群思维、疯狂的东西什么时候开始发生?
Beren Millidge:
我认为从非常基本的层面来说,这已经在发生了……只是在下一代模型中。现在,你显然可以取你的部署数据,把它放入未来模型的预训练或中期训练中,特别是如果你做一些过滤或某种判断或注释或合成的话。
Dwarkesh Patel:
你认为这在多大程度上解释了代际改进?
Beren Millidge:
我认为它解释了相当多。我不知道实验室是否这样做,因为理论上他们声称不在人们的数据上训练。但其他国家100%这样做。他们肯定得到这个优势。这基本上就是蒸馏。他们取模型,通过ping模型获得一部分部署数据,然后他们在此基础上训练下一代模型。他们当然也可以在自己的模型上这样做。完全没有理由不这样做。
Charlie O'Neill:
我完全同意。如果你退得足够远,这肯定在发生。我们都在想象的,持续学习的圣杯,是这个非常有机的、实时的循环,一个单独的模型获得经验并即时实时更新并从中学习。当你放大到那个粒度时,很多事情会崩溃。但大实验室正在这样做。闭源模型正在这样做。
也有早期迹象表明人们使用开源模型以更快的节奏这样做。一个很好的例子可能是Composer。Harvey在法律智能体上也在做同样的事情。你有某种模型,你从你拥有的特定任务数据中获得非常具体的环境,以及用户抱怨的事情,以及你以某种方式从你的特定部署中提取的所有反馈。很多这些公司比大实验室有优势,因为他们可以真的非常好地使用这个数据。
然后他们会创建环境。他们会对Kimi K3进行大的后训练。他们会部署它。他们也可能做一些在线学习,就像Composer做在线……基本上是REINFORCE很长时间。
仍然有人在循环中。仍然有人说,“好吧,这些是我们关心的信号。这是我们将如何从我们拥有的数据中创建环境。”它仍然比你想象的那个节奏要长,但它确实在发生。最终那个循环会越来越快。
Dwarkesh Patel:
Composer的事情很有趣,因为在Cursor中,人们按Tab或不按Tab在模型建议的下一个补全上。基于此,每一天,Composer在预测下一个方面变得更好——
Charlie O'Neill:
那是旧的Tab模型。他们实际上对实际的生成模型也做了同样的事情,不仅仅是Tab模型。
Dwarkesh Patel:
哦,我明白了。有趣。
Charlie O'Neill:
这很难,因为当你做在线强化学习时,你没有组。你只有一个用户说一件事,然后你得到一个rollout。所以你有一个很大的方差减少问题。
Cursor对此的模糊答案是,“我们有非常好的启发式方法,能够估计这个响应比平均好多少,或者比平均差多少。”然后他们会做这个大的REINFORCE更新。他们对它是否变差的解决方案是,如果它在CursorBench上改进了,他们每五小时部署新模型。如果没有,他们就扔掉那个版本。
John Schulman:
我认为你最大的问题实际上只是不知道自然数据的奖励函数应该是什么。如果你使用某种肤浅的信号,比如他们是否接受了编辑,那可能会以某种方式被奖励黑客。
00:45:24 – 仿真到现实的鸿沟
Dwarkesh Patel:
但这不是仿真到现实事情的更大问题吗?任务视界越长,就越难在数据中心内模拟。在我看来,即使在编程中,我们已经到了没有一个为期一年的编程任务最终不需要你与客户交谈或与公司互动或与用户互动的点。
如果你想想我们想要AI能够做的所有事情,最终超级智能应该能够经营企业,或创办新企业并使其盈利,或在市场上进行有利可图的日内交易,或赢得官司。这些都是很难在数据中心模拟的事情。其中固有的学习部分是与现实世界互动。
也许它们从仿真到现实的迁移中学习如何在这些事情上变得更好。但或者,也许你确实需要从这些类型的互动中进行权重更新才能变得更好。如果是这样的话——如果迁移不够强,你确实需要权重更新——那么模型样本效率相当低可能是一个更深层的问题。
我对此好奇的原因是,默认情况下,我看不出你怎么会在未来10年内不得到某种疯狂的递归自我改进。但这可能不发生的唯一原因是,在权重更新的样本效率方面,模型似乎远远落后于人类。它们可能比人类在从出生到成年看到的数据量 versus 模型从冷启动到完成训练看到的数据量方面落后百万倍。
这一切是说,首先,从模拟到我们想要AI在现实世界中做的极其长视界、非常复杂的真实事情之间会有良好的迁移吗?如果没有,那是否真的意味着这些模型缺乏样本效率会反咬我们一口?
Charlie O'Neill:
也许我分解两种类型任务的方式——模型变得擅长的任务和模型将继续挣扎的任务——是看任务是累积的,还是你有这个非平稳分布,你必须不断学习和重新争论一堆东西。
一个累积任务的例子可能是RSI。理论上可能有一个不到一百万token的Python文件,从头开始训练一个能够递归自我改进的模型。你做的每一个发现都是你守住的一条线。如果RSI不需要我们发现新的注意力变体之类的,那么一旦你发现了注意力,一旦你发现了混合专家,一旦你发现了GRPO,你就把它添加到训练堆栈中,它就在那里了。
一个很好的例子是5.6 Sol训练,5.6 Terra,或者OpenAI告诉我们的任何一个。它不需要回头发现注意力。它基本上会调用一堆脚本,像pre-training.sh和post-training.sh,然后就这样做。那是累积任务的一个例子。
我认为现实世界——以及人们如此思考持续学习的原因——并不是一个累积任务。想象在一家律师事务所,你有一个智能体作为法律助理。那是一个非常非平稳的分布。你必须能够在你的上下文中容纳公司里所有重要人物之间的所有关系,这些关系也一直在变化。你有所有这些关于事情如何做的隐含方式,在哪里找信息,等等。那不是像RSI那样干净的累积任务例子。
我认为任务之间会有这种分解。但如果实验室意识到这一点——他们确实相信RSI是累积的,即我们不需要回头发现某种全新的架构之类的——那么也许越来越多的努力和计算会集中在那个上面, versus 其他任务。
Dwarkesh Patel:
RSI恰好比当律师助理更容易,这真是太不幸了。
John Schulman:
我想说今天的模型在很多不同方面都比人类弱。其中一些可能与某些 regime 中的样本效率有关。在某些 regime 中,模型非常样本高效,比如在上下文中学习。但可能有一些中等长度的 regime,它们样本效率较低,因为人类可以比模型更高效地做某种权重更新。我认为在某些 regime 中样本效率较低可能是弱点的来源之一。
但我认为还有其他完全不同的弱点来源。例如,思维的多样性低于人类,或者在某些长视界判断上表现不佳。我认为很多人们称之为品味的东西是关于长期有效的行为,是人们已经意识到长期有效的行为。不是全部,但品味的某些方面。特别是对于软件工程,我认为很多品味是“什么系统在项目的长期运行中可维护且运行良好?”
模型有各种各样的弱点限制RSI以及其他事情。有些与样本效率有关,有些无关。
Charlie O'Neill:
也许一个有趣的思想实验是:假设你能够给一个模型一个一万亿token的上下文窗口,或者你需要容纳你在RLHF之前的经验所需的任何东西。它在上下文窗口中有所有这些经验,并且它具有与一百万token时相同的样本效率和上下文学习能力。你认为品味就解决了吗?它能够做出与你相同的判断吗?还是除了更长的上下文窗口和相同的样本效率之外,还有什么根本性的缺失?
John Schulman:
它必须被训练从那个上下文中学习。要么它必须被训练从那个上下文中做出正确的更新,要么它必须泛化。
Charlie O'Neill:
所以你不认为你可以只是把它全部倒进去,你的整个生活,你的研究经验?
Beren Millidge:
你仍然需要数据来训练它长上下文。即使你理论上可以得到一万亿上下文,你也需要一万亿长度的数据来训练它。现在你有10k上下文,你不能只是倒进一百万。
Charlie O'Neill:
是的,我只是问如果你有那个。
Beren Millidge:
理论上,我认为,是的。这真的只是归结为品味从短视界片段中有多少是可元学习的问题。我觉得没有明显的理由它是超级长的,因为人类以某种方式发展了品味,而没有很多长片段。我们活不到10,000岁。我们发展得相当快。
如果你想想即使是一个博士,第一年博士生和最后一年学生或博士后的区别,那大概是五年。他们总共可能只做了10-30个研究项目。但他们从相对较短的一系列小事情中相当快地发展了品味。理论上,有可能像那样发展它。
AI显然将有远远更多的经验来发展品味,元学习它。然后问题是它如何泛化到真正长视界的事情,我认为这在这一点上真的没有解决。我们不知道。
Dwarkesh Patel:
回到这个问题,最终应该有一个 regime,AI从每个单独的部署实例中学到很多东西。目前你可以说有一个模糊的元过程,模型确实从部署中改进。但我觉得这是一个非常弱的反馈循环。你看到这个在地平线上吗,有这种蜂群思维的学习非常快速,如果是这样,它到底是如何发生的?
John Schulman:
我想说我们是否得到一个从所有部署经验中学习的蜂群思维,很大程度上是激励问题,而不是技术问题。公司不会想要让模型提供商从他们所有的部署中学习,因为那可能只会降低他们业务的优势。
Charlie O'Neill:
我认为这方面的经济学会施加压力,不一定是权重更新到一个大的共同共享模型,而是模块被替换进来。一个非常明显的例子是LoRA,但它可能是别的东西。
有很多工作试图将任意上下文长度装入固定大小。这些都是线性注意力 stuff。还有cartridges,本质上是训练得非常非常压缩的KV缓存,以容纳大量信息。这是另一个例子,公司可能愿意签署,如果它被替换到模型中,并且实际上不改变基础底层模型本身。
有很多不同版本的从你的数据中实时学习。后者实际上并没有帮助大实验室,因为它们只是这些模块。但我认为经济压力会迫使实验室先走这条路,然后他们才能开始这个……
Beren Millidge:
但是哪种经济压力?我觉得即使你有一堆cartridges或LoRA什么的,你仍然可以取所有这些轨迹并把它们倒入你下一代模型的预训练中。
Charlie O'Neill:
是的。这可能是大实验室正在获得的一种更间接的学习形式。这对他们来说显然仍然非常有价值。但我无法想象一个世界,我们从“我们将直接在这个大模型上训练我们获得的所有确切数据”开始。
Beren Millidge:
不,我认为它肯定会经历阶段,因为这假设有一个不连续的事件,突然我们持续地修复权重更新。在实践中,我认为更可能是cartridges之类的东西让你在部署中专门化。然后你生成轨迹,你把它放入你的模型,三个月后你出来一个在这个东西上更好的模型。你再次专门化它,你再次巩固它,然后最终我们会让这个跳跃越来越快。
不是每三个月发布一个模型,现在是每周,然后每天,然后每小时,到那时我们基本上已经解决了。
Charlie O'Neill:
我认为这也是一个好点,因为你问当前范式离能够做到这一点有多远。我们对此做了一些研究,人们也做了很多研究。在非常大的规模上,当你洗掉足够的噪声并且有足够大的批次时,这个将数据放入中期训练并创建我们自己的环境的外循环过程在某种持续学习 regime 中确实有效。
但问题是,当你放大到微观层面足够近时——我有一个模型,我试图再次为一家律师事务所更新它之类的,我试图用相对少量的数据非常连续地这样做——所有方法都有点崩溃。如果我只是在成功的轨迹上SFT模型,离策略或在策略,最终在非常迭代的 regime 中,当你做数百个这些微更新时,你会看到灾难性遗忘。你看到之前在学习的基础上学到的信息的遗忘,那个基础模型要早得多,你看到一般能力的退化。
在策略蒸馏似乎把这个视界推远了一点,但它最终仍然屈服于同样的事情。RL擅长把能力放进去,但它不擅长把知识放进去,这种非常明确的知识,“啊,好吧,这个人在这个律师事务所做这个,这是我们发现的一个非常具体的流程。”你必须投入大量计算来创建正确的环境,用RL把知识放进去。
Dwarkesh Patel:
你认为这里的根本问题——为什么你在这些其他技能上变差或者有遗忘——根本上是容量问题还是技术问题?
Charlie O'Neill:
两者都有一点。我认为SFT甚至策略蒸馏可能破坏性太强。RL之所以如此好的原因是它只改变模型非常非常小的一部分。有很多证据表明为什么是这样。它只是在非常非常小的损失谷中微调它,把它带到正确的点。但那也限制了你可以用RL做什么,你可以实际改变模型多少。
Dwarkesh Patel:
所以你是说,为什么这不是赢者通吃,可能的原因是,很难在迭代的方式中把那么多信息蒸馏到基础模型中而不破坏某些东西?
Charlie O'Neill:
不破坏某些东西,以迭代的方式。
Beren Millidge:
把它蒸馏到一个不同的基础模型中是容易的。这是我认为主要是技术问题的地方。肯定不是没有容量。如果你有一个拥有所有这些数据的模型,你取字面上相同大小的模型,用所有这些东西在中期训练中从头预训练,它会更好。我认为这就是今天发生的很多事情。
非常有一个瓶颈阻止我们只是永远训练同一个模型, versus 只是从旧模型获取所有数据并从头训练一个新模型。这正如Charlie所说:可塑性和灾难性遗忘的某种组合。如果你只是天真地在非平稳数据上训练,因为你随着进展添加新数据,这会扰乱数据分布,所以旧的东西就被遗忘了。我们真的没有好的方法来阻止这种情况发生。
Dwarkesh Patel:
所以也许在极限情况下,你只是被从头重新训练模型与所有这些新信息所瓶颈。
Beren Millidge:
是的,这当然非常昂贵。从头训练模型是昂贵的。
Dwarkesh Patel:
但你无论如何都会这样做。
Beren Millidge:
不一定。也许最终,如果你有持续学习,你永远不训练新模型。你只是有一个模型,它不断学习和扩展。
Dwarkesh Patel:
但可能有一些深层技术原因使它非常困难。
Charlie O'Neill:
这就是问题。我认为我们已经推迟了我们需要从头做多少。现在肯定可以取预训练基础并在其上做非常好的中期训练,有点连续地,加上从训练后期不同检查点的一些RL。那看起来更像持续学习,但它肯定不是取最近的模型,应用几个非常小的更新,然后迭代地从不丢失任何东西的情况。
Dwarkesh Patel:
抱歉,我有点困惑,因为这不就是在训练期间发生的事情吗?在后训练或其他什么期间,你有一个已经经历了如此多训练的模型,然后你蒸馏一个已经进一步RL'd的分叉。这不就是字面上发生的事情吗?
Charlie O'Neill:
但它仍然在足够大的规模上,我认为,你在洗掉很多噪声,你不是只专注于一个分布,正如Beren所说,这是问题。如果你只专注于一个任务——
Dwarkesh Patel:
但在最终 regime 中你会做……有数十亿个部署实例。你同时从所有实例中学习,所以希望从那里洗掉一些噪声。
Charlie O'Neill:
也许在那个规模上,是的。
Beren Millidge:
正如Charlie所说,你肯定可以做持续中期训练很长时间,你可以回滚到一个检查点并给它新的中期训练数据。但与此同时,你不能无限期地这样做。如果你只是永远持续训练同一个基础,它在某个点会渐近。你不能只是在那基础中学习新东西。这就是为什么人们最终训练新的基础。否则你会只是永远中期训练同一个基础。
01:00:33 – 有多少进展是由数据解释的?
Dwarkesh Patel:
让我们谈谈数据。我通常对AI进展有多少只是由数据进展解释的问题感兴趣。这并不意味着它一定难以自动化,但那是另一个问题。是否存在某种数据分布,如果你在当前架构上训练它,会得到一个完全主导每个领域人类专家的超级智能?
Charlie O'Neill:
我们是在谈论预训练加后训练数据,环境也包括吗?我认为它的存在是显而易见的。只是我们是否能创建正确的环境来达到那里。
Beren Millidge:
在平凡的情况下,我们可以只是训练它输出训练实际超级智能的Python文件。只是让那个记忆在权重中。
Charlie O'Neill:
是的,可能有一个RL环境的阶梯,可以构建这样的环境,使你会得到一个至少和人类研究员一样好的AI研究员。但爬每一级阶梯的努力呈指数增长。这是你必须权衡的两件事,关于我们多快会达到最后一级阶梯,在那里它更好。我认为这相当清楚。
我们在RL环境创建方面仍然相对较早。我们利用很多不对称性来创建好的环境。我们之前谈过的一个不对称性是,有些环境倒退比前进更容易。我的意思是,很容易定义这个复杂的数据生成过程,这是你隐藏起来不让模型看到的潜变量。你可以生成任意复杂的环境,模型必须做大量不可约的token花费和不可约的工作来弄清楚那个数据生成过程是什么。
在从现实世界注入信息方面也有不对称性。Anthropic通过数万人类和LLM的结合发现一个bug,并把它变成一个非常非常简洁的环境,单个LLM理论上可以在几百万token内找到。有所有这些不对称性我们在挑选,我们指望这种任务视界泛化。
但我认为它在某个点会撞上收益递减,在创建那些环境本身有多难的收益递减,想出它们,因为你不一定能有这些倒退比前进更容易的过程。你实际上必须坐下来构建一些看起来像足够长时间视界与人类的东西,这将是一个真正复杂的任务来创建。然后还有计算和时间瓶颈,让智能体实际做那些任务。我认为你会开始看到这条曲线变平。
John Schulman:
我看到一些关于有人微调Talkie模型的东西,它只训练到1930年的数据,在现代编程智能体数据上。它在SWE-bench上比Claude 3 Opus做得更好。所以这个对代码完全没有知识的模型可以在中等数量的数据上微调,并作为编程智能体表现得比这个大得多的预训练模型更好,这很疯狂。这有点告诉你,一旦你有正确专家行为的例子,把它复制到一个相对弱的模型中实际上出奇地容易。
Charlie O'Neill:
但一个反例是最近的一篇论文,他们训练一个模型到五年级数学,还有小学英语之类的,所以它是一个不错的语言模型。他们试图RL它做高中后期和大学数学。差距太大了。他们根本无法让它爬上去。但如果你做 successive rungs 的七年级数学,然后八年级数学……等等,你显然可以爬到十二年级。再次,只是那些阶梯上梯级之间的距离,以及创建它们有多难。
Beren Millidge:
这只是回到RL信号问题。RL现在不擅长探索。如果模型不能在128次rollout中得到它,它非常不可能得到信号来进步。这就是为什么在RL中我们需要课程,而在预训练中我们不需要,因为那对预训练来说根本不是问题。
Charlie O'Neill:
再次,预训练数据与后训练数据不同。我想象随着我们继续前进,人类会越来越少地参与,但这不会改变你被你能从现实世界中提取多少信号所瓶颈的事实。
世界上有很多信号,这是真的。有人在做电子表格任务,有人在做法律任务和所有这类东西。但在模型现在所处的能力前沿,世界上有多少比特实际上与提高模型能力真正相关?有多少新的数学问题正在被解决,而这些问题超出了当前模型的能力范围?有多少新的编程问题正在被创建或解决,而这些问题超出了当前模型的能力范围?
我认为这就是为什么收益递减会到来,因为即使整个世界也没有给你有用的比特来把你推入下一个能力盆地。
Beren Millidge:
我完全同意。这真的只是信号来自哪里的问题。在预训练中,信号已经在Common Crawl中了。对于你在预训练中关心的任务,问题根本不是获取信号。它是过滤掉存在的所有噪声。这是一个相当可自动化的过程。
但随着模型变得更好,随着我们进入中期训练和后训练,信号根本不存在于我们拥有的原始数据中的任何地方。再多的过滤也得不到这个。Common Crawl中没有隐藏的千禧年大奖难题的证明,我们可以只是过滤直到我们看到它。
在那个时候,你必须以其他方式获得比特,要么直接从人类那里,要求他们写出他们的推理,要么通过创建环境,由人类决定应该创建什么环境以及这些环境的目标是什么,或者某种在部署中存在的人类数据上的训练。你必须从某处获得比特。
Dwarkesh Patel:
有一个问题是预训练中有多少进展是由数据驱动的。我和Jerry Han做了一个调查,他是普林斯顿的学生,我们把2019年至今的所有配方与2019年至今的所有数据集进行成对训练。你在最新数据集上训练GPT-2,比如Ultra-FineWeb。你在Pile或一些旧数据集上训练Delphi,这是最新的开源训练配方。你做整个网格。你看到,要达到某个能力水平,在这个网格中需要少多少计算?
你看到数据似乎解释了大约12.0倍的计算效率增益,但架构改进解释了大约3.7倍的计算效率增益,在非常小的规模上。如果这在大规模上也成立——大部分预训练计算效率增益来自更好的数据——那能持续多久?你能继续越来越多地过滤数据并构建越来越多的合成数据吗?你对这种预训练进展能持续多久有感觉吗?
Charlie O'Neill:
我的先验是,再次,低垂的果实有点耗尽了。我们得到了互联网这个大块,互联网不一定以同样的速度增长。互联网上所有有用的东西不一定以同样的速度增长。我们可能还有一些0.1%的损失下降,但肯定没有已经发生的那么多。
但你也发现这个累积的33倍改进也很有趣。我想是Epoch或某人估计自2019年以来每年3倍,这意味着大约37倍,超过2,000倍改进。那缺失的100倍左右来自哪里?那可能给你一个很好的信号,说明有多少来自后训练。
Dwarkesh Patel:
我认为解释必须是很多计算效率增益是规模依赖的,而我们是在非常小的规模上开始。这提出了一个问题,数据计算效率增益还是算法计算效率增益更有规模依赖性。我不知道你对此是否有先验。我们只是没有足够的计算来调查那个问题。
Charlie O'Neill:
只是天真地,理论上,架构的规模依赖性是相当已知的,你可以拟合一条直线。而我不知道如何为结合预训练加后训练数据和中期训练数据做那件事。
Beren Millidge:
有趣的是,我觉得数据实际上在规模上更重要。我觉得架构有点像一次性的事情。
说一个X%的效率增益有点误导,因为架构做的是让你达到一个你无法用旧架构达到的定性新 regime。在那个 regime 内,显然数据是决定它的主要东西。
但如果我们连GQA都没有,如果我们整天做全注意力,做一百万上下文会贵得离谱。因此,我们永远无法使用实际上在一百万上下文的数据,所以我们无法获得这些能力。即使你只是天真地做“这在2K上下文下有多大作用”,架构没有解锁任何东西,那么数据看起来会比它在某种意义上实际更重要。我不清楚这些东西是否真的只是以这种方式乘性增益。
Dwarkesh Patel:
我明白了。所以你对数据的规模依赖性有什么看法?
Beren Millidge:
关于规模依赖性,我认为我们现在有很多中期训练和后训练数据实际上随着规模变得更好,因为很多——非常长上下文视界环境的东西——真的需要大模型才能利用。如果你试图在你的1亿参数模型上训练SWE-bench轨迹,它不会取得任何进展。它不会向你展示你会从训练一个实际合理大小的模型上得到的同样类型的改进。
Charlie O'Neill:
现在也很难,因为很多架构变化——你看看Kimi,例如,或DeepSeek——他们做这些架构修改不仅仅是为了降低预训练损失,而是考虑模型在现实世界中将如何使用。推理效率,在DeepSeek模型中有某种形式的压缩注意力,不一定围绕根本性的权衡改进。只是,“好吧,我们在考虑模型将如何被使用。”
Dwarkesh Patel:
我好奇的一个问题,为了理解未来,是随着我们进入更RL重的 regime,参数缩放会如何发展。你可以看开源架构,看到参数缩放的速度。也许前沿开源模型大约每年2倍。即使前沿闭源模型有100B或200B活跃参数,你认为这会年复一年地2倍增长吗?
或者,现在我们在一个RL regime 中,你也想节省rollout的计算……也许有一个阈值效应,你有足够的容量,在那个时候任意增加参数就不那么重要了。你们对2030年前沿模型将有多少活跃参数有感觉吗?
Charlie O'Neill:
我认为未来几年,因为我们如此专注于做越来越长视界的RL rollout,推理效率非常重要,感觉模型不一定在它们做那件事的能力上饱和。瓶颈仍然是环境。所以我们可能会看到一点平台期。
我有一种感觉,Mythos和GPT模型比人们谈论的10万亿参数范围要小得多。即使只是天真地将它们与开源模型比较,你可能也能得出那个结论。
可能未来几年,我不会想象参数数量有巨大增长。但再次,这里有太多不同的东西需要权衡。你根据你有多少预训练数据来决定模型的大小,然后是你必须训练的最难的RL环境的难度。你理想上想要达到最优点,在那里你可以在你拥有的最难环境上得到不错的pass@1之类的。在那里做一个更大的模型通过没有意义,因为那样你只是支付比你需要多得多的推理。
所以很多取决于Mercor和内部团队能多快扩大他们训练的RL环境的复杂性。
John Schulman:
我预计模型会继续变大,只是因为人们在扩大计算,GPU变得更大。但具体变多大有点取决于缩放定律,以不明显的方式。
一件事是,我认为数据效率将比计算效率更能驱动人们使用的确切架构,因为我们现在进入高质量预训练数据快要耗尽的 regime。那可能影响你想要模型多稀疏。
我也认为我们不太理解稀疏性。参数是与活跃参数不同的资源。稀疏性肯定增加了一点,但不清楚它是否会无界地继续增加。可能存在某种甜蜜点。
有一种论点认为稀疏性应该使数据效率更差,因为你可能不得不在多个专家上学习同样的东西,尽管这是有争议的。我认为我们对缩放定律没有足够好的理论,真正理解为什么稀疏性有帮助,它会有多大帮助,以及它是否会在某个稀疏性水平上趋于平稳。
Dwarkesh Patel:
抱歉,你能具体说明数据效率对参数的影响是什么吗?听起来你会说应该更少的稀疏性,但对参数缩放的其他影响是什么?
John Schulman:
只是说,在缩放定律下,你不是试图优化计算效率。你在架构上有所有可以选择的东西。每一个都给你不同的缩放定律。传统上,你会看某种基于计算的信封。你会看性能与计算的关系,并取最佳模型的信封。
但如果我们在数据的基础上做那个决定——我们假设我们可以花很多计算,所以数据在我们的x轴上而不是计算——那么我们只是得到一组不同的最优解,或者一组不同的模型在那个前沿上。
Charlie O'Neill:
我也不认为我们在过去几年里一定每年都把模型大小翻倍。人们已经训练1万亿参数模型至少几年了。甚至有一个叫Falcon的开源模型。Periodic Labs的Liam,我想,昨天在Twitter上发布了一个早期实验,训练一个1万亿参数模型,非常非常稀疏。
John Schulman:
那是他们在OpenAI之前在Google做的,Switch Transformer。
Charlie O'Neill:
它在知识方面非常非常好,但在推理方面很糟糕,因为它太稀疏了。感觉我们已经在1000亿到2万亿参数范围内玩了一段时间了。这肯定不是这种漂亮的线性增长。
Beren Millidge:
我觉得有两件事。正如Charlie所说,推理效率对RL rollout非常重要。这将真的把活跃参数压低很多。
我认为总参数真的很大程度上取决于硬件。你真的需要非常高的内存带宽和VRAM大小才能实际服务多万亿参数模型。现在,人们仍然在使用很多H100之类的。随着每个人都转向GBs然后Vera Rubins,我们将获得更多能力来扩展并实际服务和在更大规模上做大型RL推理。
数据问题我认为很有趣,因为天真地,更大的模型在实际数据点上样本效率高得多。即使你没有饱和模型,更大仍然更好,因为更大的模型泛化得更好,在相同数据量下达到更好的损失。现在我认为我们有很多数据,那不是约束。计算是。所以我们在做非常推理高效的小模型。但如果计算不再是瓶颈,它可能会回到更大的模型,这些模型欠饱和,但由于它们大得多而具有这种泛化能力。
Dwarkesh Patel:
如果你只看基本的Chinchilla缩放定律,你只是最大化参数,它实际上减少你达到相同损失所需的数据量非常少。如果你在参数上趋于无穷,你需要的数据量我认为下降不到10倍,只是因为幂律的性质。
Beren Millidge:
但我们现在在Chinchilla定律的数据太多的一侧。现在我们根据Chinchilla过度训练模型。所以我们可以很容易回到一个点,随着数据耗尽,我们回到Chinchilla最优点,甚至稍微在欠训练模型的一侧。
Charlie O'Neill:
但肯定,即使有这些新芯片上线,未来几年我们仍然会被计算瓶颈住,所以那不一定会是情况。
Beren Millidge:
这取决于你训练和推理计算的比例,真的。如果你超级被数据瓶颈而不是计算,你应该变大。如果你超级被计算瓶颈,你应该总是变小。你也可以使用计算机生成的合成数据,所以这是很难预测的事情之一。
John Schulman:
我认为人们花这么长时间才弄清楚缩放定律的部分原因是,如果你不把所有这些事情做对,你就不会得到那么干净的关系。图表上漂亮的直线隐藏了很多复杂性,关于你必须如何确保以正确的方式缩放每个超参数,或者以可扩展的方式参数化你的优化器,随着模型大小改变而不必改变超参数。
Charlie O'Neill:
Bug也有它们自己干净的缩放定律。就像Kaplan忘记余弦退火的事情,甚至只是不考虑嵌入参数,我想。那搞乱了小模型的估计,因为嵌入参数是模型中相当大的一部分。
01:18:03 – 为什么RL如此有效?
Dwarkesh Patel:
稍微谈谈RL。一年前,很多人在论证RL在模型上不会非常成功地扩展。John,你写了一篇研究论文,指出模型在RL时每个episode学习一个比特。它们学习,“我答对了还是答错了?”然后我今年早些时候写了一些博客文章,我说,“这比那还糟糕”,因为当通过率很低,模型非常不可能答对时,它从一个RL episode中学到的几乎为零。
但我看今天的模型,它们似乎相当聪明。这似乎是扩大RL的结果。Beren,你几周前有一篇帖子,试图解释发生了什么。为什么RL比人们天真地想象的更成功?
Beren Millidge:
我认为RL的成功归结为一堆不同的东西。首先,被稍微低估的是中期训练。我们看到的很多RL的成功实际上来自非常非常好的中期训练数据,这基本上是我们做预训练,但在合成推理数据和那种让模型为RL热启动的环境上。这通常把模型带到最终RL检查点的大约80%。
然后RL在之上做的基本上是调整策略。这是为什么它不需要你天真地想象的那么多比特的原因之一。它不必从头学习所有这些行为。它只需要从这些episode中获得几个比特,你确实得到了。我在博客中指出的另一件事是,这些比特与常规预训练相比是极其高信号的,这就是为什么你需要RL而不是仅仅在成功的推理轨迹上SFT。
Dwarkesh Patel:
因为它正是关于如何得到正确答案的比特。
Beren Millidge:
有两件事。是的,第一,它正是关于如何得到正确答案的比特。但这不完全是你要想的方式,因为在SFT中,你有一个轨迹。你有,比如说,一堆数学推理,然后最后是答案。比特仍然在那里。你仍然在答案token上SFT。
重要的是,目标忽略了所有其他比特。在SFT中,你必须试图匹配模型产生的确切推理token。你本质上得到了太多关于你训练的那个其他模型如何推理的确切方式的比特。对于RL,你只得到一个比特。这意味着那个信号不会被模型拥有的所有其他比特的噪声淹没。
这真的是训练期间信噪比的超级戏剧性增加,这就是为什么RL在步骤方面如此戏剧性地高效。
Charlie O'Neill:
关于RL对模型做了什么 versus 中期训练或SFT或其他什么,有太多争论。每个人都谈论pass@1会上升,但pass@256会下降。非常罕见的正确推理轨迹会被降权,被来自更容易推理轨迹的梯度信号压倒。
我认为现在看RL的简单方式是,如果你有足够大的计算来采样足够大的组大小——使得你得到一堆正确答案的概率超过某个不算小的概率——那么它会被加权。对Beren的观点,中期训练和更多预训练——RL的起点,pass@1——随预训练token数量的对数缩放。
Dwarkesh Patel:
我能问一些非常基本的问题吗?那个答案有道理,也许有实证研究显示这就是正在发生的事情。但然后我看模型本身……我不知道发生了什么。也许你可以给我一个关于过去一年AI进展基础的感觉。
也许它只是对本来就会做正确思考的策略进行加权。但看起来在定性上,模型变得如此更有能力。也许那里没有内在矛盾。但我们如何调和这个说法所暗示的RL相对较小的影响与模型似乎正在获得的实际定性能力?
Beren Millidge:
我想在这里指出的一件事是,它不一定意味着RL有小的效果。即使你有几个比特,你只改变参数一点点,对函数空间——模型学到的输入到输出映射——的实际影响仍然可能是超级戏剧性的。即使一个比特也能大大改变你的函数空间。它可以排除一半的假设空间,这是巨大的。
我不认为一定是这种情况:少量比特、少量RL,一旦你从一个非常好的点开始,意味着你在行为上没有戏剧性的影响。至少……不一定。
Charlie O'Neill:
我认为这归结为两件事。第一件事是,每个人都希望RL能在所有这些不同领域泛化这种推理。我不认为我们一定得到了这种横向泛化。仅仅在数学上训练不一定让你成为最伟大的程序员。你确实必须在代码环境上做RL。
但我认为我们确实得到的是视界泛化。模型只是学会了如何使用更多token更长时间,并在某种任务上继续取得进展。你可以在环境上训练,让它们越来越长,然后把它们放到一个全新的环境中。是的,它们可能没有泛化让他们在那个环境中做得好的推理模式,但它们至少泛化了在那个任务上继续更长时间的能力,这与成功相关。有一篇叫EdgeBench的论文显示,模型能工作更长时间的速率每三个月翻倍。这是泛化的明确证据。
最后的思考方式是,在预训练中,有量子的想法。你有一条非常平滑的预训练损失曲线。当你看看模型中发生了什么,模型正在学习所有这些非常离散的任务,有所有这些涌现点,有相变。它没有归纳头,现在它有归纳头。有数万、数百万,可能数亿个这些东西。你把它们全部平均在一起,你得到这条非常平滑的损失曲线。
在某种程度上,类似的事情正在RL中发生。有这个非常慢的外循环,正如Beren提到的。我们会训练一个模型然后RL它,然后在下一个模型训练迭代中,我们会把一堆这些合成推理轨迹倒入中期训练数据。我们有点在击中所有不同任务的所有这些量子,在单个任务层面上,它可能看起来像一个相变。你突然从一个特定的金融任务或Excel任务或其他什么的0.5%通过率到90%通过率。
但你平均所有这些事情,加上视界泛化,你有点说,“哇,我们有了定性上更好的模型。”
Beren Millidge:
我认为很多这也只是……RL确实泛化了一点。你在数学和代码之间得到一些迁移,或者谜题和数学之类的。而且,人们瞄准的环境数量只是大得多。以前,当你尝试做你日常生活中的某个任务时,两年前,实验室不会真的关心这个。他们不会为它训练模型。现在它只是广泛得多。他们有很多针对这个特定事物的环境。
01:24:54 – 第37手和熵坍缩
Dwarkesh Patel:
早些时候在对话中,我们在谈论RL导致这种熵坍缩的背景,或者只是把概率集中在基础模型已经做过的解决方案上,导致策略中相对稀疏的更新。
但我认为还有另一个关于RL的故事,就是回到Atari游戏,然后AlphaGo想出第37手,那个超级创造性的走法。因为它从未在人类数据上初始化,它可以用人类甚至没有想到的方式思考,并想出极其创造性的解决方案。
你对我们应该何时期待,或者是否应该期待,LLM上的RL会导致像第37手这样的事情,超越人类创造力的极端创造力,因为智能是从头初始化的,有感觉吗?
Beren Millidge:
这里有几件事。首先,我认为AlphaGo使用的是MCTS,显然比常规策略梯度做更多的探索之类的。但我也认为RL不一定减少创造力。
这显然是定性的,但如果我们看OpenAI-Hugging Face事件,这些模型一次想出多个零日漏洞来突破沙箱。这显然已经是某种程度的第37手创造力,我们只是从LLM的一般泛化属性中得到。绝对不是RL完全摧毁熵,尤其是在长视界上。
John Schulman:
人们称之为创造力的一件事只是解决困难的搜索问题。第37手显然是一个例子,或者写某种满足大量不同约束的诗。这是AI显然会非常擅长的事情,如果为它训练的话。
然后还有另一种方式,模型的输出多样性在RL后低得多,它们发展出这些抽搐。即使模型看起来擅长写作,当你做某种分布分析时,你发现它们一直在重复某些主题,一直使用相同的角色名字。你没有得到与人类作者相同的多样性。你得到一种非常好的风格。所以我认为那种多样性肯定被RL大大削减了。
事实上,因为我们在谈论蒸馏,正在发生的一件事是,这么多人在蒸馏,主要从Claude,所有开源权重模型都像Claude一样写作,有相同的抽搐。这在我看来有点令人担忧,我们正在出现这种单一文化。
Beren Millidge:
再次,我不认为这是RL方法的根本问题。蒸馏也一样。即使蒸馏,你只是在数据上训练。只是因为你的数据不够广泛,不意味着训练方法本身有什么问题。这是数据的问题。
我认为很多RL熵坍缩,例如,基本上是由于在你没有巨大多样性环境时利用相当简单的验证器。写作,例如,大概是由某个裁判评分的。裁判有特定的抽搐,模型正在学习奖励黑客裁判,这就是为什么它坍缩。但这真的是裁判的问题。不是RL的一般问题。
01:28:32 – 快速预测时间线
Dwarkesh Patel:
好的,关于未来的超级快速预测。我想要以下几个问题的时间线。到什么时候我们有模型……这是对用户来说的感觉。你基本上雇佣它作为各种白领工作的即插即用远程工作者?不仅仅是编程,还有视频编辑、法律、律师助理等等。它字面上是一个实际的远程工作者,有完整的计算机使用,有字面上一个月的无缝学习和操作,执行复杂的项目,需要与其他人互动等等。人类工作者在一个月内能做的一切。
Charlie O'Neill:
如果你强制它使用浏览器之类的——而不是公司设置信息以编程方式可访问——也许几年。但如果它不是基于浏览器的——它可以发Slack消息,它可以做所有这些东西——我仍然可能说大约一年。
Beren Millidge:
我会说也许三年才能完全通用。但正如Charlie所说,我们最终会有很多人让他们的组织对AI更容易使用,所以你在那之前就能达到80-90%。
Dwarkesh Patel:
抱歉,但一年和三年之间的差异只是字面上……
Beren Millidge:
我认为会有一个长长的尾巴,一些人类能做的杂七杂八的事情,模型需要相当长时间才能做。
Dwarkesh Patel:
你是在想计算机的东西还是基本认知能力?
Beren Millidge:
我认为这真的归结为我们能多快解决这种在线学习,以及我们是否可以通过压缩和给自己写文件之类的方式达到80-90%。这是我最大的不确定性。我真的不知道。
Charlie O'Neill:
一个它不擅长的例子是,如果我必须对某人大喊大叫才能在工作中得到什么东西,或者真的推动某人完成某事。模型不会那样做。它太善良了。
John Schulman:
我会说人类远程工作者的质量差异很大。如果你试图从Upwork雇人做一个软件工程项目,会有巨大的差异。通常很难让他们做好工作或关注你给的所有反馈。我猜在某些情况下,AI之前的版本比你现在从现有AI得到的更差。
我认为它最终可能会有点复杂,因为在某种程度上我们已经有一些不那么高质量的工作有了这个。但显然我们在某些更高质量的工作形式上还没有达到人类水平。但我基本上同意Charlie和Beren,也许一年左右我们会有一个可以接受的版本。我们会有那种形式因素,它能够很好地做某些事情,某些事情不太好,事情会从那里改进。
Charlie O'Neill:
我们总是根据很长的尾巴来移动球门。我觉得你以前用过做税之类的例子。今年,我字面上只是告诉Codex去获取我需要的一切并发送给会计师。有一大堆东西它必须用计算机点击和下载。它做到了。完美。很多事情它已经能做了。
Dwarkesh Patel:
好的:给你10倍的总生产力提升。基本上,如果现在需要一年才能取得突破,你每个月就能取得突破。
John Schulman:
我想我会拒绝给你一个标量。在某些类型的工作中,我们可能已经超过那个了。假设你试图做某些类型的数学,而且——
Dwarkesh Patel:
哦,抱歉。但对你作为AI研究员试图推进AI研究的状态。AI研究员被加速或提升了多少?
Charlie O'Neill:
大概5-10年?
Dwarkesh Patel:
哦,真的吗?好的,那很遥远。
Beren Millidge:
真的,你认为这比一般远程工作者更长?有趣。
Dwarkesh Patel:
我意识到你可能对完全通用的远程工作者有非常不同的定义。我本可以早点说明的。
Beren Millidge:
这是真的,因为显然AI研究员可以是远程工作者。
Charlie O'Neill:
我在想象一个月的正常白领工作。我认为超过两个月就开始有点分歧了。
Dwarkesh Patel:
一个非常能干的白领工作者,但不一定是一个超级有创造力的研究员。
John Schulman:
我会说两年。
Dwarkesh Patel:
两年?10倍?好的。你呢,Beren?
Beren Millidge:
我其实可以理解,因为现在对于编程东西已经肯定超过10倍了。所以如果它甚至能做一两个实验反馈循环,那实际上已经是巨大的了。
Dwarkesh Patel:
所以AI研究员在两年内10倍提升。如果你把它代入一个非常天真的AI进展模型,以及有多少来自AI研究员,他们有10倍的生产力提升,你就会有从两年后开始的AI进展的急剧加速。
Beren Millidge:
我认为这将意味着AI进展不会瓶颈在AI研究员运行小实验的能力上。它会瓶颈在其他事情上。
Dwarkesh Patel:
当然。但它只是以10倍的速度发生,这是巨大的。这也帮助下一件事,给你100倍加速,更快发生,等等。
Charlie O'Neill:
我很乐意在那个上多花一点时间。
Dwarkesh Patel:
关键是什么?
Charlie O'Neill:
我吸收信息和做出下一个实验的贝叶斯最优决策的能力。
Beren Millidge:
我假设你可以把其中一些委托给AI。AI在决策方面变得不错。它运行了这个实验,得到了这个结果,它运行下一个实验。如果它能连续运行两三个实验而不崩溃,那实际上是一个巨大的提升。
Dwarkesh Patel:
好的,最后一个问题。一个在所有可以通过计算机完成的工作领域都主导顶级人类专家的AI。不仅仅是AI研究,而是所有认知工作。不仅仅是短视界工作,而是字面上,如果需要三年之类的,AI仍然会比人类做得更好。
Beren Millidge:
这基本上就是ASI?
Dwarkesh Patel:
是的。
John Schulman:
我会说3-4年。
Dwarkesh Patel:
我靠?我是说那似乎没错,但——
John Schulman:
AI显然得到了更多关注。这是更难的事情之一,但很多能量正在投入其中。它也不是AI最难的事情之一,因为它涉及大量代码和数学,模型真的很擅长。
对于涉及3D和空间 stuff 和物理 stuff 的事情,我认为那会花更长一点。如果是机械工程之类的,而且现在没有得到最多关注,那可能花更长一点。
Dwarkesh Patel:
但它也包括那些因为领域性质而数据相对较少的领域,它必须即时学习那些数据。例如,它必须在台积电成为超级工程师之类的。
John Schulman:
所以你必须假设你可以给AI相同的入职材料。然后必须解决关于长视界学习的某些问题。
Charlie O'Neill:
我会说5到10。
Dwarkesh Patel:
所以基本上,你认为自动化AI研究是ASI-complete之类的?
Charlie O'Neill:
是的,我认为是这样。我认为世界上有太多事情,即使你有一个模型外部的记忆系统,即使上下文长度增长一点,也有根本性的事情,即使你可以研究信息或自己写笔记,你今天需要超过一百万token的上下文窗口。
Beren Millidge:
我有点同意5年范围,至少对于实验室正在关注的东西。但我认为会有一个长长的尾巴,AI理论上可以去学习,但没有人费心去做,计算也没有分配到那里。所以那可能需要更长时间才能字面上每一个人类专家。
Dwarkesh Patel:
抱歉,但这也包括像人类一样快速学习新领域的能力。
Beren Millidge:
我认为那不一定必要,因为AI将拥有比任何人类多得多的经验。
Dwarkesh Patel:
非常感谢你们做这个,伙计们。我觉得这是一个很好的形式,让不同的专家不同意、辩论和一起讨论。非常有成效。
John Schulman:
谢谢邀请我们。
