各大podcast和YouTube都已经上线。
核心内容总结如下:
- 为什么强化学习(RL)很糟糕(但之前的一切更糟)
Karpathy 认为强化学习“糟糕” [00:00],主要是因为与人类的学习方式相比,它极其缺乏效率。
类比数学问题:他举了一个例子,如果让一个强化学习模型解一个数学题,它会并行尝试成百上千种不同的解法(rollouts)。然后,它会查看哪些尝试得到了正确答案,并对那些成功路径上的每一步(每个 token)都给予正面强化,对失败路径上的每一步都给予负面强化。
与人类的对比:他指出,人类绝对不会这样做。首先,人类不会进行数百次尝试。其次,当一个人找到解决方案后,他们会有一个复杂的“复盘”过程,思考“哪些部分我做得好,哪些做得不好,我应该怎样改进”。目前的强化学习(如 LLM 中使用的)完全没有这种反思和审查机制。
“但更糟”的原因:尽管 RL 如此“愚蠢”和低效,但 Karpathy 称它“糟糕,只是碰巧我们以前有的一切都更糟” [00:00]。这是因为它所取代的“模仿学习”(Imitation Learning,即监督微调)有其局限性。模仿学习只能让模型模仿人类专家的已有数据,而强化学习允许模型通过奖励函数(reward functions)“爬山”,从而有可能发现人类专家从未想出过的、全新的解决方案。
- 为什么 AGI 会融入 2% 的 GDP 增长
Karpathy 认为,通用人工智能(AGI)不会像许多人预期的那样,带来一个突然的、离散的“奇点”或经济起飞,而是会像过去几个世纪中的其他重大技术一样,缓慢地渗透并融入到现有的指数级增长中。
历史先例:他指出,纵观历史,无论是计算机、移动电话还是互联网,这些具有巨大变革性的技术都没有在宏观的 GDP 曲线上造成一个急剧的“尖峰”。相反,它们的采用和影响是“如此分散和缓慢地扩散,以至于一切最终都被平均到同一个指数(增长)中”。
AI 也是渐进的:他预测 AI 也会遵循同样的模式。它将“只是更多的自动化” [01:07:13],允许我们编写以前无法编写的新型程序。但它仍然是一个程序,一个新类型的计算系统,它有自己的各种问题,需要时间来扩散和部署。
反对“离散跳跃”:他反对那种认为我们会突然“解锁”一个“盒子里的上帝”(God in a box)、一个可以立即解决社会上任意问题的全能人类智能的假设。他认为这种“离散的跳跃”没有历史先例,也不太可能发生。相反,这将是一个渐进的扩散过程。
- 为什么自动驾驶花了这么长时间
Karpathy 认为自动驾驶之所以如此困难和耗时,主要是因为它对安全性和可靠性的要求极高,这与软件工程中的挑战类似。
极高的安全成本:自动驾驶的“失败成本非常高”。一个人类司机平均可能每 40 万英里(或每七年)才会犯一个错误。如果你要发布一个自动驾驶系统,它的可靠性必须达到甚至远超这个水平。
“九的行军”:他将此称为“九的行军”(march of nines),即追求 99.999...% 的可靠性。每增加一个“9”都非常困难。
基础感知问题:一个很大的挑战在于解决“建立鲁棒的基础感知、建立表征,并让模型具有一些常识”的问题。这需要模型能够泛化到它在训练中未见过的“分布外”情况(比如看到有人在路上以一种奇怪的方式挥手)。
与 AI Agent 的相似性:他认为,这种对安全性的极端要求并不仅限于自动驾驶。一个通用的“编码智能体”(coding agent)也将面临同样的问题。如果一个编码智能体每七年就犯一个“灾难性的编码错误”(比如破坏一个重要系统),那将是不可接受的。而且由于代码是持续不断生成的,按“时钟时间”(wall clock time)计算,这个错误发生的频率会比自动驾驶高得多。
- 对未来教育的看法
在视频的后半部分,Karpathy 分享了他对学习的看法,这预示了他对未来教育的观点。
“按需学习”:他非常推崇“按需学习”(learning on demand)[02:24:23],即为了完成某个特定项目或获得某个特定奖励而去学习知识。他认为这与学校中的“广度优先学习”(breathwise learning)[02:24:38] 形成对比,后者常常是“相信我,你以后会需要这个的” [02:24:42]。
AI 导师的潜力:他提到,如果有一个“完美的人工智能导师”(perfect AI tutor),也许你可以走得非常远 [00:42]。
通过“解释”来学习:他发现“极其有帮助”的学习策略是“向他人解释事物” [02:25:01]。他发现,“如果我不能真正理解某件事,我就无法解释它” [02:25:12]。这个过程会迫使你直面自己理解上的空白和差距,并去填补它们。他认为人们应该更多地这样做,因为它迫使你“操纵知识”,以确保你真的明白你在说什么 [02:25:35]。
详细笔记如下:
https://www.podchemy.com/notes/andrej-karpathy-agi-is-still-a-decade-away-43921620932
好文
好文
嗯,看不懂
按需学习很认同,就是用以致学