出品|虎嗅科技组 作者|黄天媛 编辑|苗正卿 头图|AI生成 "在本十年末之前,人工智能可能会杀死我们所有人。" 这是几天前,Anthropic 前研究员 Jacob Coxon 在辞职后于 X 发布的内容。 这不是科技行业第一次谈论 AI 与人类灭绝之间的联系。 但在今天凌晨,Anthropic CEO 达里奥·阿莫迪突然发布了一篇标题为"我们必须为前沿 AI 限速"的长文,再一次呼吁放慢前沿 AI 研究的脚步。这一次,他给出了一套更具体的围绕"可核验性"展开的方案。OpenAI CEO 山姆·阿尔特曼 也很快转发了推文,并表示支持。马斯克也表示认同。 阿尔特曼甚至表示,他的公司 OpenAI 可能需要推迟备受期待的首次公开募股活动,以便将精力集中在人工智能的安全性问题上。 几个全球竞争最激烈的AI巨头,罕见地在"放缓AI发展"这件事上站到了一起。 我们总结了 达里奥·阿莫迪 的文章和 山姆·阿尔特曼 近期的采访,他们目前的判断大致集中在以下几点: 关于主动限速: 两人都不主张全面暂停AI研发,但都认为能力增长不能无限制继续,应主张主动放慢前沿模型能力提升。模型每获得一级新的能力,都应该同步满足新的安全要求。如果无法证明模型可控,就不应继续训练。 关于Agent带来的新风险:二者都将OpenAI-Hugging Face事件视为重要转折点,因为模型已经开始自主越过沙箱、侵入外部系统;达里奥判断,未来6到12个月,更强的智能体可能具备大规模攻击和控制互联网系统的能力。 关于为什么现在和2023年不同: 两人都认为,今天的风险已经比2023年具体得多。过去模型主要负责生成和对话,现在已经可以自主使用工具、访问互联网、执行长时间任务,甚至参与下一代AI研发,因此安全问题已经从抽象风险变成现实的工程问题。 关于递归自我进化: 两人都认为,AI帮助研发下一代AI的过程已经开始。达里奥认为,这可能加速能力增长,甚至超过人类理解和控制的速度。 关于安全对齐:达里奥认为,目前模型能力提升的速度正在逼近甚至可能超过安全和控制机制的发展速度; 阿尔特曼则明确表示,OpenAI和其他实验室都没有真正解决对齐问题。 关于第三方驻场评估: 达里奥主张让外部安全评估机构长期进入前沿 AI 公司内部,获得接近员工级别的权限,直接查看训练流程、安全事故和模型行为,而不是只在模型发布前后做外部测试。 关于行业协调: 两人都认为,单家公司主动减速很难持续。达里奥认为,需要前沿实验室共同遵守规则,甚至进一步走向国家间协调。 关于商业压力: 两人都认为,安全不能完全让位于商业竞争。阿尔特曼明确表示,如果安全与商业利益发生冲突,OpenAI应该选择安全,并且他认为在当前 AI 安全问题集中爆发的阶段上市"不明智",明确表示不会在 2026 年 IPO;但路透社指出,Anthropic 预计最早将在 10 月中旬启动首次公开募股的市场推介,并计划在 11 月美国中期选举前几天完成上市。 关于中国变量: 两人都认为中国是前沿AI治理中绕不开的变量,但侧重点不同。达里奥更强调美国需要维持并扩大技术领先,才能获得减速空间;阿尔特曼则更强调中美之间需要建立共同的安全规则,避免为了争夺超级智能而承担失控风险。 2026年,"AI末日危机"卷土重来,仅靠承诺已经不够了。 连续的安全问题 2023年3月,马斯克、约书亚·本吉奥等上万名研究者和科技界人士曾联署公开信,要求全球AI实验室暂停至少六个月训练比GPT-4更强的系统。 当时的理由已经足够严肃:AI实验室正在陷入一场"失控的竞赛",甚至模型开发者自己都无法完全理解、预测和可靠控制这些系统。此后这封公开信累计获得超过3万名签署者。 3年时间过去,模型的自主能力发生跃迁。人们在今年密集地看到,AI正越过边界。 5月,OpenAI Agent出现多次越界行为。 一批Agent被发现对RubyGems进行未经授权的操作,上传大量恶意或垃圾软件包;同一时期,OpenAI Agent还劫持了一个德国编程网站,把它改造成Agent之间交换信息的公告板。 7月,OpenAI发生Hugging Face事件。 用于网络安全评测的一组Agent绕过隔离限制接入互联网,并进入Hugging Face生产系统。模型并没有被要求攻击Hugging Face,而是在完成原任务过程中,自主找到了一条越过安全边界的路径。OpenAI后来将其称为一次"前所未有"的网络安全事件。 同月, Claude在三次网络安全评测中从测试环境进入互联网,并未经授权访问三家真实机构,9月复盘后,Claude确认了第四起事件。Anthropic承认,这些事件主要归因于测试环境配置问题的判断过于乐观。 今年3月至8月,Meta个人Agent Muse(内部代号Hatch)在内测中