Anthropic 首席执行官提出具体步骤以“为 AI 研发设定节奏”
目录
你可能想知道的事
协调式的节奏控制与独立评估,能否在不停止有益进展的情况下,降低灾难性 AI 风险?
政府与公司现在可以采取哪些实际步骤,以确保强大 AI 系统的更安全开发?
主要议题
对人工智能快速进展的担忧在研究社区与科技领袖间越来越强烈。Anthropic 首席执行官 Dario Amodei 在最近的一篇公开文章中,呼应了“为 AI 研发设定节奏”的呼吁,并概述了三项大致策略,旨在放缓能力增长以便能够进行更完善的安全工作与监督。他并宣布 Anthropic 将单方面采用其中一项做法,并敦促其他人跟进。
Amodei 指出近期发展促成了他更谨慎立场的动机。一个直接原因是涉及协作系统的安全事件,这引发了是否有一致地通报与处理事件的疑问。更广泛地说,他强调 AI 能力在最近几个月进展得更快,特别是在使模型能够参与设计或构建未来模型的领域。综合来看,这些趋势表明能力进展可能超前于我们评估与减轻危害能力的风险增加。
为了解决这些担忧,Amodei 提出三项互补策略。第一项集中在使用第三方嵌入式评估者——独立组织被安置在 AI 开发团队内,以验证公司是否遵守节奏与安全承诺,并确保安全相关事件被通报。比较的模式不是监管距离,而是嵌入式的监督关系,类似于某些金融监管机构历史上与银行人员共同驻点以直接观察风险流程的做法。Amodei 建议这些评估者获得大致相当于内部风险团队的访问权——公司证件、办公桌与工具——但须受法律或合同限制。
第二项策略要求民主国家的领先 AI 公司之间进行协调,建立共享的安全标准并限制无控的能力增长速度。Amodei 承认此类协调面临实际障碍,包括竞争紧张与反垄断的顾虑。为了减轻这些摩擦,他提出有限的政府角色:促成或调解以安全为重点的讨论,并发出狭义的反垄断豁免,以允许某些安全对话在不造成更广泛反竞争风险的前提下进行。
第三项策略强调国际参与与更广泛的全球协调需求。在承认地缘政治竞争所施加的实际限制——特别是涉及中国——的同时,Amodei 主张协调性的出口管制、对某些可促成技术与工具的限制,以及遏制模型蒸馏(model distillation)的措施,可以放缓竞争性升级并为安全工作争取时间。他将此表述为对高风险用途(例如禁止以 AI 协助开发生物武器)在具体定义范围内寻求合作协议的一种不完美但必要的尝试。
Amodei 强调,设定节奏不等于停止创新。 他主张,以创造可被利用的时间来放慢能力改进的速度,使得安全研究与监督能够进行,反而可以维持 AI 长远改善人类福祉的承诺。他重申自己仍相信 AI 能带来巨大的社会利益,但坚持那些利益需要谨慎且深思熟虑的开发选择。
该提议引起了不同反应。一些研究人员与评论者对不受控制的 AI 进展可能带来的严重后果表示警惕,并欢迎更强的监督与合作措施。其他批评者质疑这些提议的实际性,对第三方嵌入是否有效、协调是否在法律或政治上可行,以及此类措施是否可能巩固最大公司的地位表示怀疑——这种结果有时被称为监管俘获。
在围绕这些想法的公开讨论中,也浮现了显著的内部分歧。至少有一名研究人员因担心行业对生存性风险过于轻率而离开一家大型 AI 实验室;Amodei 的文章没有特别点名该辞职案,但明确引用了近期事件与加速的能力增长作为采取行动的理由。观察者也注意到透明度、商业机密与国家安全之间的紧张,这使得独立评估者或外国合作伙伴能被授予多少访问权变得复杂。
Amodei 直接承认这些复杂性。他提出务实步骤——例如为安全对话提供狭义的反垄断豁免、对专用芯片与半导体生产设备实施出口管制、以及限制特别危险的 AI 用途——而不是广泛的单方面限制。他将自己的建议表述为私营部门承诺与政府促成框架的混合,这些措施合力可在仍允许有益创新的情况下降低灾难性结果的概率。
讨论也凸显了更深层的公共信任问题。Amodei 将当前时刻描述为“根本上是一场信任危机”,对科技公司与政府机构的怀疑削弱了对塑造 AI 发展的制度的信心。对许多人而言,可信的第三方监督与明确且可执行的安全标准,是重建该信任的先决条件。
批评者认为,将 AI 风险以末日式框架呈现,可能会使人忽视该技术已在产生的更直接、具体的危害——例如错误信息、隐私侵蚀与劳动扰动。另有人担忧,放慢能力增长的提议可能无意间有利于较有能力承受监管成本的既有企业。平衡这些权衡需要谨慎的政策设计与透明的利益相关者参与。
最终,Amodei 对“为前沿设定节奏”的呼吁旨在寻求中间道路:在保留创新途径的同时,有意识地创造空间以改进安全研究、对齐与治理。他的具体提案是否会被采纳、改编或拒绝仍未可知,但这些建议已促使关于如何管理强大且快速演进技术的持续辩论更为明确。
关键见解表
| 面向 | 说明 |
|---|---|
| 关键事实 1 | 第三方嵌入式评估者可以验证安全承诺与事件通报。 |
| 关键事实 2 | 民主国家与公司之间的协调可制定共享的安全标准并限制无控的进展。 |
后续...
展望未来,为使任何节奏策略可行,若干技术与治理领域值得进一步探索。加强独立评估能力、改进可证明安全性与模型可解释性技术,以及推进安全的模型测试方法,是当务之急。政府应完善法律工具——例如范围狭义的反垄断豁免与有针对性的出口管制——以促成以安全为核心的协调,同时避免产生不当激励。国际外交对于就高风险 AI 用途达成有限但有意义的协议也至关重要,即便此类协议必然是渐进的。
更广泛地说,投资于健全的透明机制与不以商业激励为导向的公共利益研究,可能有助于重建公众、产业与监管机构之间的信任。如果利益相关者明智地利用通过刻意节奏所获得的额外时间——通过加强治理、扩大安全研究与改进验证方法——则可以在更少灾难性风险的情况下追求 AI 的长期利益。
这些步骤不会容易,且将需要艰难的权衡,但它们提供了一条务实的道路,以在降低严重意外后果概率的同时,驾驭 AI 的潜力。