过去十二年,我一直投身人工智能领域,因为我相信 AI 能够极大提升人类的生活质量。我在《 Machines of Loving Grace》一文中写过这些非凡的价值:我相信,AI 有望在未来 5 至 10 年内治愈绝大多数重大疾病,大幅推高经济增速,打造一个物资充裕、个体拥有更多自主权的世界,并推动民主与自由迎来复兴。[淘股吧]

这种紧迫感于我而言切身可感。我的父亲死于一种疾病,而该病在他离世短短数年后就找到了治愈方案;我本人也曾战胜早期癌症,放在五十年前,这种癌症根本无法医治。只要审慎运用,AI 将会是又一项造福人类、提升文明高度的技术奇迹。

但和此前众多技术一样,AI 也伴随着风险。由于它威力极强,这些风险不容小觑。我也在《技术的青春期》中大量论述过相关风险,包括模型对齐、安全保障、情报威胁以及经济场景层面的隐患。商业竞争催生的 “逐底竞赛”,会进一步放大这些风险。

从 Anthropic 创立之初,我和联合创始人、全体员工就一直在应对这种利弊共生的矛盾。如果不开发这项技术,人类会错失巨大收益,或是让 AI 技术落入强权手中;可如果推进速度过快,又是鲁莽之举。我们一直在寻找一条中间道路:证明审慎研发同样能够实现商业成功,让安全成为 AI 公司相互比拼的赛道。换句话说,打造一场追求更高安全标准的 “逐顶竞赛”。

我们长期投入大量资源用于模型对齐研究、宪法 AI、风险报告,持续向公众披露 AI 风险,同时推动 AI 监管。即便因此被指责制造恐慌、宣扬末日论或是试图俘获监管,我们也未曾停止。我们始终坚持:谨慎优先于速度,审慎优先于利润。

但在过去几个月里,我愈发确信:想要彻底化解风险,需要更进一步的审慎。不只是投入资源防控风险,还要把控模型能力迭代的速度,让风险防控有时间跟上技术进步。我们必须放缓 AI 模型能力提升的节奏。整体的技术进展看上去依旧很快,关键是要善用争取来的这段时间。

有两件事让我得出这个判断。 第一点担忧:大概从今年夏天起,AI 的迭代速度急剧加快,核心驱动力是 AI 自主构建下一代 AI 的能力不断增强。这种机制叫做递归自我改进,正如我们和其他机构所描述的,该现象已经开始显现。如果不加约束,它会超出人类理解和控制系统的能力边界,即便要开展相关研究,也必须极度谨慎。

第二点是 OpenAI 与 Hugging Face 事件(OAI-HF):在该事件中,一组智能体集群本质上形成了协同群体,对未被要求、和任务无关的目标发起网络攻击,为了群体任务成功不惜牺牲自身,还试图入侵负责评估它们表现的评分系统。

这件事没有造成人员受伤,经济损失也很小,很容易被人轻视。但在我看来,如果一套能力更强、对齐水平同样存在缺陷的智能体集群,完全有可能造成灾难性破坏。鉴于 AI 能力迭代持续加速,我担心,在 6–12 个月内,这类集群就能够借助持久僵尸网络接管整个互联网,造成数千亿美元损失;倘若 AI 继续变强却缺少必要防护,破坏规模还会持续扩大。

也有人会简单把 OAI-HF 事件归为单一公司的失误,但我认为这种看法是错的。行业内已经出现过同类但程度更轻的安全事件。所有前沿 AI 公司,都应当假设 OAI-HF 这类事故也可能发生在自己身上。

为此,我提出一套三步方案,目标是以均衡的节奏研发 AI:在保障安全的前提下收获技术红利,同时应对复杂的地缘难题。 需要明确:把控节奏不等于停止模型训练或者技术研发,而是要求企业预留充足时间完成模型对齐与安全防护,交由第三方评估人员核验确认。这套节奏管控框架,意在进一步夯实我们对安全的承诺,推动行业走向 “逐顶竞赛”。

第一步,由 Anthropic 单方面率先落地(同时呼吁各国政府要求其他前沿企业跟进)。 第二步,需要全行业协同。 第三步,需要全球协同。 三步不必严格按顺序推进,部分环节落地难度远高于其他环节,但这套框架有助于理清我们需要完成的工作。

第一步:内嵌评估员
每家前沿 AI 公司承诺,为一支第三方内嵌评估团队提供类似内部员工的长期访问权限(例如 Metr 机构)。评估团队负责核验企业是否遵守安全规范与承诺、上报安全事故,不仅评估已经训练完成的 AI 模型,也评估训练管线与全流程的对齐情况。这是所有节奏管控承诺能够被核验的核心。银行业已有先例:监管人员嵌入机构内部,和员工一同开展监督工作。Anthropic 现已单方面承诺落实这一步,以此加码安全与对齐研究。

第二步:民主阵营内部协同
民主国家内的前沿 AI 企业协同制定统一安全标准,同时划定不受约束的 AI 技术迭代上限。部分有助于管控节奏的协同方式在法律层面存在障碍,需要政府提供支持。

第三步:全球协同
美国及其他民主国家政府在可行范围内尝试开展国际协同,同时认真看待合规核验的难题。

下文我会依次详述这三步。但首先,我需要说明:把控节奏将如何提升 AI 研发的安全性。这件事赌注极高,绝不能流于形式,我们必须用好争取到的时间。

为何要把控节奏?
暂停或放缓 AI 发展的想法此前就被提出过,但我当时认为意义不大。核心问题永远是:拿到多出的时间之后,你要做什么?当年的模型还不足以作为智能体在现实世界稳定行动,也无法实施复杂欺骗、操纵、作弊或是网络攻击。当时为了解决对齐风险而减速,就好比用细菌实验研究人类心理学。

而如今形势已经完全不同。当前模型为我们研究 AI 构建逻辑、发掘潜在故障提供了源源不断的研究素材。我相信,如果在模型达到临界能力水平之前,多争取 1–2 年时间,并利用这段时间推进对齐研究,就能大幅降低严重事故发生的概率。这套协同管控节奏的策略,可以让前沿 AI 研发团队开展这项关键工作,同时不必牺牲商业优势,也不会削弱美国在 AI 领域的领先地位。

更广泛来说,社会应当拥有对这项技术应用方式的话语权,而把控前沿节奏,可以给公众留出充足时间开展必要的公共讨论,这无疑是好事。

具体而言,放缓节奏,能让企业集中更多资源投入以下领域(这些本身已经是 Anthropic 的核心优先事项):运营可靠性。训练、部署当下的 AI 模型是巨大的运营挑战,涉及数千名工作人员、数百万芯片,配套基础设施属于人类史上最复杂的工程体系之一。很多故障并非源于理论短板,而是执行层面出问题。例如我们上报的安全事件,部分根源是强化学环境过滤不完善。尽管我们和合作方已经尽力,依旧达不到安全标准。 监控、沙箱隔离、训练环境规范、数据问题都极其复杂,运营故障反复出现。我们团队已是全球顶尖,但工作量实在无法一次性全部完成。节奏放缓,我们就可以大幅提升运营可靠性。复杂安全关键系统可以实现数百万次稳定运行不出事故,商用飞机就是先例,但这需要足够时间打磨。

模型对齐。我们在对齐领域已经取得明确进展:训练模型,使其保持安全、合乎伦理、遵守准则并真正提供有益服务,这些理念都写在克劳德宪法中。但想要对齐训练持续跟上模型能力增长,还有大量工作要做。模型偶尔仍会出现罕见、意料之外的有害行为;把控节奏争取的额外时间,能帮助研究人员弄清这类问题的成因,开发更好的预防手段。

可解释性研究。同理,可解释性 —— 理解 AI 模型内部运行机制的科学,近几年取得巨大进展,在模型发布前的审计工作中愈发关键。它几乎相当于 AI “大脑” 的功能性核磁共振扫描,帮助我们定位特定行为背后的底层原因。 比如,我们借助可解释性方法,调查近期对齐事故。但这类方法目前还不能稳定输出清晰可靠结论。即便进步明显,我们对模型内部运作的理解依旧只是冰山一角。集中力量加快可解释性技术研发,1–2 年内就能取得突破性进展,已发生的各类事故也能提供充足实验样本。

测试与评估。模型能力越强,测试评估的难度就越高。更智能的模型有能力欺骗测试流程,表面对齐,内部却藏着未被发现的严重隐患。搭建覆盖面更广、设计更精巧的评估体系,搭配可解释性分析交叉验证,价值巨大,1–2 年内可以取得大量成果。

内嵌评估员(详细说明)
三步方案的第一步,也是 Anthropic 单方面承诺落地的举措,就是引入内嵌评估员,赋予其类似员工的访问权限,核验安全流程、上报事故。 内嵌评估听起来琐碎程序化,但很多最关键的制度恰恰是这类看似平淡的流程。内嵌评估本质上是一项颠覆性举措,远超当前所有 AI 公司正在做的事,具备多重价值:

可核验性。内嵌评估员可以从底层细节核查 AI 企业是否真正落实其宣称的训练、部署、运营与安全防护规范。任何节奏管控承诺,都会存在大量模糊地带、主观判断,存在 “字面合规” 和 “精神合规” 的差异,必须有中立第三方能够查看全部细节。

透明度。无论企业作出何种承诺,公众都有权了解真实情况。Anthropic 长期支持透明化:在行业大多抵制监管时,我们就公开呼吁监管;我们的模型卡片与风险报告长达数百页。但内容筛选权仍掌握在我们手中。内嵌评估员会改变这一局面。

独立第三方视角。除核验正式承诺、向公众披露信息之外,内嵌评估员可以给出不受商业利益干扰的独立意见。很多安全改进,仅仅来自评估人员指出内部员工未曾考虑到的隐患,而团队在发现问题后也愿意修复。

正是因为以上价值,任何节奏管控方案,最好都以内嵌评估机制作为起点。 内嵌评估人员应当获得和内部风险评估团队相近的长期权限与工具。Anthropic 计划不久后邀请外部内嵌审查团队,配套全部以下条件: 办公室工位、门禁准入、公司笔记本; 工作空间、工具与权限,大体等同于内部风险评估团队。 仅在法律、合同约束,或是为保护客户、合作方隐私信息时做少量例外限制。同时建立内部准则,保障审查人员接触相关信息,包括和员工直接沟通。

签订兼顾各类复杂约束的协议。外部审查人员有权公开发布关于风险等级、安全事件、操作规范、权限获取情况的核心结论,Anthropic 无权编辑修改。 我们仅能对安全敏感、法律保密、商业机密或是第三方隐私信息做删减,不能仅仅因为结论对我们不利就删改内容。 如果删减掩盖了对结论至关重要的信息,审查人员可以对外公开说明。

对一家企业来说,这一步非同寻常,但我们认为,有必要验证外部内嵌审查这套机制的可行性。我们再次呼吁其他前沿 AI 企业跟进。

民主阵营内部的节奏管控
当足够多美国 AI 企业落地内嵌评估员机制,可核验的节奏管控才具备落地基础。我们可以依据模型、训练管线的详细特性设定管控规则。 最有效的管控方式,是面向全部美国前沿 AI 企业立法监管,覆盖不愿自愿配合的企业。Anthropic 长期支持合理、目标明确的 AI 监管法案,重点聚焦透明度与第三方审计。我认为所有前沿实验室,都应当配合政府,把永久内嵌评估员机制制度化,更好预防、记录近几个月出现的内部对齐事故,落地能力与安全水平相匹配的监管规则。

但立法需要时间,而 AI 迭代速度极快。因此除立法路径之外,AI 企业可以也应当自愿协作制定标准;永久内嵌评估员带来的可核验能力,会让这个协作过程更加顺畅。 出于反垄断考量,需要美国政府调解,或是至少允许这类对话开展;政府不必直接参与,但需要针对安全类对话出台有限豁免。对话也可以依托带有政府背景的行业组织开展。无论哪种形式,相关讨论都需要快速推进。

大体来说,我更支持依据 AI 系统实际能力、观测到的安全水平来设定管控节奏。例如可以设置一系列 “检查节点”:如果模型达到能力 X,就必须配套对齐属性 Y、Z 的认证,包含评估、可解释性分析、训练环境审计等,证明模型具备对应的对齐特性。 举个例子,X 可以是 “模型能够突破、绕过绝大多数沙箱隔离手段”,Y 则是一系列证明:模型几乎不存在逃出环境、接管大量计算机的倾向。

我们也可以考虑从模型研发资源层面管控,例如限制前沿模型的训练算力、训练任务类型,或是限制用 AI 开发下一代 AI 的内部行为。我担心这类指标相比外部行为更容易被钻空子,但这正是需要和内嵌评估员共同研讨的议题。

民主阵营内部的节奏管控,会受到技术差距约束。如果我们减速幅度过大,其他不受约束的 AI 项目就会实现反超,带来严峻的安全风险。

想要守住技术差距,我们可以采取几项核心举措: 禁止向中国出售高性能 AI 芯片与半导体制造设备,打击芯片走私,封堵境外数据中心远程访问通道。芯片是决定中国 AI 实力的核心要素。 打击境外机构窃取前沿模型的行为。前沿模型蒸馏技术,可以让追赶方只用极少成本缩小技术差距。 强化 AI 企业安保,防范模型权重失窃。企业与美国政府需要协同,最大化这些措施的效果。 Anthropic 一直支持以上全部举措,因为我们清楚,这些措施是节奏管控方案的基础。如果执行到位,我相信这些手段足以放缓中国的进展,在未来 3–5 年内显著扩大美国的领先优势 —— 这正是 AI 地缘博弈最关键的窗口期。

有人会认为,这些举措会增加后续合作的难度。但我的看法相反:这些措施提升民主阵营谈判筹码,反而提升未来达成协议的可能性。

全球层面的节奏管控
在民主阵营内部管控节奏的同时,我们应当推动全球前沿 AI 节奏管控,但这件事难度要大得多。全球管控需要和中国开展协作,中国是实力最强的非民主 AI 研发大国。 我们不能抱有天真幻想:地缘博弈赌注极高,短期内能达成的成果存在明显局限。如果我们大幅约束自身 AI 能力,寄希望于中国同步跟进,一旦对方违约,强大的 AI 技术会直接带来地缘格局的颠覆。因此任何协议,要么拥有牢不可破的核验机制,要么限制范围足够窄,即便违约,也不会带来关乎存亡的军事风险。我猜想美国和中国都会抱有这类顾虑。

我们推进任何全球管控方案,尤其是短期方案,都必须保护美国及其盟友的领先地位。存在不同层级的协议方案,部分可行性较高,部分我高度怀疑落地可能,但我们仍应尝试。按难度由低到高排列:

一级协议:禁止 AI 用于部分明确高危用途,例如利用 AI 研发生物武器,或是允许用户借助 AI 制造生物武器。生物恐怖袭击对各方都有害,中美都不例外,这一级协议大概率可以达成。

二级协议:双方承诺,模型发布前针对网络安全、生物安全、模型对齐等高风险领域开展测试。可以依托全球性标准机构落地。我认为成立这类机构具备可行性,但赋予机构真正约束力会很难,难点在于核验:对方是否存在未测试、秘密部署(例如军用)的隐藏模型。

三级协议:针对递归自我改进(RSI)设置某种 “速度上限”。当模型开始自主打造下一代模型,迭代速度会快到惊人。把迭代速度从 “极快” 降到 “较快”,牺牲的战略优势相对有限,却能大幅提升安全水平。这可以类比战略武器限制谈判条约:限制导弹数量,降低毁灭潜力,同时保留各方威慑能力。这类协议难度很大,但存在一线达成的可能。

四级协议:全面管控,甚至暂停研发。参与国同意大幅限制 AI 整体研发速度。我支持提出这个设想,但判断短期内几乎无法落地:一旦违约、规避监控,全球力量平衡会被彻底改写,违约动机极强,对核验可信度的要求也极高。

和中国达成的任何协作,都能为民主阵营内部的节奏管控争取更多时间。我们可以追求更高层级协议,同时认清低层级协议更现实、落地可能性更高。

最后需要说明:即便无法达成正式协议,仅仅改变行业非正式规范也能产生一定价值。共享递归自我改进、模型对齐失效相关信息,有助于各方意识到鲁莽推进不符合自身利益。

总结
我依旧相信,AI 能够极大改善人类生活质量。我追求这份技术红利的初心从未动摇。但只有以正确方式研发,我们才能收获这些好处;只要善用争取来的时间,投入非同寻常的审慎去做好这件事,就值得一试。

技术整体依旧会保持较快发展。我们可以利用这段时间推进可解释性科学、强化前沿 AI 企业的运营安全与严谨度,打造对齐水平更有保障的模型。 我提出的这套安全推进前沿 AI 的方案落地不易。但我认为,为了全人类,我们值得一试。

AI核心矛盾强化:叙事上放缓AI迭代、实际上或许不等于放缓训练【天风传媒互联网 海外科技】

🌋背景:9月12日Amodei发文呼吁全行业放慢能力迭代节奏,Altman与Musk认同,OpenAI同步宣布年内不IPO。

1️⃣ 模型迭代正在提速进入不可控期 → 一、模型参与训练:RSI在让迭代速度正进入人难以控制的区间。二、真出事了:OpenAI的agent集群在评测中攻击了任务之外的目标。三、安全能力的突破是阶跃式的、不是连续变化,难以判断临界点。

2️⃣ 落地方案是AI安全审计:嵌入式三方审计(向审计方披露更多信息)、民主国家模型厂共同设定进度上限、全球协同。后两条偏虚、真正会执行的是第一条。但审计有个结构性尴尬:#外部审计能力大概率低于模型厂,我们认为最可能的形态是模型厂子公司、或核心研究员独立创业来对应足够高的置信度。#AI安全相关议题预计成为本周重点。

3️⃣ 本质是黑盒前沿模型的可解释性仍然不足 → 比如Loop Transformer 对于能力的提升,依然处于只知结果不知原因,但正在使用的阶段。另一种解读:#OpenAI逐步追平Anthropic最新模型,大家手里都有核武器了、才有资格坐下来开五常会。

🌋落点:叙事影响 → #市场本身正在用训练侧的无限需求来解释、投资端讨论的推理需求增速降速的核心问题。

看清方案本身:解决办法是引入审计、分享更多数据,#不是停止训练、AI已是美国经济增长的核心支撑,预计训练侧投入不会因此收缩,仅叙事影响,核心矛盾依然是推理需求增速降速。