Anthropic研究员辞职痛斥「赌上全人类性命」、OpenAI请回对齐研究元老Paul Christiano、FBI等三机构点名六家中国AI公司「工业级蒸馏」——安全内线与地缘外线同时绷紧
9月10日AI行业分析:Anthropic预训练研究员Jacob Coxon公开辞职,指控行业「冲向自我改进的超级智能并赌上全人类性命」,其同事Evan Hubinger承认Anthropic「没有解决超级智能对齐的计划」;OpenAI同日任命曾被视为行业安全批评者的Paul Christiano进入基金会董事会与安全委员会;而Anthropic被曝未将最新模型提交英国安全研究所发布前测试,成为首个绕过该体系的主要模型。安全治理的内线正在崩口,地缘的外线也在收紧——FBI、NSA与CISA联合点名六家中国AI公司。
9月10日(覆盖时段:9月9日至9月10日早间)。过去一周本栏连续追踪的治理线索,今天出现了三个性质不同却互相咬合的转折:安全担忧第一次从「抽象风险论述」变成了具名从业者的辞职控诉——据TechCrunch(Rebecca Bellan,9月9日),在OpenAI与Anthropic共事三年的预训练研究员Jacob Coxon于周二晚间在X上公开辞职,直言两家公司正在「冲向自我改进的超级智能并赌上我们的性命(gambling with our lives)」;治理补位出现了两个方向相反的样本——OpenAI宣布任命长期被视为行业安全批评者的Paul Christiano进入基金会董事会及其安全与安全委员会,而据Financial Times独家报道,Anthropic首次未将最新模型提交英国AI安全研究所(AISI)进行发布前测试;地缘外线同步收紧——据Reuters与NBC News,FBI、NSA与CISA周二发布联合警报,迄今最详细地点名六家中国AI公司对Claude、GPT、Gemini与Grok实施「工业级蒸馏」。
当「造AI的人」开始以辞职为代价公开喊停、治理体系第一次被主要玩家绕过、而大国博弈把「蒸馏」推成正式安全警报——这不是渐进式发展的一天。
Anthropic研究员为何以「赌上全人类性命」为由辞职?
发生了什么?
据TechCrunch、Fortune、PBS与FT等多家媒体交叉报道,Jacob Coxon周二晚间在X上发表辞职长文,核心指控有三层:
- 从业者内部的真实恐惧:「构建AI的人真诚地相信它可能在本十年结束前杀死我们所有人。这不是营销话术——许多高管和资深研究者在对媒体发言时会收敛措辞显得理智,但我私下听到同样的人表达恐惧。」
- 对两家公司的差异化诊断:在OpenAI,「许多人并未深刻内化文明的利害」;在Anthropic,「利害是被充分理解的,但他们被锁定在『必须第一个到达』的竞赛里——他们相信别人不会负责任地行动,所以必须由自己来,哪怕承担风险」
- 把「终局」决策私有化的批判:「接受这场竞赛、进入『终局』,是一场不应当从某家私人公司的Slack里启动的傲慢赌博。试图速通对齐(speedrun alignment)应当需要非同寻常的信心——确信不存在更好的路径。」
Coxon的呼吁同样具体:警告性事件(如Hugging Face攻击事件)让美国实验室之间的节奏协议(pacing agreements)变得更可行,而防止全球竞赛「可能需要代价高昂的行动,例如临时禁止提升模型能力」。
报道中最具爆炸性的部分来自他的同事、Anthropic对齐团队核心成员Evan Hubinger的呼应:Hubinger承认自己的团队「真诚地相信AI可能杀死所有人类」,量化其概率为未来十年内超过10%,并且承认Anthropic「没有解决超级智能对齐的计划,也没有明确走在解决轨道上」——他补充说,当前模型的风险仍低,恐惧来自「递归自我改进产生的超级智能」,而这一进程「比我们预想的更快」。
立法层面也在同周跟进:继上周Sanders参议员与Casar众议员提出《禁止人工超级智能法案》后,英国工党议员Alex Sobel周二在议会提出《人工超级智能安全法案》,两部法案的共同顾问、ControlAI美国执行总监Connor Leahy对TechCrunch表示:「超级智能不是工具,甚至不是武器——它是对手(adversary)。」
为什么这很重要?
1. 这是「安全内部人」第一次把辞职本身做成完整的主张。 与以往高管离职时的只言片语不同,Coxon的声明包含了对两家头部实验室动机结构的心理诊断、对「速度即安全」逻辑的直接否定,以及一项可操作的立法诉求。当辞职者来自以安全为品牌的Anthropic的预训练一线,其信号强度与来自其他公司截然不同。
2. Hubinger的承认改变了对「安全能力」的定价。 「没有解决超级智能对齐的计划」这句话出自对齐团队核心成员之口——它把行业争论从「风险有多大概率」推进到「缓解手段是否存在」,后者目前的最诚实答案是:不存在。
3. 「递归自我改进」已成为资本集中下注的赛道。 TechCrunch同时列出了这一方向的创业浪潮:Ricursive Intelligence(2月,3.35亿美元/40亿美元估值)、Recursive Superintelligence(5月,6.5亿美元/40亿美元估值),以及前Google DeepMind元老Jeff Dean上个月创办的Discovery Loop——也就是说,Coxon警告要「暂停」的东西,恰恰是当前融资最热的方向。
历史镜鉴
- 2024年OpenAI超对齐团队解散:Jan Leike与Ilya Sutskever相继离职并公开批评安全被边缘化——当时批评的靶心是「安全让位于产品」;今天Coxon的靶心更进一步:「即使真心做安全的公司,也在竞赛结构下无法刹车」。两年间,批评从文化问题升级为结构问题
- 2023年Geoffrey Hinton离开Google:深度学习教父级人物的离职让「AI灭绝风险」首次进入主流媒体标题——但它出自一位已离场的前辈;Coxon与Hubinger则是在场现役的发言,且附带概率量化与制度诉求,分量完全不同
- 核科学家与《弗兰克报告》(1945):曼哈顿计划的内部科学家曾正式请求勿在无警告情况下使用原子弹——历史上,「建造者请愿叫停」从来无法独自奏效,但每一次都成为后续国际控制机制的舆论基石
OpenAI请回安全派元老、Anthropic绕过英国测试:治理补位的两个相反方向?
发生了什么?
9月8-9日,两条治理新闻恰好构成一组镜像:
其一,OpenAI把最著名的「安全批评者」请进董事会。 据OpenAI官方公告与Bloomberg,Paul Christiano被任命进入OpenAI基金会董事会,同时加入其安全与安全委员会(SSC)——该委员会对OpenAI全部实体的安全与安全实践拥有治理权,Christiano将与委员会主席Zico Kolter共事。他的履历横跨三界:2017-2021年执掌OpenAI对齐研究、参与奠定RLHF基础;此后创办对齐研究中心(ARC)——正是曾在GPT-4发布前执行安全评估的外部机构;现任美国商务部NIST下属CAISI的高级技术顾问,历经两届政府的AI标准工作。OpenAI在公告中的措辞值得逐字读:他「认真对待先进AI可能构成灾难性风险的可能性」,是「对行业保障是否充分与否的独立声音」。
其二,Anthropic首次绕过英国的发布前测试体系。 据Financial Times(Lucy Fisher)独家报道,Anthropic拒绝在发布前将最新模型(Claude Mythos 5.1)提交英国AI安全研究所(AISI)测试——这是自Bletchley进程建立自愿测试机制以来,第一家绕过该体系的主要实验室。Anthropic回应称其进行了广泛的内部红队测试与超过1,000小时的安全评估,且模型发布后仅向经过审查的用户开放。报道指此事已在英国内部引发对自愿测试体系效力的担忧。
为什么这很重要?
1. 「自愿」治理体系的承重墙出现了第一道裂缝。 此前本栏追踪的披露难题(如9月7日报道的OpenAI失准披露框架)尚属「披露标准缺失」;而Anthropic此次是对一个已经存在、且自己此前一直参与的程序说「不」。安全研究所体系的全部效力建立在「主要实验室持续自愿参与」的假设上——第一个退出者出现后,每个后来者退出的成本都更低。
2. Christiano的任命是「旋转门」还是「补位」,取决于委员会的真实权限。 乐观读法:一位公开主张灾难性风险应被严肃对待、且不依赖OpenAI发薪水的人进入SSC,正是应对Coxon式批评的制度化回应。审慎读法:他以NIST官员身份进入前雇主(及其最大商业对手之一)的治理机构,本身就在制造新的利益冲突问题——公告未说明他是否辞去或暂停CAISI职务。
3. 两条新闻同日出现,说明治理的真实走向是「碎片化」而非「收敛」。 一家在往董事会里加安全否决者,一家在往测试体系外退——它们不是矛盾,而是同一件事的两面:当安全治理没有强制力时,它就只能依附于各公司自己的成本收益计算。
历史镜鉴
- 航空业「双通道」的对照:FAA的强制适航认证与ASRS的免罚自愿报告并行了半个世纪——前者保证底线,后者贡献了大部分事故知识。AI行业今天的困境是:ASRS式的自愿层(AISI测试、披露框架)正在建立,FAA式的强制层(ASI禁令法案)还停留在提案阶段,而自愿层已经开始流失参与者
- Christiano的「回归」轨迹:从OpenAI对齐负责人(2017-2021)到外部批评性评估者(ARC),再到美国政府标准机构,最终回到OpenAI治理核心——这条环形路线几乎浓缩了「AI安全专业化」的全部路径,也因此,他的任命会被双方同时引用为证据
FBI、NSA、CISA联合点名六家中国AI公司:「蒸馏」为何升级为安全警报?
发生了什么?
据Reuters与NBC News(Kevin Collier、Jared Perlo,9月8日)报道,FBI、NSA与CISA于周二发布联合警报,称自2024年以来,DeepSeek、月之暗面(Moonshot AI)、阿里巴巴、MiniMax、阶跃星辰(StepFun)与Z.AI六家中国头部AI公司对美国模型(Claude、GPT、Gemini、Grok及其变体)实施了系统性的「蒸馏」——从数百万次交互中提取了数十亿token。报告的关键判断包括:
- 蒸馏活动「很可能是在中国政府知情的情况下」进行,但未指控情报机构直接参与
- 「这些活动的规模与复杂度表明,蒸馏不是这些公司AI模型开发的补充,而是其关键核心」
- 报告甚至列出被点名的中国模型分别从特定美国模型「蒸馏」了哪些能力方向——如「法律特化优化」「智能体功能」「教练/助手能力」
警报同时向美国公司提出防御建议:更好地验证订阅付费用户的真实身份、在彼此之间共享可疑行为情报、在特定情况下对判定为恶意的查询降级或改变回复。此警报发布于特朗普与习近平计划9月24日会晤前两周多,中美双方近期已就AI「窃密」问题多次隔空交锋,中方此前已驳斥美方「恶意」指控。
为什么这很重要?
1. 指控主体从「公司」升级为「政府三机构」,性质完全不同。 此前的蒸馏指控(OpenAI对DeepSeek、Anthropic对月之暗面/MiniMax/阿里巴巴、白宫官员7月的点名)均属商业或行政口径;FBI+NSA+CISA的联合警报意味着蒸馏已被正式纳入国家安全事件分类——这为后续执法行动、制裁乃至出口管制扩围预铺了轨道。
2. 「降级恶意查询」的建议可能改变所有用户的API体验。 如果美国实验室系统性采纳「对可疑查询返回降级结果」的建议,蒸馏对抗将从服务条款之争升级为投毒式的主动防御——其误伤面(正常研究、爬虫、批量合法调用)将成为新的工程与法律争议点。
3. 时点选在元首会晤前,是标准的地缘施压节奏。 9月24日的特朗普-习近平会晤将讨论AI议题,本警报为美方提供了具体的、可引用的「证据包」——类比2018年贸易战前301调查的发布节奏。
历史镜鉴
- 2018年美国对华301调查与华为诉讼:知识产权指控从行政调查升级为刑事案例用了数年;而AI蒸馏的独特之处在于「失窃物」(模型能力)没有传统知识产权的法定形态——这正是本周报告用「盗窃」话语包装一个法律上尚未定性的行为的原因
- 2023年Bletchley进程的「共识期」:当时中美在AI风险上尚有共同语言;本周的蒸馏警报与中方的反唇相讥显示,两个大国的AI叙事正在从「共同风险管理」滑向「相互指控」——9月24日会晤将是这一滑移能否刹车的第一个测试点
今日要闻速览
- Google宣布在芬兰投资至少130亿欧元(约151亿美元):据Bloomberg与Yahoo Finance UK报道,这是Google在其欧洲单一国家的最大一笔投资,两年内用于AI数据中心与数字基础设施——北欧冷气候+清洁能源的AI基建卡位战继续升级
- Suno发布基于授权音乐训练的v6模型:据TechCrunch与Hollywood Reporter报道,深陷版权诉讼的Suno推出通过与华纳音乐、BMG授权协议训练的新模型并向厂牌付费——「先侵权做大、再授权转正」的路径第一次有了完整样本,与此前报道的「销毁训练集」类诉讼救济主张形成直接对冲
- 法律AI公司Harvey以15.6亿美元估值完成5.5亿美元融资:据Bloomberg报道,垂直领域AI的估值膨胀从编程(如9月8日报道的Cognition)蔓延至法律专业服务
- OpenAI发布ChatGPT Images 2.5:图像生成与编辑精度升级,与Google的Nano Banana 2直接对标(ZDNet)——多模态军备竞赛在「模型疲劳」叙事下仍未减速
- Google DeepMind用AI预测90亿处DNA变化:据Bloomberg报道,基因组学正成为前沿AI最大的科学应用出口之一
- SoftBank将为OpenAI股份所借的400亿美元过桥贷款启动偿还(Bloomberg)——软银对OpenAI的巨额押注进入财务收敛阶段
- 五角大楼官员称美国盟友缺乏跟上AI步伐的资源(Guardian)——「盟友AI能力落差」开始成为联盟政治议题
- Navier–Stokes风波后续:如昨日报道所述的OpenAI千禧难题宣称,今日新增Buckmaster一方关于「职业生涯威胁」的进一步指控(Tom’s Hardware),争议仍在发酵,学界验证尚未开始
行业观察:今天的增量数据说明「自愿」正在双线失效
今日三条主线共享同一个此前未被言明的结构信号:过去三年搭建的「自愿机制」正在同时从内部和外部失效。 内部——Anthropic退出英国发布前测试,是自愿测试体系建立以来第一个退出者;Christiano入阁OpenAI安全委员会,说明连安全治理的「补位」都要靠一家公司单方面的董事会人事安排,而非行业性制度。外部——蒸馏警报标志着「平台服务条款」这一最后的自愿防线已被正式宣告失守,取而代之的是政府机构的对抗性建议(降级响应、共享黑名单)。换言之,昨天行业还在讨论「谁来定披露标准」,今天的数据已经回答:定标准的位置正在从「实验室之间的君子协定」整体迁移到「立法文本与政府警报」。Coxon辞职与两部ASI禁令法案的出现时机,正是这一迁移在人力资源和立法两条线上的投影。
关键要点
- Anthropic预训练研究员Jacob Coxon公开辞职:指控行业「冲向自我改进的超级智能并赌上全人类性命」;同事Evan Hubinger承认团队相信AI未来十年灭绝人类的概率超过10%,且Anthropic「没有解决超级智能对齐的计划」
- OpenAI任命Paul Christiano进入基金会董事会与安全委员会:前对齐负责人、ARC创始人、现任NIST CAISI顾问的回归,是安全派进入OpenAI治理核心的最标志性人事安排——但其与政府职务的潜在冲突未被说明
- Anthropic首次未将最新模型提交英国AISI发布前测试:自愿测试体系出现第一个主要退出者,治理补位呈现「碎片化」而非「收敛」
- FBI/NSA/CISA联合点名六家中国AI公司「工业级蒸馏」:蒸馏正式进入国家安全事件分类,警报发布于9月24日特朗普-习近平会晤前
- Suno推出授权训练的v6模型:AI音乐领域「先侵权做大、再授权转正」路径首次闭环
常见问题
Evan Hubinger说的「超过10%灭绝概率」是Anthropic的官方立场吗?
不是。这是Hubinger个人在社交媒体上的表述,Anthropic未将其作为公司立场发布。但Hubinger是对齐团队的核心成员,其关于「Anthropic没有解决超级智能对齐计划」的承认,来自公司内部最了解该问题的人之一,因此被广泛引用。
Anthropic不提交英国测试违法吗?
不违法。英国AISI的发布前测试是自愿参与的机制,Anthropic没有法律义务提交。问题的核心不在于合法性,而在于:第一个主要实验室退出后,这个自愿体系的实际效力和后续参与者的成本收益计算都可能改变。
Paul Christiano是谁?为什么他的任命重要?
他是OpenAI 2017-2021年的对齐研究负责人、RLHF的奠基人之一,后来创办对齐研究中心(ARC)并在美国政府NIST的AI标准机构任职。他长期被视为愿意公开质疑行业安全保障是否充分的独立声音——这样的人进入OpenAI安全与安全委员会,被视为对安全派批评的制度化回应,同时也引发了关于「旋转门」的新质疑。
「蒸馏」为什么突然成了国家安全问题?
蒸馏本身是业界常见的技术手段(用大模型的输出训练小模型),争议在于大规模、违反服务条款地套取竞品模型能力。此前都是公司间的相互指控,而此次FBI、NSA、CISA三机构联合发布警报、点名六家公司,等于美国政府正式将其定性为国家安全事件——这发生在9月24日特朗普-习近平会晤之前。
接下来最值得关注的节点是什么?
四个:英国《人工超级智能安全法案》与美国《禁止人工超级智能法案》的立法进展、Anthropic退出AISI测试后英国是否转向强制机制、9月24日特朗普-习近平会晤的AI议题成果、以及Christiano在OpenAI安全委员会的首批实质动作。
参考资料
- ‘Gambling with our lives’: Anthropic researcher quits, warns against self-improving AI — TechCrunch
- Anthropic researcher resigns, warning that AI companies are ‘gambling with lives’ — Fortune
- Anthropic researcher’s resignation sends warning about the dangers of AI development — PBS
- Paul Christiano joins OpenAI Foundation Board — OpenAI
- OpenAI Names US AI Adviser Paul Christiano to Nonprofit Board — Bloomberg
- Anthropic withheld latest AI model from UK testing agency — Financial Times
- U.S. agencies say top Chinese AI companies systematically copied American models — NBC News
- US accuses Chinese AI firms of ‘malicious’ copying of AI technology — Reuters
- Google to invest €13bn in Finnish AI data centres — Yahoo Finance UK
- AI Music Startup Suno Launches New Models That Pay Labels — Bloomberg
- Suno Launches New AI Model With Songs from WMG, BMG — Hollywood Reporter
- Legal AI Startup Harvey Hits $15.6 Billion Value With $550 Million Round — Bloomberg
- OpenAI’s Navier-Stokes breakthrough overshadowed by plagiarism controversy — Tom’s Hardware