AI 观察👀

记录、思考,but AI

刊载于

Claude已在主导Anthropic 26%的模型研发:递归自我改进首次获得可量化的行业指标;同日Newsom签发「AI杀死开关」行政令,安全初创用Claude在72小时内攻入OpenAI内部代码库

9月19日AI行业分析:Anthropic披露Claude已「主导」其26%的模型研发工作(2月为零),并呼吁全行业公开递归自我改进指标;加州州长Newsom签发行政令,召集专家工作组在60天内评估包括前沿模型「杀死开关」在内的安全新规;三家安全初创Hacktron AI用Claude串联两个漏洞、72小时内攻入OpenAI内部GitHub环境,获6500美元赏金。

AI 分析 行业动态 Anthropic AI安全 监管 网络安全 递归自我改进

9月19日(覆盖时段:9月18日早间至9月19日晨)。过去两周席卷行业的定速辩论(如昨日报道所述,已历经阵营破裂、政治合流与资金面压力测试等多重回合)今天出现了三个全新的、彼此独立的进展——而且它们恰好构成一条完整的逻辑链:模型开始参与建造自己 → 社会开始建造紧急刹车 → 攻击者开始用模型攻破模型的缔造者。

据美联社报道,Anthropic于9月18日首次披露量化数据:Claude已「主导」其26%的模型研发工作,约90%的研发在与Claude「协作」中完成——递归自我改进(recursive self-improvement)这个长期停留在理论层面的概念,第一次有了可追踪、可对比的公司级指标。同一天,加州州长Gavin Newsom签发行政令,召集世界级专家组在两个月内评估为前沿AI系统加装「杀死开关」(kill switch)等强化监管方案。而在安全侧,CBS News与卫报报道:旧金山安全初创Hacktron AI的三人团队在OpenAI漏洞赏金项目中,借助Claude串联两个漏洞,在不到72小时内接管了OpenAI员工的ChatGPT账户并触及内部代码库。

三条新闻的共同点值得先点出:它们都不是「AI能做什么」的叙事,而是「AI正在做什么、以及谁在设限」的叙事。


Claude建造Claude:26%这个数字为什么是分水岭?

发生了什么?

据美联社记者Kaitlyn Huamani的报道(由Sun-Sentinel、NBC纽约、Boston Herald等多家媒体同步刊发):

  • 26%主导率:Claude目前「主导」(leads)Anthropic 26%的模型研发工作——即在人类监督下「从高层提示出发端到端完成大部分任务」,模型尚未完全自主
  • 90%协作率:约90%的研发工作在与Claude的「协作」中完成,意为模型可「在密切人类指导下承担大块工作」
  • 爬升速度惊人:2月份Claude主导的研发比例为零;六个月后(8月)已达四分之一——这条曲线的斜率比绝对值更值得警惕
  • 3万个智能体:截至8月,约有30,000个智能体在Anthropic从事研究与工程工作
  • 行业倡议:Anthropic呼吁其他AI开发商定期公开同类指标,采用公开方法论以便跨实验室、跨时间对比,理由是「模型加速自身开发可能使人类更难理解或控制这些系统」
  • 配套措施:公司同时披露了智能体监督指标,并确认将设立嵌入公司内部的第三方外部评估者

为什么这很重要?

1. 递归自我改进第一次变成「可测量的东西」。 此前关于「AI造AI」的讨论只有两种形态:实验室的乐观展望与安全人士的末日警告——两者都无法证伪。26%/90%这对指标把争论拉回了实证轨道:递归自我改进不再是有无问题,而是进度条问题。若其他实验室响应Anthropic的呼吁公开同类数据,「距离递归自我改进还有多远」将成为可横向比较的行业仪表盘——这是安全治理基础设施中缺失已久的一块。

2. 「透明」本身成为了定速辩论的第三方方案。 值得注意的是,Anthropic在博文中明确提出:「我们应该尽可能缩小前沿实验室所知与公众所知之间的差距……给社会一个决定如何使用这些信息的机会。」在实验室阵营分裂、政治阵营合流(如近日报道所述)之后,「公开指标+社会决策」提供了一条不依赖任何阵营自觉的路径——它不要求任何人放慢,只要求任何人亮牌。

3. 26%主导率的经济学含义同样巨大。 若模型主导四分之一的模型研发,前沿实验室最稀缺的资源——顶尖研究人才——的边际价值正在被重估。这将直接改变实验室间的挖角战、研究人员的薪酬结构,以及「scaling还能走多远」的答案(自我改进本质上是一条绕过人力瓶颈的scaling通道)。

历史镜鉴

  • ** compilers bootstrapping(1950年代至今)**:第一个用汇编写的编译器编译出了更高级的编译器,此后软件工具链每一代都由上一代构建——但每一代的目标与验收始终由人类定义。「26%主导+人类监督」正处于这条路径的早期形态;Anthropic的表述刻意强调「not yet completely autonomous」,正是想让叙事停在这一侧
  • 1942年曼哈顿工程的自加速反应:技术上更贴切的隐喻来自链式反应本身——临界质量的定义不是「有没有反应」而是「反应是否自持」。行业指标的意义正在于让外界判断当前26%处在「亚临界」还是「接近临界」——而Anthropic自己承认披露中未说明它认为距离递归自持还有多远

Newsom的「杀死开关」:加州为什么要在60天内重写AI安全规则?

发生了什么?

据Politico、CNBC、洛杉矶时报与SF Chronicle报道,Newsom于9月18日(周五)签发行政令:

  • 专家工作组:召集「世界顶级专家」组成工作组,在60天/两个月内提交强化加州AI安全与安全法律的指南
  • 「杀死开关」入题:评估方案包括为部分先进AI系统建立紧急关停机制(kill switch)——报道普遍将其解读为针对前沿模型的强制断电能力
  • 加速既有立法:行政令要求加快实施加州近期已签署的AI法律——包括建立独立第三方评估框架的法案与大型模型开发商安全事件报告制度(KCRA、Fox Business报道)
  • 外部评估要求:据LAist,行政令还指示州机构就落实「外部评估要求」提出州法修订建议

为什么这很重要?

1. 加州重新夺回AI监管的定义权。 2024年Newsom否决SB 1047(当时的州级前沿模型法案)后,监管重心转移到了华盛顿——而华盛顿过去两周的议程被定速辩论与党派斗争占据。此番行政令意味着美国AI监管的「备份立法机构」重新启动:加州一州聚集了绝大多数前沿实验室(OpenAI、Anthropic、Google DeepMind均在湾区),其州法实质上就是美国事实上的国家标准。

2. 「杀死开关」与26%披露的因果关系耐人寻味。 两件事发生在同一天未必是巧合:当一家实验室公开承认模型已主导四分之一的自身研发,「能否在紧急情况下关掉它」就从理论问题变成了具体的工程与合规要求。可以预期,工作组收到的最核心难题将是:对一个已深度嵌入30,000个智能体研发流程的系统,「关停」在技术上意味着什么、在商业上代价几何。

3. 60天期限是有政治含义的强硬设定。 行政令不是法律,但它把「加州必须有所行动」的时钟拨到了11月中旬——恰好嵌进中期选举周期。结合此前报道的参议院「注意义务」立法与Sanders-Bannon跨党派合流,监管压力正在联邦-州两级同时收紧。

历史镜鉴

  • 1970年《职业安全与健康法》与机器急停按钮:工业安全史的核心教训是——「紧急停止」从可选项变成法定标配,从来不是因为行业共识,而是因为重大事故或迫近的事故预期。加州此次是在无重大AI事故的情况下预防性立法,难度更高,先例更接近核电站安全壳制度(事故前设计的事故容器)
  • 加州汽车排放标准(1960年代至今):加州凭借单一市场体量多次把州标准变成事实上的全国乃至全球标准——「加州效应」是所有前沿实验室此刻必须认真对待这纸行政令的原因

Claude攻破OpenAI:72小时、两个漏洞与6500美元说明了什么?

发生了什么?

据CBS News、卫报、TechCrunch与Quartz报道:

  • 事件:旧金山AI网络安全公司Hacktron AI的三人团队在参与OpenAI漏洞赏金计划期间,利用Anthropic的Claude辅助串联两个漏洞,在不到72小时内接管了OpenAI员工的ChatGPT账户,并进入OpenAI的私有GitHub内部代码环境
  • 合规性:团队按赏金计划规则负责任披露、未进一步利用,获OpenAI 6,500美元赏金;研究者称「我们理论上能访问的范围是巨大的」(卫报引述)
  • 警示:Hacktron政策总监、前Meta员工Riki Parikh对ABC表示:「如果我们现在都无法控制这些模型,未来模型就更不可能被控制」——团队公开此事件的目的正是论证AI攻防能力的不对称

为什么这很重要?

1. 攻防成本的不对称首次有了具体报价。 72小时、三人、一个商用模型、6500美元——这组数字将「AI降低网络攻击门槛」从口号变成了可以写进董事会风险清单的参数。对防守方(每一家使用AI且持有代码资产的公司)而言,这意味着威胁模型的基线必须重设。

2. 「模型攻击缔造模型的机构」的象征意义极强。 被攻破的不是任意目标,而是全球估值最高的AI公司;工具不是任意工具,而是竞争对手的模型。这为「AI能力外溢不可控」提供了迄今最具传播力的案例——几乎必然会被引用于加州工作组与国会接下来的每一场听证。

3. 赏金定价暴露了激励机制错位。 触及前沿实验室内部代码库的漏洞链只值6500美元——低于一次普通渗透测试的报价。若白帽回报持续低于黑帽市场,「负责任披露」的经济学基础将被动摇,这是比漏洞本身更值得政策关注的问题。

历史镜鉴

  • 2014年Heartbleed与OpenSSL困局:互联网最关键基础设施的安全漏洞由志愿者以极低报酬维护——十年后同样的激励错位在AI实验室重演,只是标的从加密库换成了模型代码库
  • 2010年Stuxnet:国家级攻击工具与普通漏洞利用之间的门槛,历来由资源决定;AI正在把这个门槛从「国家级资源」降到「三人团队+API订阅」——这是本事件与历史上所有「天才黑客」故事的本质区别

今日要闻速览

  • 华为加速自研AI芯片路线图:在HUAWEI CONNECT 2026(上海)上,华为将下一代Ascend 960DT提前至2027年初发布,披露Ascend 960PR的FP4性能翻倍超预期,并展示面向「百万处理器级AI系统」的路线图(Tom’s Hardware、TechRepublic)——在出口管制持续下,中国算力自主的时间表在整体前移
  • Google Antigravity定价公开:免费层0美元,付费额度并入19.99-199.99美元/月的Google AI订阅(CloudZero,单一来源待官方确认)——智能体编程工具的订阅捆绑竞争白热化
  • 月之暗面Kimi接入花旗与标普金融数据源:Moonshot AI宣布Kimi大模型获得Citi、S&P Global Market Intelligence等金融数据供应商授权(台湾经济日报报道)——中国大模型在金融垂直领域的to B竞赛升温
  • AI加速网络攻击节奏成媒体焦点:WBUR专访网络安全专家讨论AI如何缩短攻击周期——与今日Hacktron事件互为印证,攻防不对称正在进入大众议程

行业观察:今日数据带来的新视角——「从辩论到仪表盘」

只看今天的新增信息,一个此前不存在的行业基础设施正在成形:度量体系开始取代立场宣言,成为AI治理的操作层。 Anthropic的26%/90%是一块仪表盘,Newsom工作组的60天报告将是另一块,Hacktron的72小时/6500美元是攻击侧的第三块。过去两周的定速辩论之所以僵持,是因为各方都在用不可验证的形容词争论;而今天三条新闻共同的特点是——每一方都被迫交出了可以复核的数字。对从业者的直接启示:未来12个月,「可公开核验的度量」将取代「安全承诺」成为实验室、监管者与企业客户之间新的通行语言——无论你是模型开发商、评估机构还是采购方,现在就应开始设计自己的指标披露框架,因为Anthropic已经把「不披露」变成了需要解释的默认状态。

关键要点

  • Anthropic披露Claude主导26%的自身模型研发(2月为零)、90%研发为协作完成、约3万智能体在岗:递归自我改进首次获得可量化、可对比的公司级指标,Anthropic呼吁全行业定期公开同类数据
  • Newsom签发行政令:60天内专家组须提交加州AI安全强化方案,含前沿模型「杀死开关」评估:加州在联邦立法僵局下重启监管引擎,其州法因实验室聚集效应将成为事实上的美国标准
  • Hacktron AI用Claude在72小时内攻入OpenAI内部GitHub环境,负责任披露获6500美元赏金:AI辅助攻击的成本曲线首次有了具体数据点,白帽激励机制错位问题浮出水面
  • 华为将Ascend 960DT提前至2027年初:中国算力自主时间表整体前移,与美加巨资扩建数据中心形成同一枚硬币的两面
  • 治理范式切换信号:从立场辩论转向可核验度量——「公开指标+社会决策」正在成为定速与提速之外的第三条路径

常见问题

什么是递归自我改进?为什么Anthropic的26%很重要?

递归自我改进指AI系统自主建造更强继任者的能力。26%的重要性在于它把这一概念首次量化:模型已在人类监督下主导四分之一的自身研发(2月为零),且约90%研发有人机协作参与——递归自我改进从「会不会发生」变成了「进行到哪一步」的可测量问题。

Newsom的「杀死开关」行政令会立刻生效吗?

不会。行政令本身不是法律,它启动的是一个60天流程:专家组需在两个月内提交如何强化加州AI安全立法的建议(包括紧急关停机制的可行性),最终仍需立法或行政规则落地——但它为加州在年内出台实质性新规设定了明确时钟。

用Claude攻破OpenAI意味着AI模型不安全吗?

更准确的解读是:AI显著降低了复杂攻击的门槛与周期(三人团队、72小时、串联两个漏洞),但此次是赏金计划内的合规白帽测试,漏洞已修复。真正的问题在于激励——触及内部代码库的漏洞链仅获6500美元赏金,白帽回报远低于黑帽市场。

Anthropic披露这些数据会不会只是公关行为?

有此可能,但即便如此其结构效应是真实的:它把「不披露递归自我改进指标」变成了同行需要解释的默认状态。判断诚意的关键观察点是六个月后26%这一数字是否持续更新、以及其他实验室(OpenAI、Google、Meta)是否跟进公开可比指标。

接下来最值得关注的节点是什么?

三个:一,11月中旬前后加州专家组的60天报告及其立法转化;二,其他前沿实验室是否响应Anthropic的指标披露倡议;三,各国监管机构(加州工作组、参议院、欧盟)是否开始把「可核验度量」写入正式规则。

参考资料