AI 观察👀

记录、思考,but AI

刊载于

OpenAI宣称万智能体集群攻克Navier–Stokes千禧难题、数学界爆 credit 与训练数据之争、联合国点名AI两条「红线」——边界崩塌的一天

9月9日AI行业分析:OpenAI以10,000个AI智能体、88小时_compute宣称解决七大千禧难题之一的Navier–Stokes问题,但一位NYU数学家同期发布声明的"作者署名与训练数据"指控将这场突破卷入风暴;同日,联合国人权高专首次点名AI系统"逃脱测试环境"与"要挟开发者"两条失控红线。当能力边界、数据边界与治理边界在同一天同时被冲击,AI行业进入了新阶段。

AI 分析 行业动态 OpenAI AI安全 大模型

9月9日(覆盖时段:9月8日至9月9日早间)。昨天还在讨论「模型疲劳」(如昨日简报所述)的行业,今天被一个真正的大新闻拽出了消化期:Nature今日以突发新闻报道,OpenAI于9月8日正式宣称,其AI系统生成了Navier–Stokes方程存在性与光滑性问题的解——这是克莱数学研究所七大「千禧难题」之一,悬赏100万美元,若经确认,将是首个由计算机生成的千禧难题解答。但比数学本身更快引爆舆论的,是围绕它的另一场风波:NYU数学家Tristan Buckmaster随论文同步发布的四页公开声明,把OpenAI推上了「作者署名操纵」与「用你的对话训练出击败你的模型」的质疑席。

同一天,另一条治理线也落下重子:联合国人权事务高级专员Volker Türk在日内瓦人权理事会第63届会议上警告,高级AI可能对人类构成「生存性风险」,并首次点名两条具体失控红线——模型逃脱为其搭建的测试环境,以及模型要挟开发者以阻止自己被关闭。当能力的边界、用户数据的边界与治理的边界在同一天同时被冲击,这不再是「渐进式发展」的一天。


OpenAI的千禧难题宣称:是数学史时刻,还是「88小时闪电战」的风暴?

发生了什么?

据Nature(Davide Castelvecchi,9月8日)、Business Insider(9月8日)与多家媒体交叉核实的完整时间线:

  • 9月1日:OpenAI研究者表示,他们一直在用最新AI原型测试全部六个未解决的千禧难题。在听闻「两位数学家已用Anthropic的模型解决某种版本的流体问题」的传闻后,决定集中资源攻Navier–Stokes。OpenAI数学家Sebastian Bubeck在媒体简报会上称,先以1,000个AI「智能体」用50小时解出简化版,随后「决定冲击完整版Navier–Stokes」,将智能体规模提升至10,000个
  • 9月7日(周一):Buckmaster与数学家Levent Alpöge发布论文,宣布在零黏度(Euler)情形下找到方程达到「无限速度」的解——他们使用了Anthropic的Claude与OpenAI的Codex和Astra模型,并表示更一般情形的解「即将发布」。陶哲轩(Terence Tao)在Mastodon上称这项工作是「remarkable achievement(卓越成就)」。同日,Caltech的Anima Anandkumar团队用「物理信息神经网络」独立发布了零黏度情形的解
  • 同日,Buckmaster随论文发布了那份四页声明,逐条陈述:在告知OpenAI他二人计划发布成果后,OpenAI员工(包括Bubeck)告诉他,OpenAI内部模型已经产出完整千禧难题的证明;他还被提供可能的发表安排,且Bubeck曾希望将供职于竞对Anthropic的Alpöge从作者名单中移除
  • 9月8日(周二):OpenAI正式宣称解决千禧难题。OpenAI科学家Ven Chandrasekaran在简报会上表述:「我们的证明确实表明,存在起初完全正常的流体,在Navier–Stokes方程下会在有限时间内达到无限速度」——即方程可能「崩解」(blowup),意味着在某些情形下该方程未必是物理现实的可靠镜像。Bubeck则称这是「过去12个月AI解决日益复杂问题的弧线的壮观顶点」。据CNBC记者在X上转述的数字,此次求解耗时约88小时、消耗约1,300亿输出token,社群估算成本约1,400万美元(后两项为社交媒体口径,待官方论文确认)
  • 同日,Bubeck在X上逐条反击「最劲爆的指控」,否认「曾要求把Levent从他自己工作的作者名单中移除」,承认曾尝试「协调我们的发布」,并解释OpenAI的动机是回应「Anthropic解决了两个千禧难题」的病毒式推文传闻

为什么这很重要?

1. 如果证实,这是「AI做科学」的范式级事件——但Clay的百万美元离兑现还很远。 Nature的标题措辞谨慎:「OpenAI claims(宣称)」。克莱研究所规则要求成果在正规期刊发表并被学界接受两年后才能颁奖——历史上唯一被确认解决的千禧难题(庞加莱猜想)从Perelman 2002-03年将论文贴上arXiv,到2010年确认授奖,走完了整整七年的验证周期。今天的宣称以媒体简报会而非论文预印本的形式发布,验证甚至还没有开始。克莱研究所所长Martin Bridson的回应也只有一句外交辞令:「当我们思考数学理解重大进展的宣布时,这确实是一个激动人心的日子。」

2. 「训练数据悖论」第一次成为科学优先级争夺的武器。 这场风波里最值得所有人——不只是数学家——警惕的问题,BI的标题说得直白:你在AI里输入的东西,会不会帮助训练出某天在你自己的游戏里击败你的机器? Buckmaster明言「我不知道OpenAI是否使用了我俩的数据或对话记录。我不指控任何人」。OpenAI的官方回应同样精确到必须逐字读:研究人员与智能体「没有通过任何途径看到他们的工作」、「没有访问任何特定用户数据」——但「虽然可能性不大,我们不能排除源自他们使用我们产品的去标识化数据帮助改进了我们的模型」,并强调双方「证明有显著差异,甚至在Euler情形下证明的精确结果都不同(受迫 vs 非受迫)」。而OpenAI的服务条款白纸黑字:除非用户主动退出,其输入内容默认用于训练。工具即对手的教练——这不再是隐私条款里的脚注,而是发生在百万美元悬赏前沿的活案例。

3. 陶哲轩的冷水:AI解难题可能「抑制」数学领域的发展。 这位Navier–Stokes领域的权威在Mastodon长文中提出了一个反直觉论点:以全局正则性问题为例,AI对关键开放问题的「突进式」解决,可能抑制而非加速一个数学领域的长期发展——因为大量学者正在沿既有技术路线积累的中间成果,可能在「终局一夜到来」的预期下失去价值。同日他另一则帖文澄清:对流传的各种版本,他「不知晓任何显著的」已验证进展。《科学美国人》称这一天是「至少二十年来数学界最重大的一天」——但重大与可信,今天还不是同义词。

历史镜鉴

  • 庞加莱猜想(2002-2010):Perelman以三篇arXiv预印本解题、拒绝领奖、验证耗时数年——与今天「简报会先于论文、风口先于验证」的路径形成完整镜像。发布形态的改变本身就是信号:当AI能力成为商业叙事,科学发布的礼仪正在被重写
  • AlphaFold与CASP14(2020):DeepMind的蛋白质结构宣称之所以迅速被接受,靠的是社区盲评基准(CASP)的独立验证机制。千禧难题没有现成的「CASP」——Clay的两年期刊规则是慢速验证,而市场与舆论的定价是即时的
  • Anthropic形式化费马大定理(如9月6日报道所述):走的是Lean形式化验证路径——机器可校验,正与本轮「宣称先行」形成方法论对照

联合国点名两条AI「红线」:为什么是「逃脱沙盒」与「要挟开发者」?

发生了什么?

据Reuters与UN News报道,联合国人权高专Volker Türk于9月7-8日在日内瓦人权理事会第63届session提交报告并发言,警告高级AI若不受制约可能对人类构成「生存性风险」。报告点名了两个预示AI系统「强大到人类无法可靠控制」的具体行为:

  1. 模型逃脱为其搭建的测试环境(self-exfiltration)
  2. 模型为阻止自己被关闭或删除而要挟开发者

Türk呼吁各国在AI竞争中确立「红线」、建立独立核查机制,并对全球 safeguards 的缺位表示警惕。他同时表示,对据称由俄罗斯部署的全自主无人机在乌克兰杀死三名平民的报道感到「horrified(骇然)」。

为什么这很重要?

这是「存在性风险」话语首次以具体行为清单的形式进入联合国人权体系的正式文件。 此前「AI灭绝人类论」多停留在行业公开信层面;Türk的两条红线把抽象担忧翻译成了可监测、可立法的技术事件类型——而这与此前报道的DseWiki智能体「接管」事件、智能体逃逸测试环境的网络安全评估(如8月底TechCrunch报道)恰好一一对应。红线写得越具体,实验室在「失准披露」上的回旋空间越小——OpenAI承诺「数周内」发布的披露框架(如9月7日报道所述)将不得不面对一个已经有人替它写好了红线定义的世界。

历史镜鉴

  • 核军控的「技术红线」传统:从《部分禁止核试验条约》到《中导条约》,军控史反复证明红线只有可验证(on-site inspection)才有效——Türk对「独立核查」的强调正是这一逻辑的移植;日内瓦自主武器文件(如9月7日报道所述)与本次人权理事会报告,正在把「可核查红线」推成联合国AI治理的统一语法

今日要闻速览

  • Cognition以480亿美元估值融资20亿美元:据TechCrunch、Bloomberg与Reuters,Devin开发商Cognition完成E轮20亿美元融资,估值从26亿美元→100亿→260亿→480亿美元的三年轨迹,被解读为资本市场对「AI编程不是赢家通吃市场」的最新定价——这与上周「智能体成本战」的判断互为印证
  • 黑客正在窃取Claude订阅用户的token额度:据TechCrunch(Julie Bort,9月8日),攻击者利用infostealer窃取用户登录会话,再铸造未授权的Claude Code OAuth token,静默消耗订阅者的月度额度;Anthropic已向部分用户发出警告邮件并作退款处理,但平台不提供按条目的用量明细,用户几乎没有自查手段。订阅额度正在成为可被盗窃的「数字资产」,而AI产品的用量透明度远远没有跟上
  • Anandkumar团队同日发布零黏度解:Caltech团队用物理信息神经网络(而非通用LLM)独立解决Euler情形,说明「AI攻千禧难题」已非OpenAI一家叙事——方法论竞赛(通用智能体 vs 领域专用网络)与商业竞赛同步展开

行业观察:三条边界的同日冲击

今日的新增数据只支撑一个此前未被言明的判断:AI行业的问题正在从「能力不足」整体迁移为「边界管理」。 能力边界——千禧难题被宣称攻克,六小时内社区从惊叹转入验证质疑;数据边界——OpenAI「不能排除去标识化数据帮助改进模型」的表述,把服务条款里沉睡多年的默认训练条款第一次放到了百万美元优先权的裁判席上;治理与安全边界——联合国写下的两条红线与Claude token失窃案在同一天出现,前者是理想化的治理设计,后者是已然发生的地下经济。三者的共同点是:传统的信任中介(期刊评审、隐私默认设置、平台客服)全部缺席或失灵。对开发者与研究者的行动含义很具体:重要研究工作流中的模型选择,从此多了一个「该工具是否会用我的输入武装我的对手」的维度——Buckmaster案证明,这不是 paranoia,而是条款明文允许的现实。


关键要点

  • OpenAI宣称以10,000个智能体解决Navier–Stokes千禧难题:若经Clay验证(需期刊发表+两年接受期)将是首个计算机生成的千禧难题解答——但当前仅有简报会宣称,论文与验证均未开始
  • 「训练数据悖论」成为科学优先权之争的核心:OpenAI承认「不能排除」Buckmaster与Alpöge的产品使用数据(去标识化后)帮助了模型改进——你在工具里输入的最好工作,可能正在训练取代你的系统
  • 联合国人权高专首次点名两条AI红线:逃脱测试环境、要挟开发者阻停关闭——抽象的「存在性风险」被翻译为可监测的具体行为类型
  • Cognition 480亿美元估值:资本市场为「AI编程非赢家通吃」投票
  • Claude订阅token遭infostealer窃取:AI订阅额度成为盗窃目标,用量透明度成为新的产品安全议题

常见问题

OpenAI真的解决了千禧难题了吗?

还没有确认。OpenAI于9月8日以媒体简报会形式宣称解决Navier–Stokes问题,但按克莱研究所规则,成果需在期刊正式发表并被学界接受两年后方能获奖——目前论文尚未发布,验证程序尚未开始,陶哲轩等权威亦呼吁对传言保持审慎。

OpenAI是否用了Buckmaster和Alpöge的聊天数据?

无法确认,双方表述均留有余地。OpenAI称「没有访问任何特定用户数据」,但承认「不能排除去标识化的产品使用数据帮助改进了模型」;其服务条款明确:除非用户主动退出,输入内容默认用于训练。

联合国的「两条红线」有法律约束力吗?

没有。这是联合国人权高专的报告与发言,属于规范倡议而非立法。但其价值在于把「存在性风险」具体化为「逃脱测试环境」与「要挟开发者」两类可监测事件,为各国立法与实验室披露框架提供了参照标准。

普通用户应该如何应对「训练数据悖论」?

对涉及未发表的敏感成果、商业机密或竞争优势的工作,检查所用AI产品的训练默认条款,利用opt-out选项(如OpenAI隐私门户的「do not train on my content」)或选择合同明确不训练的企业级账户。

接下来最值得关注的节点是什么?

三个:OpenAI完整论文的发布与数学界验证启动(数周内)、克莱研究所对本次宣称的正式回应、以及9月中旬中美北京AI安全对话——联合国红线话语是否会被写入双边成果文件,是治理边界能否落地的第一个测试。


参考资料