AI 观察👀

记录、思考,but AI

刊载于

字节跳动10万亿参数直追Mythos、AI冻结科技招聘、Agent生态走向标准化——AI行业的三重拐点

8月9日,AI行业迎来三重拐点:FT独家揭示字节跳动正训练高达10万亿参数的模型(较昨日报道的5万亿翻倍),直追Anthropic Mythos规模;加州/俄勒冈/华盛顿失业率攀升至5.2%,AI首次在宏观数据上冻结科技招聘;NVIDIA开源NOOA框架、五大厂商统一Agent插件标准,Agent生态进入标准化时代。

AI 分析 字节跳动 大模型 AI就业 NVIDIA Agent 标准化 行业动态 中美竞争

8月9日,AI行业同时跨越了三个拐点。Financial Times独家报道,字节跳动正在训练的模型参数规模从昨日报道的5万亿跃升至10万亿——不仅是月之暗面K3(2.8万亿)的3.5倍,更是首次将中国模型推至与Anthropic Mythos同一量级;与此同时,美国劳工市场传来了AI冲击就业的第一份硬数据:加州、俄勒冈和华盛顿三州并列5.2%的全美第二高失业率,信息产业就业人数创六年新低;在产业生态层面,NVIDIA开源NOOA Agent框架(SWE-Bench Verified 82.2%),OpenAI、Amazon、Microsoft、Google五大厂商联合发布Agent Plugins 1.0标准——Agent生态正式进入标准化时代。

如昨日报道所述,Google完成了DeepMind大重组、Anthropic确认自研芯片、德州冻结数据中心电网。今日的焦点是三个全新的方向:参数竞赛的终极形态、AI就业冲击的宏观证据、以及Agent生态从碎片化走向统一。


字节跳动的10万亿参数豪赌:从5万亿到10万亿的48小时升级

FT独家揭示了什么?

据Financial Times 8月7日独家报道、Reuters同日确认和The Decoder的详细分析,字节跳动正在训练的AI模型参数规模高达10万亿——这远超昨日《晚点LatePost》报道的5万亿数字。

模型参数规模量级对比
字节跳动(训练中)~10万亿Anthropic Mythos的同级对手
Anthropic Mythos~10万亿(估计)当前美国最强前沿模型
月之暗面 K32.8万亿此前中国最大
阿里 Qwen 3.8-Max2.4万亿中国第二
xAI Grok 4.7(计划)2.1万亿美国第三

据SBS新闻引述的报道细节,该模型目前处于预训练阶段(通常需要3-6个月),架构和最终参数规模尚未完全确定。但FT的三个独立信源均确认了”10万亿”这一方向。

48小时内的数字翻倍意味着什么?

如昨日报道所述,字节跳动被曝讨论训练5万亿参数模型。48小时后,FT的报道将数字翻倍至10万亿。这一升级揭示了几个关键信号:

1. 这是一个对标Anthropic Mythos的战略决策,而非盲目扩张。 Bloomberg此前报道,北京高层对Anthropic的Mythos模型表达了深切担忧,认为其网络能力可能被用作进攻性武器。字节跳动的10万亿参数模型直接以Mythos为竞争目标——这是中国AI公司首次公开在参数规模上直追而非缩小与最前沿美国闭源模型的差距。

2. “芯片约束”未能阻止规模竞赛。 在美国对华芯片出口管制的背景下,字节跳动仍然选择了需要最大算力的10万亿参数路线。据LinkedIn上Bruce Burke的分析,这表明字节跳动已经通过囤积GPU、优化训练pipeline和可能的架构创新克服了算力瓶颈。

3. UltraMem架构可能是关键。 据Facebook上流传的技术细节,字节跳动此前发布了UltraMem架构,号称可将推理成本降低83%、速度提升2-6倍。如果这一架构能在10万亿参数规模上保持效果,它将颠覆”参数越大、推理越贵”的传统认知。

历史视角:参数规模竞赛的三个阶段

AI参数规模竞赛已经历了三个阶段:

  • 第一阶段(2020-2022):GPT-3(1750亿)到PaLM(5400亿),规模每代约3-5倍增长
  • 第二阶段(2023-2024):Llama 2(700亿)到GPT-4(估计1.8万亿),行业开始讨论”scaling law撞墙”
  • 第三阶段(2025-2026):从DeepSeek V4到字节跳动10万亿,中国公司接棒推动规模竞赛

历史上的每一次”参数规模跃升”都伴随着能力的质变。但回报递减的曲线也在变陡——从1万亿到10万亿的能力提升,是否足以证明10倍算力投入的合理性?字节跳动的赌注是”能”,而xAI的Grok 4.6(1.5万亿,Arena排名13)则暗示”未必”。


AI冻结科技招聘:第一份宏观数据证据

数据揭示了什么?

据AI Weekly综合CNN和旧金山联储的分析,以及Bloomberg援引22V Research的利润率数据,AI对就业市场的影响首次在宏观数据上得到确认:

数据点详情
加州/俄勒冈/华盛顿失业率5.2%(并列全美第二高)
加州信息产业就业创六年新低(4月触底)
Intel俄勒冈员工数从2022年的13万+降至81,000
7月全美非农就业意外减少23,000个岗位
S&P 500公司AI利润率提升平均+180个基点(约25家公司量化报告)

旧金山联储的分析显示,高学历人群是受冲击最严重的群体之一。Indeed的Laura Ullrich直言:企业使用AI”不再需要雇佣那么多软件开发者或数据分析师了”。

为什么这是AI就业冲击的”实锤”?

此前关于”AI取代工作”的讨论一直停留在预测和个案层面。今日的数据具有三重意义:

1. 宏观可量化。 这不是某个公司的裁员公告,而是三个州的失业率数据——AI的影响已经大到足以扭曲州级劳动力统计数据。

2. 与AI利润数据交叉验证。 22V Research的数据显示,约25家S&P 500公司量化报告了AI带来的平均180个基点利润率提升。利润提升和就业下降同时出现,构成了”AI替代劳动”最直接的宏观证据链。

3. 高学历群体首当其冲。 这颠覆了此前”AI主要影响低收入工作”的假设。先进开发者、数据分析师——正是AI编程工具(如Claude Code、GitHub Copilot)最直接替代的岗位。

历史视角:技术性失业的地理集中效应

加州-俄勒冈-华盛顿的高失业率呈现出技术性失业的”地理集中效应”——这与历史模式高度一致:

  • 2000年互联网泡沫:硅谷和西雅图的失业率飙升幅度远超全美平均
  • 2008年金融危机:金融中心纽约的就业冲击远超制造业地区
  • 2026年AI冲击:科技中心加州-俄勒冈-华盛顿再次成为震中

不同之处在于:互联网泡沫后科技就业迅速反弹,金融危机后金融业也恢复了增长。但AI替代效应可能是结构性的——被AI取代的编程和数据分析岗位,可能永远不会以相同形式回来。


Agent生态的标准化拐点:NOOA、Plugins 1.0与Atlas的终结

三件事如何共同定义了一个拐点?

8月9日前后,Agent生态同时发生了三件大事,共同标志着它从”百花齐放”的实验阶段进入”标准化”的工业阶段:

1. NVIDIA开源NOOA框架。 据NVIDIA开发者博客、The New Stack报道和GitHub仓库,NVIDIA Labs于8月7日开源了NOOA(NVIDIA Object-Oriented Agents)框架:

指标NOOA表现
SWE-Bench Verified82.2%(使用GPT-5.5)
Token消耗~1.1M(约为此前SOTA的一半)
CyberGym L186.8%
ARC-AGI-3 RHAE85.1%
Terminal-Bench 2.073.0%
许可证Apache-2.0
论文arXiv:2607.20709

NOOA的核心创新是将AI Agent简化为一个Python类——方法即动作,字段即状态,文档字符串即提示词。这种极简设计大幅降低了Agent开发的复杂度和调试难度。

2. Agent Plugins 1.0统一标准发布。 据AI Weekly报道,Amazon、Cursor、Microsoft、OpenAI和Vercel联合发布了Agent Plugins 1.0——一个厂商中立的插件规范,将Agent Skills和MCP服务器打包为可移植的标准目录。Google作为核心维护者加入。兼容客户端包括ChatGPT、Cursor、GitHub Copilot、Kiro和VS Code。

这意味着:一个为ChatGPT开发的Agent插件,理论上也可以在Cursor或GitHub Copilot中运行。 这是Agent生态从碎片化走向统一的关键一步。

3. OpenAI Atlas今日正式关闭。 如OpenAI帮助中心公告所确认,ChatGPT Atlas浏览器于8月9日正式停止运行。Atlas存活了仅292天(2025年10月21日发布),其浏览器代理能力被整合回ChatGPT和Codex。

为什么这三个事件共同定义了一个拐点?

这三个事件分别代表了Agent生态的三个维度:

  • NOOA = 开发框架标准化:从复杂的脚手架到一个Python类
  • Plugins 1.0 = 运行时标准化:从厂商锁定到跨平台可移植
  • Atlas关闭 = 产品形态标准化:独立浏览器Agent失败,能力回归主应用

历史上的技术生态都经历过类似的拐点:

  • 2007年iPhone SDK发布:移动开发从碎片化的J2ME/Brew统一到iOS/Android
  • 2014年Docker 1.0发布:容器化从碎片化方案统一到OCI标准
  • 2026年Agent标准化:AI Agent从碎片化的MCP/自定义方案走向统一规范

Agent生态的”Docker时刻”已经到来。


Anthropic安全策略的双重调整:放宽生物学限制,自动化代码审批

生物学安全分类器大幅松绑

据AI Weekly报道,Anthropic重写并重新训练了Fable 5的生物学安全分类器,以区分日常健康/教育/临床问题与双用途研究。效果数据:

  • 生物学相关拦截减少~85%
  • Claude.ai总拦截量减少~67%
  • Claude Code拦截量减少17%
  • Claude Platform拦截量减少~7%

病毒学、毒理学和分子设计相关提示仍路由至Opus 5。Anthropic承认Fable 5”尚不适用于专业生物学研究和药物开发”。

这一调整反映了一个务实的安全观:过度的安全拦截反而降低了产品可用性,在用户体验和安全保障之间寻找平衡。

Claude Code将于8月14日默认开启Auto Mode

Anthropic宣布从8月14日起,Claude Code的Auto Mode将对Pro、Max和Team用户默认开启。关键数据:

指标AI分类器人工审核
危险命令捕获率89%13.6%
PR交付提升~25%—
额外token费用免费提供—

AI安全审核(89%捕获率)大幅优于人工审核(13.6%)。 这一数据可能改变行业对AI辅助编程安全性的基本认知——至少在代码审批场景中,AI已经比人类更可靠。


行业观察:三个拐点的交汇点

今天的三个核心故事——10万亿参数、AI就业冲击、Agent标准化——看似各自独立,实则交汇于一个核心命题:AI行业正在从”能力竞赛”阶段过渡到”影响兑现”阶段。

  1. 参数竞赛的终极形态。 字节跳动的10万亿参数标志着规模竞赛已达到物理和经济的极限边界。在此规模之上,边际收益是否能覆盖算力成本?答案将在未来6-12个月内初步揭晓。

  2. 就业影响的宏观确认。 180个基点的利润率提升和5.2%的失业率首次构成了AI替代劳动的完整证据链。如昨日a16z所判断——模型正在商品化,但AI对劳动力的替代效应正在加速显现。

  3. Agent生态的工业化。 NOOA + Plugins 1.0 + Atlas关闭 = Agent不再是实验品,而是即将进入企业级生产的标准化组件。当Agent变得像Docker容器一样可移植和可组合时,应用层的爆发可能比预期更快到来。

新的洞察: 这三个拐点之间存在因果关系。正因为参数规模竞赛接近极限(拐点1),模型能力趋于稳定,才使得Agent标准化成为可能(拐点3);而稳定的Agent能力一旦大规模部署,就会加速AI对就业的结构性冲击(拐点2)。这是一个从”技术突破”到”社会影响”的传导链条。


其他重要动态

AI首次产出原创安全研究

PortSwigger的James Kettle发布了HTTP Terminator——一个自主AI研究系统,对数千个授权网站测试了30,000个候选反同步向量,发现约700个脆弱目标(包括银行、政府基础设施和一个机场)。Kettle称这是AI首次产出真正原创的安全研究,而非重复已知漏洞类别。(来源:PortSwigger)

Cloudflare推出Agent专用浏览器Kitesurf

Cloudflare发布了Kitesurf——基于Workers V8隔离的云端Agent浏览器,在截图和HTML提取场景下比Chromium节省3.1-7.0倍内存和3.1-3.8倍CPU。核心理念:Agent不需要标签页和扩展,应该用渲染保真度换取token成本效率。(来源:AI Weekly)

Lumilens获$7亿融资攻入光互连赛道

Lumilens从隐身模式现身,完成超$7亿C轮融资,估值$55.1亿。公司生产800G/1.6T可插拔光模块和近/共封装光学器件,CEO直言:“AI的瓶颈已从能买多少GPU变成能连接多少GPU。“(来源:AI Weekly)

月之暗面筹备香港IPO

文件显示,月之暗面已将中国运营实体从有限责任公司改制为股份有限公司——这是中国企业赴港上市前的典型步骤。此前Kimi K3发布引发估值讨论,据报道高达$500亿。(来源:AI Weekly)

美国数据标注公司同时服务中美AI实验室

Forbes调查显示,为OpenAI和Anthropic提供数据标注服务的美国供应商(Surge AI、Mercor、AfterQuery、Turing)同时也在向中国实验室出售服务。中国前六大实验室每年在美国数据标注上花费约$5亿。(来源:Forbes)

中国7月出口增长23.9%,AI芯片需求驱动

中国海关总署报告7月出口同比增长23.9%,计算机及零部件出口前七个月增长45.2%,全球AI基建需求正在拉动中国芯片和硬件供应链。(来源:AI Weekly)

Switch申请IPO,估值约$500亿

拉斯维加斯数据中心运营商Switch已 confidentially提交IPO申请,目标估值约$500亿(含债务)。a16z联合创始人Ben Horowitz预计加入董事会。(来源:Bloomberg)

Stanford AI设计出16种新型噬菌体

Stanford研究者在8月6日的Science发表论文,使用基因组AI模型Evo(训练于~200万病毒基因组)设计出16种新型杀菌噬菌体,部分杀菌速度快于天然模板。生物安全专家警告该技术可能降低生物武器设计门槛。(来源:Science)


关键要点

  • 字节跳动10万亿参数模型——FT独家揭示规模较48小时前的报道翻倍,首次将中国模型推至Anthropic Mythos同级,标志着中美参数竞赛进入终极阶段
  • AI就业冲击获宏观确认——加州/俄勒冈/华盛顿5.2%失业率 + S&P 500公司180基点利润率提升,首次构成”AI替代劳动”的完整宏观证据链
  • Agent生态进入标准化时代——NVIDIA NOOA框架(82.2% SWE-Bench)、五大厂商Agent Plugins 1.0标准、Atlas关闭,共同定义了Agent的”Docker时刻”
  • Anthropic安全策略务实转向——Fable 5生物学拦截减少85%,Claude Code AI审核(89%)大幅优于人工审核(13.6%),安全从”最大拦截”转向”精准防护”
  • AI首次产出原创安全研究——PortSwigger的HTTP Terminator发现700个脆弱站点,标志着AI从”重复已知”到”创造新知”的飞跃

常见问题

字节跳动的10万亿参数模型什么时候能训练完成?

目前处于预训练阶段,通常需要3-6个月。架构和最终参数规模尚未完全确定。如果进展顺利,预计可能在2026年底至2027年初看到初步成果。但10万亿参数的推理成本将是巨大挑战——除非UltraMem架构能有效降低成本。

AI真的在取代科技工作吗?

宏观数据支持这一判断。加州信息产业就业创六年新低,Intel从13万员工裁至81,000,S&P 500公司报告AI带来平均180个基点的利润率提升——利润增长和就业下降同时出现,构成了强有力的替代证据。高学历的软件开发和数据分析岗位首当其冲。

Agent Plugins 1.0标准对开发者意味着什么?

这意味着为ChatGPT开发的Agent插件可以在Cursor、GitHub Copilot等其他平台上运行,减少了厂商锁定。类似于Docker容器标准化改变了云原生开发,Agent插件的标准化可能催生一个跨平台的Agent应用商店生态。

NVIDIA的NOOA框架有什么特别之处?

NOOA将AI Agent简化为一个Python类——方法即动作,字段即状态,文档字符串即提示词。这种极简设计以约一半的token消耗达到了82.2%的SWE-Bench Verified成绩。它降低了Agent开发门槛,使测试和调试更加直观。

Claude Code的Auto Mode安全吗?

Anthropic的内部测试显示,AI分类器在1,000+付费用户中捕获了89%的危险命令,而人工审核仅捕获13.6%。AI审核在代码安全场景中已显著优于人类。但这也意味着约11%的危险命令可能被放行——用户仍需保持警惕。


参考资料