DeepSeek V4 Flash以$0.28击穿AI价格底价——华为芯片变量浮现,内存芯片危机吞噬全球70%产能
8月3日,DeepSeek V4 Flash以$0.14/$0.28的每百万token定价将前沿AI模型价格推至新低,其背后是华为Ascend 950芯片的战略性整合。同日CSIS发布内存芯片危机分析:50-70%全球DRAM产能被AI数据中心吞噬,短缺或将持续至2029年。Grok 4.6瞄准8月7日发布(1.5T参数),Ling-3.0-flash免费124B MoE模型上线。AI基础设施的供需撕裂正在加速。
8月3日,AI行业进入了一个新的阶段——不再是”谁的模型更强”,而是”谁的成本结构更不可逆”。DeepSeek的V4 Flash模型以每百万输出token仅$0.28的定价,将前沿级AI能力的价格底线推到了前所未有的低点。 这不是一次常规的降价促销——它的背后是一套系统性的成本重构:284B参数MoE架构(仅13B激活参数)、100万token上下文窗口,以及与华为Ascend 950芯片的深度整合。
如昨日报道所述,OpenAI Astra在数学研究领域取得了历史性突破,而欧盟AI法案已于8月2日正式获得执行权力。但今日的核心焦点转向了一个更具商业穿透力的问题:当AI模型的价格持续崩塌、底层硬件供应却日益紧缺,行业的供需结构正在经历怎样的撕裂?
DeepSeek V4 Flash:$0.28意味着什么?
定价冲击的具体数据
据Startup Fortune 8月2日的详细分析,DeepSeek V4 Flash的官方API定价如下:
| 模型 | 输入价格(/百万token) | 输出价格(/百万token) | 对比V4 Flash倍数 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14(缓存未命中)/ $0.0028(命中) | $0.28 | 基准 |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | 输出贵4.3倍 |
| OpenAI标准定价页 | ~$1.00 | ~$6.00 | 输出贵21倍 |
| Anthropic Haiku 4.5 | $1.00 | $5.00 | 输出贵17.9倍 |
如8月1日报道所述,OpenAI在7月30日将GPT-5.6 Luna降价80%以应对竞争。但DeepSeek的V4 Flash定价再次将Luna的价格击穿了4倍以上。 每当美国实验室降到一个新的”历史最低”,DeepSeek总能在更低的价格点上提供可用的前沿级能力。
技术架构:为什么它敢这么便宜?
V4 Flash并非简单的”缩小版”。据DeepSeek官方技术文档和Startup Fortune的分析,其核心架构为:
- 总参数量:284B(2840亿)
- 激活参数:仅13B(130亿)per token——这是MoE(混合专家)架构的关键优势
- 上下文窗口:100万token
- 运行模式:支持思考模式与非思考模式切换
对比之下,V4 Pro更为庞大:1.6万亿总参数、49B激活参数。但Flash的定位是高吞吐、低成本场景——当你需要处理数百万token的文档摘要、代码辅助或批量分类时,你不需要最强的模型,你需要的是”足够好且足够便宜”的模型。
华为变量:成本重构的底层逻辑
这才是整个故事中最具战略意义的部分。据Fortune 4月报道,DeepSeek的V4系列与华为芯片实现了深度整合,DeepSeek预计随着华为Ascend 950处理器产能扩大,V4 Pro的价格将进一步下降。
DeepSeek没有仅仅在API定价上做文章——它正在改变账单底下的成本基础。 当美国实验室的推理成本依赖于NVIDIA GPU的溢价时,DeepSeek正在构建一个基于国产芯片的替代成本结构。这是一个结构性的不对称优势:即便DeepSeek的模型在benchmark上不是最强的,它也可能在”每美元能完成多少有用工作”的指标上碾压对手。
基准测试的现实
需要指出的是,V4 Flash并非在所有维度上都能击败更贵的模型。据BenchLM的公开数据:
- V4 Flash在Terminal-Bench 2.0上得分49.1%,而Moonshot AI的Kimi K3为88.3%
- GPQA上V4 Flash为71.2%,Kimi K3为93.5%
- 但Kimi K3的API价格为$3/$15——DeepSeek的论点不是”Flash最强”,而是”很多工作不需要用最强的模型”
内存芯片危机:AI基础设施的隐性瓶颈
50-70%的全球产能被AI吞噬
就在DeepSeek用价格战搅动市场的同时,AI基础设施的供应端正在发出警报。据CSIS 8月3日发布的分析,2026年全球50%至70%的内存芯片产量将被AI数据中心吞噬。
这不是GPU短缺的翻版——这是一场不同维度的供应链危机:
- HBM(高带宽内存):AI训练和推理的核心组件,需求增速远超产能扩张
- DDR5:数据中心标准内存,同样面临供应紧张
- 消费电子波及:笔记本电脑、平板、游戏主机的内存成本正在攀升
- 零售行业预警:据Retail TouchPoints报道,零售协会已发出正式警告
时间线:2027-2029年的持续压力
据CNBC 1月报道,Synopsys CEO Sassine Ghazi表示芯片”紧缺”将持续整个2026年并延伸至2027年。而Everstream AI的风险分析更指出,供应紧张可能持续到2029年。
一些规划中的AI数据中心面临30-50%的产能延迟风险——这不是因为买不到GPU,而是因为配套的内存芯片供应不上。当所有人都关注NVIDIA GPU的产能时,内存芯片可能成为真正的瓶颈。
为什么DeepSeek的成本优势在这种背景下更加重要?
这里出现了一个有趣的交叉点:如果内存芯片价格因为AI数据中心的需求而持续上涨,那么使用华为Ascend 950芯片(可能配套国产HBM替代方案)的DeepSeek,将获得双重成本优势——不仅是芯片本身更便宜,还可能绕过全球HBM供应瓶颈。当然,这取决于华为是否能真正大规模生产替代方案。
Grok 4.6即将登场:参数规模再创新高
8月7日目标发布
据ROIC报道和Basenor分析,Elon Musk确认Grok 4.6将于8月7日左右发布,关键规格如下:
| 指标 | Grok 4.6 | Grok 4.7(下月) |
|---|---|---|
| 总参数量 | 1.5万亿(1.5T) | 2.1万亿(2.1T) |
| 改进重点 | SFT、RL大幅增强 | 进一步规模扩展 |
| 预期提升 | 推理、数学、编码 | 持续优化 |
| 吞吐量 | ~80 transactions/sec | TBD |
Grok 4.6的1.5万亿参数规模,使其成为市场上最大的商业模型之一(仅次于DeepSeek V4 Pro的1.6T和Moonshot Kimi K3的2.8T)。Musk同时预告Grok 4.7将在约一个月后发布,参数进一步扩大至2.1万亿——xAI正在执行一种激进的”快速迭代+规模扩张”策略。
在价格战背景下的定位
Grok 4.6的发布时机耐人寻味。在DeepSeek以极低价格抢占开发者和企业用户的同时,xAI选择走”更大、更强”的路线。这暗示了一种战略分化:
- DeepSeek路线:极致性价比,以成本结构赢取市场
- xAI/OpenAI路线:追求能力上限,以性能溢价维持定价
- Anthropic路线:以安全和可靠性作为差异化
问题是:当”足够好”的模型已经便宜到接近免费时,“最强”的模型能维持多高的溢价?
今日其他重要动态
Ling-3.0-flash:又一个免费124B MoE模型
据OpenRouter官方页面和Reddit r/LocalLLaMA社区报道,InclusionAI(蚂蚁集团相关)发布的Ling-3.0-flash已上线OpenRouter,在8月3日前免费使用。该模型为124B参数MoE架构,5.1B激活参数,支持262K上下文。这进一步证明了中国AI实验室在开源/低价MoE模型上的集体战略。
Gemini Robotics 2发布
据AI Weekly 8月2日报道,Google DeepMind发布了Gemini Robotics 2——一套包含三个模型的机器人视觉-语言-动作(VLA)系统。这标志着Google在物理AI领域的又一次重大投入,与NVIDIA的机器人训练自动化形成竞争。
Ai4 2026大会今日启动
据 Ai4官方,美国最大规模AI会议之一的Ai4 2026今日在拉斯维加斯开启预热日,包括应用AI研究会议(AAIRC)和技术商业峰会。正式会议(8月4-6日)预计将有12,000+参会者、1,000+演讲者和400+展商。本届大会可能成为观察企业AI采用趋势的重要窗口。
行业趋势:供需撕裂的三重张力
今日的新闻集中暴露了一个结构性矛盾——AI基础设施的供需正在向相反方向撕裂:
- 价格向下:DeepSeek V4 Flash的$0.28输出价格、Ling-3.0-flash的免费开放、GPT-5.6 Luna的80%降价——模型使用的边际成本正在趋近于零
- 硬件向上:内存芯片50-70%被数据中心吞噬、HBM和DDR5供应紧张持续至2027-2029、消费电子面临涨价压力——基础设施的固定成本正在飙升
- 规模向上:Grok 4.6的1.5T参数、DeepSeek V4 Pro的1.6T参数、Kimi K3的2.8T参数——模型规模仍在指数级膨胀
这三重张力正在创造一种不可持续的局面:模型使用越来越便宜,但训练和部署这些模型所需的硬件资源越来越昂贵。谁能在成本结构和硬件获取上取得优势,谁就将定义AI行业的下一个阶段。 DeepSeek+华为的组合,正是在这种张力中最值得关注的力量。
关键要点
- DeepSeek V4 Flash以$0.28/百万输出token的价格,将前沿AI能力推至新低——比Anthropic Haiku 4.5便宜近18倍,其底层是华为Ascend 950芯片的战略性整合
- 50-70%全球内存芯片产能被AI数据中心吞噬,短缺预计持续至2027-2029年,消费电子和零售行业面临连锁冲击
- Grok 4.6瞄准8月7日发布,1.5万亿参数,xAI执行”规模扩张+快速迭代”策略,与DeepSeek的”极致性价比”路线形成分化
- Ling-3.0-flash(124B MoE)免费上线OpenRouter,进一步证明中国AI实验室在开源MoE模型上的集体战略
- AI基础设施供需正在撕裂:模型价格趋近于零,硬件成本持续飙升——这种结构性矛盾将在未来12-18个月成为行业的核心议题
常见问题
DeepSeek V4 Flash真的比GPT-5.6便宜那么多吗?
是的。按官方定价,V4 Flash输出价格为$0.28/百万token,而GPT-5.6 Luna的输出价格约为$1.20/百万token,标准定价更可达$6/百万token。DeepSeek在输入端同样大幅领先。但需要注意,V4 Flash在部分基准测试上表现不如更贵的模型,适合高吞吐、低成本场景。
内存芯片短缺会影响普通消费者吗?
会的。当50-70%的内存芯片产能被AI数据中心吸收时,笔记本电脑、智能手机、游戏主机等消费电子产品的内存成本将上升。零售行业协会已经发出正式警告。预计短缺将持续到2027-2029年。
华为Ascend 950芯片能替代NVIDIA GPU吗?
目前尚无定论。DeepSeek的V4系列已与华为芯片深度整合,在推理成本上展现出显著优势。但在训练超大规模模型方面,NVIDIA的CUDA生态和硬件性能仍有领先。关键在于华为能否真正扩大Ascend 950的生产规模。
Grok 4.6的1.5万亿参数意味着什么?
参数规模是模型能力的粗略指标之一,但并非唯一。Grok 4.6的1.5T参数配合改进的SFT(监督微调)和RL(强化学习),目标是提升推理、数学和编码能力。但更大的模型也意味着更高的推理成本——这与DeepSeek追求的成本效率形成对比。
中国AI实验室为什么集体采用MoE架构?
MoE(混合专家)架构允许模型拥有极大的总参数量(如DeepSeek V4 Flash的284B),但每次推理只激活一小部分(如13B),从而在保持能力的同时大幅降低推理成本。这使得中国实验室能够在芯片受限的情况下,依然提供具有竞争力的模型。
参考资料
- DeepSeek V4-Flash定价分析 — Startup Fortune
- The United States’ Accelerating Memory Chip Crunch — CSIS
- DeepSeek’s Latest Breakthrough Is Redefining AI Race — CSIS
- Memory chip shortage to last through 2027 — CNBC
- Retail Associations Warn of Memory Chip Shortage — Retail TouchPoints
- Global Memory Chip Shortage Worsens — Everstream AI
- Musk Signals Rapid Grok Rollout — ROIC
- Grok 4.6 Confirmed: What We Know — Basenor
- Ling-3.0-flash on OpenRouter
- AI News Today, August 2 — AI Weekly
- Ai4 2026 Conference — Official Site
- DeepSeek disrupts AI pricing — Yahoo Finance