🔥 行业热点 · AI 大模型

DeepSeek V4 Flash 最新动态

上线不到一周登顶全球 AI 模型调用量第一,单日吞下 8 万亿 Token,被业界称为大模型「斩杀线」——这一期我们带你全面回顾 V4 Flash 发布以来的重磅新闻。

信息整理时间:2026-08-04 | 数据来源:新浪科技 / 快科技 / 量子位 / 界面新闻 / 爱范儿 / OpenRouter 等
7.22万亿
OpenRouter 周调用量
全球第一 · 环比 +13%
8万亿
OpenCode 单日 Token
5万亿免费 + 3万亿付费
0.28美元
每百万输出 Token 价格
仅约 2 元人民币
284B
总参数量 · 激活仅 13B
MoE 混合专家架构

事件时间线

2026-07-31
重大发布DeepSeek 正式发布 V4 Flash-0731 正式版并开启 API 公测:架构与预览版一致(284B 总参数 / 13B 激活),仅重做后训练,重点强化编码与 Agent 能力。
2026-08-01
用量爆发开源 AI Agent 工具 OpenCode 显示:V4 Flash 正式版单日消耗 8 万亿 Token(5 万亿免费 + 3 万亿付费套餐),超过 OpenRouter 全平台日均 6.6 万亿 Token。
2026-08-02
评测上榜大模型竞技场 Arena 前端编码榜单将 V4 Flash 列入「价格—性能」前沿模型;跑分出炉,多项 Agent 基准反超自家 Pro 预览版。
2026-08-03
行业震荡OpenAI 宣布 GPT-5.6 Luna 大降价 80%(输出 6 → 1.2 美元/百万 Token);网友晒出对比账单:V4 Flash 0.07 美元做出 3D 射击游戏。
2026-08-04
登顶全球OpenRouter 周度统计(7/27–8/2):V4 Flash 以 7.22 万亿 Token 登顶全球调用量第一;同期前五名均为中国模型,中国大模型周调用量连续十四周超美国。

模型档案:V4 Flash 是什么?

轻量化高效旗舰 MIT 开源

  • 定位:DeepSeek V4 系列轻量化高效版本,面向高并发、规模化服务场景。
  • 架构:混合专家模型(MoE),总参数 2840 亿(284B),每次推理仅激活 130 亿(13B)参数,大幅降低计算成本。
  • 注意力机制:CSA + HCA 混合压缩注意力——先压缩再筛选,仅在必要时回看全局,缓解百万级上下文 KV 缓存压力。
  • 低精度权重:FP4 + FP8 混合精度,压缩存储与搬运成本而不失推理精度。
  • 推理加速:新增 DSpark 投机解码,提升服务器并发吞吐。
  • 上下文:原生支持 100 万 Token 超长上下文,思考 / 非思考双模式。
  • 后训练:SFT 监督微调 + GRPO 强化学习重做,预训练成本一分未加,Agent 能力大幅跃升。

核心性能数据 公开评测

评测项V4 Flash 正式版预览版说明
Terminal Bench 2.182.761.8终端 Agent 任务基准
Toolathlon70.349.7工具调用能力
LiveCodeBench(代码)93.5%代码生成赛道
Artificial Analysis 智能指数50 分与 Gemini 3.6 Flash 持平

编程能力已超过 GLM-5.2,接近 Opus 4.8,与 GPT-5.6 Luna 互有胜负;支持原生 Responses API 并适配 Codex。

定价:便宜到离谱,重塑价格体系

官方 API 价格

项目价格
输入(缓存命中)0.0028 美元 / 百万 Token
输入(未命中)0.14 美元 / 百万 Token
输出0.28 美元 / 百万 Token(约 2 元人民币)

2000 万 Token 的 Agent 任务折前约 3.5 美元;Artificial Analysis 认定其为全球知名 AI 模型中运行成本最低的产品,单次基准测试平均成本仅 0.03 美元(不足 Claude Fable 5 的 1%)。

🆚 太空射击游戏实测

1 美分

V4 Flash:约 900 行代码完成全部功能

1 美元

Claude Opus 5:近 3000 行代码,100 倍价差

🆚 森林划船小游戏实测

0.05 美元

V4 Flash:完整 3D 场景 + 碰撞计分

2.47 美元

GPT-5.6 Sol:效果趋同,贵约 50 倍

🆚 宝可梦 3D 模型实测

47.7 万 Token

V4 Flash 输出量,成本低约 14 倍

230 万+ Token

GPT-5.6 Luna 输出量,成品难分高下

横向价格对比(每百万输出 Token)

模型价格
DeepSeek V4 Flash2 元(约 0.28 美元)
Qwen 3.8 Max36 元
GLM 5.228 元
GPT-5.6 Luna(降价后)1.2 美元(原 6 美元)
Claude Opus 4.8 / Opus 525 美元
Claude Fable 550 美元

Artificial Analysis 全套评测:V4 Flash 得 50 分仅花 72 美元,Claude Opus 4.8 Max 得 56 分花 3752 美元——多 6 分,贵 52 倍;Fable 5 得 60 分花 5600 美元。

调用量:凭什么登顶全球第一?

原因一:绝对低价释放被压抑的需求

官方 API 已足够便宜,而 OpenCode Go 中的 V4 Flash 价格还能低至官方价的 1/6。开发者实测:半小时任务仅花 0.093 美元(Claude Opus 5 首次输入就要 0.5 美元)。

原因二:精准卡位 Agent 赛道,性能够用

中等复杂度的 Agent 任务需数十次模型调用,V4 Flash 让批量自动化试错具备财务可行性;实测在编程、代码生成、文档处理等 80% 高频任务中达到可用甚至优秀水平。对比实测:V4 Flash + Hermes 40 秒完成任务,GPT-5.6 Sol 组合耗时 1 分 47 秒。

原因三:「斩杀线」效应

网友将 V4 Flash 称为 AI 大模型「斩杀线」:性能拉开差距的模型才有生存空间,拉不开差距就会被超低价格斩杀。真正尴尬的是中间层模型——比 V4 Flash 强一些却贵几十倍,又没强到能解决 V4 Flash 做不了的问题。

国产模型霸榜

同期全球调用量前五名全部来自中国企业:小米 MiMo-V2.5、DeepSeek V4 Flash、腾讯 Hy3、智谱 GLM-5.2、DeepSeek V4 Pro。中国大模型周调用量已连续十四周超过美国。

行业影响与未来展望

对行业的影响 连锁反应

  • OpenAI 降价 80%:GPT-5.6 Luna 输出价从 6 美元降至 1.2 美元,但单任务成本仍比 V4 Flash 高约 60%。
  • 竞争逻辑改变:Agent 时代衡量模型的单位从「单次回答多聪明」变成「完成长任务花多少钱、多久、失败几次」,性价比成为核心指标。
  • 本地部署下沉:社区项目 DwarfStar 通过低比特量化将 V4 Flash 装入 96/128GB 统一内存设备,128GB Mac 上可达每秒 20+ Token;「高水平模型只能待在机房」的门槛被打破。

下一张王牌:V4 Pro 正式版 即将发布

  • 规模:总参数 1.6 万亿(约为 Flash 的 5 倍),每 Token 激活约 490 亿参数。
  • 配套工具:随正式版一同发布 DeepSeek Harness 工具(V4 Flash 82.7 分的 Terminal Bench 成绩即使用了 Harness 极简模式 + max 推理档)。
  • 行业预判:若 V4 Pro 正式版带来同幅度的性能提升,「斩杀线」标准可能提升至 Opus 5 / GPT-5.6 Sol 级别,大模型领域将迎来真正的洗牌。

新闻来源

⚠️ 免责声明:本页面内容整理自公开网络新闻报道,数据以各模型厂商官方公告为准;页面信息仅供信息参考,不构成任何投资或商业决策建议。