上线不到一周登顶全球 AI 模型调用量第一,单日吞下 8 万亿 Token,被业界称为大模型「斩杀线」——这一期我们带你全面回顾 V4 Flash 发布以来的重磅新闻。
| 评测项 | V4 Flash 正式版 | 预览版 | 说明 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 终端 Agent 任务基准 |
| Toolathlon | 70.3 | 49.7 | 工具调用能力 |
| LiveCodeBench(代码) | 93.5% | — | 代码生成赛道 |
| Artificial Analysis 智能指数 | 50 分 | — | 与 Gemini 3.6 Flash 持平 |
编程能力已超过 GLM-5.2,接近 Opus 4.8,与 GPT-5.6 Luna 互有胜负;支持原生 Responses API 并适配 Codex。
| 项目 | 价格 |
|---|---|
| 输入(缓存命中) | 0.0028 美元 / 百万 Token |
| 输入(未命中) | 0.14 美元 / 百万 Token |
| 输出 | 0.28 美元 / 百万 Token(约 2 元人民币) |
2000 万 Token 的 Agent 任务折前约 3.5 美元;Artificial Analysis 认定其为全球知名 AI 模型中运行成本最低的产品,单次基准测试平均成本仅 0.03 美元(不足 Claude Fable 5 的 1%)。
V4 Flash:约 900 行代码完成全部功能
Claude Opus 5:近 3000 行代码,100 倍价差
V4 Flash:完整 3D 场景 + 碰撞计分
GPT-5.6 Sol:效果趋同,贵约 50 倍
V4 Flash 输出量,成本低约 14 倍
GPT-5.6 Luna 输出量,成品难分高下
| 模型 | 价格 |
|---|---|
| DeepSeek V4 Flash | 2 元(约 0.28 美元) |
| Qwen 3.8 Max | 36 元 |
| GLM 5.2 | 28 元 |
| GPT-5.6 Luna(降价后) | 1.2 美元(原 6 美元) |
| Claude Opus 4.8 / Opus 5 | 25 美元 |
| Claude Fable 5 | 50 美元 |
Artificial Analysis 全套评测:V4 Flash 得 50 分仅花 72 美元,Claude Opus 4.8 Max 得 56 分花 3752 美元——多 6 分,贵 52 倍;Fable 5 得 60 分花 5600 美元。
官方 API 已足够便宜,而 OpenCode Go 中的 V4 Flash 价格还能低至官方价的 1/6。开发者实测:半小时任务仅花 0.093 美元(Claude Opus 5 首次输入就要 0.5 美元)。
中等复杂度的 Agent 任务需数十次模型调用,V4 Flash 让批量自动化试错具备财务可行性;实测在编程、代码生成、文档处理等 80% 高频任务中达到可用甚至优秀水平。对比实测:V4 Flash + Hermes 40 秒完成任务,GPT-5.6 Sol 组合耗时 1 分 47 秒。
网友将 V4 Flash 称为 AI 大模型「斩杀线」:性能拉开差距的模型才有生存空间,拉不开差距就会被超低价格斩杀。真正尴尬的是中间层模型——比 V4 Flash 强一些却贵几十倍,又没强到能解决 V4 Flash 做不了的问题。
同期全球调用量前五名全部来自中国企业:小米 MiMo-V2.5、DeepSeek V4 Flash、腾讯 Hy3、智谱 GLM-5.2、DeepSeek V4 Pro。中国大模型周调用量已连续十四周超过美国。