2026-08 主流大模型性能与吞吐对比:DeepSeek V4 / GLM-5 / Kimi K3 / 豆包 2.1 / Qwen3.8
本文是一份面向 Coding / Agent 场景的大模型横向对比备忘,数据来自 2026 年 8 月的公开评测与实测报告,结论基于多来源交叉核对。
一、背景与方法
Section titled “一、背景与方法”这是一个分析类任务,工作方法:先梳理涉及的模型,再并行搜索权威的性能/吞吐数据,避免基于残缺信息下结论。
当前默认模型:Coding plan/deepseek-v4-flash-ga-260731 —— 火山方舟 Coding plan 接入的 DeepSeek V4 Flash(2026-07-31 GA 版)。同一 plan 还提供 doubao-seed-2-1-pro、glm-5-2 备选。
数据口径声明(重要):吞吐数据来源混合了「供应商服务端 API 实测」「开源单卡部署」「中文综合评测耗时」,硬件/并发/上下文/框架各异——只能看量级,不能精确横向比大小。
二、性能 / 价格 / 吞吐总表
Section titled “二、性能 / 价格 / 吞吐总表”| 模型 | 参数(总/激活) | 上下文 | 价格(元/百万token 入/出) | 吞吐·生成速度 | TTFT | 代表性能 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash(默认) | 284B/13B | 1M | 1 / 2 | ~394ms | SWE-bench V ≈79% | |
| DeepSeek V4 Pro | 1.6T/49B | 1M | 3 / 6 | 低于 Flash | ~800ms+ | SWE-bench V ≈80.6%,TB 2.1 87.9 |
| 豆包 Seed 2.1 Pro | 未公开 | 256K | 6 / 30 | 21.7–25.3 tps | 5.2–18.4s | TB 2.1 ≈ Opus 4.7 |
| GLM-5 | 744B/40B | 200K | 4 / 18 | 30–60 tok/s | 1–2s | SWE-bench V 77.8% |
| Kimi K3 | 2.8T/104B | 1M | 20 / 100 | 单卡113→DSpark 423 tok/s | — | Code Arena 第1,中文 75.6% |
| Qwen3.8-Max | 2.4T/95B | 1M | 12 / 36 | 31.4–38.6 tps | 1.5–2.8s | PaperBench 93,TB 2.1 86.6 |
三、关键结论
Section titled “三、关键结论”1. 默认的 Flash 就是性价比/吞吐甜点位
Section titled “1. 默认的 Flash 就是性价比/吞吐甜点位”13B 激活参数、约 184 tok/s 生成速度、2500 并发、1/2 元定价——编码能力(SWE-bench V ≈79%)只比 Pro 低约 1.6 个百分点,价格却只有 1/3。高频 Coding 场景选它最合理。
2. 要编码上限:DeepSeek V4 Pro 或 Kimi K3
Section titled “2. 要编码上限:DeepSeek V4 Pro 或 Kimi K3”- Kimi K3(Code Arena 第 1,2.8T/104B):编码天花板,但价格贵约 10 倍(20/100 元)、端到端慢 2–3 倍
- DeepSeek V4 Pro(SWE-bench V ≈80.6%、TB 2.1 87.9):旗舰平衡之选,3/6 元定价
3. 要多模态/长程 Agent:Qwen3.8-Max 或豆包 2.1 Pro
Section titled “3. 要多模态/长程 Agent:Qwen3.8-Max 或豆包 2.1 Pro”- Qwen3.8-Max(2.4T/95B):视觉 + 1M 上下文 + TTFT 最快(1.5–2.8s),PaperBench 93、TB 2.1 86.6,长程自动编程表现出色
- 豆包 Seed 2.1 Pro:生产级稳定,TB 2.1 ≈ Opus 4.7,Agent 长跑能力强(官方演示 18 小时自主完成芯片设计代码)
4. 纯编码省钱:默认 Flash 即可;GLM-5 是平价开源编程备选
Section titled “4. 纯编码省钱:默认 Flash 即可;GLM-5 是平价开源编程备选”GLM-5(744B/40B、4/18 元)SWE-bench V 77.8%,与 Flash 接近,且开源可私有部署。
四、数据缺口(诚实声明)
Section titled “四、数据缺口(诚实声明)”- MiMo 2.5、ark-code-latest:未检索到可靠公开吞吐/基准数据,无法对比
- GLM-5.2(Coding plan 提供版本):仅有 Super CLUE 编程 64.13 分间接数据,无独立吞吐
- 吞吐口径不统一:来源混合「供应商服务端 API 实测」「开源单卡部署」「中文综合评测耗时」,硬件/并发/上下文/框架各异,只能看量级
五、参考来源
Section titled “五、参考来源”DeepSeek V4
- DeepSeek V4 Pro 正式版比 Flash 正式版强多少?旗舰版与高性价比版的全面对比
- DeepSeek V4 Flash 对比 V4 Pro:效率与旗舰
- DeepSeek‑V4全解析:Flash与Pro双版本性能差异、计费规则与API实战调用完整教程
- DeepSeek 再放大招,推理速度狂飙85%,怎么做到的?
- DeepSeek 开源 DeepSpec 框架,将 V4 模型速度提升高达 85%
- DeepSeek V4:功能、基准测试与对比
- 实测DeepSeekV4:天下武功,唯快不破
智谱 GLM-5
- 智谱官宣GLM-5底层基建进展:吞吐最高提升132%,修复方案被SGLang开源社区采纳
- GLM-5 Benchmark Results, Specs & Pricing | DataLearnerAI
- GLM-5 API 完全教程(2026):免费额度、价格对比、三版本选型
- GLM-5深夜炸场:国产AI的“代码之神”来了
Kimi K3
- Kimi K3:很强,很贵,很爱给你炫技
- Kimi K3创造 另一个“DeepSeek时刻”?
- 实测Kimi K3:强得意外,慢得着急
- 月之暗面发布Kimi K3:2.8万亿参数MoE模型,定价进入顶尖区间
豆包 2.1
- Token调用量增长超10倍!豆包大模型2.1上线
- 刚刚,豆包2.1发布!Agent自己跑18个小时搞定芯片设计代码
- 豆包2.1 Pro 实测:国产大模型杀进“生产级”
- 字节豆包 Seed 2.1 Pro 和 Turbo 深度思考模型发布
Qwen3.8-Max