跳转到内容

2026-08 主流大模型性能与吞吐对比:DeepSeek V4 / GLM-5 / Kimi K3 / 豆包 2.1 / Qwen3.8

本文是一份面向 Coding / Agent 场景的大模型横向对比备忘,数据来自 2026 年 8 月的公开评测与实测报告,结论基于多来源交叉核对。

这是一个分析类任务,工作方法:先梳理涉及的模型,再并行搜索权威的性能/吞吐数据,避免基于残缺信息下结论。

当前默认模型:Coding plan/deepseek-v4-flash-ga-260731 —— 火山方舟 Coding plan 接入的 DeepSeek V4 Flash(2026-07-31 GA 版)。同一 plan 还提供 doubao-seed-2-1-pro、glm-5-2 备选。

数据口径声明(重要):吞吐数据来源混合了「供应商服务端 API 实测」「开源单卡部署」「中文综合评测耗时」,硬件/并发/上下文/框架各异——只能看量级,不能精确横向比大小。

模型 参数(总/激活) 上下文 价格(元/百万token 入/出) 吞吐·生成速度 TTFT 代表性能
DeepSeek V4 Flash(默认) 284B/13B 1M 1 / 2 184 tok/s,DSpark 单流60 tok/s ~394ms SWE-bench V ≈79%
DeepSeek V4 Pro 1.6T/49B 1M 3 / 6 低于 Flash ~800ms+ SWE-bench V ≈80.6%,TB 2.1 87.9
豆包 Seed 2.1 Pro 未公开 256K 6 / 30 21.7–25.3 tps 5.2–18.4s TB 2.1 ≈ Opus 4.7
GLM-5 744B/40B 200K 4 / 18 30–60 tok/s 1–2s SWE-bench V 77.8%
Kimi K3 2.8T/104B 1M 20 / 100 单卡113→DSpark 423 tok/s — Code Arena 第1,中文 75.6%
Qwen3.8-Max 2.4T/95B 1M 12 / 36 31.4–38.6 tps 1.5–2.8s PaperBench 93,TB 2.1 86.6

1. 默认的 Flash 就是性价比/吞吐甜点位

Section titled “1. 默认的 Flash 就是性价比/吞吐甜点位”

13B 激活参数、约 184 tok/s 生成速度、2500 并发、1/2 元定价——编码能力(SWE-bench V ≈79%)只比 Pro 低约 1.6 个百分点,价格却只有 1/3。高频 Coding 场景选它最合理。

2. 要编码上限:DeepSeek V4 Pro 或 Kimi K3

Section titled “2. 要编码上限:DeepSeek V4 Pro 或 Kimi K3”
  • Kimi K3(Code Arena 第 1,2.8T/104B):编码天花板,但价格贵约 10 倍(20/100 元)、端到端慢 2–3 倍
  • DeepSeek V4 Pro(SWE-bench V ≈80.6%、TB 2.1 87.9):旗舰平衡之选,3/6 元定价

3. 要多模态/长程 Agent:Qwen3.8-Max 或豆包 2.1 Pro

Section titled “3. 要多模态/长程 Agent:Qwen3.8-Max 或豆包 2.1 Pro”
  • Qwen3.8-Max(2.4T/95B):视觉 + 1M 上下文 + TTFT 最快(1.5–2.8s),PaperBench 93、TB 2.1 86.6,长程自动编程表现出色
  • 豆包 Seed 2.1 Pro:生产级稳定,TB 2.1 ≈ Opus 4.7,Agent 长跑能力强(官方演示 18 小时自主完成芯片设计代码)

4. 纯编码省钱:默认 Flash 即可;GLM-5 是平价开源编程备选

Section titled “4. 纯编码省钱:默认 Flash 即可;GLM-5 是平价开源编程备选”

GLM-5(744B/40B、4/18 元)SWE-bench V 77.8%,与 Flash 接近,且开源可私有部署。

  • MiMo 2.5、ark-code-latest:未检索到可靠公开吞吐/基准数据,无法对比
  • GLM-5.2(Coding plan 提供版本):仅有 Super CLUE 编程 64.13 分间接数据,无独立吞吐
  • 吞吐口径不统一:来源混合「供应商服务端 API 实测」「开源单卡部署」「中文综合评测耗时」,硬件/并发/上下文/框架各异,只能看量级

DeepSeek V4

智谱 GLM-5

Kimi K3

豆包 2.1

Qwen3.8-Max