DeepSeek-V3
- 上下文
- 128K
- 输入价
- $0.27 / 百万 tokens
- 输出价
- $1.10 / 百万 tokens
- 许可
- 开源
概览
深度求索的开源大模型,采用 671B 参数 MoE 架构,在推理、代码与中文任务上表现优异,并以极低的 API 定价著称,是开源大模型的代表。训练仅耗费约 278 万 H800 GPU 小时,性价比极高。
- 模态
- 文本
- 参数量
- 671B (MoE)
- 许可说明
- 开源 · DeepSeek License
能力
- 复杂数学推理
- 代码生成与调试
- 中英双语处理
- 长上下文理解(128K)
- 高效 MoE 推理
基准测试
分数按各测试原始量表列示,不同测试之间不作百分比换算。
| 测试项目 | 得分 | 量表 |
|---|---|---|
| MMLU | 87.1 | / 100 |
| HumanEval | 82.6 | / 100 |
| MATH | 61.6 | / 100 |
| GPQA | 59.1 | / 100 |
| GSM8K | 89.9 | / 100 |
版本历史
2025-03
- 发布 V3-0324 版本,代码生成与前端任务能力大幅提升
- 指令跟随一致性改善,减少格式错误率
2025-01
- 推出 DeepSeek-R1(强推理版),AIME 2024 得分达 79.8%
- 同步优化 V3 推理效率,API 响应速度提升约 20%
2024-12
上下文 128K输入 $0.27 / 百万 tokens输出 $1.10 / 百万 tokens- 首次发布,MoE 架构升级至 671B,推理与代码能力大幅提升
