概览
百度于 2026 年 2 月 6 日发布的统一全模态基座模型,总参数 2.4 万亿、每 token 仅激活约 3%,采用统一自回归框架加模态无关路由的 MoE 设计与弹性训练。它用「Next-Group-of-Tokens Prediction」这一统一目标把文本、图像、视频、音频映射到同一 token 空间,因此在同一个模型里既能做多模态理解,也能做图像与视频生成、音频理解与语音合成,上下文从上一代的 8K 扩展到 128K。已由 2026 年 5 月发布的文心大模型 5.1 接棒。
- 模态
- 多模态
- 参数量
- 2.4T(MoE,每 token 激活约 3%)
能力
- 原生全模态:文本、图像、视频与音频统一理解
- 图像与视频生成
- 音频理解与语音合成
- 跨模态推理与长文本理解(上下文从 8K 扩展到 128K)
