概览
德国 Aleph Alpha 的开放权重 MoE 推理模型:780 亿总参数、每 token 激活约 34.6 亿,最长 1M 上下文,专攻德语和英语,Apache 2.0 可商用,主打本地私有化部署。 主要能力: - MoE 架构:总参数约 781 亿,每 token 激活约 34.6 亿;每层 384 个专家(1 个共享 + 6 个路由),50 层 - 最长 1,048,576 tokens 上下文(原生 262,144),滑动窗口与 GQA 注意力 4:1 混合 - 推理模式可调:reasoning_effort 取 low / medium / high,或设为 none 关闭思考 - 支持 Hermes 风格工具调用和结构化输出,可与推理模式同时使用 - 专为德语优化的双语分词器,预训练 20T tokens(英语约 62.5%、德语约 23.9%、代码约 13.6%) - FP8 权重约 78GB,最低 2×A100 80GB、2×H100 或单张 H200 / B200 / B300 即可运行 - 文档中找不到答案时会回答「不知道」,适合基于自有资料的问答与 RAG Kolibri(模型卡称 Kolibri 1)是德国海德堡 AI 公司 Aleph Alpha 在 2026 年 10 月 3 日(德国统一日)发布的开放权重大语言模型,采用 Apache 2.0 许可,可在 Hugging Face 下载。它是混合专家(MoE)推理模型,总参数约 781 亿,模型卡标注每 token 激活约 34.6 亿(博客写作约 30 亿),支持显式推理模式和工具调用。模型在德国和芬兰的基础设施上训练:预训练用 768 块 NVIDIA B200 跑了 21 天,消耗 20T tokens,之后又做了 3.44T tokens 的中期训练和 2010 亿 tokens 的长上下文扩展;知识截止 2026 年 6 月 18 日。官方定位是面向公共管理、工业、航空航天等受监管领域的「主权」模型,强调供应链可追溯、可完全本地部署,Aleph Alpha 也签署了欧盟 GPAI 行为准则。官方称 Kolibri 在英语和德语的「质量-服务成本」上处于帕累托前沿,在数学、编程、事实依据和长上下文任务上可比肩激活参数约 4 倍于它的模型(如 Nemotron 3 Super),以上为官方数据。 使用方式:pip install 'aleph-alpha-inference>=1'(会安装 Kolibri 的 vLLM 插件和配套 vLLM 版本,也可直接用容器镜像 ghcr.io/aleph-alpha/aleph-alpha-inference),然后运行 vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 --reasoning-parser kolibri1 --tool-call-parser kolibri1 --enable-auto-tool-choice。服务启动后用任意 OpenAI 兼容客户端请求 http://localhost:8000/v1,model 填 Aleph-Alpha/Kolibri-1,通过 extra_body 的 chat_template_kwargs 设置 reasoning_effort 和 enable_thinking。需要超过 262,144 tokens 的上下文时,加 --max-model-len 1048576 --hf-overrides '{"max_position_embeddings": 1048576}'。官方推荐采样参数 temperature=1.0、top_p=0.97、top_k=128。注意:官方只针对德语和英语训练与评测,中文场景需要自行验证。来源:aleph-alpha.com 发布博客、huggingface.co/Aleph-Alpha/Kolibri-1 模型卡(2026-10-07 核对)。 API ID:Aleph-Alpha/Kolibri-1(Hugging Face 模型 ID,vLLM 自托管时即模型名)
- 模态
- 文本
- 参数量
- 781 亿总参数(激活约 34.6 亿,MoE)
- 许可说明
- 开源 · Apache 2.0
