概览
Liquid AI 开放权重的 3B 多模态「决策模型」:输入文本、JSON 或图片和一组问题,单次前向直接返回带概率的是 / 否、选项或评分,不生成任何 token;RTX 4090 上单个判断约 8 毫秒,适合路由、审核、分类、LLM 评审和智能体护栏。 能力要点:零输出 token:一次前向传播回答同一输入上的多个具名问题,返回校准过的概率而不是生成文字;不是聊天模型;三种题型:noul(是 / 否,返回 P(yes))、choice(从命名选项中选一个,附置信度和各选项概率)、score(2–10 级有序评分);多模态:同一输入里可混合文本、JSON 和图片;11 项公开图像基准平均 74.1(基座 LFM2.5-VL-3B 为 73.9);Decision Index v0.2.1 公开集 48.57:10B 以下决策模型最高,略高于参数约 12 倍的 Decider 35B-A3B(47.11);7 项公开文本基准均值 82.9(SQuAD2 85.3、Civil Comments 93.0、MASSIVE 87.3、PubMedQA 66.0、BoolQ 86.7、XNLI 85.0、PAWS-X 76.9);延迟(单个问题):RTX 4090 8 ms、AMD MI325X 9 ms、Apple M5 Pro 30 ms、Jetson AGX Thor 16 ms、Jetson AGX Orin 26 ms、Jetson Orin Nano 50 ms;3.12B 参数,视觉编码器 SigLIP2 NaFlex 400M,上下文 32,768 token,词表 128,000;首日支持 llama.cpp;官方标注语言:中文、英语、日语、韩语、阿拉伯语、法语、德语、印地语、印尼语、意大利语、波兰语、葡萄牙语、俄语、西班牙语、泰语、越南语。 d1-3B 是 Liquid AI 于 2026 年 10 月 7 日开放权重的决策模型(同时发布的还有实验性的 d1-omni-600M),基于自家视觉语言模型 LFM2.5-VL-3B 后训练而来。和常见大模型不同,它不逐字生成回答:你给出一个「状态」(一段文本、任意 JSON、图片,或混合)和若干具名问题,模型在一次前向传播里给出每个问题的结构化答案和概率,返回结果里 output_tokens 恒为 0。官方推荐的用途是流水线里所有需要「是 / 否、从几个选项里挑一个、打个分」的环节:工单路由与分级、内容审核、意图和主题分类、抽取结果校验、重排序、LLM-as-a-judge 打分、智能体护栏和视觉质检。 因为只做一次前向,延迟非常低:RTX 4090(开启 CUDA Graph)单个问题 8 ms,一次回答 3 个问题 21 ms,64 个请求打包吞吐约每秒 475 次;在 NVIDIA Jetson Orin Nano 这类小型边缘设备上单个问题也只要 50 ms。官方给出的 Decision Index v0.2.1(公开集)成绩为 48.57,是 10B 以下最高,与 35B 参数的 Decider 35B-A3B 相当。 许可为 LFM Open License v1.0:可免费使用、修改和分发,但年收入达到或超过 1000 万美元的企业做商业使用不在授权范围内(符合条件的非营利机构用于非商业或研究目的不受此限)。模型只提供开放权重,本轮未核到托管 API 价格,因此价格字段留空。 上手方式:pip install "transformers>=5.14" torch torchvision pillow,用 AutoModel.from_pretrained("LiquidAI/d1-3B", trust_remote_code=True) 加载,然后调用 model.system_one(状态, 问题字典),例如对「这个月被扣了两次款,请退一笔」同时问「是否要求退款(noul)」「该转给哪个团队(choice:billing / technical / fraud)」「紧急程度(score)」;批量请求用 system_one_batch。Hugging Face 上有 10 个现成演示的 Open d1 Arcade 空间。来源:liquid.ai/blog/d1-open、huggingface.co/LiquidAI/d1-3B 模型卡与 LICENSE(2026-10-08 核对)。 API ID:无托管 API(Hugging Face 模型 ID:LiquidAI/d1-3B);最大输出:不生成 token(输出为结构化判断,output_tokens 恒为 0);上下文 32,768 token;许可 LFM Open License v1.0。
- 模态
- 多模态
- 参数量
- 3.12B
- 许可说明
- 开源 · LFM Open License v1.0(年收入 ≥1000 万美元企业的商业使用不在授权内)
能力
- 零输出 token:一次前向传播回答同一输入上的多个具名问题,返回校准过的概率而不是生成文字;不是聊天模型
- 三种题型:noul(是 / 否,返回 P(yes))、choice(从命名选项中选一个,附置信度和各选项概率)、score(2–10 级有序评分)
- 多模态:同一输入里可混合文本、JSON 和图片;11 项公开图像基准平均 74.1(基座 LFM2.5-VL-3B 为 73.9)
- Decision Index v0.2.1 公开集 48.57:10B 以下决策模型最高,略高于参数约 12 倍的 Decider 35B-A3B(47.11)
- 7 项公开文本基准均值 82.9(SQuAD2 85.3、Civil Comments 93.0、MASSIVE 87.3、PubMedQA 66.0、BoolQ 86.7、XNLI 85.0、PAWS-X 76.9)
- 延迟(单个问题):RTX 4090 8 ms、AMD MI325X 9 ms、Apple M5 Pro 30 ms、Jetson AGX Thor 16 ms、Jetson AGX Orin 26 ms、Jetson Orin Nano 50 ms
- 3.12B 参数,视觉编码器 SigLIP2 NaFlex 400M,上下文 32,768 token,词表 128,000;首日支持 llama.cpp
- 官方标注语言:中文、英语、日语、韩语、阿拉伯语、法语、德语、印地语、印尼语、意大利语、波兰语、葡萄牙语、俄语、西班牙语、泰语、越南语
