概览
Musubi 开源的 17 亿参数内容审核决策模型:读你用大白话写的审核规则,单次前向就给出每个类别 0–1 的违规分数,短消息中位延迟约 35 毫秒,Apache 2.0 可商用。 自定义策略(explicit 模式):推理时用简短规则写类别(违规规则、非违规规则、例外条款),改规则不用重新训练 内置 Aegis 2.0 的 23 类通用安全分类(aegis 模式),外加一个「Prompt harmful」总分 一次前向返回最多 16 个类别的多标签分数,可按类别分别设置阈值 提供 precision(默认,自定义策略阈值 0.335)和 balanced(0.275)两档预设 速度:24GB NVIDIA L4 上、最多 6 个类别时短消息中位延迟约 35 毫秒(H100 约 22 毫秒),也能在笔记本 CPU 或 Apple 芯片上跑 在 19 种语言上评测(含中文),英语最强、泰米尔语最弱;自带文本清洗,能还原形近字、字母间隔和 base64 伪装 不需要 trust_remote_code,可离线运行 PolicyLM-1.7B 是信任与安全公司 Musubi 在 2026 年 10 月 6 日发布的开放权重内容审核模型(Apache 2.0),面向直播聊天、游戏大厅、私信、用户名这类必须「立刻给出判断」的场景。官方的思路是:传统固定分类器快且便宜,但读不懂各平台自己的规则,规则一改就要重新标注、重新训练;大模型能读懂规则,但对实时聊天来说太慢太贵。PolicyLM 属于「决策模型」:它把策略和消息一起读入,一次前向就返回每个类别的分数,不生成任何文字,所以速度和成本接近分类器。官方称在自家的自定义策略基准上,它胜过所有测试过的 200 亿参数以下模型;其微调版已在一个日处理超过 100 万条消息的平台上运行(以上为官方数据)。 模型基于 BidirLM-1.7B-Embedding(由 Qwen3-1.7B-Base 派生的开源编码器),用 NVIDIA Nemotron Safety Guard Dataset v3、阿里巴巴 XGuard-Train-Open-200K、PolyGuardMix 等公开安全数据集及合成数据训练,参数约 17.3 亿。它同时加入了 ROOST 开放安全模型社区。官方明确的局限:只处理文本、一次一条消息(不看对话历史);不提供文字理由,申诉、封号、下架等需要说明理由的决定应交给更大的模型;测试过的自定义策略都是英文写的;不适合作为儿童安全执法工具、唯一的自伤防护、对抗性用户的安全边界,也不用于审核 AI 助手自身的回复。 使用方式:新建虚拟环境后运行 pip install "transformers==4.57.6" "torch>=2.5.1" "safetensors>=0.4" "huggingface_hub>=0.34,<1.0" ,然后 hf download musubilabs/policylm-1.7b --revision v1.2 --local-dir policylm-1.7b ,再运行 python policylm-1.7b/inference/quickstart.py policylm-1.7b 。在代码里用 PolicyLM.from_pretrained("policylm-1.7b") 加载,构造 Policy([Category(名称, violation_rule=..., not_violation_rule=...)]) 后调用 model.classify(消息, policy);用内置分类时把 policy 换成 "aegis"。注意 transformers 5.x 暂不支持。中文场景官方未单独给出指标,上线前应先用自己的标注样本校准阈值。来源:musubilabs.ai 发布博客、huggingface.co/musubilabs/policylm-1.7b 模型卡(2026-10-07 核对)。 API ID: musubilabs/policylm-1.7b(Hugging Face 模型 ID,revision v1.2)
- 模态
- 文本
- 参数量
- 1.7B
- 许可说明
- 开源 · Apache 2.0
