郭震 AI公众号:郭震AI

实时 AI 消息

Qwen 上线 Qwen3Guard-Stream 流式防护模型,0.6B 与 4B 两个版本同时放出

9月27日,Qwen 在 Hugging Face 官方模型库上线 Qwen3Guard-Stream 的 0.6B 与 4B 两个版本,分别基于 Qwen3-0.6B 和 Qwen3-4B 微调,定位为流式内容判定。一次放出大小两档,意味着同一套判定能力既能铺在高并发链路上,也能用更高容量换取更细的结果。

发布时间
Qwen 上线 Qwen3Guard-Stream 流式防护模型,0.6B 与 4B 两个版本同时放出
图源: huggingface.co

9月27日,Qwen 团队在 Hugging Face 官方模型库上线了 Qwen3Guard-Stream 系列的两个模型,分别是 Qwen/Qwen3Guard-Stream-4B 与 Qwen/Qwen3Guard-Stream-0.6B,两个仓库目前都已公开可下载。这是 Qwen3Guard 的流式(Stream)版本,定位在生成过程中完成内容判定。

从仓库标签与模型卡看,两个模型的任务类型都标为 feature-extraction,使用 transformers 库,标签包含 safetensors、qwen3 与 custom_code;它们分别以 Qwen3-4B 和 Qwen3-0.6B 作为基座进行微调,模型卡还标注了配套论文编号 arXiv:2510.14276。

一次放出 0.6B 与 4B 两个尺寸,是这次更新里最直接的工程信息。0.6B 版本面向显存与延迟受限的场景,可以在有限硬件上承担高并发的过滤任务;4B 版本则用更大的容量换取单次判定更细的表现。两者共用相近的接口思路,使用方可以按吞吐需求切换。

Qwen 上线 Qwen3Guard-Stream 流式防护模型,0.6B 与 4B 两个版本同时放出
图源: huggingface.co

注册表上的早期数据也指向同一个方向。上线后不久,0.6B 版本显示 3858 次下载、35 个点赞,4B 版本为 492 次下载、25 个点赞。小模型下载量明显更高,说明真实需求更偏向能低成本铺开的审核能力,而不是参数量本身。

真正的变量在“Stream”上。流式审核意味着在生成过程中就逐段判定内容,而不是等整段输出完成后才做过滤,这直接决定它能否嵌进实时对话和智能体链路。

把权重放到公开仓库,影响也不只是分数。团队可以把护栏接进自己的推理栈,让用户数据留在自有边界内,这对受监管行业的产品来说,往往决定一项 AI 功能能不能真正上线。

后续可以关注三件事:配套论文 arXiv:2510.14276 给出的评测口径与多语言覆盖、4B 与 0.6B 在延迟和误判率上的实际差距,以及社区多久会给出量化版本与推理框架适配。

为什么重要

把安全护栏做成可自托管的开源权重,会直接压低温审场景的部署成本,也把延迟与判定精度之间的取舍交回给应用团队;对做对话产品和智能体的团队来说,这是一个可以立刻接入的新选项。

微博邮件

QwenOpen SourceSafety
返回实时消息

附近消息

全部