实时 AI 消息
Qwen发布Qwen3.8-2.4T-A95B开源MoE模型及FP8量化版
Qwen 团队在 Hugging Face 发布新模型 Qwen3.8-2.4T-A95B,按命名规则这是一款总参数约 2.4 万亿、激活参数约 950 亿的混合专家模型,并同步推出 FP8 量化版本。模型标签显示其属于 Qwen3.5 系列的 MoE 文本模型,基础版与量化版均已上线供社区下载。

Qwen 团队在 Hugging Face 上发布了新模型 Qwen3.8-2.4T-A95B,这是通义千问开源家族的最新一次模型更新。
模型卡片显示,该模型的 pipeline 为 text-generation,基于 transformers 库构建,标签中包含 qwen3_5_moe_text,说明它是一款面向文本生成的混合专家(MoE)模型。
按 Qwen 家族命名惯例,2.4T 指总参数量约 2.4 万亿,A95B 指每次推理激活约 950 亿参数,属于典型的稀疏激活 MoE 架构。
几乎同一时间,官方还上传了 FP8 量化版本 Qwen3.8-2.4T-A95B-FP8,其模型卡将原始模型标注为 base_model,量化版本通常在显存占用和推理效率上更具优势。
截至发布时,基础版模型在 Hugging Face 上已有 978 次下载,FP8 版本下载量约为 3851 次,社区热度正在快速上升。
大参数 MoE 模型的持续开源,意味着开发者可以在本地或自建环境中获得接近前沿的文本生成能力,同时通过稀疏激活控制推理成本。
接下来值得关注的是官方是否会发布技术报告和基准测试数据,以及该模型能否快速获得主流推理框架与部署工具的支持。
为什么重要
Qwen3.8-2.4T-A95B 的发布为开源社区带来又一款大参数 MoE 文本模型,有望降低前沿文本生成能力的获取门槛。
附近消息
全部08/12 17:52
雷军挖走字节一员大将,科技高管人才流动再受关注
据新浪网报道,雷军已从字节跳动挖走一员大将,报道未披露该高管的姓名与具体职务。这一人事变动经由字节AI相关资讯聚合流出,被视为头部科技公司人才竞争加剧的最新信号。
08/12 19:00
AI代码测试初创公司Blacksmith估值一年内飙升近10倍至5.5亿美元
AI代码测试初创公司Blacksmith宣布,其估值在不到一年内上涨近10倍,达到5.5亿美元。公司表示,过去一年营收增长超过十倍,反映出AI编程热潮正在把资本关注推向软件验证环节,市场对代码质量保障工具的需求持续升温。
08/12 17:47
字节跳动Seedance 2.5引关注:AI视频一次生成30秒
字节跳动的AI视频生成模型Seedance 2.5引发关注,报道称其能够一次生成30秒视频,创作者无需再拼接多个片段。若该能力得到实测验证,将显著提升视频生成的连贯性与实用场景,并对短视频和广告创作产生直接价值。
08/12 15:57
中国边缘AI大模型独角兽ModelBest启动A股上市辅导,MiniCPM系列下载量达3800万
中国最大的边缘AI大模型独角兽ModelBest已启动A股上市辅导,其MiniCPM系列模型累计下载量达到3800万次。此举意味着这家以端侧大模型见长的公司正式迈出登陆A股市场的第一步,端侧AI赛道的资本化进程再进一步。