郭震 AI公众号:郭震AI

实时 AI 消息

DeepSeek-V4.1-Flash 技术拆解:552B 总参数、8B 激活的 MoE 多模态模型

HackerNoon 对 DeepSeek-V4.1-Flash 的模型卡做了技术梳理:这是一款接受文本与图像输入的多模态混合专家模型,总参数 552B,单次推理只激活约 8B 参数,主打长上下文下的内存与推理效率。模型以 MIT 许可开放权重,支持 1M token 上下文与可调推理强度,但在部分推理基准上仍不及体量更大的 V4-Pro 系列。

发布时间
DeepSeek-V4.1-Flash 技术拆解:552B 总参数、8B 激活的 MoE 多模态模型
图源: deepseek.com

HackerNoon 刊出的一篇技术梳理把 DeepSeek-V4.1-Flash 的模型卡拆开来看:这是一款同时接受文本与图像输入、输出文本的多模态混合专家(MoE)模型,官方权重按 MIT 许可开放。

官方给出的关键数字是 552B 的总参数与 8B 量级的单次激活参数。写作者认为,这款模型的定位不是把通用推理能力推到最高,而是压缩长输入、重上下文任务的内存与推理成本:它每 token 的全局 KV 缓存占用约为 890 字节,据称只有 DeepSeek-V4-Flash 的四分之一左右。

架构层面,文章描述该版本采用 CED 设计,配合官方记录的 CSA2 与 FP4 KV 缓存方案,并集成 DSpark 推测解码,最大上下文窗口为 1M token。指令版本开放推理强度调节,让调用方可以在质量与成本之间自己找平衡。

能力定位上,梳理给出的推荐场景是长上下文编码 Agent、依赖工具调用的研究与自动化 Agent,以及多模态文档理解。模型通过官方提供的编码实现与 deepseek-recipe 工具包支持工具调用,后者负责把 Messages、Chat Completions 与 Responses 接口请求转换成模型自有的 Conversation 格式,并解析完整或流式回复。

文章也明确列出了落差。在多项推理基准上,V4.1-Flash 的基础模型不及体量更大的 DeepSeek-V4-Pro-Base,LongBench-V2 等长上下文得分也低于 Pro 版本。作者提醒,1M token 是最大上下文窗口,并不等于每个位置上的质量都一致,长上下文应用需要自行测试检索、指令遵循与工具状态保持。

工程侧的坑同样被点出:这次发布没有附带 Jinja 格式的对话模板,直接套用通用聊天接口可能生成错误的提示词,应用必须依赖官方编码参考实现或 deepseek-recipe,来准确表达 thinking、工具调用、图像、系统消息与推理强度等字段。

部署门槛也仍然存在。模型卡没有给出显存要求、推理速度数据、权重量化与转换命令,也没有托管价格,本地部署需要结合推理说明与现有硬件自行验证。

文章给出的选型建议很直接:需要多模态输入、更强的代码表现、可控推理成本与更低 KV 缓存持久化开销时选 V4.1-Flash;如果更在意模型容量与峰值通用推理质量,体量更大的 V4-Pro 系列仍然更合适。

对开源生态来说,这个发布的信号是重心从堆参数转向堆效率:激活参数、KV 缓存设计与推测解码,正在决定长上下文 Agent 工作流的真实成本。接下来值得看的是社区能否补齐对话模板与量化版本,以及第三方实测能否复现官方宣称的推理效率。

为什么重要

DeepSeek 继续为开源权重示范一条以服务成本为优先的路线,这会给闭源厂商的长上下文定价和本地部署的硬件门槛同时带来压力。

微博邮件

DeepSeekOpen SourceMoE
返回实时消息

附近消息

全部

09/14 11:55

中国大模型周调用量连续二十周领跑,DeepSeek V4.1 Flash 上线三天升至第六

《每日经济新闻》基于 OpenRouter 最新数据测算,9 月 7 日至 13 日全球大模型总调用量达 127 万亿 Token,中国大模型以 61.17 万亿 Token 连续二十周位居全球首位。9 月 10 日发布的 DeepSeek V4.1 Flash 上线三天即升至第六,前五名中有四款是中国模型。

09/14 09:51

DeepSeek 把 V4-Pro 的 API 流量全部切到 V4.1-Flash,并按 Flash 价格计费

据 Pandaily 报道,DeepSeek 已把发往 V4-Pro 的 API 流量全部路由至 V4.1-Flash,并按 Flash 档位的价格计费。这意味着需要 V4-Pro 能力的请求,现在由 V4.1-Flash 承接,成本侧的预期也随之改变。

09/14 08:30

智谱在财务公告里提前剧透 GLM-6.0,完全自训练方法被公开

据量子位报道,智谱在一份财务公告中提前披露了下一代模型 GLM-6.0,并公开了其完全自训练的方法,而模型本体与相关论文目前尚未发布。本该由技术博客或论文首发的信息先出现在财务文件里,让外界提前看到了智谱下一代模型的训练路线。

09/14 07:01

《泰晤士报》:英国大臣为「保护国家利益」回避对AI施加约束

《泰晤士报》9 月 13 日报道称,英国大臣们在 AI 监管问题上回避了施加约束,给出的理由是保护英国的国家利益。这篇报道把英国政府在安全关切与产业竞争力之间的取舍重新推到台面上,成为观察其先进 AI 规则走向的一个信号。