实时 AI 消息
DeepSeek-V4.1-Flash 技术拆解:552B 总参数、8B 激活的 MoE 多模态模型
HackerNoon 对 DeepSeek-V4.1-Flash 的模型卡做了技术梳理:这是一款接受文本与图像输入的多模态混合专家模型,总参数 552B,单次推理只激活约 8B 参数,主打长上下文下的内存与推理效率。模型以 MIT 许可开放权重,支持 1M token 上下文与可调推理强度,但在部分推理基准上仍不及体量更大的 V4-Pro 系列。

HackerNoon 刊出的一篇技术梳理把 DeepSeek-V4.1-Flash 的模型卡拆开来看:这是一款同时接受文本与图像输入、输出文本的多模态混合专家(MoE)模型,官方权重按 MIT 许可开放。
官方给出的关键数字是 552B 的总参数与 8B 量级的单次激活参数。写作者认为,这款模型的定位不是把通用推理能力推到最高,而是压缩长输入、重上下文任务的内存与推理成本:它每 token 的全局 KV 缓存占用约为 890 字节,据称只有 DeepSeek-V4-Flash 的四分之一左右。
架构层面,文章描述该版本采用 CED 设计,配合官方记录的 CSA2 与 FP4 KV 缓存方案,并集成 DSpark 推测解码,最大上下文窗口为 1M token。指令版本开放推理强度调节,让调用方可以在质量与成本之间自己找平衡。
能力定位上,梳理给出的推荐场景是长上下文编码 Agent、依赖工具调用的研究与自动化 Agent,以及多模态文档理解。模型通过官方提供的编码实现与 deepseek-recipe 工具包支持工具调用,后者负责把 Messages、Chat Completions 与 Responses 接口请求转换成模型自有的 Conversation 格式,并解析完整或流式回复。
文章也明确列出了落差。在多项推理基准上,V4.1-Flash 的基础模型不及体量更大的 DeepSeek-V4-Pro-Base,LongBench-V2 等长上下文得分也低于 Pro 版本。作者提醒,1M token 是最大上下文窗口,并不等于每个位置上的质量都一致,长上下文应用需要自行测试检索、指令遵循与工具状态保持。
工程侧的坑同样被点出:这次发布没有附带 Jinja 格式的对话模板,直接套用通用聊天接口可能生成错误的提示词,应用必须依赖官方编码参考实现或 deepseek-recipe,来准确表达 thinking、工具调用、图像、系统消息与推理强度等字段。
部署门槛也仍然存在。模型卡没有给出显存要求、推理速度数据、权重量化与转换命令,也没有托管价格,本地部署需要结合推理说明与现有硬件自行验证。
文章给出的选型建议很直接:需要多模态输入、更强的代码表现、可控推理成本与更低 KV 缓存持久化开销时选 V4.1-Flash;如果更在意模型容量与峰值通用推理质量,体量更大的 V4-Pro 系列仍然更合适。
对开源生态来说,这个发布的信号是重心从堆参数转向堆效率:激活参数、KV 缓存设计与推测解码,正在决定长上下文 Agent 工作流的真实成本。接下来值得看的是社区能否补齐对话模板与量化版本,以及第三方实测能否复现官方宣称的推理效率。
来源
为什么重要
DeepSeek 继续为开源权重示范一条以服务成本为优先的路线,这会给闭源厂商的长上下文定价和本地部署的硬件门槛同时带来压力。
附近消息
全部09/14 11:18
中国物理AI模型PhysBrain 1.5登顶全球开源榜,空间智能对标GPT-6 Astra
量子位报道称,中国团队的物理AI模型PhysBrain 1.5已登顶全球开源榜一,报道将其描述为跑完了物理闭环里最难的一段路。该模型在空间智能上的表现被拿来与GPT-6 Astra并提,物理AI方向的落地路径因此再次受到关注。
09/14 11:45
CosmosMind联合多校发布MetaRSI-v1:统一三类RSI,并开源可自我迭代的Harness
9月14日,量子位刊载了CosmosMind团队MetaRSI-v1的发布内容:该架构由CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家海内外高校提出,被称为全球首个统一Model-RSI、Data-RSI与Harness-RSI的元递归架构,目标是改进“自我改进的过程”本身。团队同时开源了可自我学习、自我迭代的RSI-Harness,并称30亿激活参数的小模型在四项基准上平均自我提升10.9分,六款前沿模型在Terminal-Bench 2.1上平均提升7.3分。
09/14 11:55
中国大模型周调用量连续二十周领跑,DeepSeek V4.1 Flash 上线三天升至第六
《每日经济新闻》基于 OpenRouter 最新数据测算,9 月 7 日至 13 日全球大模型总调用量达 127 万亿 Token,中国大模型以 61.17 万亿 Token 连续二十周位居全球首位。9 月 10 日发布的 DeepSeek V4.1 Flash 上线三天即升至第六,前五名中有四款是中国模型。
09/14 12:05
OpenAI 测试全新 ChatGPT 广告形态:点击后进入品牌对话,而不是跳转网站
Digiday 报道,OpenAI 已向部分客户推出一款面向 ChatGPT 应用的 AI 原生广告,广告主可在广告上挂载品牌 AI 智能体,用户点击“Chat to us”后不会跳转到品牌官网,而是直接进入 ChatGPT 内的品牌对话。Wayfair 正在试用,OpenAI 首席财务官 Sarah Friar 此前称现有广告只是“基础的起点”。