实时 AI 消息
中国大模型周调用量连续二十周领跑,DeepSeek V4.1 Flash 上线三天升至第六
《每日经济新闻》基于 OpenRouter 最新数据测算,9 月 7 日至 13 日全球大模型总调用量达 127 万亿 Token,中国大模型以 61.17 万亿 Token 连续二十周位居全球首位。9 月 10 日发布的 DeepSeek V4.1 Flash 上线三天即升至第六,前五名中有四款是中国模型。
《每日经济新闻》根据 OpenRouter 最新数据测算,上周(9 月 7 日至 9 月 13 日)全球 AI 大模型总调用量为 127 万亿 Token,环比增长 10.43%。其中,上榜的中国 AI 大模型周调用量达 61.17 万亿 Token,环比增长 7.85%;同期美国大模型的周调用量为 21.76 万亿 Token,环比增长 31.56%。
榜单前列的构成同样值得注意:全球调用量排名前五当中有四款中国模型。腾讯混元 Hy4 preview 位居第二,周调用量达 16.8 万亿 Token,环比增长 15%。报道指出,Hy4 preview 于 8 月 28 日正式发布并开源,总参数 770B、激活参数 49B,上下文长度突破 1M,重点面向 Agent、Coding 与生产力场景优化。
智谱 GLM 5.3 Flash 位居第三,周调用量 11.9 万亿 Token,环比下滑 4%;DeepSeek V4 Flash 0731(即 DeepSeek V4 Flash 正式版)位居第四,周调用量 11.6 万亿 Token,环比下滑 6%;小米 MiMo-V2.5 升至第五,周调用量 7.77 万亿 Token,环比增长 230%。
本期最受关注的新面孔是 DeepSeek V4.1 Flash。该模型于 9 月 10 日正式发布,上线三天即登上榜单第六位,周调用量 4.94 万亿 Token。按报道描述,V4.1 Flash 采用全新的 Causal-Encoder-Decoder(因果编码器—解码器)结构,是一个总参数量 552B 的混合专家(MoE)模型。
价格方面,DeepSeek 下调了 V4.1 Flash 的 API 定价。按每百万 Token 计算,空闲时段的缓存命中输入价格为 0.02 元、缓存未命中输入 1 元、输出 4 元;高峰时段分别为 0.04 元、2 元和 8 元,新价格自 2026 年 9 月 10 日 12:00 起生效。与 V4 Flash 同一时段的价格相比,缓存命中输入降价 60%,缓存未命中输入降价约 33.3%,输出降价约 11.1%。
据 DeepSeek 介绍,V4.1 Flash 在性能、费用、速度和任务总用时等指标上已全面超越 V4 Pro。与此同时,上一周排名第六的 MiniMax M3 与排名第九的智谱 GLM 5.3 跌出榜单,榜单内部的新旧更替明显加快。
值得关注的是两地增长的节奏差异。中国模型的周调用量基数更大,但增速为 7.85%;美国模型虽然总量只有约三分之一,环比却增长了 31.56%,说明美国侧的调用需求正在加速回升。这也意味着,中国模型连续二十周领跑的背后,竞争并没有停下来。
后续可以观察三点:DeepSeek V4.1 Flash 在降价之后能否继续向上爬榜;GLM 5.3 Flash、腾讯混元 Hy4 preview 等模型的排名能否守住;以及随着 Agent 类应用把 Token 消耗推向高位,价格战是否会在更多厂商之间蔓延。
为什么重要
调用量是 Agent 时代最直接的算力需求指标。中国模型连续二十周领先,但美国侧 31.56% 的环比增速提醒我们,领先优势更多来自价格与开源策略带来的规模,而竞争节奏仍在变化;DeepSeek 降价后的爬榜速度,将成为观察价格战走向的关键样本。
附近消息
全部09/14 12:05
OpenAI 测试全新 ChatGPT 广告形态:点击后进入品牌对话,而不是跳转网站
Digiday 报道,OpenAI 已向部分客户推出一款面向 ChatGPT 应用的 AI 原生广告,广告主可在广告上挂载品牌 AI 智能体,用户点击“Chat to us”后不会跳转到品牌官网,而是直接进入 ChatGPT 内的品牌对话。Wayfair 正在试用,OpenAI 首席财务官 Sarah Friar 此前称现有广告只是“基础的起点”。
09/14 11:01
DeepSeek-V4.1-Flash 技术拆解:552B 总参数、8B 激活的 MoE 多模态模型
HackerNoon 对 DeepSeek-V4.1-Flash 的模型卡做了技术梳理:这是一款接受文本与图像输入的多模态混合专家模型,总参数 552B,单次推理只激活约 8B 参数,主打长上下文下的内存与推理效率。模型以 MIT 许可开放权重,支持 1M token 上下文与可调推理强度,但在部分推理基准上仍不及体量更大的 V4-Pro 系列。
09/14 09:51
DeepSeek 把 V4-Pro 的 API 流量全部切到 V4.1-Flash,并按 Flash 价格计费
据 Pandaily 报道,DeepSeek 已把发往 V4-Pro 的 API 流量全部路由至 V4.1-Flash,并按 Flash 档位的价格计费。这意味着需要 V4-Pro 能力的请求,现在由 V4.1-Flash 承接,成本侧的预期也随之改变。
09/14 08:30
智谱在财务公告里提前剧透 GLM-6.0,完全自训练方法被公开
据量子位报道,智谱在一份财务公告中提前披露了下一代模型 GLM-6.0,并公开了其完全自训练的方法,而模型本体与相关论文目前尚未发布。本该由技术博客或论文首发的信息先出现在财务文件里,让外界提前看到了智谱下一代模型的训练路线。