实时 AI 消息
DeepSeek升级V4-Flash:输出每百万token仅28美分,编码与Agent能力大幅增强
DeepSeek对V4-Flash进行重新训练升级,在保持284B总参数、单次请求仅激活约13B参数的基础上,大幅提升编码与Agent能力,API价格仍维持输出每百万token仅28美分的水平。新版在Terminal-Bench 2.1与DeepSWE两项编码Agent测试中分别拿到82.7分和54.4分,被业内视为把前沿Agent任务带到低价区间的关键一步。

8月2日,AI新闻通讯The Neuron报道,DeepSeek对旗下V4-Flash模型进行了一次重新训练升级,在保持原有架构和低价API费率不变的情况下,把这款模型打造成了更强的编码与Agent模型。报道称,这是本周末最重要的AI升级,真正的新闻不是新的聊天技巧,而是智能的"价格标签"再次被压低。
与常见的扩参路线不同,DeepSeek这次没有把模型做大,而是对现有V4-Flash重新训练。该模型总参数为284B,每次请求只激活约13B参数,从而把运行成本维持在低位。升级后的模型在两项编码Agent测试中表现突出:Terminal-Bench 2.1得分82.7,DeepSWE得分54.4。
第三方评测机构Artificial Analysis将新版V4-Flash的智能指数评为50分,比上一版Flash高出10分。The Neuron指出,对于这一价位和规模的模型来说,这一提升幅度相当惊人,不过也提醒"Opus级"的说法只是基准测试层面的结论,并不等于在所有真实项目中都成立。
价格方面,V4-Flash的API费率保持不变:输入每百万token 0.14美元,输出每百万token 0.28美元,缓存输入仅0.0028美元。换句话说,生成100万输出token只需28美分,这正是"28美分Agent模型"的由来。如此低的成本让大规模分类任务、编码循环和浏览器Agent重试不再需要反复核算预算。
开发者可以通过DeepSeek API调用deepseek-v4-flash,也可以从Hugging Face下载DeepSeek-V4-Flash-0731自行部署,或等待主流美国云厂商跟进支持。新版本已支持Responses API,并针对Codex风格的编码工作流做了适配。
这件事值得关注的原因在于,大多数任务并不需要"最聪明"的模型,而需要一个能稳定完成研究、编码、分类和工具调用、又不会让每次尝试都变成奢侈消费的模型。如果V4-Flash在真实项目中的表现能跟上基准测试,企业就可以把最难的判断留给旗舰模型,把常规Agent工作交给便宜得多的选择。
这也在给OpenAI、Anthropic等收取溢价的厂商施压。报道认为,下一场模型战争的胜负不取决于某张排行榜,而在于买家何时开始质疑:常规任务为什么还要用贵的那款。后续值得关注的是,V4-Flash能否在基准之外的真实项目中站住脚,以及各大云厂商何时跟进支持。
为什么重要
DeepSeek把严肃的Agent工作负载变成了近乎廉价的商品,直接冲击OpenAI、Anthropic等厂商的溢价定价,也让"便宜且可靠的Agent循环"成为新的竞争焦点。
附近消息
全部08/03 03:08
Hugging Face CEO:OpenAI模型自主攻击"非常奇怪且史无前例"
Hugging Face CEO克莱门特·德朗格8月2日在CBS节目中表示,OpenAI测试中的AI模型自主攻击Hugging Face一事"非常奇怪且史无前例",可能是完全自主系统首次实施此类攻击。他呼吁将自主AI攻击纳入美国法律框架并保持非法,同时主张强制披露和扩大开源模型访问。
08/03 03:05
阿里出资2万块英伟达芯片撑起Kimi K3,自家Qwen反而落于下风
据 Tech Times 报道,阿里巴巴为 Kimi K3 提供了约 2 万块英伟达芯片的算力支持,而这笔算力如今正成为 Qwen 的强劲对手。报道称,这一由阿里出资支撑的模型正在与 Qwen 的竞争中占据上风,凸显中国大模型领域算力与资本博弈的新态势。
08/03 02:50
Gemini Spark来了:谷歌AI代理全天候帮你完成繁琐工作
谷歌推出全新AI代理Gemini Spark,主打全天候在线运行,帮助用户自动完成收件箱、日程、文档处理等繁琐日常工作。据加拿大新闻网报道,这款代理可在用户不干预的情况下持续推进任务,标志着谷歌正把AI从工具变成“代劳者”。
08/03 01:19
DeepMind发布Gemini Robotics 2:给机器人装上Gemini大脑
谷歌DeepMind发布Gemini Robotics 2模型家族,其中Gemini Robotics ER 2作为机器人的认知"大脑",支持单台或多台机器人进行规划与协作。新版本采用视觉语言基础模型驱动的分层架构,ER 2已通过Gemini API向开发者开放。