实时 AI 消息
微软叫停Tokenmaxxing:预算卡死、超限自负,内部默认用GPT-5.6
据量子位报道,微软已叫停内部“Tokenmaxxing”做法,将AI使用预算卡死,超出限额的用量由使用者自行承担。报道称,微软内部目前默认使用GPT-5.6,成本管控成为大模型应用的新重点。
量子位报道,微软已在内部叫停“Tokenmaxxing”——把Token用量一路顶到极限的做法——并将AI使用预算“卡死”。
报道称,超出预算限额的用量需要使用者自行负责,这意味着员工不能再无节制地挥霍Token。
报道还提到,微软内部目前默认使用GPT-5.6,作为日常AI工作的主力模型。
大模型Token消耗正在成为企业AI开支的最大变量,长上下文、Agent自动执行等场景让单次任务的成本迅速放大。
微软既是OpenAI的主要投资方,也是全球最大的云服务商之一,其内部成本纪律往往被看作整个行业AI支出风向的参考。
对一线开发者而言,预算上限意味着提示词设计、上下文长度和Agent调用次数都需要更精细地规划。
接下来值得关注的是,微软是否会推出更细粒度的额度管理工具,其他科技巨头又是否会跟进类似的预算限制。
为什么重要
微软内部预算收紧与默认模型切换,标志大模型成本管控正成为头部企业运营的硬约束,可能带动行业效仿。
附近消息
全部08/05 15:05
Sand.ai开源全球首个千亿参数MoE视频生成模型:114B参数、6B激活,10秒1080P成本仅5毛
Sand.ai刚刚开源了其千亿参数MoE视频生成模型,总参数达114B、激活参数仅6B,并宣称这是全球首个千亿级MoE视频生成模型。该模型支持10秒1080P视频生成,单次生成成本约0.5元,大幅拉低了高质量AI视频的生产门槛。
08/05 13:59
字节 Seed 发布 SeedRealtime:音视频全双工大模型上车豆包
字节跳动 Seed 团队发布音视频全双工大模型 SeedRealtime,并将其集成到豆包 App。该模型支持"边看、边听、边说"的实时多模态对话,消除了传统语音助手一问一答间的"卡拍"停顿,让交互更接近自然交流。
08/05 13:53
AI用10小时凿开黄仁勋20年筑起的CUDA护城河,量子位:CUDA又危了?
量子位报道,AI刚刚用约10小时凿开了NVIDIA创始人黄仁勋经营20年之久的CUDA护城河。报道借此抛出“CUDA又危了?”的疑问,认为AI正在大幅降低绕开或替换CUDA生态的门槛。
08/05 16:04
NVIDIA Nemotron 3 Ultra:AI智能体能力迎来新进展
据Techgenyz报道,NVIDIA Nemotron 3 Ultra在AI智能体能力上带来一系列新进展,成为业界关注的焦点。这一动向延续了NVIDIA以模型与算力生态切入智能体赛道的策略,具体能力细节与基准表现仍有待官方披露。