实时 AI 消息
MiniMax发布全模态生成模型H3:支持15秒2K音视频,价格不到主流三分之一
MiniMax今日正式发布通用全模态生成模型MiniMax H3,首次实现文本、图像、视频、音频的统一理解与生成,最高支持15秒2K分辨率、带原生双声道的音视频输出。官方称其在2K分辨率下的每秒生成成本不到主流模型的1/3,并计划未来几天内在符合法律法规的前提下开放模型权重。

AI公司MiniMax今日正式发布通用全模态生成模型MiniMax H3。官方介绍称,这是首款实现文本、图像、视频、音频统一理解与生成的模型,打破了视频生成领域各任务、各模态相互割裂的局面。
据介绍,H3支持原生双声道音视频输出,最高可生成15秒2K分辨率内容。在前期邀测中,模型在指令遵循、品牌信息呈现、V2V动作迁移等场景下表现出商用级稳定性,可应用于广告、电商、游戏、UI设计等多个领域。
用户只需用自然语言描述复杂关系——例如“参考某段视频的希区柯克式镜头运动,让指定图片中的人物唱出某段音频的歌声”——模型即可自动完成全链路理解与生成。
技术层面,H3引入了Contextual Omni Representation(上下文全模态表示)技术,使自然语言成为连接各类模态的通用桥梁;配合自研的H3-VAE与In-context Regeneration技术,模型在2K分辨率下的每秒生成成本不到主流模型的1/3,768P分辨率下不到1/2。
定价与生态方面,MiniMax宣布将在未来几天内、在符合相关法律法规的前提下开源H3模型权重。这也是国产视频生成大模型首次面向社区开放权重,旨在推动开源生态建设并加速国产芯片适配——H3在设计初期就考虑了多款国产芯片的兼容性。
MiniMax方面表示,H3目前仍存在画面精细度和模型规模上的提升空间,后续将推进H系列与M系列模型能力的融合,并通过Scaling持续扩展模型上限。
业内分析认为,H3的发布与开源或将改变闭源模型长期主导视频生成领域的格局,为多模态AI的普惠化应用按下加速键。
为什么重要
H3以低价与开源策略切入视频生成市场,若权重如期开放,可能重塑国产视频大模型的竞争格局并加速国产芯片适配。关注未来几天开源落地与H系列、M系列的后续融合。
附近消息
全部07/31 12:55
他们让GPT自己经营「0人公司」24小时,结果亏损447美元
Bottleneck Labs团队给基于GPT 5.6 Sol的智能体Saul配了Mac mini、真实银行账户和在售的iOS应用,让它全权经营公司24小时。结果Saul不仅新增收入为零,还亏损447美元,期间出现购买假数据、群发邮件、六次改价等行为。
07/31 14:47
学习强国推出AI星伙社区:上线两周铺进68座城市
学习强国AI频道发起「AI星伙社区」并推出「AI超级卡」,上线仅两周成员已遍布68座城市,多地正自发组织线下活动。社区以一份8万余份问卷揭示的普通用户AI使用痛点为切入口,试图把AI普及从开发者圈层下沉到职场人和基层用户。
07/31 14:54
姚顺雨为腾讯混元AI4S招人:自研智能体Hyra攻克50年数学难题
量子位报道,姚顺雨亲自下场为腾讯混元AI for Science方向招人,并晒出一张科研成绩单:基于本月开源的Hy3模型(总参数295B、激活21B),自研智能体Hyra为加法组合学中困扰数学家约50年的开放问题给出完整答案,证明结果可无限逼近理论上限。混元强调这并非单纯暴力搜索——Hyra先用自然语言提出数学构造与论证,约24小时后找到论文核心思路,团队随后整理出完整证明并给出Lean 4形式化验证。
07/31 15:00
Univé借助ChatGPT Enterprise打造AI就绪员工队伍
荷兰保险企业Univé借助ChatGPT Enterprise打造「AI就绪」的员工队伍,将领导层支持、负责任治理与员工主导创新结合起来。OpenAI发布的企业案例显示,这家公司正以治理先行的方式把AI嵌入从管理到一线的日常工作流程。