实时 AI 消息
智象未来发布首个原生全模态视频模型 HiDream-O1-Video-1.0,双榜进入全球第一梯队
智象未来(HiDream.ai)9月15日正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0,支持文本、图片、视频多模态输入,可一键直出5至20秒1080p视频。该模型在 Artificial Analysis 图生视频榜(含音频)排名全球第四、Arena.ai 图生视频盲测排名第八,发布同期公司宣布完成由新微资本、交子资本、工银资本参与的 C+轮融资。
9月15日,智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(模型简称 HD-V1)。据量子位转载的官方信息,该模型采用智象自研的原生全模态架构,支持文本、图片、视频等多种模态输入,可一键直出5至20秒1080p高保真视频,并在意图理解、物理规律理解、自主规划叙事以及音画一体化生成等维度完成升级。
发布同期,HD-V1 在两项国际评测榜单中给出了名次:在全球独立AI基准测试与分析平台 Artificial Analysis 的 Image to Video Leaderboard(With Audio)上排名全球第四,在全球AI模型盲测评测平台 Arena.ai 的 Image-to-Video 榜单上排名第八。Artificial Analysis 以标准化、可复现的基准评测头部视频生成模型,Arena.ai 则采用盲测方式,两者都是业内常被引用的第三方参考。
技术路线上,HD-V1 在生成流程最前面加了一个多模态意图理解模块,先把用户口语化、碎片化的提示词转成结构化规划,规划字段涵盖镜头时长、场景地点、画面内容、首帧约束、在场角色、动作与表情、景别构图、运镜焦段以及台词和背景声等音效设计。模型在这一步完成对意图的解析,再进入后续的联合生成,以减少意图漏解、镜头跳戏和人物漂移等常见问题。
另一个被重点强调的能力是物理规律理解。物体在重力下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减、空间如何保持连续,都被写进画面生成的底层逻辑。官方给出的对比演示显示,在同样提示词下,对照组模型出现了线条受力方向不合理、物体凭空出现等问题,而 HD-V1 生成的手部发力与线的形变、张力走向更贴合真实物理。
在音画同步上,HD-V1 走的是原生全模态路线,对文本、视频、音频信号进行联合建模,让三者在同一生成过程中相互约束和彼此对齐,而不是先逐帧出画面、再回头配音配效的后期拼接方案。官方披露其后训练阶段采用了 Diffusion Reinforcement Learning,并设计了与人工认知对齐的多模态 Reward 模型,从画面到声音、从局部到整体统一评估音视频内容。此外,模型的时长决策也交给内容本身,根据事件展开逻辑与叙事节奏自行规划生成时长,而非由提示词里写死的秒数决定。
把这款视频模型放回智象自己的产品矩阵里看,闭环意义更明显。自今年4月发布原生全模态世界模型架构 HiDream-O1 以来,智象陆续推出同源演进的模型家族:图像生成模型 HiDream-O1-Image 系列的商用版1.5版本在 Artificial Analysis 文生图榜单取得中国第一、全球第二;交互式世界模型 HiDream-O1-World 在行业首个交互式世界模型基准 WBench 综合总榜排名第一;具身世界模型 HiDream-O1-Embodied 曾在 RoboColiseum 的扰动适应与空间推理子榜单登顶。随着视频模型正式发布,业内首个原生全模态世界模型闭环就此成型。
资本层面的动作同样落在了这一天。智象在 HD-V1 发布之际宣布完成 C+轮融资,投资方为新微资本、交子资本与工银资本。新微资本由上海新微科技集团、上海科创投集团与管理团队共同发起成立,管理基金规模近百亿元;交子资本是成都交子金控集团旗下全资国有股权投资平台,管理基金规模超1700亿元。两家投资方均在官方表态中把智象的原生全模态世界模型矩阵与自身产业资源、算力基建和落地场景联系起来。
对智象未来来说,这次发布把公司从“单点能力”推向“统一底座”。智象创始人梅涛表示,公司要做的是一个原生全模态底座、四大模型同源演进的模型矩阵;CTO 姚霆则表示,HD-V1 是原生全模态世界模型矩阵的关键组成部分,双榜进入第一梯队是对这条技术路线最直接的验证。接下来值得关注的是视频模型的实际开放节奏、榜单名次能否稳定,以及国资产业资本进入后,公司在算力与行业落地上会以多快的速度推进。
为什么重要
这次发布补齐了智象世界模型矩阵的视频环节,也说明中国厂商在图生视频这一高密度赛道上已具备与全球头部模型同榜竞争的能力。国资产业资本的进入,则可能加快其在算力采购与行业落地上的推进速度。
附近消息
全部09/15 18:57
Perplexity 把本地智能体 Portable Computer 带到 Windows,需 24GB 显存 RTX 显卡
Perplexity 于 9 月 14 日把本地智能体 Portable Computer 带入 Windows 平台,该功能可在搭载 NVIDIA GeForce RTX 或 RTX PRO 显卡、显存不低于 24GB 的电脑上完全本地运行,面向 Pro 与 Max 订阅用户开放。与云端版本不同,模型、智能体框架、编排器与调度器全部运行在本机,敏感数据不出设备,本地完成的任务也不消耗 Perplexity Computer 额度。
09/15 17:58
单张GPU跑10万原子:分子之心QuantaMind把酶催化反应模拟成电影
分子之心最新披露,其反应性机器学习力场 QuantaMind 已能在单张 GPU 上以接近量子化学计算的精度,模拟十万原子级体系数百纳秒的化学反应,单步耗时约 0.25 秒。论文层面,它在一个包含 17,792 个原子的完整 PET 水解酶体系中连续模拟 6 纳秒,跑通质子转移、断键成键到完整催化循环的全过程,AI 结果与量子力学复核吻合度超过 0.99。
09/15 17:50
联发科发布2nm旗舰芯片天玑9600 Pro,主打AI原生架构瞄准智能体
联发科推出新一代旗舰移动芯片天玑9600 Pro,采用2nm制程,并以AI原生架构作为核心卖点,官方定位直指智能体(Agent)场景。这是端侧AI叙事从“跑得动大模型”转向“长期跑好智能体”的一个明确信号。
09/15 17:43
紫东太初开源 ZDTaichu5.0-9B:主打 10B 参数内的空间具身能力
紫东太初系列开源通用多模态大模型 ZDTaichu5.0-9B,发布信息称其在 10B 参数以内的通用多模态模型中空间具身能力最强。该版本把参数控制在 9B 级别,指向的是把多模态理解能力放进机器人等实体设备的方向。