郭震 AI公众号:郭震AI

实时 AI 消息

兔展智能联合北大、鹏城实验室研发的UniWorld-View登顶李飞飞团队世界模型榜单

兔展智能联合北京大学、鹏城实验室研发的UniWorld-View模型登顶李飞飞团队世界模型榜单。该模型支持单张图片或单目视频生成任意视角的新视角视频,已适配国产昇腾算力,代码和权重已全部开源。

发布时间

李飞飞团队的世界模型榜单刚刚换了新榜首。登顶的是兔展智能联合北京大学、鹏城实验室研发的UniWorld-View模型,该模型已适配国产昇腾算力,代码和权重已全部开源。

UniWorld-View的核心能力是新视角合成(Novel View Synthesis),即让AI根据单张图片或单目视频自动"脑补"出未拍摄角度的画面。用户随手拍摄一段视频或仅提供一张图片,即可生成可自由指定相机轨迹的新视角视频——推、拉、摇、移,甚至绕场景360°旋转均可实现,提供精确的相机位姿控制。

传统方法如NeRF和3DGS走的是"重建"路线,依赖多视角输入,面对覆盖极少的单目视频时容易出现空洞伪影或直接失败。而多数生成式方法仅将相机位姿作为抽象条件向量塞入扩散模型,缺乏显式3D建模,视角稍大就会出现漂移和失控。

UniWorld-View的技术创新在于其"遮挡感知点云渲染"(Occlusion-aware Point Cloud Rendering)。团队首先发现,现有方法使用的点云是一堆孤立点,缺乏连接和朝向信息,在大基线视角变换时导致前景纹理被错误拉伸或背景像素穿透。UniWorld-View通过双重投影(Double-Reprojection)识别被遮挡区域并挖掉错误信号,同时为每个点估计法向量,背向相机的点直接踢出渲染,从而为扩散模型提供干净的几何条件。

在生成阶段,UniWorld-View采用"双流条件注入"策略:一路接收点云渲染图确保位置正确,另一路接收源视频确保内容完整,让生成结果既贴合目标视角又与原始场景一致。该模型更进一步的亮点是支持"单目视频→多视角视频→4D场景"的全流程——通过任意变换机位生成多视角视频,再喂给4DGS(动态3D高斯溅射)进行优化,最终获得可自由视角漫游的4D场景。

兔展智能由北京大学校友与北大视觉领域青年领军人才联合创立,公司自主研发Open-Sora Plan、UniWorld等系列视觉AI模型,其中Open-Sora Plan是行业首个开源文生视频模型,2024年代码引用量位居全球第一,UniWorld系列则率先探索理解与生成统一架构。此前兔展智能已发布UniWorld-V2和UniWorld-V2.5,在图文交错、文字密集等场景对齐了GPT-Image-2的生成能力。

本次UniWorld-View的训练数据来自北大系初创企业元空智能,代码和权重已全部开源至GitHub。值得注意的是,该模型已适配国产昇腾算力,体现了国产AI基础设施在视觉大模型训练与推理方面的持续进步。兔展智能同时透露,公司正加速推进UniWorld大模型能力的产品化,近期将推出产模一体设计生产工具RabbitVis,推动视觉AI进入商业设计工作流。

随着世界模型赛道竞争日益激烈,UniWorld-View在榜单登顶和全栈开源的双重加持下,有望为具身智能、自动驾驶、影视制作等需要丰富三维理解的应用场景提供更强大的基础能力。

为什么重要

UniWorld-View登顶榜单和全栈开源标志着国产视觉大模型在世界模型赛道取得重要突破,适配昇腾算力进一步强化了国产AI基础设施的生态闭环,对具身智能和4D场景生成等前沿方向具有推动意义。

微博邮件

UniWorld-View世界模型兔展智能北京大学鹏城实验室昇腾
返回实时消息

附近消息

全部

07/24 22:00

AI动态:‘AI communism’, rogue models, and the why Kimi K3 spooked Wall Street

据 techcrunch.com 消息,‘AI communism’, rogue models, and the why Kimi K3 spooked Wall Street。Chinese AI lab Moonshot’s open model Kimi went viral this week for reasons that had less to do with the model itself and more to do with how the U.S. AI industry reacted to it. Meanwhile, an unreleased OpenAI model wandered outside its test environment and end...

07/24 22:42

合肥再押AI独角兽:智象未来三个月融超21亿,多模态赛道资本火热

多模态大模型公司智象未来(HiDream.ai)宣布完成15亿元C轮融资,近三个月内密集完成三轮融资总计超21亿元,估值已超过10亿美元跻身全球AI独角兽行列。此轮融资由社保基金四川振兴科创基金、工银资本等联合领投,阵容涵盖国家级资本、多地国资和影视产业资本。

07/24 21:46

小米新机入网备案文心一言、DeepSeek、通义千问等十余款大模型,或搭载澎湃OS 4

博主@数码闲聊站爆料,小米一款型号为2608BPX34C的新机已通过入网审核,备案了包括小米大模型、智谱AI、文心一言、DeepSeek、通义千问、混元等十余款大模型。消息人士推测这批备案可能为即将到来的澎湃OS 4系统做准备。

07/24 21:36

OpenAI将ChatGPT Voice语音模式带到桌面端,可语音操控Codex和Agent

OpenAI于7月24日宣布为其ChatGPT桌面应用加入语音模式支持,用户现在可以通过语音与AI助手对话并控制其执行计算机操作任务。该功能基于OpenAI本月早些时候发布的ChatGPT-Live语音模型系列,可配合ChatGPT Work和Codex完成多步骤指令。