实时 AI 消息
字节跳动发布Seed Audio 1.0音频生成模型,单模型统一语音、音效与配乐创作
字节跳动正式发布音频生成模型Seed Audio 1.0,该模型可在统一框架内联合建模语音、音效、背景音乐和环境音,通过单次提示词生成完整的叙事音频作品。模型已上线火山方舟体验中心,面向创作者开放测试。
字节跳动于7月20日正式推出音频生成模型Seed Audio 1.0,这标志着AI音频生成技术从单一语音合成阶段迈向完整的音景创作新阶段。该模型已在火山方舟体验中心上线,面向创作者开放测试。
长期以来,影视级音频内容的制作依赖多模型分别生成人声、音效和背景音乐,再进行人工剪辑和混音,流程冗长且难以保证整体叙事的连贯性。Seed Audio 1.0的核心突破在于并非简单拼接素材,而是在统一框架内联合建模多种音频元素,端到端生成服务于故事叙述的完整音频作品。
据官方介绍,Seed Audio 1.0具备三大核心能力。第一是精准时空编排,支持以100毫秒的精度沿时间轴控制对白和音效的进入时机,适合视频配音和广告制作等场景。第二是稳定语音表现,支持零样本生成和长音频扩展,在保持角色音色一致性的同时自然表达愤怒、喜悦等不同情绪,甚至可以让同一个声音分饰多角。第三是流畅多语言支持,覆盖中、英、日等20余种语言,确保语音符合各地表达节奏和重音习惯。
评估数据显示,该模型在九大常见创意场景中的音频可用性超过90%,多语言生成的自然度MOS评分普遍在4分以上。
在BytePlus平台上,Seed Audio 1.0支持文本提示词(最长3000字符)、参考音频、参考图像等多种输入模式,单次生成最长120秒音频,并支持通过扩展功能延伸至更长片段。该模型被BytePlus定位为Dola系列首款基于参考的音频生成模型。
从Seed-TTS语音合成到Seed Audio 1.0的全场景音频生成,字节跳动在音频AI领域的路线图正逐步展开。未来团队计划进一步整合视频参考等多模态输入,探索可控翻译技术,持续优化长音频和音轨生成能力。
为什么重要
Seed Audio 1.0将影视级音频制作从多模型拼接流程压缩为单模型生成,大幅降低高质量音频内容的制作门槛,可能对播客、影视、广告和游戏内容创作产生广泛影响。
附近消息
全部07/20 16:54
阿里千问发布语音合成大模型Qwen-Audio-3.0-TTS
阿里云通义千问团队发布新一代语音合成大模型Qwen-Audio-3.0-TTS,在语音自然度和情感表现力上实现进一步优化。这是Qwen系列多模态布局在音频领域的最新延伸,为开发者和企业提供了更多语音交互场景的选择。
07/20 14:57
智象未来发布全球首个无限时长AI视频创作智能体vivago R1
智象未来正式推出全球首个无限时长AI视频创作智能体vivago R1,打破了过去15秒的视频生成时长限制。该产品宣称商业可用率达到85%,标志着AI视频生成从实验性走向商业化的重要一步。
07/20 17:41
全球首发AI for ADANES技术路线,中国探索用人工智能赋能先进核能
在2026世界人工智能大会期间,中国学者发布了全球首创的AI for ADANES原创技术路线,通过物理本征世界模型实现核能系统智能化。同时启动的全域创新联盟将推动AI与先进核能的深度融合,助力解决能源安全与算力耗电的长期矛盾。
07/20 17:54
当AI进入最依赖"人"的行业:一家四线城市康复机构利润增长40%
大米和小米推出的RICE AI系统已在三四线城市康复机构运行半年,将评估效率提升超10倍。河南平顶山一家机构2026年上半年利润同比增长40%,验证了AI辅助特需儿童康复的商业可行性。