郭震 AI公众号:郭震AI

实时 AI 消息

字节跳动发布Seed Audio 1.0音频生成模型,单模型统一语音、音效与配乐创作

字节跳动正式发布音频生成模型Seed Audio 1.0,该模型可在统一框架内联合建模语音、音效、背景音乐和环境音,通过单次提示词生成完整的叙事音频作品。模型已上线火山方舟体验中心,面向创作者开放测试。

发布时间

字节跳动于7月20日正式推出音频生成模型Seed Audio 1.0,这标志着AI音频生成技术从单一语音合成阶段迈向完整的音景创作新阶段。该模型已在火山方舟体验中心上线,面向创作者开放测试。

长期以来,影视级音频内容的制作依赖多模型分别生成人声、音效和背景音乐,再进行人工剪辑和混音,流程冗长且难以保证整体叙事的连贯性。Seed Audio 1.0的核心突破在于并非简单拼接素材,而是在统一框架内联合建模多种音频元素,端到端生成服务于故事叙述的完整音频作品。

据官方介绍,Seed Audio 1.0具备三大核心能力。第一是精准时空编排,支持以100毫秒的精度沿时间轴控制对白和音效的进入时机,适合视频配音和广告制作等场景。第二是稳定语音表现,支持零样本生成和长音频扩展,在保持角色音色一致性的同时自然表达愤怒、喜悦等不同情绪,甚至可以让同一个声音分饰多角。第三是流畅多语言支持,覆盖中、英、日等20余种语言,确保语音符合各地表达节奏和重音习惯。

评估数据显示,该模型在九大常见创意场景中的音频可用性超过90%,多语言生成的自然度MOS评分普遍在4分以上。

在BytePlus平台上,Seed Audio 1.0支持文本提示词(最长3000字符)、参考音频、参考图像等多种输入模式,单次生成最长120秒音频,并支持通过扩展功能延伸至更长片段。该模型被BytePlus定位为Dola系列首款基于参考的音频生成模型。

从Seed-TTS语音合成到Seed Audio 1.0的全场景音频生成,字节跳动在音频AI领域的路线图正逐步展开。未来团队计划进一步整合视频参考等多模态输入,探索可控翻译技术,持续优化长音频和音轨生成能力。

为什么重要

Seed Audio 1.0将影视级音频制作从多模型拼接流程压缩为单模型生成,大幅降低高质量音频内容的制作门槛,可能对播客、影视、广告和游戏内容创作产生广泛影响。

微博邮件

字节跳动Seed Audio音频生成火山方舟BytePlus
返回AI日报

附近消息

全部