字节跳动 Seed 团队昨日发布 Seed Audio 1.0,用统一框架同时建模人声、音效和环境声,用一条指令组织角色、台词、情绪、背景与声音进场时机。 时间控制:模型会将创作意图拆成结构化时间线,目前支持 100ms 间隔精度。 音色与时长:支持文本或参考音频输入,单次可生成约 2 分钟音频,并 本文链接