提示词直出影视级声音:豆包音频生成模型实测

火山引擎上线豆包音频生成模型1.0(Seed-Audio 1.0)。相比去年10月的语音合成2.0,此次升级为“音频生成”,核心能力是影视级全要素直出:一段提示词即可一次生成人声、配乐、音效、环境声,无需后期分轨合成。
也就是说,过去用AI做声音,用户往往只能得到一条干净的人声;现在模型能把人声、配乐、音效和环境声在同一段音频里编排在一起,直接交付一段有画面感的声音。这在以前通常需要配音、音效、混音几个岗位分别完成。
实测中,该模型的完成度相当高。它可以生成1分10秒的连续对话,对话中不仅包含角色的情绪变化,还自然地出现了电话忙音,模拟出真实的通话场景;为三人漫剧配音时,它能够输出旁白、长老、少年等不同音色,同时配上古筝、刀剑等音效,听上去就像一段完整的广播剧。此外,它还能制作世界杯解说和冰雪奇缘特效片段,冰晶碎裂的音效与原文接近。
长内容方面,古诗朗读没有AI腔,能保持长程一致性,单次生成可达2分钟;更重要的是,它可以基于参考音频继续生成,把一段声音延展到几十分钟。这意味着创作者先用一小段样本定好音色,就能让模型持续产出后续内容,而不必每次重新描述。四川方言场景也表现自然,说明模型对地域性口音的适应力并不弱。
从合成到生成
严格来说,从“语音合成2.0”到“音频生成1.0”不是简单的版本迭代,而是创作范式变了。语音合成关注的是“说得像人”,音频生成关注的是“像一部作品”。Seed-Audio 1.0把配乐、音效、环境声和人物对白当成一个整体来建模,提示词就是导演的剧本,模型一次性完成所有声部的编排。
这种能力可能大幅降低声音创作的门槛。过去创作者如果要做一个带背景音乐和现场音效的片段,需要分别找素材、分轨录制、再手动混音;现在只需要写一段文字,剩下的交给模型。用作者的话说,它不再是单纯的配音工具,而是“声音导演”——一个人就能完成成片级声音制作。
落地方式
模型已在火山方舟上线。使用上,它支持上传参考音频生成相似音色,这意味着制作方可以固定一个角色声线,再让模型生成它后续的台词。同时,在文本中@多个音频,可以实现多人多音色的对话,相当于一场“声音演出”的指挥中心。
从语音合成到音频生成,AI声音创作正在从“能说话”走向“能导演”。这次豆包音频生成模型1.0的落地,或许就是声音内容制作新阶段的一个信号:未来的有声剧、短视频、动画配音,也许只需要一个写提示词的人。
更多推荐阅读

世界模型专家刘宇加盟理想,机器人基座模型研发提速
理想汽车引入世界模型专家刘宇,负责机器人基座模型研发。刘宇曾想创业做“中国的π”,因认可理想智驾VLA路线而加入。理想近一年流失13位核心高管,刘宇的加入为团队注入强心剂。
2026-09-05
AI办公赛道巨头混战,Agent创业窗口反而开启
2026年夏,字节、腾讯、阿里会战AI办公,巨头重兵投入背后是恐惧。创新工场汪华称,国产模型能力与成本突破才真正点燃Agent爆发,创业公司反在巨头照亮市场后觅得细分机会。
2026-09-05
AI报告读着累?新指标用隐喻率量化可读性
Manus团队提出“隐喻率”与“信息量”双指标,量化AI调研报告的可读性与信息密度。测试发现Claude Fable-5隐喻最多,GPT信息密度偏低,但可通过Prompt优化。
2026-09-05
AI科学家K Pro上岗,全球最大药企研发提速70%
Owkin与勃林格殷格翰达成许可协议,授权AI科学家K Pro及多模态数据,加速肿瘤学和免疫学新药研发。试点项目已显成效,靶点识别速度提升70%。
2026-09-05
估值300亿美元,AI云新贵Crusoe凭什么吸金超30亿
Crusoe完成超30亿美元融资,估值达300亿美元,与OpenAI、微软、Meta等合作,并获Jane Street五年大单,AI算力需求推动其估值飙升。
2026-09-05
AI攻克费马大定理:Claude 11天写出1300万行证明
Anthropic宣布,Claude在清华姚班毕业生彭天翼团队带领下,仅用11天完成费马大定理的首个端到端机器验证证明,产出1300万行代码、30300条定理,规模超Mathlib五倍,烧掉60亿Token,引发数学界震动。
2026-09-05