🔥LIMITED OFFER
01:58:23
GET 50% OFF
全场景 AI 音频

使用 Seed Audio 1.0 指导整个声音场景。

借助 Seed Audio 1.0,超越单一音轨。将说话人、情感、环境、音乐和声音事件描述为一个紧凑的制作简报,然后前往 SeedAudio.co 生成结果。

外部生成器 · 打开 SeedAudio.co

制作层
制作层
场景简报

两名侦探在雨淋的小巷中低语。保持两人声音克制且靠近。加入远处的交通声、低悬疑背景音、湿脚步声,然后一声金属门砰然关上。

对话

2位说话人 · 克制

环境音

雨 · 交通 · 小巷

音乐

低悬疑背景

音效

脚步声 · 门砰

提示中描述的各层视觉映射——非实时生成器。

1个提示

指导完整场景

最多3个

可选音频参考

1张图片

作为替代参考

≈ 2分钟

单次最大输出

有用的区别

一份制作简报,而不仅仅是一行文字。

传统文本转语音只是朗读文字。Seed Audio 1.0 围绕声音、时间、地点、音乐和事件之间的关系设计——当输出应该像一个场景而不是孤立的叙述时,这很有用。

传统文本转语音

  • 一段脚本变成一条音轨
  • 环境音和效果之后添加
  • 说话人轮次通常需要手动组装

场景级生成

  • 多个说话人共享一个指导
  • 情感和节奏属于提示
  • 环境音、音乐和效果跟随场景

你可以指导什么

四个决策塑造初版。

保持每个决策具体。模型需要猜测的工作更少,当混音需要再次调整时,你也有更明确的目标。

01

说话人和表达

指定说话人数量、语言、声音质感、情感强度、节奏和清晰度优先级。仅在声音身份或风格真正重要时使用参考。

02

地点和氛围

用一条清晰的环境音底设置声学空间:安静的录音室、雨街、拥挤的市场、森林边缘、车辆内部或其他特定环境。

03

音乐指导

描述音乐的作用而非堆叠流派。说明情绪、乐器、强度以及背景音应该何时进入或淡出。

04

按播放顺序的事件

仅按听众应听到的顺序放置重要的声音——脚步声、通知、门声、呼吸声、撞击声或结束提示。

可重复的工作流程

像音频导演一样编写场景。

最安全的提示要足够短以便遵循,又要足够具体以便呈现。分四步构建,然后先修改最嘈杂的层。

  1. 01

    构建场景框架

    从格式、设定、受众、语言、情绪和大致时长开始。这确定了音频应该做什么。

  2. 02

    编排人声

    定义说话人角色并编写对话或叙述。将情感和节奏提示放在它们影响的对白旁边。

  3. 03

    仅添加必要层

    选择一条环境音底、一个音乐指导以及少量声音事件。更多层并不自动创造更丰富的结果。

  4. 04

    聆听、隔离、修改

    如果语音被淹没或场景感觉拥挤,一次移除或柔化一个层。将请求的时长视为指导,并为最终剪辑留出空间。

适用场景

在最终混音前用声音建立世界。

Seed Audio 1.0 在声音和上下文需要同时出现时最为有用。它可以加速探索,而最终制作仍受益于编辑和人工审查。

短片预可视化

在画面锁定前安排对话、环境音、拟音和音乐,以便评估场景的节奏和情感形态。

广告和社交概念

草拟本地化广告片、产品时刻、活动钩子和以声音为主导的社交片段,无需单独组装每个音频层。

游戏和互动媒体

在确定最终录制流程之前,探索角色语音、环境循环、UI 时刻和过场动画方向。

播客和学习

原型化主持人交流、基于场景的课程、引导式讲解和章节开头,包含节奏和背景纹理。

提示结构

按照听众应该听到的顺序编写。

时间线比一团标签更容易遵循。以此紧凑结构为起点,然后删除场景不需要的任何指示。

prompt-brief.txt提示结构
01场景

创建一个35秒的英语广播剧场景,地点在午夜雨淋的小巷。

02声音

两名侦探以克制的紧张感低语;保持每句对白清晰且靠近。

03环境音

使用稳定的小雨、远处的交通声和狭窄的户外声学空间。

04音乐

添加一个低悬疑背景音,保持在对话下方,并在最后节拍前淡出。

05事件

在第二句对白后放置两个湿脚步声,然后以一声金属门砰然关上结束。

如果结果感觉混乱,在添加更多细节前先移除一个层。

生成之前

知道初稿的终点。

场景生成是探索方向的快速方式,而非最终母版承诺。在花费时间优化提示前,设定正确的期望。

时长是近似的

请求的长度和事件放置指导输出,但帧精确的编辑可能仍需要在音频或视频编辑器中修剪。

密集提示可能模糊混音

太多角色、效果、音乐变化或情感节拍可能相互竞争。从窄范围开始,仅在核心场景运作后添加复杂性。

专用音乐工具可能更适合

当音乐支持场景时使用 Seed Audio 1.0。当歌曲本身是主要交付物时,以音乐为先的工作流程可能更合适。

参考需要许可

仅上传你有权使用的音频和图片。避免模仿公众人物或重新创建受保护的角色和声音。

实用解答

常见问题

什么是 Seed Audio 1.0?

Seed Audio 1.0 被呈现为一个场景级 AI 音频模型,可以同时指导语音、表达、环境音、背景音乐和音效。此页面是一个独立指南,并链接到 SeedAudio.co 进行生成。

Seed Audio 1.0 与文本转语音有何不同?

文本转语音通常将脚本转换为音轨。Seed Audio 1.0 专为更广泛的声学场景设计,其中说话人互动、环境、音乐、时间和效果可以在同一份制作简报中描述。

我可以使用音频或图片参考吗?

SeedAudio.co 的 API 文档描述支持最多三个音频参考或一个图片参考。这些参考类型不能在同一请求中组合,并且每个上传的资产应获得许可使用。

我可以在此页面生成音频吗?

不能。此页面仅用于介绍 Seed Audio 1.0,不提供生成器功能。主按钮会打开 SeedAudio.co,你可以在那里直接查看账户要求、当前参数、价格和生成服务的可用状态。

Seed Audio 1.0 是开源的吗?

不要将 Seed Audio 1.0 视为开源或开放权重发布。当前通过托管服务和 API 提供访问。

从简报初剪

为整个场景赋予声音。

从专注的制作简报开始,保持各层有目的性,当准备生成时前往 SeedAudio.co。

尝试 Seed Audio 1.0

你将离开 Nanabanana 并打开 SeedAudio.co。

研究依据: 能力和工作流程说明已根据 SeedAudio.co 产品文档、其提示指南和 API 参考、字节跳动 Seed 的公共模型索引以及最近的创作者讨论进行了审查。服务控制可能会变化。

研究依据