用自然语言描述生成目标音频。把一段场景描述(人声对话、环境声、音效、背景音乐等复合音频)一次性生成成音频。当用户描述一个声音场景、要求生成/合成/制作一段音频或声音、给出形如"角色:台词"的对话脚本要转成音频、或要按参考音频的音色说话时使用。支持两种模式:纯文本描述生成(T2A)和带参考音频生成(A2A,在描述中引用参考音频指定角色音色)
Scanned 9/12/2026
Install to Claude Code
npx -y skills add ahang1598/doubao-workbuddy-qwenwork-skills --skill seed-audio --agent claude-codeInstalls into .claude/skills of the current project.
Are you the author of Seed Audio?
Add the live security badge to your README — it updates automatically with every re-scan.
[](https://www.skillsdirectory.com/skills/ahang1598-seed-audio)More formats (shields.io, HTML) on the badges page.
---
name: seed-audio
description: 用自然语言描述生成目标音频。把一段场景描述(人声对话、环境声、音效、背景音乐等复合音频)一次性生成成音频。当用户描述一个声音场景、要求生成/合成/制作一段音频或声音、给出形如"角色:台词"的对话脚本要转成音频、或要按参考音频的音色说话时使用。支持两种模式:纯文本描述生成(T2A)和带参考音频生成(A2A,在描述中引用参考音频指定角色音色)
version: 0.2.0
---
# seed-audio 使用指南
用自然语言描述一段目标音频,直接生成音频结果。描述可以简单到一句台词,也可以复杂到包含环境声、背景音乐、多角色对话、音效的完整场景。
## 两种模式
| 模式 | 何时使用 | Skill |
| ---- | ------------------------------ | ------------------------ |
| T2A | 描述里**没有任何参考音频指代** | [T2A](references/T2A.md) |
| A2A | 描述里**有参考音频指代** | [A2A](references/A2A.md) |
判定规则:扫一遍用户给出的音频描述,只要出现任何形式的参考音频指代(`@音频N`、「参考音频 1」「第一个音频」「附件 1」、或用附件文件名如「用麻雀的」引用等)就走 A2A,否则走 T2A。
## 意图识别
用户的输入通常是「意图前缀 + 音频描述」两部分。常见前缀形式:
- `给我生成一段声音/音频:{{音频描述}}`
- `按照以下要求,生成声音/音频:{{音频描述}}`
- `帮我合成/制作一段音频:{{音频描述}}`
- `把下面这段变成声音:{{音频描述}}`
- 直接给出音频描述,没有前缀
构造 tool input 的 `prompt` 时,**只保留音频描述本体,去掉其他无关内容**。例如用户输入「给我生成一段声音:男性 (青年): "你好呀!"」,传给 tool 的 `prompt` 应为 `男性(青年): "你好呀!"`。
## 通用原则
### 要做
- **原样保留用户描述**:用户给的音频描述(角色设定、环境描写、台词等)整体作为 `prompt`,不改写、不补全、不翻译、不重排。
- **复杂场景单次调用**:无论描述多长、包含多少角色和环境音,整段作为一个 `prompt` 一次调用,不要按角色或场景拆成多次调用。
- **只剥离与音频描述无关的内容**:用户输入里「给我生成一段音频」「按照以下要求」这类与音频内容无关的部分要去掉,其他与音频描述相关的文字一律保留。
- **以最长匹配构造 `prompt`**:尽量把更像音频描述的文字保留进 `prompt`,只把明显是描述边界外的其余内容拆出 `prompt`;对于时长,如果用户有指定时长的话,我们是应该从意图中提取时长的值,但时长本身也可以是提示词的一部分,而不是成为音频描述的硬分界符。
### 不要做
- **不要篡改或润色用户描述**:不要把「青年男性」改成「年轻男子」、不要把台词改写得更通顺、不要补充用户没说的环境细节或情绪标注。
- **不要拆分调用**:多角色对话、多段场景不要拆成多次 tool 调用再拼接,一次性把整段描述传给 tool。
- **不要自作主张补充参数**:严格遵循各 tool 的入参定义,只传 tool 明确要求的字段,不自行添加任何额外字段。
- **不要处理与生成音频无关的请求**:音色克隆注册等场景不归本 skill
Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.
No comments yet. Be the first to comment!