技能教程 · TUTORIAL
AI 配音 / 音乐生成 · 详细教程
通过开放 API 把文字转成配音、生成背景音乐、克隆音色。需要你自己的 API Key,提交任务后轮询取回音频。
这是什么
audio-gen 是一个调用开放 API 做音频生成的 skill:文字转语音(TTS)、生成配乐、克隆音色,都走它。本 skill 只覆盖音频;要生图用 image-gen,要出视频用 video-gen。
需要你自己的 API Key:它不内置额度,跑之前要配置好 Key,按平台计费。
适合谁 / 不适合谁
- ✅ 给短视频配解说、朗读文章、做配音。
- ✅ 生成背景音乐、按风格出歌。
- ✅ 克隆自己的声音(先在平台完成音色克隆拿到 voice_id)。
- ❌ 不处理视频画面、不处理图片。要那类去找对应的 skill。
怎么部署
- 下载解压:点页面顶部的「下载 …」拿到 zip,解压得到一个
audio-gen/文件夹(里面是SKILL.md和scripts/)。 - 装进 AI 助手:把整个
audio-gen/文件夹放进你所用助手的 skills 目录,助手就能自动发现它 ——
- WorkBuddy / CodeBuddy(用户级):
~/.workbuddy/skills/audio-gen/,Windows 上是C://Users//<你的用户名>//.workbuddy//skills//audio-gen//; - 只想在某个项目里用:
<项目目录>/.workbuddy/skills/audio-gen/。
- 配好 Key:这个 skill 要调用平台 API,需要你自己的
sk-Key —— 见下一节「准备:配置 API Key」。 - 用起来:直接跟助手说要做什么(例:「把这段文字转成配音」),它会调用。
准备:配置 API Key
程序按这个顺序找 Key(找到第一个就用):
- 本 skill 目录下的
api_key.txt(与 SKILL.md 同级,内容就是一行 Key); - 环境变量
AUDIOGEN_API_KEY(也认VIDEOGEN_API_KEY/IMAGEGEN_API_KEY,同平台同一个 Key 三个 skill 通用); - 文件
~/.audio-gen/api_key.txt; - 都没有 → 到平台官网「开放API」页面创建
sk-开头的 Key(平台 API 域名https://api.lk888.ai),拿到后写入上面的api_key.txt保存,下次无需再问。
它已内置接口地址与鉴权方式,你不用关心底层 URL。
用法
音频比视频快(TTS 通常秒级到一两分钟,音乐几分钟),但仍然拆成「提交 + 查进度」两步,不要一条命令死等:
# 1) 看有哪些音频模型 / 某个模型的参数
python scripts/generate.py --list-models
python scripts/generate.py --show-model "doubao-tts-2.0"
# 2) 提交配音(文本走文件,避免中文乱码)
python scripts/generate.py --model "doubao-tts-2.0" --prompt-file text.txt \
--params '{"voice_id":"zh_female_vv_uranus_bigtts","emotion":"happy"}' --submit-only
# 3) 隔 10–30 秒查一次(完成自动下载到 ./output)
python scripts/generate.py --task-id 58392 --out ./output
# 音乐:风格放顶层 prompt,歌词放 params.lyrics
python scripts/generate.py --model "suno-v4.5" --prompt-file style.txt \
--params-file params.json --submit-only
以返回的 is_final 为唯一终点,不要按墙钟时间自行判定失败,也不要重复提交(会重复计费)。
选型(就三类)
| 你想要 | 模型(API name) |
|---|---|
| 配音 / 朗读 / 解说 | doubao-tts-2.0(36 个预置音色)、gem-3.1-tts / gem-2.5-tts(30 个预置音色,可描述情绪)、speech-2.8(海螺语音克隆,无预置音色) |
| 歌曲 / 音乐生成 | suno-v4.5、music-2.5+ / music-2.5 |
| 专属音色 | speech-2.8:先在平台官网完成音色克隆拿到 voice_id 再用 |
- 页面显示名 ≠ API 模型名(如「豆包 语音合成 2.0」的 API name 是
doubao-tts-2.0),model字段必须填后者。 - 参数值一律用接口给的
value原样传,不要自己发明取值;具体以--show-model实时返回为准。
编码规则
- 中文文本不要直接放命令行参数(Windows 控制台默认 GBK 会乱码),写进 UTF-8 文件用
--prompt-file传,歌词也可以写进--params-file的 JSON 里。 - 提交前可查余额;不足时先充值,不要反复重试。
已知边界(如实说,不吹)
- 失败任务余额自动退回;按
error.type分类处置(参数错误就改参数、Key 无效就检查 Key、余额不足就充值、频率限制就退避),不要对错误文案做文本匹配。 - 接口行为以平台实时返回为准,模型上下架、参数变化以
--show-model查到的为准。
想要加功能
包里目前是 SKILL.md + scripts/generate.py + references/models.md(音频模型速查)。想加专属音色工作流、批量生成、或接进你们自己的系统 → 用页面底部的联系方式找我,说清场景,我帮你做。