墨屿 MOYU
← 返回技能

技能教程 · TUTORIAL

AI 配音 / 音乐生成 · 详细教程

通过开放 API 把文字转成配音、生成背景音乐、克隆音色。需要你自己的 API Key,提交任务后轮询取回音频。

下载技能包

这是一个可以直接用的技能包(zip(约 15 KB))。下载解压后,按下面的「安装 / 用法」跑起来。

下载 AI 配音 / 音乐生成 · 详细教程 ↓

这是什么

audio-gen 是一个调用开放 API 做音频生成的 skill:文字转语音(TTS)、生成配乐、克隆音色,都走它。本 skill 只覆盖音频;要生图用 image-gen,要出视频用 video-gen

需要你自己的 API Key:它不内置额度,跑之前要配置好 Key,按平台计费。

适合谁 / 不适合谁

怎么部署

  1. 下载解压:点页面顶部的「下载 …」拿到 zip,解压得到一个 audio-gen/ 文件夹(里面是 SKILL.mdscripts/)。
  2. 装进 AI 助手:把整个 audio-gen/ 文件夹放进你所用助手的 skills 目录,助手就能自动发现它 ——
  1. 配好 Key:这个 skill 要调用平台 API,需要你自己的 sk- Key —— 见下一节「准备:配置 API Key」。
  2. 用起来:直接跟助手说要做什么(例:「把这段文字转成配音」),它会调用。

准备:配置 API Key

程序按这个顺序找 Key(找到第一个就用):

  1. 本 skill 目录下的 api_key.txt(与 SKILL.md 同级,内容就是一行 Key);
  2. 环境变量 AUDIOGEN_API_KEY(也认 VIDEOGEN_API_KEY / IMAGEGEN_API_KEY,同平台同一个 Key 三个 skill 通用);
  3. 文件 ~/.audio-gen/api_key.txt
  4. 都没有 → 到平台官网「开放API」页面创建 sk- 开头的 Key(平台 API 域名 https://api.lk888.ai),拿到后写入上面的 api_key.txt 保存,下次无需再问。
它已内置接口地址与鉴权方式,你不用关心底层 URL。

用法

音频比视频快(TTS 通常秒级到一两分钟,音乐几分钟),但仍然拆成「提交 + 查进度」两步,不要一条命令死等:

# 1) 看有哪些音频模型 / 某个模型的参数
python scripts/generate.py --list-models
python scripts/generate.py --show-model "doubao-tts-2.0"

# 2) 提交配音(文本走文件,避免中文乱码)
python scripts/generate.py --model "doubao-tts-2.0" --prompt-file text.txt \
  --params '{"voice_id":"zh_female_vv_uranus_bigtts","emotion":"happy"}' --submit-only

# 3) 隔 10–30 秒查一次(完成自动下载到 ./output)
python scripts/generate.py --task-id 58392 --out ./output

# 音乐:风格放顶层 prompt,歌词放 params.lyrics
python scripts/generate.py --model "suno-v4.5" --prompt-file style.txt \
  --params-file params.json --submit-only

以返回的 is_final 为唯一终点,不要按墙钟时间自行判定失败,也不要重复提交(会重复计费)。

选型(就三类)

你想要模型(API name)
配音 / 朗读 / 解说doubao-tts-2.0(36 个预置音色)、gem-3.1-tts / gem-2.5-tts(30 个预置音色,可描述情绪)、speech-2.8(海螺语音克隆,无预置音色)
歌曲 / 音乐生成suno-v4.5music-2.5+ / music-2.5
专属音色speech-2.8:先在平台官网完成音色克隆拿到 voice_id 再用

编码规则

已知边界(如实说,不吹)

想要加功能

包里目前是 SKILL.md + scripts/generate.py + references/models.md(音频模型速查)。想加专属音色工作流、批量生成、或接进你们自己的系统 → 用页面底部的联系方式找我,说清场景,我帮你做。