下列所有模型通过统一 API、一个 key 即可调用。点击模型查看完整 playground 与文档。
| 模型 | model 参数 | 价格 | 说明 |
|---|---|---|---|
| Kling Custom Voice | kling-custom-voice | $0.006 / per call | Kling Custom Voice 从音频样本创建可复用的自定义音色:上传 5–30 秒、干净的单人音频(.mp3/.wav/.mp4/.mov),或引用一个历史视频 ID。生成的音色可用于 Kling TTS 与可灵对口型模型,让数字人 / 旁白用你的专属嗓音说话,再对到视频做口型同步。 |
| Kling Face Recognition | kling-identify-face | $0.01 / per call | Kling Face Recognition 在视频里识别人脸:传入 videoUrl 或 videoId,返回 sessionId 与一组 faceId。这些 ID 用于 Kling Lip-Sync Video——它是对口型流程的第一步,让你在多人视频里精确选定要对口型的那张脸,再对该人脸对齐音频。 |
| Kling Sound Effects | kling-sound-effects | $0.044 / per call | Kling Sound Effects 从文字描述生成音效(text-to-SFX),输出 3–10 秒音频。用自然语言描述想要的声音——「玻璃破碎」「雨打窗户」「碎石上的脚步声」——即可得到对应音效,适合游戏、视频与短片的拟音与氛围声,无需录音或购买素材库。 |
| Kling Video-to-Audio | kling-video-to-audio | $0.003 / per call | Kling Video-to-Audio 为视频自动生成匹配的音效与背景音乐(SFX + BGM),支持 3–20 秒视频,并提供 ASMR 模式。是给无声片快速配上贴合氛围与配乐的便捷方式,把原始或生成的片段变成沉浸式、可直接分享的内容。 |
| Kling TTS | kling-tts | $0.01 / per call | Kling TTS 是可灵的文本转语音,提供多种预置音色、可调语速,支持多语言,适合给视频、口播、提示音快速生成旁白。想用自己的嗓音,先用 Kling Custom Voice 克隆再在这里选用;同样的音色也可用于可灵对口型(Lip-Sync)模型。 |
| Minimax Speech 2.8 HD | minimax-speech-2.8-hd | $0.063 / 1K chars | MiniMax speech-2.8-hd 是 MiniMax(海螺)最新的高保真 TTS,能从上下文预测情感与语调,生成极自然、富表现力的个性化语音,适合社交、播客、有声书、新闻、教育与数字人。支持声音克隆与声音设计,$0.07/千字符。要又快又省可选 2.8 Turbo,要前代高保真可选 02 HD。 |
| Minimax Speech 2.8 Turbo | minimax-speech-2.8-turbo | $0.04 / 1K chars | MiniMax speech-2.8-turbo 是 MiniMax(海螺)最新的快速、经济 TTS,在大批量合成上有最佳性价比,韵律自然、多语言支持强。支持声音克隆与声音设计,$0.04/千字符(约 $0.4/一万字符)。要最高保真选同系列的 2.8 HD($0.07/千字符)。 |
| Minimax Speech 2.6 HD | minimax-speech-2.6-hd | $0.063 / 1K chars | Minimax Speech 2.6 HD 是 MiniMax(海螺)的高清异步文本转语音模型,主打丰富表现力与自然韵律,是其用于成品配音与内容创作的高质量档位。支持声音克隆(Voice Clone,复刻已有音色)与声音设计(Voice Design,定制新音色),再用该音色合成语音,适合需要稳定、专属音色的品牌口播、有声书与数字人。按字符计费,$0.07 / 千字符(约 $0.7 / 一万字符);系统预置音色不收额外费用,失败不扣费。 |
| Minimax Speech 02 HD | minimax-speech-02-hd | $0.063 / 1K chars | MiniMax speech-02-hd 是 MiniMax(海螺)的高保真 TTS,能从上下文智能预测情感与语调,生成极自然、个性化的语音,在社交、播客、有声书、新闻、教育与数字人等场景表现强。支持声音克隆与声音设计,$0.07/千字符;系统预置音色不额外收费。更新一代为 speech-2.8-hd,要又快又省可选 Turbo 档。 |
| Minimax Speech 02 Turbo | minimax-speech-02-turbo | $0.04 / 1K chars | Minimax Speech 02 Turbo 是 MiniMax(海螺)快速、经济的异步 TTS,支持声音克隆、声音设计、发音词典与多语言增强,$0.04/千字符(约 $0.4/一万字符),适合大批量、对成本敏感的语音合成。要最高保真可上 HD 档(2.6 HD / 2.8 HD / 02 HD,$0.07/千字符);2.8 系列为最新。 |
| Eleven Flash v2.5 | eleven-tts-flash | $0.0425 / 1K chars | Eleven Flash v2.5 是 ElevenLabs 的超低延迟文本转语音,支持 32 种语言,并支持 SSML 与音素控制,价格约低 50%。极低延迟使它非常适合实时对话场景——语音助手、客服机器人、互动 NPC。要更高质量(稍高延迟)选 Turbo v2.5;要最逼真选 Multilingual v2 或表现力最强的 Eleven v3。 |
| Eleven Turbo v2.5 | eleven-tts-turbo | $0.0425 / 1K chars | Eleven Turbo v2.5 是 ElevenLabs 高质量、低延迟的文本转语音,支持 32 种语言与 SSML,价格约低 50%。它在质量与速度间取得平衡,是重响应速度的开发场景的稳妥默认。要最低延迟选 Flash v2.5;要最逼真、富情感选 Multilingual v2 或 Eleven v3。 |
| Eleven Multilingual v2 | eleven-tts-multilingual | $0.085 / 1K chars | Eleven Multilingual v2 是 ElevenLabs 最逼真、情感最丰富的文本转语音档,支持 29 种语言,最适合配音、有声书与后期制作等对音质与情感表现要求高的场景。要低延迟实时对话选 Flash 或 Turbo v2.5;要最强表现力与音频标签控制,见 Eleven v3。 |
| Suno 音乐生成(v4/v5) | suno-v5 | $0.26 / per song (2 variants) | Suno 是音乐生成模型,不是文字转语音:给一句话,它把旋律、编曲、演唱和歌词一起写出来。在 APIMODELS 上只用一个模型名 `suno-v5`,具体走哪种模式由"你传了哪些字段"自动决定 —— 灵感模式(只给一句描述,歌词由它写)、自定义模式(唱你自己的词,支持 [Verse]/[Chorus] 结构标记)、纯音乐模式(无人声),以及续写、翻唱、局部改写(infill)、加伴奏、加人声、重制、哼唱成曲、拼接、歌手风格复用(persona)和音效。模型版本用 mv 参数指定,chirp-v5(默认)、chirp-v5-5、chirp-v4-5、chirp-v4 均可,不必换模型名。异步接口:提交拿 taskId,轮询取成品 mp3。计费按调用次数:歌曲 $0.26/次、每次返回 2 个版本(即单曲 $0.13),并附封面图与完整歌词;音效 $0.05/次;生成歌词和创建 persona 免费。适合短视频与广告配乐、游戏与 App 原声、品牌 jingle、播客片头片尾。请仅将生成音乐用于你有权使用的场景。 |
| Eleven v3 | eleven-tts-v3 | $0.085 / 1K chars | Eleven v3 是 ElevenLabs 表现力最强的文本转语音模型,覆盖 70+ 种语言。它最大的特色是「音频标签」(Audio Tags):在文本里写 [laughs]、[whispers]、[sighs] 等标记,即可直接控制笑声、耳语、叹息等情绪与副语言表现,让配音远比平铺直叙的 TTS 更像真人。适合对情感与细腻度要求高的内容:有声书、游戏角色、播客、动画与短视频配音。只需快速、低成本的常规旁白时,选 ElevenLabs 的 Turbo / Flash 档更划算。 |
| ElevenLabs Dialogue | eleven-dialogue | $0.085 / 1K chars | ElevenLabs Dialogue 是多角色对话生成模型,能让多个说话人自然轮替、对话流畅,适合播客、有声书与互动内容。相比单人 TTS,它专为多人对话优化,声音混合与衔接更自然。要单人朗读(旁白、单口有声书)用 ElevenLabs 的 TTS 档(Flash / Turbo / Multilingual / v3);要多角色对话用 Dialogue。 |
| Voice Isolator | eleven-isolator | $0.102 / min | Voice Isolator(人声分离)从背景噪声、音乐与环境音中提取干净的人声,用于后期制作。适合清理录音、播客 / 访谈降噪,以及为配音 / 译制准备干净的人声轨——常作为转写、TTS 对齐或重新混音前的第一步。 |
| AI Dubbing | eleven-dubbing | $0.2805 / min | AI Dubbing 是 ElevenLabs 的音视频翻译配音模型:把一段音频或视频翻译成另一种语言,同时保留原说话人的情感、节奏与语调,再自动做口型同步与声音克隆,让译制后听起来仍是「同一个人在说另一种语言」,支持约 29 种语言。它为「快速本地化已有视频 / 播客、无需重新找配音演员」而生:出海内容分发、多语言课程与教程、访谈 / 播客译制。配合平台其它语音与视频模型,可串起「翻译 → 配音 → 口型同步」的完整流程。 |
ElevenLabs 与 MiniMax TTS、Suno v5 音乐生成(有专页),以及 Kling TTS、音效、视频转音频、配音——统一端点和 Key。
在 POST /api/v1/audio/generations 用 model suno-v5,模式(灵感/自定义/翻唱/哼唱成曲…)由字段自动识别。详见 Suno 专页。