还没有音频。提交表单以生成音频。
探索不同用例和参数配置
elevenlabs/text-to-dialogue-v3 使用完整指南
通过 APIPASS,在 70 多种语言中构建自然、情感表达丰富的对话体验,支持精细控制、多说话人生成和灵活部署。

Eleven V3 (Alpha) API 是 ElevenLabs 迄今为止表现力最强的 Text to Speech 模型,旨在让语音听起来不再像机械合成,而更像真实且经过导演的表演。它超越了传统 AI 语音生成,能够理解情感细微差别、节奏和上下文,使生成的声音可以自然地低语、大笑、叹息并做出反应。借助 APIPASS,该 API 将先进的多说话人 Text to Dialogue 和内联音频标签直接带入你的生产工作流,帮助你构建沉浸式、情感丰富的音频叙事和交互式应用。
每个请求都必须包含 dialogue,且其值必须是非空数组。每一项都必须是同时包含 text 和 voice 的对象。
适配器仅接受 0、0.5 或 1 作为 stability 的值。如果省略该字段,适配器会在将任务转发到上游之前注入默认值 0.5。
你可以发送 language_code 来引导提供方。如果省略该字段,适配器会不传递该字段,并允许自动语言检测。
创作者可以在文本中使用内联标签,对语气、情绪和非语言反应进行精细控制,让语音听起来更像有意图的表达,而不是人工生成的声音。
该 API 原生支持多说话人 Text to Dialogue,可生成流畅对话,具备真实的轮次切换、节奏和打断效果,无需手动拼接独立语音轨道。
该模型能够在 70 多种语言中保持情感表达、细腻层次和韵律,非常适合国际受众和多语言产品。
Eleven V3 能够出色地理解脚本中的上下文和意图,在较长的口语段落中实现更好的重音、语流和情感连续性。
开发者可以从多种音频格式中进行选择,以满足应用需求,包括 MP3、PCM (S16LE)、μ-law、A-law 和 Opus。
平台不将用户限制在固定订阅方案中,而是采用灵活的额度系统,让团队可以根据真实需求无缝扩展用量并控制支出。
该集成遵循 ApiPass 异步任务的标准流程,该流程用于 Kie 支持的生成模型。
在 apipass.dev 创建账号并生成专属 API Key,以解锁访问权限并对你向 Eleven V3 API 发起的请求进行身份验证。
使用 apipass.dev playground 体验富有表现力的生成效果,测试各种音频标签,并在集成到正式生产环境之前预览多说话人对话行为。
在你的应用中定义请求结构,准备 dialogue 文本输入,设置说话人结构,并为具体用例选择合适的输出格式。
将 API 直接部署到你的服务、应用或内部工作流中,为创意或交互式平台提供语音功能。
随着产品增长,你可以在 apipass.dev 上轻松扩展 Eleven V3 API 的使用量,并使用同一技术基础同时支持简单语音生成和高级对话体验。
这些建议与适配器防护规则和上游 payload 结构保持一致。
为确保生成最可靠并保留表现力质量,请将文本请求控制在 2,000 个字符以内,并将长脚本按场景或说话人轮次等逻辑片段进行拆分。
将音频标签(如 [whispers] 或 [laughs])有意放在关键情绪节点,而不是连续使用;过度使用标签可能会让对话显得过于风格化且一致性下降。
插入省略号是影响节奏的有效方式,可引入微妙的延续思绪、停顿或犹豫,这对对话时机控制非常重要。
破折号有助于表示突然转向或句中打断,从而生成高度真实的对话流和动态节奏。
非常适合长篇叙事内容,让创作者能够制作有声书和故事,并呈现鲜明的角色情感与节奏,更接近真实表演。
轻松生成播客风格节目或采访模拟,具备真实的多说话人时机控制和情感连续性。
通过可信的性格表现、分支对话和叙事驱动的互动,让电子游戏角色和 NPC 栩栩如生,显著提升玩家沉浸感。
为 AI 头像、视频旁白和创意媒体工作流,将富有表现力的 Text to Speech 配音与视觉叙事无缝结合,在这些场景中,表达方式深刻影响用户体验。
文档使用 elevenlabs/text-to-dialogue-v3,是因为这是 Kie 适配器针对该功能识别的确切公开模型标识符。
readme 和 API 部分描述了代码中实现的相同规则:dialogue 为必填项,每一项都需要 text 和 voice,总文本必须控制在 5000 个字符以内,并且 stability 仅接受 0、0.5 或 1。
示例返回 resultUrls,是因为 Kie 适配器会将已完成任务的输出规范化为通用的 ApiPass resultJson 结构,该结构用于各类异步生成模型。
所有 API 都需要通过 Bearer Token 进行身份验证。
Authorization: Bearer
通过 ApiPass 统一 jobs API 创建新的 ElevenLabs Dialogue V3 音频生成任务
对于由 Kie 支持的异步模型,ApiPass 会保持公共请求封装稳定不变。对话生成参数通过 input 对象传入。
1{
2 "model": "elevenlabs/text-to-dialogue-v3",
3 "callBackUrl": "string (optional)",
4 "input": {
5 "dialogue": [
6 {
7 "text": "string",
8 "voice": "string"
9 }
10 ],
11 "stability": "0 | 0.5 | 1 (optional)",
12 "language_code": "string (optional)"
13 },
14 "channel": "auto"
15}model必填string用于 ElevenLabs 对话生成的 ApiPass 公共模型名称。
"elevenlabs/text-to-dialogue-v3"
callBackUrl可选string可选的回调 URL,用于接收任务完成通知。
"https://your-domain.com/api/callback"
channel可选string你可以通过 channel 参数在 APIPASS 中指定对应的提供商;这些提供商负责处理实际的图像和视频生成任务。APIPASS 目前提供三种提供商选项:
channel 参数的默认值为 auto。启用后,APIPASS 会根据实时价格和稳定性指标,在可用提供商之间自动分配任务,以平衡最低成本和可靠性能。除非你有自定义路由需求,否则请保留默认值 auto。
可用选项:
auto
input 对象包含 ApiPass 接受的对话生成字段。适配器会校验必需的 dialogue 项,并在省略 stability 时注入默认值。
input.dialogue必填array<object>对话数组。每一项都必须包含 text 和 voice,并且所有项的文本总长度不得超过 5000 个字符。
[{"text":"Hello and welcome.","voice":"BIvP0GN1cAtSRTxNHnWS"},{"text":"Thanks, let's begin.","voice":"aMSt68OGf4xUZAnLpTU8"}]input.stability可选number可选的稳定性控制。允许的值为 0、0.5 和 1。省略该字段时,适配器默认使用 0.5。
可用选项:
0.5
input.language_code可选string可选的语言代码,提供时会转发至上游。
"eng"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "elevenlabs/text-to-dialogue-v3",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "dialogue": [
9 {
10 "text": "Thanks for joining the launch review today. I want us to keep the tone warm and natural.",
11 "voice": "BIvP0GN1cAtSRTxNHnWS"
12 },
13 {
14 "text": "Absolutely. I will keep the pacing calm and conversational so the exchange feels like a real discussion.",
15 "voice": "aMSt68OGf4xUZAnLpTU8"
16 }
17 ],
18 "stability": 0.5,
19 "language_code": "eng"
20 }
21 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_elevenlabs_dialogue_1768468200000"
6 }
7}code状态码。200 表示任务已成功创建。
messageApiPass 返回的响应消息。
data.taskId用于后续状态查询的任务标识符。