Noch kein Audio. Senden Sie das Formular ab, um Audio zu generieren.
Entdecken Sie verschiedene Anwendungsfälle und Parameterkonfigurationen
Vollständige Anleitung zur Verwendung von elevenlabs/text-to-dialogue-v3
Erstellen Sie natürliche, emotional ausdrucksstarke Dialogerlebnisse in über 70 Sprachen mit fein abgestimmter Steuerung, Multi-Speaker-Generierung und flexibler Bereitstellung über APIPASS.

Die Eleven V3 (Alpha) API ist das bislang ausdrucksstärkste Text-to-Speech-Modell von ElevenLabs und wurde entwickelt, um weniger wie mechanische Synthese und mehr wie eine echte, inszenierte Performance zu klingen. Es übertrifft herkömmliche KI-Sprachgenerierung, indem es emotionale Nuancen, Tempo und Kontext versteht, sodass generierte Stimmen flüstern, lachen, seufzen und natürlich reagieren können. Unterstützt durch APIPASS bringt diese API fortschrittliches Multi-Speaker Text-to-Dialogue und Inline-Audio-Tags direkt in Ihre Produktionsworkflows und ermöglicht Ihnen den Aufbau immersiver, emotional reichhaltiger Audio-Storytelling- und interaktiver Anwendungen.
Jede Anfrage muss dialogue als nicht leeres Array enthalten. Jedes Element muss ein Objekt sein, das sowohl text als auch voice enthält.
Der Adapter akzeptiert nur stability-Werte von 0, 0.5 oder 1. Wenn das Feld weggelassen wird, fügt der Adapter vor der Weiterleitung der Aufgabe upstream den Standardwert 0.5 ein.
Sie können language_code senden, um den Anbieter zu steuern. Wenn Sie es weglassen, lässt der Adapter das Feld aus und ermöglicht die automatische Spracherkennung.
Creator können Inline-Tags innerhalb des Textes verwenden, um Tonfall, Emotionen und nonverbale Reaktionen präzise zu steuern, sodass die Sprache bewusst gestaltet wirkt statt künstlich erzeugt.
Die API unterstützt Multi-Speaker Text-to-Dialogue nativ und ermöglicht fließende Gespräche mit realistischem Sprecherwechsel, Tempo und Unterbrechungen, ohne separate Sprachspuren manuell zusammenfügen zu müssen.
Das Modell bewahrt emotionale Darstellung, Nuancen und Prosodie in mehr als 70 Sprachen und eignet sich damit hervorragend für internationale Zielgruppen und mehrsprachige Produkte.
Eleven V3 interpretiert Kontext und Absicht aus Skripten außergewöhnlich gut, was zu verbesserter Betonung, Kadenz und emotionaler Kontinuität über längere gesprochene Passagen hinweg führt.
Entwickler können aus einer Vielzahl von Audioformaten wählen, passend zu den Anforderungen ihrer Anwendung, darunter MP3, PCM (S16LE), μ-law, A-law und Opus.
Anstatt Nutzer an starre Abonnementpläne zu binden, nutzt die Plattform ein flexibles kreditbasiertes System, mit dem Teams die Nutzung nahtlos skalieren und Ausgaben entsprechend der tatsächlichen Nachfrage kontrollieren können.
Die Integration folgt dem standardmäßigen asynchronen Job-Flow von ApiPass, der von Kie-gestützten Generierungsmodellen verwendet wird.
Erstellen Sie ein Konto auf apipass.dev und generieren Sie Ihren eindeutigen API Key, um den Zugriff freizuschalten und Ihre Anfragen an die Eleven V3 API zu authentifizieren.
Nutzen Sie den apipass.dev Playground, um mit ausdrucksstarker Generierung zu experimentieren, verschiedene Audio-Tags zu testen und das Verhalten von Multi-Speaker-Dialogen vor der Integration in Ihre Live-Produktionsumgebung vorzuschauen.
Definieren Sie die Anfrage-Strukturen in Ihrer Anwendung, indem Sie die dialogue-Texteingaben vorbereiten, die Sprecherstruktur einrichten und die passenden Ausgabeformate für Ihren konkreten Anwendungsfall auswählen.
Stellen Sie die API direkt in Ihrem Service, Ihrer Anwendung oder Ihrem internen Workflow bereit, um Sprachfunktionen auf Ihren kreativen oder interaktiven Plattformen zu ermöglichen.
Wenn Ihr Produkt wächst, können Sie Ihre Nutzung der Eleven V3 API auf apipass.dev einfach skalieren und dieselbe technische Grundlage sowohl für einfache Sprachgenerierung als auch für fortgeschrittene Dialogerlebnisse verwenden.
Diese Empfehlungen stimmen mit den Schutzmechanismen des Adapters und der Payload-Struktur des Upstream-Anbieters überein.
Um eine möglichst zuverlässige Generierung sicherzustellen und die Ausdrucksqualität zu bewahren, halten Sie Ihre Textanfragen bei oder unter 2,000 Zeichen und teilen Sie lange Skripte in logische Segmente wie Szenen oder Sprecherwechsel auf.
Platzieren Sie Audio-Tags (wie [whispers] oder [laughs]) bewusst an wichtigen emotionalen Momenten, anstatt sie durchgehend zu verwenden, da eine übermäßige Nutzung von Tags den Dialog zu stark stilisiert und weniger konsistent wirken lassen kann.
Das Einfügen von Auslassungspunkten ist eine effektive Methode, um das Tempo zu beeinflussen und subtile ausklingende Gedanken, Pausen oder Zögern einzuführen, was für das Timing von Gesprächen entscheidend ist.
Gedankenstriche helfen dabei, abrupte Richtungswechsel oder Unterbrechungen mitten im Satz zu kennzeichnen, wodurch ein sehr realistischer Gesprächsfluss und ein dynamischer Rhythmus entstehen.
Ideal für narrative Langform-Inhalte, da Creator Hörbücher und Geschichten erstellen können, die eine ausgeprägte Charakteremotion und ein Tempo vermitteln, das einer echten Performance näherkommt.
Erstellen Sie mühelos Podcast-ähnliche Episoden oder Interview-Simulationen mit realistischem Multi-Speaker-Timing und emotionaler Kontinuität.
Erwecken Sie Videospielcharaktere und NPCs mit glaubwürdigen Persönlichkeiten, verzweigten Gesprächen und erzählerisch geprägten Interaktionen zum Leben, die die Immersion der Spieler deutlich verbessern.
Stimmen Sie ausdrucksstarke Text-to-Speech-Voiceovers nahtlos auf visuelles Storytelling für KI-Avatare, Videonarration und kreative Medienworkflows ab, bei denen die Darbietung die Nutzererfahrung maßgeblich prägt.
Das Dokument verwendet elevenlabs/text-to-dialogue-v3, weil dies die exakte öffentliche Modellkennung ist, die vom Kie-Adapter für diese Funktion erkannt wird.
Die readme- und API-Abschnitte beschreiben dieselben Regeln, die im Code implementiert sind: dialogue ist erforderlich, jedes Element benötigt text und voice, der gesamte Text muss innerhalb von 5000 Zeichen bleiben, und stability akzeptiert nur 0, 0.5 oder 1.
Die Beispiele geben resultUrls zurück, weil der Kie-Adapter die Ausgabe abgeschlossener Aufgaben in die gemeinsame ApiPass resultJson-Struktur normalisiert, die in asynchronen Generierungsmodellen verwendet wird.
Alle APIs erfordern eine Authentifizierung über Bearer Token.
Authorization: Bearer
Erstellen Sie eine neue ElevenLabs Dialogue V3-Audiogenerierungsaufgabe über die einheitliche Jobs-API von ApiPass
ApiPass hält den öffentlichen Anfrage-Envelope über asynchrone, Kie-gestützte Modelle hinweg stabil. Parameter für die Dialoggenerierung werden im input-Objekt übergeben.
1{
2 "model": "elevenlabs/text-to-dialogue-v3",
3 "callBackUrl": "string (optional)",
4 "input": {
5 "dialogue": [
6 {
7 "text": "string",
8 "voice": "string"
9 }
10 ],
11 "stability": "0 | 0.5 | 1 (optional)",
12 "language_code": "string (optional)"
13 },
14 "channel": "auto"
15}modelErforderlichstringDer öffentliche ApiPass-Modellname für die Dialoggenerierung mit ElevenLabs.
"elevenlabs/text-to-dialogue-v3"
callBackUrlOptionalstringOptionale Callback-URL für Benachrichtigungen zum Aufgabenabschluss.
"https://your-domain.com/api/callback"
channelOptionalstringSie können den entsprechenden Anbieter innerhalb von APIPASS über den Parameter channel angeben; diese Anbieter übernehmen die eigentlichen Aufgaben zur Bild- und Videogenerierung. APIPASS bietet derzeit drei Anbieteroptionen:
Der Standardwert für den Parameter channel ist auto. Wenn aktiviert, verteilt APIPASS Aufgaben automatisch auf verfügbare Anbieter basierend auf Echtzeit-Preis- und Stabilitätsmetriken, um minimale Kosten und zuverlässige Leistung auszubalancieren. Behalten Sie den Standardwert auto bei, sofern Sie keine individuellen Routing-Anforderungen haben.
Verfügbare Optionen:
auto
Das input-Objekt enthält die von ApiPass akzeptierten Felder für die Dialoggenerierung. Der Adapter validiert erforderliche dialogue-Elemente und fügt den Standardwert für stability ein, wenn er ausgelassen wurde.
input.dialogueErforderlicharray<object>Dialog-Array. Jedes Element muss text und voice enthalten, und die gesamte kombinierte Textlänge über alle Elemente hinweg darf 5000 Zeichen nicht überschreiten.
[{"text":"Hello and welcome.","voice":"BIvP0GN1cAtSRTxNHnWS"},{"text":"Thanks, let's begin.","voice":"aMSt68OGf4xUZAnLpTU8"}]input.stabilityOptionalnumberOptionale Stabilitätssteuerung. Zulässige Werte sind 0, 0.5 und 1. Der Adapter verwendet standardmäßig 0.5, wenn dieses Feld ausgelassen wird.
Verfügbare Optionen:
0.5
input.language_codeOptionalstringOptionaler Sprachcode, der bei Angabe upstream weitergeleitet wird.
"eng"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "elevenlabs/text-to-dialogue-v3",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "dialogue": [
9 {
10 "text": "Thanks for joining the launch review today. I want us to keep the tone warm and natural.",
11 "voice": "BIvP0GN1cAtSRTxNHnWS"
12 },
13 {
14 "text": "Absolutely. I will keep the pacing calm and conversational so the exchange feels like a real discussion.",
15 "voice": "aMSt68OGf4xUZAnLpTU8"
16 }
17 ],
18 "stability": 0.5,
19 "language_code": "eng"
20 }
21 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_elevenlabs_dialogue_1768468200000"
6 }
7}codeStatuscode. 200 gibt an, dass die Aufgabe erfolgreich erstellt wurde.
messageVon ApiPass zurückgegebene Antwortnachricht.
data.taskIdAufgabenkennung, die für spätere Statusabfragen verwendet wird.