Aucun audio pour le moment. Envoyez le formulaire pour générer de l'audio.
Explorez différents cas d'utilisation et configurations de paramètres
Guide complet d'utilisation de elevenlabs/text-to-dialogue-v3
Créez des expériences de dialogue naturelles et émotionnellement expressives dans plus de 70 langues, avec un contrôle précis, une génération multi-locuteurs et un déploiement flexible via APIPASS.

L’API Eleven V3 (Alpha) est le modèle Text to Speech le plus expressif d’ElevenLabs à ce jour, conçu pour sonner moins comme une synthèse mécanique et davantage comme une véritable performance dirigée. Il dépasse la génération vocale IA traditionnelle en comprenant les nuances émotionnelles, le rythme et le contexte, ce qui permet aux voix générées de chuchoter, rire, soupirer et réagir naturellement. Propulsée par APIPASS, cette API apporte le Text to Dialogue multi-locuteurs avancé et les balises audio intégrées directement dans vos workflows de production, vous permettant de créer des récits audio immersifs et riches en émotion ainsi que des applications interactives.
Chaque requête doit inclure dialogue sous forme de tableau non vide. Chaque élément doit être un objet contenant à la fois text et voice.
L’adaptateur accepte uniquement les valeurs de stability 0, 0.5 ou 1. Si le champ est omis, l’adaptateur injecte la valeur par défaut 0.5 avant de transmettre la tâche en amont.
Vous pouvez envoyer language_code pour guider le fournisseur. Si vous l’omettez, l’adaptateur n’inclut pas le champ et permet la détection automatique de la langue.
Les créateurs peuvent utiliser des balises intégrées dans le texte afin d’exercer un contrôle précis sur le ton, l’émotion et les réactions non verbales, donnant à la parole un rendu intentionnel plutôt qu’artificiellement généré.
L’API prend nativement en charge le Text to Dialogue multi-locuteurs, permettant des conversations fluides avec des tours de parole, un rythme et des interruptions réalistes, sans avoir à assembler manuellement des pistes vocales séparées.
Le modèle conserve l’expressivité émotionnelle, les nuances et la prosodie dans plus de 70 langues, ce qui le rend parfaitement adapté aux publics internationaux et aux produits multilingues.
Eleven V3 interprète exceptionnellement bien le contexte et l’intention des scripts, ce qui améliore l’accentuation, la cadence et la continuité émotionnelle dans les passages parlés plus longs.
Les développeurs peuvent choisir parmi divers formats audio pour répondre aux besoins de leur application, notamment MP3, PCM (S16LE), μ-law, A-law et Opus.
Au lieu d’enfermer les utilisateurs dans des abonnements rigides, la plateforme utilise un système flexible basé sur des crédits, permettant aux équipes d’adapter facilement leur utilisation et de maîtriser leurs dépenses en fonction de la demande réelle.
L’intégration suit le flux standard de tâches asynchrones ApiPass utilisé par les modèles de génération adossés à Kie.
Créez un compte sur apipass.dev et générez votre clé API unique pour débloquer l’accès et authentifier vos requêtes vers l’API Eleven V3.
Utilisez le playground apipass.dev pour expérimenter la génération expressive, tester différentes balises audio et prévisualiser le comportement des dialogues multi-locuteurs avant de l’intégrer à votre environnement de production.
Définissez les structures de requête dans votre application en préparant les entrées de texte du dialogue, en configurant la structure des locuteurs et en sélectionnant les formats de sortie appropriés à votre cas d’usage.
Déployez l’API directement dans votre service, application ou workflow interne afin d’alimenter des fonctionnalités vocales sur vos plateformes créatives ou interactives.
À mesure que votre produit se développe, vous pouvez facilement faire évoluer votre utilisation de l’API Eleven V3 sur apipass.dev, en utilisant la même base technique pour la génération vocale simple comme pour les expériences de dialogue avancées.
Ces suggestions sont alignées avec les garde-fous de l’adaptateur et la structure de payload en amont.
Pour garantir la génération la plus fiable possible et préserver la qualité expressive, limitez vos requêtes textuelles à 2,000 caractères ou moins et divisez les longs scripts en segments logiques, comme des scènes ou des tours de parole.
Placez les balises audio (comme [whispers] ou [laughs]) de manière intentionnelle aux moments émotionnels clés plutôt que de les utiliser en continu, car un usage excessif des balises peut rendre le dialogue trop stylisé et moins cohérent.
Insérer des points de suspension est un moyen efficace d’influencer le rythme, en introduisant de subtiles pensées inachevées, pauses ou hésitations, ce qui est essentiel pour le timing conversationnel.
Les tirets aident à indiquer des changements brusques de direction ou des interruptions en milieu de phrase, produisant un flux conversationnel très réaliste et un rythme dynamique.
Idéal pour les contenus narratifs longs, permettant aux créateurs de produire des livres audio et des histoires avec une émotion de personnage distincte et un rythme plus proches d’une véritable performance.
Générez facilement des épisodes de style podcast ou des simulations d’entretien avec un timing multi-locuteurs réaliste et une continuité émotionnelle.
Donnez vie aux personnages de jeux vidéo et aux PNJ avec des personnalités crédibles, des conversations ramifiées et des interactions guidées par la narration qui renforcent considérablement l’immersion des joueurs.
Alignez parfaitement des voix off Text to Speech expressives avec la narration visuelle pour les avatars IA, la narration vidéo et les workflows de médias créatifs où l’interprétation définit profondément l’expérience utilisateur.
Le document utilise elevenlabs/text-to-dialogue-v3 car il s’agit de l’identifiant public exact du modèle reconnu par l’adaptateur Kie pour cette fonctionnalité.
Le readme et les sections API décrivent les mêmes règles que celles implémentées dans le code : dialogue est obligatoire, chaque élément nécessite text et voice, le texte total doit rester dans la limite de 5000 caractères, et stability accepte uniquement 0, 0.5 ou 1.
Les exemples renvoient resultUrls, car l’adaptateur Kie normalise la sortie des tâches terminées dans la structure commune resultJson d’ApiPass utilisée par les modèles de génération asynchrone.
Toutes les API nécessitent une authentification via un token Bearer.
Authorization: Bearer
Créez une nouvelle tâche de génération audio ElevenLabs Dialogue V3 via l’API unifiée de tâches ApiPass
ApiPass conserve une enveloppe de requête publique stable pour les modèles asynchrones adossés à Kie. Les paramètres de génération de dialogue sont transmis dans l’objet input.
1{
2 "model": "elevenlabs/text-to-dialogue-v3",
3 "callBackUrl": "string (optional)",
4 "input": {
5 "dialogue": [
6 {
7 "text": "string",
8 "voice": "string"
9 }
10 ],
11 "stability": "0 | 0.5 | 1 (optional)",
12 "language_code": "string (optional)"
13 },
14 "channel": "auto"
15}modelRequisstringNom public du modèle ApiPass pour la génération de dialogue ElevenLabs.
"elevenlabs/text-to-dialogue-v3"
callBackUrlOptionnelstringURL de rappel facultative pour les notifications de fin de tâche.
"https://your-domain.com/api/callback"
channelOptionnelstringVous pouvez spécifier le fournisseur correspondant au sein d’APIPASS via le paramètre channel ; ces fournisseurs prennent en charge les tâches réelles de génération d’images et de vidéos. APIPASS propose actuellement trois options de fournisseur :
La valeur par défaut du paramètre channel est auto. Lorsqu’elle est activée, APIPASS répartit automatiquement les tâches entre les fournisseurs disponibles en fonction des prix en temps réel et des métriques de stabilité, afin d’équilibrer coût minimal et performances fiables. Conservez la valeur par défaut auto, sauf si vous avez des exigences de routage personnalisées.
Options disponibles :
auto
L’objet input contient les champs de génération de dialogue acceptés par ApiPass. L’adaptateur valide les éléments de dialogue obligatoires et injecte la valeur de stabilité par défaut lorsqu’elle est omise.
input.dialogueRequisarray<object>Tableau de dialogues. Chaque élément doit contenir text et voice, et la longueur totale combinée du texte de tous les éléments ne doit pas dépasser 5000 caractères.
[{"text":"Hello and welcome.","voice":"BIvP0GN1cAtSRTxNHnWS"},{"text":"Thanks, let's begin.","voice":"aMSt68OGf4xUZAnLpTU8"}]input.stabilityOptionnelnumberContrôle de stabilité facultatif. Les valeurs autorisées sont 0, 0.5 et 1. L’adaptateur utilise 0.5 par défaut lorsque ce champ est omis.
Options disponibles :
0.5
input.language_codeOptionnelstringCode de langue facultatif transmis en amont lorsqu’il est fourni.
"eng"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "elevenlabs/text-to-dialogue-v3",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "dialogue": [
9 {
10 "text": "Thanks for joining the launch review today. I want us to keep the tone warm and natural.",
11 "voice": "BIvP0GN1cAtSRTxNHnWS"
12 },
13 {
14 "text": "Absolutely. I will keep the pacing calm and conversational so the exchange feels like a real discussion.",
15 "voice": "aMSt68OGf4xUZAnLpTU8"
16 }
17 ],
18 "stability": 0.5,
19 "language_code": "eng"
20 }
21 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_elevenlabs_dialogue_1768468200000"
6 }
7}codeCode d’état. 200 indique que la tâche a été créée avec succès.
messageMessage de réponse renvoyé par ApiPass.
data.taskIdIdentifiant de tâche utilisé pour les vérifications ultérieures de l’état.