Aucune image pour le moment. Envoyez le formulaire pour générer une image.
Explorez différents cas d'utilisation et configurations de paramètres
Tarifs transparents sans frais cachés. Payez à l'utilisation.
| Règle & Modalité | Channel | Crédits | Prix (USD) | Prix officiel / référence | Économie quotidienne |
|---|---|---|---|---|---|
test otherGoogle | Regular | 999per run | $4.541 | - | - |
Guide complet d'utilisation de Gemini Omni
Générez un audio naturel, expressif et multilingue à partir de prompts textuels avec le modèle omnimodal Gemini de Google, via un point de terminaison unique et unifié.

Gemini Omni Audio API sur ApiPass vous permet de définir, nommer et enregistrer une voix — timbre, tonalité, humeur, accent et persona — sous forme de profil audio réutilisable qui renvoie un ID audio portable. Au lieu de redécrire une voix chaque fois que vous générez une vidéo ou animez un personnage, vous créez la voix une seule fois, puis vous la référencez dans des générations text-to-video, image-to-video et d’édition vidéo, avec un audio synchronisé produit lors de la même passe de génération. Comme Gemini Omni est nativement multimodal — il traite simultanément texte, image, audio et vidéo pour une sortie plus cohérente, constante et contrôlable — les profils vocaux que vous créez ici restent parfaitement synchronisés avec les visuels produits par le reste de la famille Gemini Omni sur ApiPass.
Évitez l’onboarding Vertex AI, les comptes de facturation et les rôles IAM. Une seule clé API ApiPass débloque instantanément Gemini Omni Audio.
Propulsé par l’architecture omnimodale phare de Google, qui raisonne nativement sur le texte et l’audio au sein d’un même modèle.
Basé sur la même génération audio Gemini qui offre une qualité audio nettement améliorée, donnant l’impression de parler avec une personne, avec des interactions vocales plus riches et plus naturelles parmi 30 voix HD en 24 langues.
Soumettez une seule fois, recevez un taskId, puis interrogez recordInfo ou utilisez callBackUrl pour des notifications push — idéal pour les générations longues sans bloquer vos serveurs.
Parlez dans plusieurs langues et le modèle passe de l’une à l’autre sans effort, sans aucune préconfiguration ; la langue n’est plus une barrière.
Suivez les coûts, la latence (costTime) et les taux de réussite de tous les modèles Gemini, Veo et Nano-Banana dans un seul tableau de bord ApiPass.
Convertissez de simples prompts textuels en paroles expressives et en sorties audio de qualité studio grâce à l’ossature Gemini Omni de Google.
En s’appuyant sur la pile audio de Gemini, capable de comprendre les expressions émotionnelles des utilisateurs et d’y répondre de façon appropriée pour des conversations plus nuancées, la sortie générée porte une intonation et une expressivité naturelles.
Chaque requête renvoie un taskId ; les résultats (y compris les resultUrls vers le fichier audio généré) peuvent être récupérés via recordInfo ou envoyés directement à votre callBackUrl.
Donnez à votre chatbot une voix naturelle et multilingue sans assembler des fournisseurs TTS, STT et LLM.
Convertissez des scripts, des articles ou des contenus longs en audio narré avec une prosodie réaliste.
Générez automatiquement des doublages et des voix off dans plus de 20 langues pour l’e-learning, le marketing ou le gaming.
Créez des lecteurs d’écran, de la narration en temps réel et des applications d’aide à la lecture qui sonnent humaines, et non robotiques.
Là où les surfaces audio officielles sont principalement optimisées pour des agents conversationnels en temps réel, la capacité ApiPass Gemini Omni Audio est optimisée pour la création d’assets — en produisant un profil vocal réutilisable qui s’intègre directement à la génération vidéo Gemini Omni.
L’accès officiel aux surfaces audio, vidéo et multimodales de Gemini est réparti entre différents points de terminaison, consoles et canaux de préversion. ApiPass consolide la famille Omni — audio, personnage, vidéo — derrière une seule clé API, un seul tableau de bord et un schéma JSON cohérent.
Remplacez les menus IVR rigides et préenregistrés par des réponses vocales dynamiques, sensibles au contexte et générées à la demande.
Alimentez des produits SaaS qui transforment des articles de blog, des tweets ou des scripts en clips audio partageables et en épisodes de podcast.
Produisez des exemples de prononciation de qualité native et des dialogues interactifs dans des dizaines de langues.
Donnez aux personnages non joueurs des voix uniques et expressives générées à l’exécution, au lieu de s’appuyer sur des répliques préenregistrées.
Inscrivez-vous sur apipass.dev et copiez votre jeton bearer depuis le tableau de bord.
Envoyez une requête POST à https://api.apipass.dev/api/v1/jobs/createTask avec "model": "google/gemini-omni-audio", votre prompt d’entrée et un callBackUrl facultatif. Vous recevrez un taskId en réponse.
Attendez le callback, ou effectuez une requête GET vers https://api.apipass.dev/api/v1/jobs/recordInfo?taskId=... pour récupérer l’URL audio finalisée depuis le champ resultJson.resultUrls une fois que state vaut success.
Toutes les API nécessitent une authentification via un token Bearer.
Authorization: Bearer
Soumettez une nouvelle tâche de génération ou de modification d’image Nano Banana 2
L’API accepte une charge utile JSON avec la structure suivante :
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "channel": "auto",
5 "input": {
6 // Input parameters
7 }
8}modelRequisstringNom du modèle à utiliser pour la génération
"google/nano-banana-2"
callBackUrlOptionnelstringURL de callback pour les notifications de fin de tâche. Si elle est omise, aucun callback ne sera envoyé.
"https://your-domain.com/api/callback"
channelOptionnelstringVous pouvez spécifier le fournisseur correspondant au sein d’APIPASS via le paramètre channel ; ces fournisseurs exécutent les tâches réelles de génération d’images et de vidéos. APIPASS propose actuellement trois options de fournisseur :
La valeur par défaut du paramètre channel est auto. Lorsqu’elle est activée, APIPASS répartit automatiquement les tâches entre les fournisseurs disponibles selon les tarifs en temps réel et les indicateurs de stabilité, afin d’équilibrer coût minimal et performances fiables. Conservez la valeur par défaut auto, sauf si vous avez des exigences de routage personnalisées.
Options disponibles :
auto
L’objet input contient les paramètres suivants :
input.promptRequisstringDescription textuelle de l’image que vous souhaitez générer
Décrivez le sujet, le style, l’éclairage et la composition pour obtenir les meilleurs résultats
"A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic"
input.image_inputOptionnelarray(URL)Images d’entrée à transformer ou à utiliser comme référence. Prend en charge jusqu’à 14 images.
Types acceptés : image/jpeg, image/png ; taille maximale : 30MB par image ; nombre maximal de fichiers : 14
["https://example.com/reference.jpg"]
input.aspect_ratioOptionnelstringRapport d’aspect de l’image générée. Par défaut, match_input_image lorsque image_input est fourni, sinon 1:1.
Options disponibles :
"16:9"
input.resolutionOptionnelstringRésolution de l’image générée. Les résolutions plus élevées produisent davantage de détails, mais prennent plus de temps à générer. Par défaut : 1K.
Options disponibles :
"1K"
input.output_formatOptionnelstringFormat de l’image de sortie. Par défaut : jpg.
Options disponibles :
"jpg"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "google/nano-banana-2",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "prompt": "A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic",
9 "aspect_ratio": "16:9",
10 "resolution": "1K",
11 "google_search": false,
12 "image_search": false,
13 "output_format": "jpg"
14 }
15 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}codeCode d’état, 200 en cas de réussite, toute autre valeur en cas d’échec
messageMessage de réponse, description de l’erreur en cas d’échec
data.taskIdID de tâche permettant de consulter l’état et les résultats de la tâche