Aucune vidéo pour le moment. Envoyez le formulaire pour générer une vidéo.
Explorez différents cas d'utilisation et configurations de paramètres
Tarifs transparents sans frais cachés. Payez à l'utilisation.
| Règle & Modalité | Channel | Crédits | Prix (USD) | Prix officiel / référence | Économie quotidienne |
|---|---|---|---|---|---|
with-video-720p videoGoogleresolution: 720p | Regular | 268per run | $1.218 | - | - |
with-video-1080p videoGoogleresolution: 1080p | Regular | 270per run | $1.227 | - | - |
with-video-4k videoGoogleresolution: 4k | Regular | 400per run | $1.818 | - | - |
no-video-720p-4s videoGoogleduration: 4, resolution: 720p | Regular | 102per run | $0.464 | - | - |
no-video-720p-6s videoGoogleduration: 6, resolution: 720p | Regular | 135per run | $0.614 | - | - |
no-video-720p-8s videoGoogleduration: 8, resolution: 720p | Regular | 168per run | $0.764 | - | - |
no-video-720p-10s videoGoogleduration: 10, resolution: 720p | Regular | 200per run | $0.909 | - | - |
no-video-1080p-4s videoGoogleduration: 4, resolution: 1080p | Regular | 103per run | $0.468 | - | - |
no-video-1080p-6s videoGoogleduration: 6, resolution: 1080p | Regular | 136per run | $0.618 | - | - |
no-video-1080p-8s videoGoogleduration: 4, resolution: 1080p | Regular | 168per run | $0.764 | - | - |
no-video-1080p-10s videoGoogleduration: 10, resolution: 1080p | Regular | 202per run | $0.918 | - | - |
no-video-4k-4s videoGoogleduration: 4, resolution: 4k | Regular | 233per run | $1.059 | - | - |
no-video-4k-6s videoGoogleduration: 6, resolution: 4k | Regular | 268per run | $1.218 | - | - |
no-video-4k-8s videoGoogleduration: 8, resolution: 4k | Regular | 300per run | $1.364 | - | - |
no-video-4k-10s videoGoogleduration: 10, resolution: 4k | Regular | 335per run | $1.523 | - | - |
Guide complet d'utilisation de Gemini Omni
Générez des vidéos IA cinématographiques et sensibles à la physique avec le modèle Gemini Omni de Google — combinées à des personnages et des voix réutilisables — via un seul endpoint ApiPass.

L’API Gemini Omni Video sur ApiPass est l’interface de génération vidéo de Gemini Omni Flash de Google, un modèle multimodal haute performance conçu pour la génération vidéo rapide, le montage et le contrôle cinématographique. Au lieu d’exécuter le text-to-video comme un appel isolé, ApiPass expose Gemini Omni Video comme la couche de composition de la famille Omni : vous pouvez transmettre des ressources de personnages réutilisables et des profils vocaux que vous avez déjà créés sur ApiPass, puis obtenir une vidéo entièrement rendue avec des visuels et un audio synchronisés. Gemini Omni traite simultanément le texte, l’image, l’audio et la vidéo, ce qui vous offre des résultats plus cohérents, constants et contrôlables — et ApiPass encapsule cette capacité derrière une seule clé API, aux côtés du reste de son catalogue de modèles.
Au lieu de gérer des comptes séparés, des accès en preview ou une configuration cloud, ApiPass vous donne accès à Gemini Omni Video avec la même clé API que vous utilisez déjà pour le reste du catalogue de modèles.
Gemini Omni Video accepte n’importe quelle combinaison de texte, d’image, de vidéo et d’audio dans un même prompt, ce qui vous permet d’amorcer les générations à partir de véritables ressources créatives plutôt que d’un prompt texte vide.
Ancrée dans un modèle de physique du monde réel, l’API restitue des reflets, la gravité, l’éclairage et la météo de manière crédible, afin que les scènes restent visuellement cohérentes au lieu de dériver vers des artefacts, même dans les plans dynamiques.
Vous pouvez guider une génération avec plusieurs images de référence et de courts clips vidéo, et le modèle conserve la cohérence des sujets, du style et de la scène, en maintenant l’identité stable au fil des montages et des plans.
Le montage conversationnel vous permet d’affiner et de modifier vos vidéos de manière itérative en langage naturel, afin de retravailler une scène sans reconstruire tout le prompt depuis zéro.
Gemini Omni combine une vaste connaissance du monde avec de solides capacités vidéo — il comprend le contexte culturel, les cadres historiques et l’exactitude scientifique, générant des vidéos qui ont du sens et ne se contentent pas d’être esthétiques, ce qui est utile lorsque les prompts font référence à des époques, des lieux ou des concepts spécifiques nécessitant une cohérence factuelle.
L’API Gemini Omni prend en charge le montage vidéo en langage naturel, permettant aux utilisateurs d’affiner une scène étape par étape au lieu de reconstruire le prompt complet à chaque fois. Un utilisateur peut changer l’environnement, ajuster l’action, remplacer des objets, modifier l’angle de caméra ou ajouter des effets visuels tout en conservant la cohérence de la scène d’origine. Cela la rend utile pour les éditeurs vidéo IA, les outils de création et les applications où les utilisateurs ont besoin d’un moyen plus intuitif de transformer des séquences existantes.
Gemini Omni Video relie la création visuelle à des connaissances en physique, histoire, biologie, culture et logique narrative. Cela aide les vidéos générées à paraître moins aléatoires et plus intentionnelles, ce qui est précieux pour les vidéos explicatives, la narration cinématographique, les concepts produit et les contenus éducatifs.
Le texte peut définir la direction, les images peuvent guider les sujets ou le style, la vidéo peut fournir le mouvement et le contexte de scène, et l’audio ou les ressources de personnages peuvent soutenir des workflows pilotés par la parole ou sensibles à l’identité. Cela aide les développeurs à créer des outils vidéo qui partent de véritables ressources créatives plutôt que d’un simple prompt vide.
Gemini Omni Video peut prendre en charge des scénarios de type avatar où la présence du personnage, l’expression, l’intonation et l’environnement doivent sembler connectés. C’est utile pour les clips de présentateur, les contenus menés par des personnages, les médias interactifs et les produits vidéo créatifs tournés vers l’avenir.
Clips verticaux générés à partir d’un prompt et d’une seule image de référence, avec un protagoniste réutilisable dans chaque épisode.
Variantes publicitaires localisées qui partagent un même porte-parole et une même voix conformes à la marque, tout en changeant de produit, de message ou de marché.
Contenu éducatif, scènes historiquement exactes et narration riche en connaissances où la cohérence factuelle compte autant que la qualité visuelle.
Workflows de type avatar pilotés par la parole, où l’interprétation vocale guide le résultat final, utiles pour les vidéos de présentateur, les dialogues de personnages, les scènes narrées et les clips générés où la voix, l’expression et l’action à l’écran doivent sembler connectées.
L’accès officiel à Gemini Omni est actuellement réparti entre des parcours en preview, plusieurs consoles et des interfaces d’entreprise. ApiPass le consolide derrière une seule clé API, aux côtés du reste de votre stack de modèles, de sorte que l’intégration se limite à un changement de base-URL et de clé plutôt qu’à l’onboarding d’un nouveau fournisseur.
L’API officielle traite chaque génération comme une requête autonome. Sur ApiPass, Gemini Omni Video est conçu pour consommer les ressources de personnages et de voix que vous avez déjà créées sur la plateforme via les capacités Gemini Omni Character et Gemini Omni Audio — vous pouvez ainsi maintenir une bibliothèque d’identités et de voix, puis les intégrer à n’importe quelle tâche vidéo ultérieure.
Produire des vidéos épisodiques au format court nécessitant un protagoniste, un narrateur et un style visuel réutilisables.
Livrer des variantes publicitaires localisées et personnalisées qui restent conformes à la marque sur différents marchés et permutations créatives.
Transformer des scripts de cours et des plans de leçon en vidéos pédagogiques narrées et portées par des personnages, avec des scènes historiquement ou scientifiquement fondées.
Produire des cinématiques, des bandes-annonces et des séquences narratives in-app où le même personnage apparaît de manière fiable à travers de nombreux plans et itérations.
Créez un compte ApiPass et générez une clé API depuis votre tableau de bord pour débloquer toute la famille Gemini Omni — vidéo, personnage et audio — aux côtés du reste du catalogue de modèles.
Rédigez un prompt de scène et, si nécessaire, rassemblez vos ressources de référence — images, courte vidéo source, ressource de personnage réutilisable et profil vocal depuis Gemini Omni Audio — afin que le modèle dispose de tout ce dont il a besoin pour maintenir la cohérence de l’identité, du ton et du style.
Appelez Gemini Omni Video avec votre prompt et les entrées choisies, examinez le clip généré, puis affinez-le au moyen de modifications conversationnelles jusqu’à ce que la scène, le mouvement et l’interprétation correspondent à votre direction créative.
Toutes les API nécessitent une authentification via un token Bearer.
Authorization: Bearer
Soumettre une nouvelle tâche de génération ou d’édition d’image Nano Banana 2
L’API accepte une charge utile JSON avec la structure suivante :
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "channel": "auto",
5 "input": {
6 // Input parameters
7 }
8}modelRequisstringLe nom du modèle à utiliser pour la génération
"google/nano-banana-2"
callBackUrlOptionnelstringURL de callback pour les notifications de fin de tâche. Si elle est omise, aucun callback ne sera envoyé.
"https://your-domain.com/api/callback"
channelOptionnelstringVous pouvez spécifier le fournisseur correspondant dans APIPASS via le paramètre channel ; ces fournisseurs traitent les tâches réelles de génération d’images et de vidéos. APIPASS propose actuellement trois options de fournisseurs :
La valeur par défaut du paramètre channel est auto. Lorsqu’il est activé, APIPASS répartit automatiquement les tâches entre les fournisseurs disponibles selon les prix en temps réel et les métriques de stabilité, afin d’équilibrer coût minimal et performances fiables. Conservez la valeur par défaut auto, sauf si vous avez des besoins de routage personnalisés.
Options disponibles :
auto
L’objet input contient les paramètres suivants :
input.promptRequisstringDescription textuelle de l’image que vous souhaitez générer
Décrivez le sujet, le style, l’éclairage et la composition pour obtenir les meilleurs résultats
"A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic"
input.image_inputOptionnelarray(URL)Images d’entrée à transformer ou à utiliser comme référence. Prend en charge jusqu’à 14 images.
Types acceptés : image/jpeg, image/png ; taille maximale : 30MB par image ; nombre maximal de fichiers : 14
["https://example.com/reference.jpg"]
input.aspect_ratioOptionnelstringFormat d’image de l’image générée. Par défaut, match_input_image lorsque image_input est fourni, sinon 1:1.
Options disponibles :
"16:9"
input.resolutionOptionnelstringRésolution de l’image générée. Les résolutions plus élevées produisent plus de détails, mais prennent plus de temps à générer. Valeur par défaut : 1K.
Options disponibles :
"1K"
input.output_formatOptionnelstringFormat de l’image de sortie. Valeur par défaut : jpg.
Options disponibles :
"jpg"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "google/nano-banana-2",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "prompt": "A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic",
9 "aspect_ratio": "16:9",
10 "resolution": "1K",
11 "google_search": false,
12 "image_search": false,
13 "output_format": "jpg"
14 }
15 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}codeCode d’état, 200 en cas de succès, autres valeurs en cas d’échec
messageMessage de réponse, description de l’erreur en cas d’échec
data.taskIdID de tâche utilisé pour consulter l’état et les résultats de la tâche

ByteDance
ByteDance
À partir de
0 crédits
ByteDance
ByteDance
À partir de
0 crédits
ByteDance
ByteDance
Turn text, images, video clips, and audio into cinematic, audio-synced videos with a single API call.
À partir de
0 crédits
MiniMax
MiniMax
À partir de
0 crédits
ByteDance
ByteDance
Generate cinematic 4K AI videos up to 30 seconds with Seedance 2.5's multimodal power.
À partir de
0 crédits
Google Veo 3.1 is the latest state-of-the-art generative video model designed to transform text and image prompts into high-fidelity cinematic visuals. Building upon its predecessors, Veo 3.1 features significant upgrades in prompt adherence, visual realism, and native audio generation, creating 8-second clips with synchronized sound effects and dialogue.
À partir de
0 crédits
wan
wan
À partir de
0 crédits
Runway
Runway
À partir de
0 crédits
Kling
Kling
Transform text prompts and images into high-quality videos with advanced AI. Generate cinematic content with customizable duration, aspect ratio, and audio capabilities.
À partir de
0 crédits
MiniMax
MiniMax
Generate high-quality AI videos from text prompts or images with MiniMax's Hailuo 2.3 model. Support for both 6s and 10s durations, 768p and 1080p resolutions, with intelligent prompt optimization.
À partir de
0 crédits
grok
grok
Grok Imagine is xAI’s AI video generation model for creating high-quality videos with realistic motion, native audio, and synchronized speech. Grok Imagine 1.5 introduces faster generation speeds, improved motion physics, and stronger visual consistency for modern AI video applications.
À partir de
0 crédits
Luma
Luma
À partir de
0 crédits
Kling
Kling
Kling v3 video generation model, supports text-to-video and image-to-video, up to 15 seconds, 1080p pro mode
À partir de
0 crédits
wan
wan
Generate videos with cinematic consistency by reimagining existing footage through high-fidelity visual transformation and structural control.
À partir de
0 crédits
grok
grok
À partir de
0 crédits
kling
kling
À partir de
0 crédits