Noch kein Video. Senden Sie das Formular ab, um ein Video zu generieren.
Entdecken Sie verschiedene Anwendungsfälle und Parameterkonfigurationen
Transparente Preisgestaltung ohne versteckte Gebühren. Bezahlen Sie nach Verbrauch.
| Regel & Modalität | Channel | Guthaben | Preis (USD) | Offizieller / Referenzpreis | Tägliche Ersparnis |
|---|---|---|---|---|---|
with-video-720p videoGoogleresolution: 720p | Regular | 268per run | $1.218 | - | - |
with-video-1080p videoGoogleresolution: 1080p | Regular | 270per run | $1.227 | - | - |
with-video-4k videoGoogleresolution: 4k | Regular | 400per run | $1.818 | - | - |
no-video-720p-4s videoGoogleduration: 4, resolution: 720p | Regular | 102per run | $0.464 | - | - |
no-video-720p-6s videoGoogleduration: 6, resolution: 720p | Regular | 135per run | $0.614 | - | - |
no-video-720p-8s videoGoogleduration: 8, resolution: 720p | Regular | 168per run | $0.764 | - | - |
no-video-720p-10s videoGoogleduration: 10, resolution: 720p | Regular | 200per run | $0.909 | - | - |
no-video-1080p-4s videoGoogleduration: 4, resolution: 1080p | Regular | 103per run | $0.468 | - | - |
no-video-1080p-6s videoGoogleduration: 6, resolution: 1080p | Regular | 136per run | $0.618 | - | - |
no-video-1080p-8s videoGoogleduration: 4, resolution: 1080p | Regular | 168per run | $0.764 | - | - |
no-video-1080p-10s videoGoogleduration: 10, resolution: 1080p | Regular | 202per run | $0.918 | - | - |
no-video-4k-4s videoGoogleduration: 4, resolution: 4k | Regular | 233per run | $1.059 | - | - |
no-video-4k-6s videoGoogleduration: 6, resolution: 4k | Regular | 268per run | $1.218 | - | - |
no-video-4k-8s videoGoogleduration: 8, resolution: 4k | Regular | 300per run | $1.364 | - | - |
no-video-4k-10s videoGoogleduration: 10, resolution: 4k | Regular | 335per run | $1.523 | - | - |
Vollständige Anleitung zur Verwendung von Gemini Omni
Erstellen Sie filmische, physikbewusste KI-Videos mit Googles Gemini Omni-Modell — kombiniert mit wiederverwendbaren Charakteren und Stimmen — über einen einzigen ApiPass-Endpunkt.

Die Gemini Omni Video API auf ApiPass ist die Videoerzeugungsoberfläche von Googles Gemini Omni Flash, einem leistungsstarken multimodalen Modell für schnelle Videogenerierung, Bearbeitung und filmische Steuerung. Anstatt Text-zu-Video als isolierten Aufruf auszuführen, stellt ApiPass Gemini Omni Video als Kompositionsebene der Omni-Familie bereit: Sie können wiederverwendbare Charakterressourcen und Stimmprofile übergeben, die Sie bereits auf ApiPass erstellt haben, und erhalten ein vollständig gerendertes Video mit synchronisierten Bild- und Audiospuren zurück. Gemini Omni verarbeitet Text, Bild, Audio und Video gleichzeitig und liefert dadurch kohärentere, konsistentere und besser steuerbare Ergebnisse — und ApiPass bündelt diese Fähigkeit hinter einem API-Schlüssel zusammen mit dem restlichen Modellkatalog.
Anstatt separate Konten, Preview-Zugänge oder Cloud-Setups zu verwalten, stellt ApiPass Ihnen Gemini Omni Video über denselben API-Schlüssel bereit, den Sie bereits für den restlichen Modellkatalog verwenden.
Gemini Omni Video akzeptiert jede Kombination aus Text, Bild, Video und Audio in einem einzigen Prompt, sodass Sie Generierungen mit realen kreativen Materialien starten können statt nur mit einem leeren Textprompt.
Basierend auf einem Modell realer Physik rendert die API glaubwürdige Reflexionen, Schwerkraft, Beleuchtung und Wetter, sodass Szenen visuell stimmig bleiben, statt selbst bei dynamischen Aufnahmen in Artefakte abzudriften.
Sie können eine Generierung mit mehreren Referenzbildern und kurzen Videoclips steuern, und das Modell hält Motive, Stil und Szene konsistent, sodass die Identität über Bearbeitungen und Aufnahmen hinweg stabil bleibt.
Konversationelle Bearbeitung ermöglicht es Ihnen, Ihre Videos schrittweise per natürlicher Sprache zu verfeinern und zu bearbeiten, sodass Sie eine Szene überarbeiten können, ohne den gesamten Prompt von Grund auf neu aufzubauen.
Gemini Omni kombiniert breites Weltwissen mit starken Videofähigkeiten — es versteht kulturellen Kontext, historische Schauplätze und wissenschaftliche Genauigkeit und erzeugt Videos, die Sinn ergeben und nicht nur gut aussehen. Das ist besonders nützlich, wenn Prompts bestimmte Epochen, Orte oder Konzepte referenzieren, die faktische Kohärenz erfordern.
Die Gemini Omni API unterstützt Videobearbeitung in natürlicher Sprache und ermöglicht es Nutzerinnen und Nutzern, eine Szene Schritt für Schritt zu verfeinern, statt jedes Mal den vollständigen Prompt neu zu erstellen. Ein Nutzer kann die Umgebung ändern, die Handlung anpassen, Objekte ersetzen, den Kamerawinkel verschieben oder visuelle Effekte hinzufügen, während die ursprüngliche Szene kohärent bleibt. Dadurch eignet sie sich für KI-Videoeditoren, Creator-Tools und Anwendungen, in denen Nutzer eine intuitivere Möglichkeit benötigen, vorhandenes Filmmaterial zu transformieren.
Gemini Omni Video verbindet visuelle Erstellung mit Wissen über Physik, Geschichte, Biologie, Kultur und narrative Logik. Dadurch wirken generierte Videos weniger zufällig und stärker beabsichtigt, was für Erklärvideos, filmisches Storytelling, Produktkonzepte und Bildungsinhalte wertvoll ist.
Text kann die Richtung vorgeben, Bilder können Motive oder Stil leiten, Video kann Bewegung und Szenenkontext liefern, und Audio- oder Charakterressourcen können sprachgesteuerte oder identitätsbewusste Workflows unterstützen. So können Entwickler Videotools erstellen, die von echten kreativen Materialien ausgehen statt nur von einem leeren Prompt.
Gemini Omni Video kann avatarartige Szenarien unterstützen, in denen Charakterpräsenz, Ausdruck, Vortrag und Umgebung miteinander verbunden wirken müssen. Das ist nützlich für Presenter-Clips, charaktergeführte Inhalte, interaktive Medien und zukunftsorientierte kreative Videoprodukte.
Vertikale Clips, die aus einem Prompt plus einem einzelnen Referenzbild generiert werden, mit einer wiederholbaren Hauptfigur über jede Episode hinweg.
Lokalisierte Anzeigenvarianten, die denselben markenkonformen Sprecher und dieselbe Stimme verwenden, aber Produkt, Botschaft oder Markt austauschen.
Bildungsinhalte, historisch genaue Szenen und wissensreiches Storytelling, bei denen faktische Kohärenz ebenso wichtig ist wie visuelle Qualität.
Sprachgesteuerte, avatarartige Workflows, bei denen die stimmliche Darbietung das Endergebnis leitet; nützlich für Presenter-Videos, Charakterdialoge, erzählte Szenen und generierte Clips, in denen Stimme, Ausdruck und Handlung auf dem Bildschirm miteinander verbunden wirken müssen.
Der offizielle Gemini Omni-Zugriff ist derzeit über Preview-Tracks sowie mehrere Konsolen und Enterprise-Oberflächen verteilt. ApiPass konsolidiert ihn hinter einem einzigen API-Schlüssel zusammen mit Ihrem restlichen Modell-Stack, sodass die Integration eher eine Änderung von base-URL und Schlüssel ist als ein neues Anbieter-Onboarding.
Die offizielle API behandelt jede Generierung als eigenständige Anfrage. Auf ApiPass ist Gemini Omni Video darauf ausgelegt, die Charakter- und Stimmressourcen zu verwenden, die Sie bereits über die Fähigkeiten Gemini Omni Character und Gemini Omni Audio auf der Plattform erstellt haben — so können Sie eine Bibliothek aus Identitäten und Stimmen pflegen und sie in jeden nachfolgenden Videoauftrag einbinden.
Produktion episodischer Kurzformat-Videos, die eine wiederholbare Hauptfigur, einen Erzähler und einen visuellen Stil benötigen.
Bereitstellung lokalisierter, personalisierter Anzeigenvarianten, die über Märkte und kreative Varianten hinweg markenkonform bleiben.
Umwandlung von Kursskripten und Unterrichtsplänen in erzählte, charaktergeführte Lehrvideos mit historisch oder wissenschaftlich fundierten Szenen.
Produktion von Cinematics, Trailern und In-App-Storysequenzen, in denen derselbe Charakter zuverlässig über viele Aufnahmen und Iterationen hinweg erscheint.
Erstellen Sie ein ApiPass-Konto und generieren Sie in Ihrem Dashboard einen API-Schlüssel, um die vollständige Gemini Omni-Familie — Video, Charakter und Audio — zusammen mit dem restlichen Modellkatalog freizuschalten.
Schreiben Sie einen Szenen-Prompt und sammeln Sie optional Ihre Referenzmaterialien — Bilder, ein kurzes Quellvideo, eine wiederverwendbare Charakterressource und ein Stimmprofil aus Gemini Omni Audio — damit das Modell alles hat, was es benötigt, um Identität, Tonalität und Stil konsistent zu halten.
Rufen Sie Gemini Omni Video mit Ihrem Prompt und den ausgewählten Eingaben auf, prüfen Sie den generierten Clip und verfeinern Sie ihn durch konversationelle Bearbeitungen, bis Szene, Bewegung und Darbietung Ihrer kreativen Richtung entsprechen.
Alle APIs erfordern eine Authentifizierung über Bearer Token.
Authorization: Bearer
Reichen Sie eine neue Aufgabe zur Nano Banana 2-Bildgenerierung oder -bearbeitung ein
Die API akzeptiert eine JSON-Nutzlast mit der folgenden Struktur:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "channel": "auto",
5 "input": {
6 // Input parameters
7 }
8}modelErforderlichstringDer Modellname, der für die Generierung verwendet werden soll
"google/nano-banana-2"
callBackUrlOptionalstringCallback-URL für Benachrichtigungen nach Abschluss der Aufgabe. Wenn sie weggelassen wird, wird kein Callback gesendet.
"https://your-domain.com/api/callback"
channelOptionalstringSie können den entsprechenden Anbieter innerhalb von APIPASS über den Parameter channel angeben; diese Anbieter übernehmen die eigentlichen Aufgaben zur Bild- und Videogenerierung. APIPASS bietet derzeit drei Anbieteroptionen:
Der Standardwert für den Parameter channel ist auto. Wenn aktiviert, verteilt APIPASS Aufgaben automatisch auf verfügbare Anbieter basierend auf Echtzeitpreisen und Stabilitätsmetriken, um minimale Kosten und zuverlässige Leistung auszubalancieren. Behalten Sie den Standardwert auto bei, sofern Sie keine benutzerdefinierten Routing-Anforderungen haben.
Verfügbare Optionen:
auto
Das input-Objekt enthält die folgenden Parameter:
input.promptErforderlichstringEine Textbeschreibung des Bildes, das Sie generieren möchten
Beschreiben Sie Motiv, Stil, Beleuchtung und Komposition, um die besten Ergebnisse zu erzielen
"A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic"
input.image_inputOptionalarray(URL)Eingabebilder, die transformiert oder als Referenz verwendet werden sollen. Unterstützt bis zu 14 Bilder.
Akzeptierte Typen: image/jpeg, image/png; Maximale Größe: 30MB pro Bild; Maximale Anzahl von Dateien: 14
["https://example.com/reference.jpg"]
input.aspect_ratioOptionalstringSeitenverhältnis des generierten Bildes. Standardmäßig match_input_image, wenn image_input bereitgestellt wird, andernfalls 1:1.
Verfügbare Optionen:
"16:9"
input.resolutionOptionalstringAuflösung des generierten Bildes. Höhere Auflösungen erzeugen mehr Details, benötigen aber länger für die Generierung. Standard: 1K.
Verfügbare Optionen:
"1K"
input.output_formatOptionalstringFormat des Ausgabebildes. Standard: jpg.
Verfügbare Optionen:
"jpg"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "google/nano-banana-2",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "prompt": "A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic",
9 "aspect_ratio": "16:9",
10 "resolution": "1K",
11 "google_search": false,
12 "image_search": false,
13 "output_format": "jpg"
14 }
15 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}codeStatuscode, 200 für Erfolg, andere Werte für Fehler
messageAntwortnachricht, Fehlerbeschreibung bei Fehlschlag
data.taskIdTask-ID zum Abfragen des Aufgabenstatus und der Ergebnisse

ByteDance
ByteDance
Ab
0 Credits
ByteDance
ByteDance
Ab
0 Credits
ByteDance
ByteDance
Turn text, images, video clips, and audio into cinematic, audio-synced videos with a single API call.
Ab
0 Credits
MiniMax
MiniMax
Ab
0 Credits
ByteDance
ByteDance
Generate cinematic 4K AI videos up to 30 seconds with Seedance 2.5's multimodal power.
Ab
0 Credits
Google Veo 3.1 is the latest state-of-the-art generative video model designed to transform text and image prompts into high-fidelity cinematic visuals. Building upon its predecessors, Veo 3.1 features significant upgrades in prompt adherence, visual realism, and native audio generation, creating 8-second clips with synchronized sound effects and dialogue.
Ab
0 Credits
wan
wan
Ab
0 Credits
Runway
Runway
Ab
0 Credits
Kling
Kling
Transform text prompts and images into high-quality videos with advanced AI. Generate cinematic content with customizable duration, aspect ratio, and audio capabilities.
Ab
0 Credits
MiniMax
MiniMax
Generate high-quality AI videos from text prompts or images with MiniMax's Hailuo 2.3 model. Support for both 6s and 10s durations, 768p and 1080p resolutions, with intelligent prompt optimization.
Ab
0 Credits
grok
grok
Grok Imagine is xAI’s AI video generation model for creating high-quality videos with realistic motion, native audio, and synchronized speech. Grok Imagine 1.5 introduces faster generation speeds, improved motion physics, and stronger visual consistency for modern AI video applications.
Ab
0 Credits
Luma
Luma
Ab
0 Credits
Kling
Kling
Kling v3 video generation model, supports text-to-video and image-to-video, up to 15 seconds, 1080p pro mode
Ab
0 Credits
wan
wan
Generate videos with cinematic consistency by reimagining existing footage through high-fidelity visual transformation and structural control.
Ab
0 Credits
grok
grok
Ab
0 Credits
kling
kling
Ab
0 Credits