Noch kein Bild. Senden Sie das Formular ab, um ein Bild zu generieren.
Entdecken Sie verschiedene Anwendungsfälle und Parameterkonfigurationen
Transparente Preisgestaltung ohne versteckte Gebühren. Bezahlen Sie nach Verbrauch.
| Regel & Modalität | Channel | Guthaben | Preis (USD) | Offizieller / Referenzpreis | Tägliche Ersparnis |
|---|---|---|---|---|---|
test otherGoogle | Regular | 999per run | $4.541 | - | - |
Vollständige Anleitung zur Verwendung von Gemini Omni
Erzeugen Sie natürliche, ausdrucksstarke und mehrsprachige Audiodateien aus Text-Prompts mit Googles omnimodalem Gemini-Modell über einen einzigen einheitlichen Endpunkt.

Mit der Gemini Omni Audio API auf ApiPass können Sie eine Stimme — Klangfarbe, Ton, Stimmung, Akzent und Persona — als wiederverwendbares Audioprofil definieren, benennen und registrieren, das eine portable Audio-ID zurückgibt. Statt eine Stimme jedes Mal neu zu beschreiben, wenn Sie ein Video generieren oder eine Figur animieren, erstellen Sie die Stimme einmal und referenzieren sie anschließend in Text-zu-Video-, Bild-zu-Video- und Video-Editing-Generierungen mit synchronisiertem Audio, das im selben Forward-Pass erzeugt wird. Da Gemini Omni nativ multimodal ist — es verarbeitet Text, Bild, Audio und Video gleichzeitig für kohärentere, konsistentere und besser steuerbare Ausgaben — bleiben die hier erstellten Stimmprofile perfekt mit den visuellen Ergebnissen synchron, die von der übrigen Gemini-Omni-Familie auf ApiPass erzeugt werden.
Überspringen Sie Vertex AI-Onboarding, Abrechnungskonten und IAM-Rollen. Ein einziger ApiPass API-Schlüssel schaltet Gemini Omni Audio sofort frei.
Angetrieben von Googles führender omnimodaler Architektur, die Text und Audio nativ in einem einzigen Modell gemeinsam verarbeitet.
Basierend auf derselben Generation von Gemini-Audio, die eine deutlich verbesserte Audioqualität liefert und sich wie ein Gespräch mit einer Person anfühlt — mit reichhaltigeren, natürlicheren Sprachinteraktionen über 30 HD-Stimmen in 24 Sprachen hinweg.
Einmal absenden, eine taskId erhalten und anschließend entweder recordInfo abfragen oder callBackUrl für Push-Benachrichtigungen verwenden — ideal für lang laufende Generierungen, ohne Ihre Server zu blockieren.
Sprechen Sie in mehreren Sprachen, und das Modell wechselt mühelos zwischen ihnen, ohne dass eine Vorkonfiguration erforderlich ist; Sprache ist keine Barriere mehr.
Verfolgen Sie Kosten, Latenz (costTime) und Erfolgsraten für alle Gemini-, Veo- und Nano-Banana-Modelle in einem einzigen ApiPass-Dashboard.
Wandeln Sie einfache Text-Prompts mithilfe von Googles Gemini-Omni-Backbone in ausdrucksstarke Sprach- und Audioausgaben in Studioqualität um.
Durch die Nutzung von Geminis Audio-Stack, der emotionale Ausdrucksweisen von Nutzern verstehen und angemessen darauf reagieren kann, trägt die generierte Ausgabe natürliche Intonation und Ausdruckskraft.
Jede Anfrage gibt eine taskId zurück; Ergebnisse (einschließlich resultUrls zur generierten Audiodatei) können über recordInfo abgerufen oder direkt an Ihre callBackUrl geliefert werden.
Geben Sie Ihrem Chatbot eine natürliche, mehrsprachige Stimme, ohne TTS-, STT- und LLM-Anbieter miteinander zu verknüpfen.
Wandeln Sie Skripte, Artikel oder Long-Form-Inhalte in vertonte Audiodateien mit realistischer Prosodie um.
Erzeugen Sie automatisch Synchronfassungen und Voice-overs in 20+ Sprachen für E-Learning, Marketing oder Gaming.
Erstellen Sie Screenreader, Echtzeit-Erzählungen und Lesehilfe-Apps, die menschlich und nicht roboterhaft klingen.
Während die offiziellen Audio-Angebote hauptsächlich für Echtzeit-Konversationsagenten optimiert sind, ist die ApiPass Gemini Omni Audio-Funktion auf Asset-Erstellung ausgerichtet — sie erzeugt ein wiederverwendbares Stimmprofil, das direkt in die Gemini-Omni-Videogenerierung eingebunden werden kann.
Der offizielle Zugriff auf Geminis Audio-, Video- und multimodale Oberflächen ist auf unterschiedliche Endpunkte, Konsolen und Preview-Tracks verteilt. ApiPass konsolidiert die Omni-Familie — Audio, Charakter, Video — hinter einem einzigen API-Schlüssel, einem einzigen Dashboard und einem konsistenten JSON-Schema.
Ersetzen Sie starre, vorab aufgezeichnete IVR-Menüs durch dynamische, kontextbewusste Sprachantworten, die bei Bedarf generiert werden.
Ermöglichen Sie SaaS-Produkten, Blogbeiträge, Tweets oder Skripte in teilbare Audioclips und Podcast-Episoden umzuwandeln.
Erzeugen Sie Aussprachebeispiele in Muttersprachqualität und interaktive Dialoge in Dutzenden von Sprachen.
Geben Sie Nicht-Spieler-Charakteren einzigartige, ausdrucksstarke Stimmen, die zur Laufzeit generiert werden, statt sich auf vorab aufgezeichnete Zeilen zu verlassen.
Registrieren Sie sich auf apipass.dev und kopieren Sie Ihr bearer token aus dem Dashboard.
Senden Sie ein POST an https://api.apipass.dev/api/v1/jobs/createTask mit "model": "google/gemini-omni-audio", Ihrem Eingabe-Prompt und einer optionalen callBackUrl. Als Antwort erhalten Sie eine taskId.
Warten Sie entweder auf den Callback oder senden Sie ein GET an https://api.apipass.dev/api/v1/jobs/recordInfo?taskId=..., um die fertige Audio-URL aus dem Feld resultJson.resultUrls abzurufen, sobald state success ist.
Alle APIs erfordern eine Authentifizierung über Bearer Token.
Authorization: Bearer
Senden Sie eine neue Aufgabe zur Bildgenerierung oder -bearbeitung mit Nano Banana 2
Die API akzeptiert eine JSON-Payload mit der folgenden Struktur:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "channel": "auto",
5 "input": {
6 // Input parameters
7 }
8}modelErforderlichstringDer für die Generierung zu verwendende Modellname
"google/nano-banana-2"
callBackUrlOptionalstringCallback-URL für Benachrichtigungen nach Abschluss der Aufgabe. Wenn sie weggelassen wird, wird kein Callback gesendet.
"https://your-domain.com/api/callback"
channelOptionalstringSie können den entsprechenden Anbieter innerhalb von APIPASS über den Parameter channel angeben; diese Anbieter übernehmen die eigentlichen Aufgaben zur Bild- und Videogenerierung. APIPASS bietet derzeit drei Anbieteroptionen:
Der Standardwert für den Parameter channel ist auto. Wenn aktiviert, verteilt APIPASS Aufgaben automatisch auf verfügbare Anbieter anhand von Echtzeitpreisen und Stabilitätsmetriken, um minimale Kosten und zuverlässige Leistung auszubalancieren. Behalten Sie den Standardwert auto bei, sofern Sie keine benutzerdefinierten Routing-Anforderungen haben.
Verfügbare Optionen:
auto
Das input-Objekt enthält die folgenden Parameter:
input.promptErforderlichstringEine Textbeschreibung des Bildes, das Sie generieren möchten
Beschreiben Sie Motiv, Stil, Beleuchtung und Komposition, um die besten Ergebnisse zu erzielen
"A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic"
input.image_inputOptionalarray(URL)Eingabebilder zum Transformieren oder zur Verwendung als Referenz. Unterstützt bis zu 14 Bilder.
Akzeptierte Typen: image/jpeg, image/png; Maximale Größe: 30MB pro Bild; Maximale Dateien: 14
["https://example.com/reference.jpg"]
input.aspect_ratioOptionalstringSeitenverhältnis des generierten Bildes. Standardmäßig match_input_image, wenn image_input angegeben ist, andernfalls 1:1.
Verfügbare Optionen:
"16:9"
input.resolutionOptionalstringAuflösung des generierten Bildes. Höhere Auflösungen liefern mehr Details, benötigen jedoch länger für die Generierung. Standard: 1K.
Verfügbare Optionen:
"1K"
input.output_formatOptionalstringFormat des Ausgabebildes. Standard: jpg.
Verfügbare Optionen:
"jpg"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "google/nano-banana-2",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "prompt": "A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic",
9 "aspect_ratio": "16:9",
10 "resolution": "1K",
11 "google_search": false,
12 "image_search": false,
13 "output_format": "jpg"
14 }
15 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}codeStatuscode, 200 bei Erfolg, andere Werte bei Fehler
messageAntwortnachricht, Fehlerbeschreibung bei Fehlschlag
data.taskIdAufgaben-ID zum Abfragen des Aufgabenstatus und der Ergebnisse