Noch kein Video. Senden Sie das Formular ab, um ein Video zu generieren.
Entdecken Sie verschiedene Anwendungsfälle und Parameterkonfigurationen
Transparente Preisgestaltung ohne versteckte Gebühren. Bezahlen Sie nach Verbrauch.
| Regel & Modalität | Channel | Guthaben | Preis (USD) | Offizieller / Referenzpreis | Tägliche Ersparnis |
|---|---|---|---|---|---|
omni-human-1.5 videoByteDance | Starter | 1per second | $0.005 | - | - |
Wettbewerberpreise kosten $818.180/Tag mehr
ApiPass ist 32.73% günstiger, geschätzt bei Basierend auf 1,000 10-Sekunden-Videos/Tag
omni-human-1.5
ApiPass-Preis
$0.168
37 Credits per second
Wettbewerberpreise
Vollständige Anleitung zur Verwendung von OmniHuman 1.5
Erstellen Sie realistische Animationsvideos von Menschen, indem Sie ein Porträtbild mit Audio kombinieren und natürliche Lippensynchronisation, Gesichtsausdrücke und Körperbewegungen erzeugen.

OmniHuman 1.5 wurde von ByteDance entwickelt und ist ein fortschrittliches Modell für menschliche Animation, das aus einem einzelnen Porträtbild und einer Audioeingabe realistische Videoinhalte erzeugt. Das Modell synthetisiert natürliche Lippenbewegungen, Gesichtsausdrücke und Körpergesten, die mit dem bereitgestellten Audio synchronisiert sind. Es unterstützt mehrere Sprachen, darunter Chinesisch, Englisch, Japanisch, Koreanisch, Spanisch und Indonesisch. Die OmniHuman 1.5 API bietet programmgesteuerten Zugriff auf diese Funktion und ermöglicht Entwicklern, die Generierung menschlicher Animationen in ihre Anwendungen, Plattformen und Produktions-Workflows zu integrieren.
Der Standardmodus bietet eine ausgewogene Kombination aus Qualität und Generierungsgeschwindigkeit und eignet sich für die meisten Anwendungsfälle, darunter Content-Erstellung, Marketingmaterialien und Social-Media-Videos.
Der Schnellmodus priorisiert die Generierungsgeschwindigkeit gegenüber der Qualität und ermöglicht kürzere Durchlaufzeiten. Ideal für schnelles Prototyping, Tests und Produktionsszenarien mit hohem Volumen, in denen Geschwindigkeit wichtiger ist als maximale visuelle Genauigkeit.
Die OmniHuman 1.5 API erzeugt eine hochpräzise Lippensynchronisation aus Audioeingaben. Mundbewegungen werden natürlich an die Sprache angepasst und erzeugen realistische Talking-Head-Videos, die sich für digitale Avatare, virtuelle Präsentatoren und Synchronisationsanwendungen eignen.
Mit der OmniHuman 1.5 API werden Gesichtsausdrücke dynamisch basierend auf Tonfall und Inhalt des Audios erzeugt. Das Modell erzeugt natürliche Augenbewegungen, Augenbrauengesten und eine gesamte Gesichtsanimation, die zum emotionalen Kontext des Audios passt.
Die OmniHuman API erzeugt subtile Körperbewegungen und Gesten, die mit dem Audio synchronisiert sind. Oberkörperbewegungen, Kopfneigungen und natürliches Wiegen sorgen für ansprechendere und lebensechtere Videoinhalte im Vergleich zu statischen Talking-Head-Ansätzen.
Die OmniHuman 1.5 API unterstützt Audioeingaben in mehreren Sprachen, darunter Chinesisch, Englisch, Japanisch, Koreanisch, Spanisch und Indonesisch. Lippenbewegungen werden unabhängig von der im Audio gesprochenen Sprache präzise erzeugt.
Die OmniHuman 1.5 API ermöglicht optionale Text-Prompts zur präzisen Steuerung von Szene, Bewegungen und Kamerawinkeln. Entwickler können bestimmte Aktionen, Umgebungen und visuelle Stile definieren, um die generierte Ausgabe anzupassen.
Starten Sie mit der OmniHuman 1.5 API in nur wenigen einfachen Schritten ...
Erstellen Sie ein Konto und registrieren Sie sich für den Zugriff, um Ihren OmniHuman 1.5 API Key zu erhalten. Dieser API Key authentifiziert alle Anfragen an die OmniHuman API und verknüpft die Nutzung mit Ihrem Konto.
Bevor Sie die API in Ihr System integrieren, verwenden Sie den Playground, um die OmniHuman 1.5 API in einer interaktiven Umgebung zu testen. Laden Sie ein Porträtbild und eine Audiodatei hoch, passen Sie Prompts an und sehen Sie sich die generierten Ergebnisse in der Vorschau an.
Integrieren Sie die OmniHuman 1.5 API nach dem Testen in Ihr Backend oder Ihre Anwendungslogik. Definieren Sie, wie Porträtbilder, Audiodateien, Prompts und Generierungsparameter über API-Anfragen übergeben werden.
Stellen Sie Ihre Integration mit der OmniHuman 1.5 API in einer Produktionsumgebung bereit. Verarbeiten Sie asynchrone Generierungsaufträge, verfolgen Sie den Aufgabenstatus und liefern Sie die generierten Videoausgaben an Ihre Nutzer aus.
Nach der Bereitstellung skalieren Sie die Generierung menschlicher Animationen mit der OmniHuman 1.5 API, indem Sie Bildqualität, Audioklarheit und Prompt-Konsistenz optimieren. Die API unterstützt Workloads mit hohem Volumen für den Produktionseinsatz.
Um mit der OmniHuman 1.5 API stabile, hochwertige Ergebnisse zu erzielen, befolgen Sie diese Richtlinien für optimale Bild- und Audioeingaben.
Stellen Sie klare, gut ausgeleuchtete Porträtbilder bereit, auf denen das Gesicht der Person deutlich sichtbar ist. Die Bilder sollten eine gute Auflösung haben und das Gesicht sollte deutlich im Vordergrund stehen. Vermeiden Sie Bilder mit starker Verdeckung, extremen Winkeln oder schlechter Beleuchtung.
Audiodateien müssen kürzer als 35 Sekunden sein. Wenn Ihr Audio dieses Limit überschreitet, teilen Sie es in kürzere Segmente auf. Klares Audio ohne übermäßige Hintergrundgeräusche führt zu besseren Lippensynchronisationsergebnissen.
Wenn Sie bestimmte Bewegungen, Ausdrücke oder Szeneneinstellungen benötigen, geben Sie detaillierte Prompts an, die die gewünschte Ausgabe beschreiben. Prompts helfen, das Modell so zu steuern, dass Animationen entstehen, die Ihrer kreativen Vision entsprechen.
Die OmniHuman 1.5 API ermöglicht die Erstellung realistischer digitaler Avatare und virtueller Präsentatoren. Generieren Sie Talking-Head-Videos aus einem einzelnen Porträt und einer Audionarration für Produktdemos, Tutorials und Präsentationen.
Mit mehrsprachiger Unterstützung erleichtert die OmniHuman 1.5 API die Content-Lokalisierung, indem sie lippensynchrone Videos in verschiedenen Sprachen aus demselben Porträtbild erzeugt und so effiziente Synchronisations-Workflows ermöglicht.
Die OmniHuman API ermöglicht die schnelle Erstellung ansprechender Social-Media-Inhalte. Generieren Sie Talking-Head-Videos für TikTok, Instagram Reels und YouTube Shorts mit einem konsistenten Erscheinungsbild der Figur über mehrere Videos hinweg.
Für Bildungsinhalte hilft die OmniHuman 1.5 API dabei, ansprechende, von Lehrenden geführte Videos zu erstellen. Generieren Sie konsistente virtuelle Lehrkräfte, die Kursinhalte mit natürlichen Ausdrücken und Bewegungen vermitteln.
apipass.dev bietet preisgünstige OmniHuman 1.5 API-Preise, die für echte Produktions-Workloads ausgelegt sind. Das Preismodell unterstützt skalierbare Generierung menschlicher Animationen mit planbaren Kosten.
Die OmniHuman 1.5 API-Dokumentation bietet Entwicklern klare, strukturierte Anleitungen über den gesamten Integrationslebenszyklus hinweg. Von der Einrichtung des API Key und Playground-Tests bis hin zu Bereitstellung und Skalierung.
Mit 24/7-Support für die OmniHuman 1.5 API stellt apipass.dev jederzeit kontinuierliche Serviceverfügbarkeit und reaktionsschnelle technische Unterstützung sicher.
Alle APIs erfordern eine Authentifizierung über Bearer Token.
Authorization: Bearer
Erstellen Sie einen neuen OmniHuman 1.5-Generierungstask
Die API akzeptiert eine JSON-Nutzlast mit der folgenden Struktur:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "input": {
5 "image_url": "string",
6 "audio_url": "string",
7 "prompt": "string (optional)",
8 "fast_mode": "boolean (optional)"
9 },
10 "channel": "auto"
11}modelErforderlichstringDer für die Generierung zu verwendende Modellname
"bytedance/omni-human-1-5"
callBackUrlOptionalstringCallback-URL für Benachrichtigungen über den Task-Abschluss.
"https://your-domain.com/api/callback"
channelOptionalstringSie können über den Parameter channel den entsprechenden Anbieter innerhalb von APIPASS angeben; diese Anbieter übernehmen die eigentlichen Bild- und Videogenerierungsaufgaben. APIPASS bietet derzeit drei Anbieteroptionen:
Der Standardwert für den Parameter channel ist auto. Wenn aktiviert, verteilt APIPASS Tasks automatisch auf verfügbare Anbieter basierend auf Echtzeitpreisen und Stabilitätsmetriken, um minimale Kosten und zuverlässige Leistung auszubalancieren. Behalten Sie den Standardwert auto bei, sofern Sie keine individuellen Routing-Anforderungen haben.
Verfügbare Optionen:
auto
Das Eingabeobjekt enthält die folgenden Parameter:
input.image_urlErforderlichstringURL des Eingabebildes, das eine menschliche Person, ein Gesicht oder eine Figur enthält.
Akzeptierte Typen: image/jpeg, image/png, image/webp; Maximale Größe: 10MB
"https://example.com/portrait.jpg"
input.audio_urlErforderlichstringURL der Eingabe-Audiodatei. Die Dauer muss unter 35 Sekunden liegen.
Akzeptierte Typen: MP3, WAV; Maximale Dauer: 35 Sekunden
"https://example.com/audio.mp3"
input.promptOptionalstringOptionaler Prompt zur präzisen Steuerung der Szene, Bewegungen, Kamerabewegungen usw. Unterstützt Chinesisch, Englisch, Japanisch, Koreanisch, Spanisch und Indonesisch.
Maximale Länge: 2000 Zeichen
"A woman plays the piano and sings."
input.fast_modeOptionalbooleanAktiviert den Schnellmodus, um die Generierung durch Abstriche bei einigen Effekten zu beschleunigen. Standard: true
true
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "bytedance/omni-human-1-5",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "image_url": "https://example.com/portrait.jpg",
9 "audio_url": "https://example.com/audio.mp3",
10 "prompt": "A woman plays the piano and sings.",
11 "fast_mode": true
12 }
13 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}codeStatuscode, 200 bei Erfolg, andere Werte bei Fehler
messageAntwortnachricht, Fehlerbeschreibung bei fehlgeschlagener Anfrage
data.taskIdTask-ID zum Abfragen des Task-Status

ByteDance
ByteDance
Ab
0 Credits
ByteDance
ByteDance
Ab
0 Credits
ByteDance
ByteDance
Turn text, images, video clips, and audio into cinematic, audio-synced videos with a single API call.
Ab
0 Credits
MiniMax
MiniMax
Ab
0 Credits
ByteDance
ByteDance
Generate cinematic 4K AI videos up to 30 seconds with Seedance 2.5's multimodal power.
Ab
0 Credits
Google Veo 3.1 is the latest state-of-the-art generative video model designed to transform text and image prompts into high-fidelity cinematic visuals. Building upon its predecessors, Veo 3.1 features significant upgrades in prompt adherence, visual realism, and native audio generation, creating 8-second clips with synchronized sound effects and dialogue.
Ab
0 Credits
wan
wan
Ab
0 Credits
Runway
Runway
Ab
0 Credits
Kling
Kling
Transform text prompts and images into high-quality videos with advanced AI. Generate cinematic content with customizable duration, aspect ratio, and audio capabilities.
Ab
0 Credits
MiniMax
MiniMax
Generate high-quality AI videos from text prompts or images with MiniMax's Hailuo 2.3 model. Support for both 6s and 10s durations, 768p and 1080p resolutions, with intelligent prompt optimization.
Ab
0 Credits
grok
grok
Grok Imagine is xAI’s AI video generation model for creating high-quality videos with realistic motion, native audio, and synchronized speech. Grok Imagine 1.5 introduces faster generation speeds, improved motion physics, and stronger visual consistency for modern AI video applications.
Ab
0 Credits
Kling
Kling
Ab
0 Credits
Luma
Luma
Ab
0 Credits
Kling
Kling
Kling v3 video generation model, supports text-to-video and image-to-video, up to 15 seconds, 1080p pro mode
Ab
0 Credits
Kling
Kling
Generate realistic talking avatar videos from a single image and audio file using Kling AI Avatar v2 API. Create lifelike lip-sync animations with natural expressions and body movements.
Ab
0 Credits
Ab
0 Credits
kling
kling
Ab
0 Credits