Aucune vidéo pour le moment. Envoyez le formulaire pour générer une vidéo.
Explorez différents cas d'utilisation et configurations de paramètres
Tarifs transparents sans frais cachés. Payez à l'utilisation.
| Règle & Modalité | Channel | Crédits | Prix (USD) | Prix officiel / référence | Économie quotidienne |
|---|---|---|---|---|---|
omni-human-1.5 videoByteDance | Starter | 1per second | $0.005 | - | - |
Le prix concurrent coûte $818.180/jour de plus
ApiPass est 32.73% moins cher, estimé sur Basé sur 1,000 vidéos de 10 secondes/jour
omni-human-1.5
Prix ApiPass
$0.168
37 crédits per second
Prix concurrents
Guide complet d'utilisation de OmniHuman 1.5
Générez des vidéos d’animation humaine réalistes en combinant une image de portrait avec de l’audio, avec une synchronisation labiale naturelle, des expressions faciales et des mouvements du corps.

Développé par ByteDance, OmniHuman 1.5 est un modèle avancé d’animation humaine qui génère du contenu vidéo réaliste à partir d’une seule image de portrait et d’une entrée audio. Le modèle synthétise des mouvements de lèvres naturels, des expressions faciales et des gestes corporels synchronisés avec l’audio fourni. Il prend en charge plusieurs langues, notamment le chinois, l’anglais, le japonais, le coréen, l’espagnol et l’indonésien. L’API OmniHuman 1.5 fournit un accès programmatique à cette capacité, permettant aux développeurs d’intégrer la génération d’animations humaines dans leurs applications, plateformes et flux de production.
Le mode standard offre un bon équilibre entre qualité et vitesse de génération, adapté à la plupart des cas d’utilisation, notamment la création de contenu, les supports marketing et les vidéos pour les réseaux sociaux.
Le mode rapide privilégie la vitesse de génération au détriment de la qualité, permettant des délais de production plus courts. Idéal pour le prototypage rapide, les tests et les scénarios de production à fort volume où la vitesse est plus importante que la fidélité visuelle maximale.
L’API OmniHuman 1.5 génère une synchronisation labiale très précise à partir d’une entrée audio. Les mouvements de la bouche sont naturellement alignés sur la parole, produisant des vidéos réalistes de tête parlante adaptées aux avatars numériques, présentateurs virtuels et applications de doublage.
Avec l’API OmniHuman 1.5, les expressions faciales sont générées dynamiquement en fonction du ton et du contenu de l’audio. Le modèle produit des mouvements naturels des yeux, des gestes des sourcils et une animation faciale globale correspondant au contexte émotionnel de l’audio.
L’API OmniHuman génère des mouvements corporels et des gestes subtils synchronisés avec l’audio. Les mouvements du haut du corps, les inclinaisons de la tête et les balancements naturels créent un contenu vidéo plus captivant et plus réaliste que les approches statiques de tête parlante.
L’API OmniHuman 1.5 prend en charge les entrées audio dans plusieurs langues, notamment le chinois, l’anglais, le japonais, le coréen, l’espagnol et l’indonésien. Les mouvements des lèvres sont générés avec précision, quelle que soit la langue parlée dans l’audio.
L’API OmniHuman 1.5 permet d’utiliser des prompts textuels facultatifs pour contrôler précisément la scène, les mouvements et les angles de caméra. Les développeurs peuvent définir des actions, des environnements et des styles visuels spécifiques afin de personnaliser le résultat généré.
Démarrez avec l’API OmniHuman 1.5 en quelques étapes simples...
Créez un compte et demandez l’accès afin d’obtenir votre clé API OmniHuman 1.5. Cette clé API authentifie toutes les requêtes envoyées à l’API OmniHuman et associe l’utilisation à votre compte.
Avant d’intégrer l’API à votre système, utilisez le playground pour tester l’API OmniHuman 1.5 dans un environnement interactif. Importez une image de portrait et un fichier audio, ajustez les prompts et prévisualisez les résultats générés.
Après les tests, intégrez l’API OmniHuman 1.5 dans votre backend ou votre logique applicative. Définissez comment les images de portrait, les fichiers audio, les prompts et les paramètres de génération sont transmis via les requêtes API.
Déployez votre intégration dans un environnement de production avec l’API OmniHuman 1.5. Gérez les tâches de génération asynchrones, suivez l’état des tâches et fournissez les vidéos générées à vos utilisateurs.
Une fois déployée, faites évoluer la génération d’animations humaines avec l’API OmniHuman 1.5 en optimisant la qualité des images, la clarté audio et la cohérence des prompts. L’API prend en charge les charges de travail à fort volume pour une utilisation en production.
Pour obtenir des résultats stables et de haute qualité avec l’API OmniHuman 1.5, suivez ces recommandations pour optimiser les entrées image et audio.
Fournissez des images de portrait nettes et bien éclairées, avec le visage du sujet clairement visible. Les images doivent avoir une bonne résolution et le visage doit être bien mis en avant. Évitez les images avec une forte occlusion, des angles extrêmes ou un mauvais éclairage.
Les fichiers audio doivent durer moins de 35 secondes. Si votre audio dépasse cette limite, divisez-le en segments plus courts. Un audio clair, sans bruit de fond excessif, produit de meilleurs résultats de synchronisation labiale.
Lorsque vous avez besoin de mouvements, d’expressions ou de paramètres de scène spécifiques, fournissez des prompts détaillés décrivant le résultat souhaité. Les prompts aident à guider le modèle pour produire des animations correspondant à votre vision créative.
L’API OmniHuman 1.5 permet de créer des avatars numériques et des présentateurs virtuels réalistes. Générez des vidéos de tête parlante à partir d’un seul portrait et d’une narration audio pour des démonstrations de produits, des tutoriels et des présentations.
Grâce à sa prise en charge multilingue, l’API OmniHuman 1.5 facilite la localisation de contenu en générant des vidéos synchronisées sur les lèvres dans différentes langues à partir de la même image de portrait, ce qui permet des workflows de doublage efficaces.
L’API OmniHuman permet de créer rapidement du contenu engageant pour les réseaux sociaux. Générez des vidéos de tête parlante pour TikTok, Instagram Reels et YouTube Shorts avec une apparence de personnage cohérente sur plusieurs vidéos.
Pour le contenu éducatif, l’API OmniHuman 1.5 aide à créer des vidéos engageantes animées par un instructeur. Générez des formateurs virtuels cohérents qui présentent le contenu des cours avec des expressions et des mouvements naturels.
apipass.dev propose une tarification abordable pour l’API OmniHuman 1.5, conçue pour de véritables charges de travail en production. Le modèle tarifaire prend en charge la génération évolutive d’animations humaines avec des coûts prévisibles.
La documentation de l’API OmniHuman 1.5 fournit aux développeurs des instructions claires et structurées tout au long du cycle d’intégration. De la configuration de la clé API aux tests dans le playground, jusqu’au déploiement et à la montée en charge.
Avec un support 24/7 pour l’API OmniHuman 1.5, apipass.dev garantit une disponibilité continue du service et une assistance technique réactive à tout moment.
Toutes les API nécessitent une authentification via un token Bearer.
Authorization: Bearer
Créer une nouvelle tâche de génération OmniHuman 1.5
L’API accepte une charge utile JSON avec la structure suivante :
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "input": {
5 "image_url": "string",
6 "audio_url": "string",
7 "prompt": "string (optional)",
8 "fast_mode": "boolean (optional)"
9 },
10 "channel": "auto"
11}modelRequisstringLe nom du modèle à utiliser pour la génération
"bytedance/omni-human-1-5"
callBackUrlOptionnelstringURL de rappel pour les notifications de fin de tâche.
"https://your-domain.com/api/callback"
channelOptionnelstringVous pouvez spécifier le fournisseur correspondant au sein d’APIPASS via le paramètre channel ; ces fournisseurs exécutent les tâches réelles de génération d’images et de vidéos. APIPASS propose actuellement trois options de fournisseur :
La valeur par défaut du paramètre channel est auto. Lorsque cette option est activée, APIPASS répartit automatiquement les tâches entre les fournisseurs disponibles en fonction des prix en temps réel et des indicateurs de stabilité, afin d’équilibrer coût minimal et performances fiables. Conservez la valeur par défaut auto, sauf si vous avez des besoins de routage personnalisés.
Options disponibles :
auto
L’objet input contient les paramètres suivants :
input.image_urlRequisstringURL de l’image d’entrée contenant un sujet humain, un visage ou un personnage.
Types acceptés : image/jpeg, image/png, image/webp ; taille maximale : 10MB
"https://example.com/portrait.jpg"
input.audio_urlRequisstringURL du fichier audio d’entrée. La durée doit être inférieure à 35 secondes.
Types acceptés : MP3, WAV ; durée maximale : 35 secondes
"https://example.com/audio.mp3"
input.promptOptionnelstringPrompt facultatif pour un contrôle précis de la scène, des mouvements, des mouvements de caméra, etc. Prend en charge le chinois, l’anglais, le japonais, le coréen, l’espagnol et l’indonésien.
Longueur maximale : 2000 caractères
"A woman plays the piano and sings."
input.fast_modeOptionnelbooleanActivez le mode rapide pour accélérer la génération en sacrifiant certains effets. Valeur par défaut : true
true
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "bytedance/omni-human-1-5",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "image_url": "https://example.com/portrait.jpg",
9 "audio_url": "https://example.com/audio.mp3",
10 "prompt": "A woman plays the piano and sings.",
11 "fast_mode": true
12 }
13 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}codeCode de statut, 200 en cas de succès, autres valeurs en cas d’échec
messageMessage de réponse, description de l’erreur en cas d’échec
data.taskIdID de tâche pour interroger le statut de la tâche

ByteDance
ByteDance
À partir de
0 crédits
ByteDance
ByteDance
À partir de
0 crédits
ByteDance
ByteDance
Turn text, images, video clips, and audio into cinematic, audio-synced videos with a single API call.
À partir de
0 crédits
MiniMax
MiniMax
À partir de
0 crédits
ByteDance
ByteDance
Generate cinematic 4K AI videos up to 30 seconds with Seedance 2.5's multimodal power.
À partir de
0 crédits
Google Veo 3.1 is the latest state-of-the-art generative video model designed to transform text and image prompts into high-fidelity cinematic visuals. Building upon its predecessors, Veo 3.1 features significant upgrades in prompt adherence, visual realism, and native audio generation, creating 8-second clips with synchronized sound effects and dialogue.
À partir de
0 crédits
wan
wan
À partir de
0 crédits
Runway
Runway
À partir de
0 crédits
Kling
Kling
Transform text prompts and images into high-quality videos with advanced AI. Generate cinematic content with customizable duration, aspect ratio, and audio capabilities.
À partir de
0 crédits
MiniMax
MiniMax
Generate high-quality AI videos from text prompts or images with MiniMax's Hailuo 2.3 model. Support for both 6s and 10s durations, 768p and 1080p resolutions, with intelligent prompt optimization.
À partir de
0 crédits
grok
grok
Grok Imagine is xAI’s AI video generation model for creating high-quality videos with realistic motion, native audio, and synchronized speech. Grok Imagine 1.5 introduces faster generation speeds, improved motion physics, and stronger visual consistency for modern AI video applications.
À partir de
0 crédits
Kling
Kling
À partir de
0 crédits
Luma
Luma
À partir de
0 crédits
Kling
Kling
Kling v3 video generation model, supports text-to-video and image-to-video, up to 15 seconds, 1080p pro mode
À partir de
0 crédits
Kling
Kling
Generate realistic talking avatar videos from a single image and audio file using Kling AI Avatar v2 API. Create lifelike lip-sync animations with natural expressions and body movements.
À partir de
0 crédits
À partir de
0 crédits
kling
kling
À partir de
0 crédits