まだ動画はありません。フォームを送信して動画を生成してください。
さまざまなユースケースとパラメータ設定を確認できます
透明な価格設定、隠れた手数料なし。使用量に応じてお支払い。
| ルールとモダリティ | Channel | クレジット | 価格(USD) | 公式/参考価格 | 1日の節約額 |
|---|---|---|---|---|---|
omni-human-1.5 videoByteDance | Starter | 1per second | $0.005 | - | - |
OmniHuman 1.5 の完全ガイド
ポートレート画像と音声を組み合わせて、自然なリップシンク、表情、身体の動きを備えたリアルな人物アニメーション動画を生成します。

ByteDance が開発した OmniHuman 1.5 は、1枚のポートレート画像と音声入力からリアルな動画コンテンツを生成する高度な人物アニメーションモデルです。このモデルは、提供された音声に同期した自然な口の動き、表情、身体のジェスチャーを合成します。中国語、英語、日本語、韓国語、スペイン語、インドネシア語を含む複数の言語に対応しています。OmniHuman 1.5 API はこの機能へのプログラムによるアクセスを提供し、開発者が人物アニメーション生成をアプリケーション、プラットフォーム、制作ワークフローに統合できるようにします。
標準モードは品質と生成速度のバランスに優れており、コンテンツ制作、マーケティング素材、ソーシャルメディア動画など、ほとんどのユースケースに適しています。
高速モードは品質よりも生成速度を優先し、より短い納期を実現します。最大限の視覚的忠実度よりも速度が重要なラピッドプロトタイピング、テスト、大量制作シナリオに最適です。
OmniHuman 1.5 API は、音声入力から非常に正確なリップシンクを生成します。口の動きは発話に自然に一致し、デジタルアバター、バーチャルプレゼンター、吹き替えアプリケーションに適したリアルなトーキングヘッド動画を作成できます。
OmniHuman 1.5 API では、音声のトーンや内容に基づいて表情が動的に生成されます。このモデルは、音声の感情的な文脈に合った自然な目の動き、眉のジェスチャー、全体的な顔のアニメーションを生成します。
OmniHuman API は、音声に同期した繊細な身体の動きやジェスチャーを生成します。上半身の動き、首の傾き、自然な揺れにより、静的なトーキングヘッド手法と比べて、より魅力的で生き生きとした動画コンテンツを作成できます。
OmniHuman 1.5 API は、中国語、英語、日本語、韓国語、スペイン語、インドネシア語を含む複数の言語の音声入力に対応しています。音声で話されている言語に関係なく、口の動きが正確に生成されます。
OmniHuman 1.5 API では、シーン、動き、カメラアングルを精密に制御するための任意のテキストプロンプトを使用できます。開発者は、生成結果をカスタマイズするために、具体的なアクション、環境、ビジュアルスタイルを定義できます。
いくつかの簡単な手順だけで OmniHuman 1.5 API を使い始められます...
アカウントを作成し、アクセス登録を行って OmniHuman 1.5 APIキーを取得します。この APIキーは OmniHuman API へのすべてのリクエストを認証し、利用状況をあなたのアカウントに紐付けます。
API をシステムに統合する前に、playground を使用してインタラクティブな環境で OmniHuman 1.5 API をテストします。ポートレート画像と音声ファイルをアップロードし、プロンプトを調整して、生成結果をプレビューできます。
テスト後、OmniHuman 1.5 API をバックエンドまたはアプリケーションロジックに統合します。ポートレート画像、音声ファイル、プロンプト、生成パラメータを API リクエストを通じてどのように渡すかを定義します。
OmniHuman 1.5 API を使用して、統合を本番環境にデプロイします。非同期生成ジョブを処理し、タスクのステータスを追跡し、生成された動画出力をユーザーに提供します。
デプロイ後は、画像品質、音声の明瞭さ、プロンプトの一貫性を最適化することで、OmniHuman 1.5 API による人物アニメーション生成をスケールできます。この API は本番利用向けの大量ワークロードに対応しています。
OmniHuman 1.5 API で安定した高品質な結果を得るには、最適な画像および音声入力のために以下のガイドラインに従ってください。
被写体の顔がはっきり見える、明るく鮮明なポートレート画像を用意してください。画像は十分な解像度があり、顔が目立つように写っている必要があります。大きな遮蔽、極端な角度、不十分な照明の画像は避けてください。
音声ファイルの長さは 35 秒未満である必要があります。音声がこの制限を超える場合は、短いセグメントに分割してください。過度な背景ノイズのないクリアな音声は、より良いリップシンク結果を生み出します。
特定の動き、表情、シーン設定が必要な場合は、望ましい出力を説明する詳細なプロンプトを入力してください。プロンプトは、あなたのクリエイティブな意図に合ったアニメーションをモデルが生成するためのガイドになります。
OmniHuman 1.5 API により、リアルなデジタルアバターやバーチャルプレゼンターを作成できます。1枚のポートレートと音声ナレーションから、製品デモ、チュートリアル、プレゼンテーション向けのトーキングヘッド動画を生成します。
多言語対応により、OmniHuman 1.5 API は同じポートレート画像から異なる言語のリップシンク動画を生成し、効率的な吹き替えワークフローを可能にすることで、コンテンツのローカライズを支援します。
OmniHuman API は、魅力的なソーシャルメディアコンテンツを迅速に作成できるようにします。複数の動画で一貫したキャラクターの外見を保ちながら、TikTok、Instagram Reels、YouTube Shorts 向けのトーキングヘッド動画を生成します。
教育コンテンツ向けに、OmniHuman 1.5 API は魅力的な講師主導の動画作成を支援します。自然な表情と動きでコース内容を伝える、一貫性のあるバーチャル講師を生成できます。
apipass.dev は、実際の本番ワークロード向けに設計された手頃な価格の OmniHuman 1.5 API 料金を提供しています。この料金モデルは、予測可能なコストでスケーラブルな人物アニメーション生成をサポートします。
OmniHuman 1.5 API ドキュメントは、統合ライフサイクル全体を通じて開発者に明確で体系的なガイダンスを提供します。APIキーの設定や playground でのテストから、デプロイとスケーリングまで対応します。
24/7 の OmniHuman 1.5 API サポートにより、apipass.dev は継続的なサービス可用性と迅速な技術支援を常に提供します。
すべてのAPIはBearer Tokenによる認証が必要です。
Authorization: Bearer
新しい OmniHuman 1.5 生成タスクを作成します
この API は、次の構造の JSON ペイロードを受け取ります:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "input": {
5 "image_url": "string",
6 "audio_url": "string",
7 "prompt": "string (optional)",
8 "fast_mode": "boolean (optional)"
9 },
10 "channel": "auto"
11}model必要string生成に使用するモデル名
"bytedance/omni-human-1-5"
callBackUrlオプションstringタスク完了通知用のコールバック URL。
"https://your-domain.com/api/callback"
channelオプションstringchannel パラメータを使用して、APIPASS 内の対応するプロバイダーを指定できます。これらのプロバイダーが実際の画像および動画生成タスクを処理します。APIPASS は現在、3つのプロバイダーオプションを提供しています:
channel パラメータのデフォルト値は auto です。有効にすると、APIPASS はリアルタイムの価格と安定性指標に基づき、利用可能なプロバイダー間でタスクを自動的に割り当て、最小コストと信頼性の高いパフォーマンスのバランスを取ります。カスタムルーティング要件がない限り、デフォルトの auto 値を維持してください。
利用可能なオプション:
auto
input オブジェクトには、次のパラメータが含まれます:
input.image_url必要string人物、顔、またはキャラクターを含む入力画像の URL。
対応タイプ: image/jpeg, image/png, image/webp; 最大サイズ: 10MB
"https://example.com/portrait.jpg"
input.audio_url必要string入力音声ファイルの URL。長さは35秒未満である必要があります。
対応タイプ: MP3, WAV; 最大長: 35秒
"https://example.com/audio.mp3"
input.promptオプションstringシーン、動き、カメラワークなどを精密に制御するための任意のプロンプト。中国語、英語、日本語、韓国語、スペイン語、インドネシア語に対応しています。
最大長: 2000文字
"A woman plays the piano and sings."
input.fast_modeオプションboolean一部の効果を犠牲にして生成を高速化する fast mode を有効にします。デフォルト: true
true
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "bytedance/omni-human-1-5",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "image_url": "https://example.com/portrait.jpg",
9 "audio_url": "https://example.com/audio.mp3",
10 "prompt": "A woman plays the piano and sings.",
11 "fast_mode": true
12 }
13 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}codeステータスコード。200 は成功、その他は失敗を示します
messageレスポンスメッセージ。失敗時はエラーの説明が含まれます
data.taskIdタスクのステータス照会に使用するタスクID

ByteDance
ByteDance
開始価格
0 クレジット
ByteDance
ByteDance
開始価格
0 クレジット
ByteDance
ByteDance
Turn text, images, video clips, and audio into cinematic, audio-synced videos with a single API call.
開始価格
0 クレジット
MiniMax
MiniMax
開始価格
0 クレジット
ByteDance
ByteDance
Generate cinematic 4K AI videos up to 30 seconds with Seedance 2.5's multimodal power.
開始価格
0 クレジット
Google Veo 3.1 is the latest state-of-the-art generative video model designed to transform text and image prompts into high-fidelity cinematic visuals. Building upon its predecessors, Veo 3.1 features significant upgrades in prompt adherence, visual realism, and native audio generation, creating 8-second clips with synchronized sound effects and dialogue.
開始価格
0 クレジット
wan
wan
開始価格
0 クレジット
Runway
Runway
開始価格
0 クレジット
Kling
Kling
Transform text prompts and images into high-quality videos with advanced AI. Generate cinematic content with customizable duration, aspect ratio, and audio capabilities.
開始価格
0 クレジット
MiniMax
MiniMax
Generate high-quality AI videos from text prompts or images with MiniMax's Hailuo 2.3 model. Support for both 6s and 10s durations, 768p and 1080p resolutions, with intelligent prompt optimization.
開始価格
0 クレジット
grok
grok
Grok Imagine is xAI’s AI video generation model for creating high-quality videos with realistic motion, native audio, and synchronized speech. Grok Imagine 1.5 introduces faster generation speeds, improved motion physics, and stronger visual consistency for modern AI video applications.
開始価格
0 クレジット
Kling
Kling
開始価格
0 クレジット
Luma
Luma
開始価格
0 クレジット
Kling
Kling
Kling v3 video generation model, supports text-to-video and image-to-video, up to 15 seconds, 1080p pro mode
開始価格
0 クレジット
Kling
Kling
Generate realistic talking avatar videos from a single image and audio file using Kling AI Avatar v2 API. Create lifelike lip-sync animations with natural expressions and body movements.
開始価格
0 クレジット
開始価格
0 クレジット
kling
kling
開始価格
0 クレジット