まだ動画はありません。フォームを送信して動画を生成してください。
さまざまなユースケースとパラメータ設定を確認できます
透明な価格設定、隠れた手数料なし。使用量に応じてお支払い。
| ルールとモダリティ | Channel | クレジット | 価格(USD) | 公式/参考価格 | 1日の節約額 |
|---|---|---|---|---|---|
kling-avatar-v2-pro videoKlingmode: pro | Starter | 1per second | $0.005 | - | - |
kling-avatar-v2-std videoKlingmode: std | Starter | 0.8per second | $0.004 | - | - |
kling-avatar-v2 の完全ガイド
Kling AI Avatar v2 API を使用して、1枚の画像と音声ファイルからリアルな話すアバター動画を生成できます。自然な表情や身体の動きを備えた、リアルなリップシンクアニメーションを作成します。

KuaiShou が開発した Kling Avatar v2 は、1枚の参照画像と音声ファイルからリアルな動画コンテンツを作成する、高度な AI 搭載の話すアバター生成システムです。このシステムは音声を分析し、発話と完全に同期する正確な口の動き、表情、自然な身体ジェスチャーを生成します。この技術により、複雑なモーションキャプチャ機器や手作業のアニメーションを必要とせずに、バーチャルスポークスパーソン、デジタルプレゼンター、アニメーションキャラクターを作成できます。Kling Avatar v2 API はこの機能へのプログラムによるアクセスを提供し、開発者が話すアバター生成をアプリケーション、プラットフォーム、制作ワークフローに統合できるようにします。
Kling AI Avatar v2 Standard API は、最適化された処理速度で 720p 解像度の話すアバター動画を生成します。自然なリップシンクと身体の動きを提供し、効率性と費用対効果が重視されるソーシャルメディアコンテンツ、マーケティング素材、大量制作に適しています。
Kling AI Avatar v2 Pro API は、強化されたビジュアル品質で 1080p 解像度の話すアバター動画を生成します。このモードは、より高い解像度と洗練されたディテールが重要となるプロフェッショナルなプレゼンテーション、放送コンテンツ、プレミアム制作に最適です。
Kling Avatar v2 API は、入力音声と完全に同期する非常に正確な口の動きを生成します。システムは発話パターン、音素、タイミングを分析し、音声内容に一致する自然な口の動きを作り出すことで、説得力のある話すアバター動画を生成します。
Kling AI Avatar v2 API を使用すると、アバターは発話内容を引き立てるリアルな表情を表示します。システムは適切な感情表現、目の動き、微細な表情を生成し、アバターに生命感を与え、視聴者のエンゲージメントを高めます。
Kling Avatar v2 API は、生成される動画に自然な身体の動きやジェスチャーを追加します。手のジェスチャー、頭の動き、肩の動きが合成され、発話中の実際の人間の振る舞いを模倣した、より動的で魅力的なプレゼンテーションを作成します。
Kling AI Avatar v2 API は、アバターの動作、表情、カメラの動きをガイドするための任意のテキストプロンプトに対応しています。開発者は、目的の振る舞い、感情のトーン、プレゼンテーションスタイルを指定し、さまざまなユースケースや対象ユーザーに合わせて出力をカスタマイズできます。
Kling Avatar v2 API は、話すアバター動画を生成するために必要なのは1枚の参照画像のみです。システムは画像から顔の特徴、外見の詳細、身体構造を抽出し、生成される動画全体を通して一貫性があり認識しやすいキャラクターを作成します。
いくつかの簡単なステップで、すぐに製品を使い始められます...
アカウントを作成し、アクセス登録を行って Kling AI Avatar v2 API Key を取得します。この API キーは Kling Avatar v2 API へのすべてのリクエストを認証し、利用状況をアカウントに紐づけます。発行後、このキーにより、アプリケーションは話すアバター生成エンドポイントを安全に呼び出し、生成タスクをプログラムで管理できます。
API をシステムに統合する前に、playground を使用して対話型環境で Kling AI Avatar v2 API をテストします。参照画像と音声ファイルをアップロードし、動作制御のための任意のプロンプトを追加して、生成結果をプレビューできます。このステップにより、本番環境へ移行する前に入力品質を検証し、出力内容を理解できます。
テスト後、Kling Avatar v2 API をバックエンドまたはアプリケーションロジックに統合します。参照画像、音声ファイル、プロンプト、生成パラメータを API リクエストでどのように渡すかを定義します。この統合により、既存のワークフローやサービスの一部として、話すアバター動画生成を自動化できます。
Kling AI Avatar v2 API を使用して、統合を本番環境にデプロイします。一般的なデプロイには、非同期生成ジョブの処理、タスクステータスの追跡、生成された動画出力の保存または配信が含まれます。このステップにより、話すアバター生成を実際のユーザー向けまたは社内向けの本番パイプラインに接続できます。
デプロイ後は、画像選定、音声品質、生成モードの選択を最適化することで、Kling AI Avatar v2 API による話すアバター動画生成を拡張できます。需要の増加に応じて、API は大量ワークロードをサポートし、安定した出力品質と予測可能なリソース使用量を維持しながら、チームの制作拡大を可能にします。
Kling AI Avatar v2 API で安定した高品質な結果を得るには、参照画像と音声ファイルを慎重に準備することが重要です。以下のガイドラインに従うことで、正確なリップシンク、自然な表情、一貫した出力を確保しやすくなります。
顔、頭部、肩、胴体がはっきり見える参照画像を選択してください。画像は明るく、遮蔽物が少なく、ニュートラルまたは正面向きのポーズであることが望ましいです。リップシンクの精度に影響する可能性があるため、濃いメイク、極端な角度、顔を大きく遮る要素がある画像は避けてください。
明瞭な発話で、背景ノイズが少ない音声ファイルを使用してください。音量レベルは一貫しており、声の重なりや音楽は避ける必要があります。クリーンな音声は、アバター動画でより正確な口の動きと自然なタイミングを生成するのに役立ちます。
任意の prompt パラメータを使用して、アバターの動作、表情、カメラの動きをガイドします。「プロフェッショナルなジェスチャーをする自信に満ちたプレゼンター」や「温かい笑顔の親しみやすいスポークスパーソン」のような説明的なプロンプトは、システムがより狙いに沿った、文脈に適したアニメーションを生成するのに役立ちます。
Kling AI Avatar v2 API により、マーケターは話すスポークスパーソン動画を大規模に作成できます。ブランド画像と台本付き音声を組み合わせることで、チームはキャンペーン、製品発表、ソーシャルメディア向けの一貫したマーケティングコンテンツを、繰り返しの動画撮影や出演者調整なしで制作できます。
Kling Avatar v2 API を使用すると、教育コンテンツ制作者は静止画像とナレーション音声から講師主導の動画を生成できます。これにより、複数のレッスンにわたって一貫したプレゼンターの外見を保ちながら、研修教材、コースコンテンツ、教育動画をスケーラブルに制作できます。
Kling Avatar v2 API は、ソーシャルメディアやストリーミングプラットフォーム向けの AI インフルエンサーおよびバーチャルプレゼンターの作成をサポートします。コンテンツ制作者はキャラクター画像から話す動画を生成でき、バーチャルペルソナがリアルなリップシンクと表情で台本付きコンテンツを届けられるようになります。
カスタマーサービス用途では、Kling AI Avatar v2 API により、text-to-speech 音声からパーソナライズされた動画応答を生成できます。これにより、チャットボットやサポートシステムは人間らしい存在感のある動画メッセージを提供でき、顧客エンゲージメントとコミュニケーションの明確さを向上させます。
apipass.dev は、実際の本番ワークロード向けに設計された手頃な価格の Kling AI Avatar v2 API 料金を提供しています。この料金モデルは、予測可能なリソース使用量でスケーラブルな話すアバター生成をサポートし、不要なコスト負担なく、開発、テスト、デプロイの各段階で継続的に利用するのに適しています。
Kling AI Avatar v2 API ドキュメントは、統合ライフサイクル全体を通じて開発者向けに明確で構造化されたガイダンスを提供します。API キーの設定や playground でのテストから、デプロイやスケーリングまで、ドキュメントにはチームが話すアバターのワークフローを効率的に実装するための実践的な説明と例が含まれています。
24/7 の Kling AI Avatar v2 API サポートにより、apipass.dev は常時のサービス可用性と迅速な技術支援を提供します。統合時、本番デプロイ時、継続運用時のいずれにおいても、チームは24時間体制のサポートを頼りに、話すアバター生成を安定してスムーズに稼働させることができます。
すべてのAPIはBearer Tokenによる認証が必要です。
Authorization: Bearer
新しい Kling Avatar v2 生成タスクを作成します
この API は、以下の構造の JSON ペイロードを受け付けます:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "channel": "auto",
5 "input": {
6 // Input parameters based on form configuration
7 }
8}model必要string生成に使用するモデル名
"kling/avatar-v2"
callBackUrlオプションstringタスク完了通知用のコールバック URL。
"https://your-domain.com/api/callback"
channelオプションstringchannel パラメータを使用して、APIPASS 内の対応するプロバイダーを指定できます。これらのプロバイダーが実際の画像および動画生成タスクを処理します。APIPASS は現在、3 つのプロバイダーオプションを提供しています:
channel パラメータのデフォルト値は auto です。有効にすると、APIPASS はリアルタイムの価格と安定性指標に基づいて、利用可能なプロバイダー間でタスクを自動的に割り当て、最小コストと信頼性の高いパフォーマンスのバランスを取ります。カスタムルーティング要件がない限り、デフォルトの auto 値を維持してください。
利用可能なオプション:
auto
input オブジェクトには、フォーム設定に基づく以下のパラメータが含まれます:
input.image必要string (URL)アバター参照画像の URL。写真には被写体の頭、肩、胴体がはっきり写っている必要があります。
対応形式: .jpg/.jpeg/.png、最大サイズ: 10MB、最小寸法: 300px、アスペクト比: 1:2.5 ~ 2.5:1
"https://example.com/avatar-image.jpg"
input.audio必要string (URL)リップシンクとアバターアニメーションに使用する音声ファイルの URL。
対応形式: .mp3/.wav/.m4a/.aac、最大サイズ: 5MB
"https://example.com/speech-audio.mp3"
input.promptオプションstringアバターの動作、表情、カメラの動きを定義するテキストプロンプト。
最大長: 2500 文字
"A professional spokesperson delivering a speech with confident gestures"
input.modeオプションstring動画生成モード。デフォルトは 'std' です。
利用可能なオプション:
"std"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "kling/avatar-v2",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "image": "https://example.com/avatar-image.jpg",
9 "audio": "https://example.com/speech-audio.mp3",
10 "prompt": "A professional spokesperson delivering a speech with confident gestures",
11 "mode": "std"
12 }
13 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}codeステータスコード。200 は成功、その他は失敗を示します
messageレスポンスメッセージ。失敗時はエラーの説明が含まれます
data.taskIdタスクステータスの照会に使用するタスク ID

ByteDance
ByteDance
開始価格
0 クレジット
ByteDance
ByteDance
開始価格
0 クレジット
ByteDance
ByteDance
Turn text, images, video clips, and audio into cinematic, audio-synced videos with a single API call.
開始価格
0 クレジット
MiniMax
MiniMax
開始価格
0 クレジット
ByteDance
ByteDance
Generate cinematic 4K AI videos up to 30 seconds with Seedance 2.5's multimodal power.
開始価格
0 クレジット
Google Veo 3.1 is the latest state-of-the-art generative video model designed to transform text and image prompts into high-fidelity cinematic visuals. Building upon its predecessors, Veo 3.1 features significant upgrades in prompt adherence, visual realism, and native audio generation, creating 8-second clips with synchronized sound effects and dialogue.
開始価格
0 クレジット
wan
wan
開始価格
0 クレジット
Runway
Runway
開始価格
0 クレジット
Kling
Kling
Transform text prompts and images into high-quality videos with advanced AI. Generate cinematic content with customizable duration, aspect ratio, and audio capabilities.
開始価格
0 クレジット
ByteDance
ByteDance
Generate realistic human animation videos by combining a portrait image with audio, producing natural lip-sync, facial expressions, and body movements.
開始価格
0 クレジット
MiniMax
MiniMax
Generate high-quality AI videos from text prompts or images with MiniMax's Hailuo 2.3 model. Support for both 6s and 10s durations, 768p and 1080p resolutions, with intelligent prompt optimization.
開始価格
0 クレジット
grok
grok
Grok Imagine is xAI’s AI video generation model for creating high-quality videos with realistic motion, native audio, and synchronized speech. Grok Imagine 1.5 introduces faster generation speeds, improved motion physics, and stronger visual consistency for modern AI video applications.
開始価格
0 クレジット
Kling
Kling
開始価格
0 クレジット
Luma
Luma
開始価格
0 クレジット
Kling
Kling
Kling v3 video generation model, supports text-to-video and image-to-video, up to 15 seconds, 1080p pro mode
開始価格
0 クレジット
開始価格
0 クレジット
kling
kling
開始価格
0 クレジット