还没有视频。提交表单以生成视频。
探索不同用例和参数配置
透明定价,无隐藏费用。按需支付。
| 规则与模式 | 渠道 | 积分 | 价格(美元) | 官方/参考价格 | 每日节省 |
|---|---|---|---|---|---|
kling-avatar-v2-pro videoKlingmode: pro | Starter | 1per second | $0.005 | - | - |
kling-avatar-v2-std videoKlingmode: std | Starter | 0.8per second | $0.004 | - | - |
kling-avatar-v2 使用完整指南
使用 Kling AI Avatar v2 API,仅凭一张图片和一个音频文件即可生成逼真的数字人说话视频。创建具备自然表情和肢体动作的高真实感唇形同步动画。

Kling Avatar v2 由 KuaiShou 开发,是一套先进的 AI 驱动型数字人说话视频生成系统,可基于单张参考图片和音频文件创建逼真的视频内容。系统会分析音频,生成与语音完美同步的精准唇形动作、面部表情和自然肢体手势。借助这项技术,无需复杂的动作捕捉设备或手工动画制作,即可创建虚拟代言人、数字主持人和动画角色。Kling Avatar v2 API 提供对该能力的程序化访问,帮助开发者将数字人说话视频生成集成到应用、平台和生产工作流中。
Kling AI Avatar v2 Standard API 可生成 720p 分辨率的数字人说话视频,并针对处理速度进行了优化。它能够提供自然的唇形同步和肢体动作,适用于社交媒体内容、营销素材以及以效率和成本效益为优先的高批量生产场景。
Kling AI Avatar v2 Pro API 可生成 1080p 分辨率的数字人说话视频,并提供更高的视觉质量。该模式非常适合专业演示、广播级内容以及对更高分辨率和精细细节有要求的高端制作。
Kling Avatar v2 API 可生成与输入音频高度同步的精准唇形动作。系统会分析语音模式、音素和时序,生成与音频内容匹配的自然口型动作,从而创建可信度高的数字人说话视频。
借助 Kling AI Avatar v2 API,数字人能够呈现与语音内容相匹配的逼真面部表情。系统会生成适当的情绪表达、眼部动作和微表情,让数字人更加生动,并提升观众参与度。
Kling Avatar v2 API 会为生成的视频添加自然的肢体动作和手势。系统可合成手部姿势、头部动作和肩部运动,打造更具动态感和吸引力的呈现效果,模拟真实人类说话时的行为。
Kling AI Avatar v2 API 支持可选的文本提示词,用于引导数字人的动作、表情和镜头运动。开发者可以指定期望的行为、情绪语调和呈现风格,从而为不同用例和受众定制输出结果。
Kling Avatar v2 API 仅需一张参考图片即可生成数字人说话视频。系统会从图片中提取面部特征、外观细节和身体结构,在整个生成视频中创建一致且易于识别的角色形象。
只需几个简单步骤,即可开始使用我们的产品...
创建账户并注册访问权限,以获取你的 Kling AI Avatar v2 API Key。该 API key 用于验证所有发送到 Kling Avatar v2 API 的请求,并将用量关联到你的账户。签发后,该 key 可让你的应用安全调用数字人说话视频生成端点,并以程序化方式管理生成任务。
在将 API 集成到系统之前,请使用 playground 在交互式环境中测试 Kling AI Avatar v2 API。上传参考图片和音频文件,添加可选提示词以控制行为,并预览生成结果。此步骤可帮助你验证输入质量,并在进入生产环境前了解输出效果。
完成测试后,将 Kling Avatar v2 API 集成到你的后端或应用逻辑中。定义参考图片、音频文件、提示词和生成参数如何通过 API 请求传递。此集成可将自动化数字人说话视频生成纳入你现有的工作流或服务。
使用 Kling AI Avatar v2 API 将你的集成部署到生产环境。典型部署包括处理异步生成任务、跟踪任务状态,以及存储或交付生成的视频输出。此步骤将数字人说话视频生成连接到真实的面向用户或内部生产流程。
部署完成后,可通过优化图片选择、音频质量和生成模式选择,使用 Kling AI Avatar v2 API 扩展数字人说话视频生成规模。随着需求增长,该 API 支持高批量工作负载,帮助团队在保持稳定输出质量和可预测资源使用的同时扩大生产。
为了通过 Kling AI Avatar v2 API 获得稳定且高质量的结果,认真准备参考图片和音频文件非常重要。遵循以下指南将有助于确保准确的唇形同步、自然的表情和一致的输出效果。
请选择面部、头部、肩部和躯干清晰可见的参考图片。图片应具备良好光照、尽量少的遮挡,以及中性或正面姿态。避免使用浓妆、极端角度或面部明显遮挡的图片,否则可能影响唇形同步准确性。
使用语音清晰且背景噪声尽量少的音频文件。音频应保持稳定音量,并避免多人声重叠或音乐干扰。干净的音频有助于系统在数字人视频中生成更准确的唇形动作和更自然的时序。
使用可选的 prompt 参数来引导数字人的行为、表情和镜头运动。诸如 'confident presenter with professional gestures' 或 'friendly spokesperson with warm smile' 这类描述性提示词,可帮助系统生成更有针对性且更符合上下文的动画效果。
Kling AI Avatar v2 API 让营销人员能够规模化创建会说话的代言人视频。通过将品牌图片与脚本音频结合,团队无需反复拍摄视频或协调真人出镜,即可为营销活动、产品发布和社交媒体持续产出一致的营销内容。
借助 Kling Avatar v2 API,教育内容创作者可以从静态图片和旁白音频生成由讲师讲解的视频。这使培训资料、课程内容和教育视频能够规模化生产,并在多节课程中保持一致的讲师形象。
Kling Avatar v2 API 支持为社交媒体和流媒体平台创建 AI 网红和虚拟主持人。内容创作者可以基于角色图片生成说话视频,让虚拟人设以逼真的唇形同步和表情呈现脚本内容。
在客户服务应用中,Kling AI Avatar v2 API 可基于文本转语音音频生成个性化视频回复。这让聊天机器人和支持系统能够以更接近真人的存在感传递视频消息,从而提升客户参与度和沟通清晰度。
apipass.dev 提供价格亲民的 Kling AI Avatar v2 API 定价,专为真实生产工作负载而设计。该定价模型支持可扩展的数字人说话视频生成,并具备可预测的资源使用,适合在开发、测试和部署阶段持续使用,同时避免不必要的成本压力。
Kling AI Avatar v2 API 文档为开发者在整个集成生命周期中提供清晰、结构化的指导。从 API key 设置和 playground 测试,到部署与扩展,文档包含实用说明和示例,帮助团队高效实现数字人说话视频工作流。
凭借 7×24 小时 Kling AI Avatar v2 API 支持,apipass.dev 可确保持续的服务可用性,并随时提供响应迅速的技术协助。无论是在集成、生产部署还是持续运行期间,团队都可以依靠全天候支持,让数字人说话视频生成保持稳定并顺畅运行。
所有 API 都需要通过 Bearer Token 进行身份验证。
Authorization: Bearer
创建新的 Kling Avatar v2 生成任务
该 API 接受具有以下结构的 JSON 载荷:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "channel": "auto",
5 "input": {
6 // Input parameters based on form configuration
7 }
8}model必填string用于生成的模型名称
"kling/avatar-v2"
callBackUrl可选string用于任务完成通知的回调 URL。
"https://your-domain.com/api/callback"
channel可选string你可以通过 channel 参数在 APIPASS 中指定对应的提供方;这些提供方负责实际的图像和视频生成任务。APIPASS 目前提供三种提供方选项:
channel 参数的默认值为 auto。启用后,APIPASS 会根据实时价格和稳定性指标,在可用提供方之间自动分配任务,以在最低成本和可靠性能之间取得平衡。除非你有自定义路由需求,否则请保留默认值 auto。
可用选项:
auto
input 对象包含以下基于表单配置的参数:
input.image必填string (URL)Avatar 参考图像 URL。照片必须清晰展示主体的头部、肩部和躯干。
支持的格式:.jpg/.jpeg/.png;最大大小:10MB;最小尺寸:300px;宽高比:1:2.5 至 2.5:1
"https://example.com/avatar-image.jpg"
input.audio必填string (URL)用于对口型和 Avatar 动画的音频文件 URL。
支持的格式:.mp3/.wav/.m4a/.aac;最大大小:5MB
"https://example.com/speech-audio.mp3"
input.prompt可选string用于定义 Avatar 动作、表情和镜头运动的文本提示词。
最大长度:2500 个字符
"A professional spokesperson delivering a speech with confident gestures"
input.mode可选string视频生成模式。默认值为 'std'。
可用选项:
"std"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "kling/avatar-v2",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "image": "https://example.com/avatar-image.jpg",
9 "audio": "https://example.com/speech-audio.mp3",
10 "prompt": "A professional spokesperson delivering a speech with confident gestures",
11 "mode": "std"
12 }
13 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}code状态码,200 表示成功,其他表示失败
message响应消息;失败时为错误说明
data.taskId用于查询任务状态的任务 ID

ByteDance
ByteDance
起价
0 积分
ByteDance
ByteDance
起价
0 积分
ByteDance
ByteDance
Turn text, images, video clips, and audio into cinematic, audio-synced videos with a single API call.
起价
0 积分
MiniMax
MiniMax
起价
0 积分
ByteDance
ByteDance
Generate cinematic 4K AI videos up to 30 seconds with Seedance 2.5's multimodal power.
起价
0 积分
Google Veo 3.1 is the latest state-of-the-art generative video model designed to transform text and image prompts into high-fidelity cinematic visuals. Building upon its predecessors, Veo 3.1 features significant upgrades in prompt adherence, visual realism, and native audio generation, creating 8-second clips with synchronized sound effects and dialogue.
起价
0 积分
wan
wan
起价
0 积分
Runway
Runway
起价
0 积分
Kling
Kling
Transform text prompts and images into high-quality videos with advanced AI. Generate cinematic content with customizable duration, aspect ratio, and audio capabilities.
起价
0 积分
ByteDance
ByteDance
Generate realistic human animation videos by combining a portrait image with audio, producing natural lip-sync, facial expressions, and body movements.
起价
0 积分
MiniMax
MiniMax
Generate high-quality AI videos from text prompts or images with MiniMax's Hailuo 2.3 model. Support for both 6s and 10s durations, 768p and 1080p resolutions, with intelligent prompt optimization.
起价
0 积分
grok
grok
Grok Imagine is xAI’s AI video generation model for creating high-quality videos with realistic motion, native audio, and synchronized speech. Grok Imagine 1.5 introduces faster generation speeds, improved motion physics, and stronger visual consistency for modern AI video applications.
起价
0 积分
Kling
Kling
起价
0 积分
Luma
Luma
起价
0 积分
Kling
Kling
Kling v3 video generation model, supports text-to-video and image-to-video, up to 15 seconds, 1080p pro mode
起价
0 积分
起价
0 积分
kling
kling
起价
0 积分