还没有视频。提交表单以生成视频。
探索不同用例和参数配置
透明定价,无隐藏费用。按需支付。
| 规则与模式 | 渠道 | 积分 | 价格(美元) | 官方/参考价格 | 每日节省 |
|---|---|---|---|---|---|
omni-human-1.5 videoByteDance | Starter | 1per second | $0.005 | - | - |
OmniHuman 1.5 使用完整指南
通过将人像图片与音频结合,生成逼真的人物动画视频,呈现自然的口型同步、面部表情和肢体动作。

OmniHuman 1.5 由 ByteDance 开发,是一款先进的人物动画模型,可基于单张人像图片和音频输入生成逼真的视频内容。该模型能够合成与所提供音频同步的自然唇部动作、面部表情和身体姿态。它支持包括中文、英语、日语、韩语、西班牙语和印尼语在内的多种语言。OmniHuman 1.5 API 提供对这一能力的程序化访问,使开发者能够将人物动画生成集成到应用、平台和生产工作流中。
标准模式在质量与生成速度之间取得平衡,适用于大多数使用场景,包括内容创作、营销素材和社交媒体视频。
快速模式优先考虑生成速度而非质量,可缩短交付时间。适合快速原型开发、测试,以及速度比最高视觉保真度更重要的大批量生产场景。
OmniHuman 1.5 API 可根据音频输入生成高度准确的口型同步效果。嘴部动作与语音自然匹配,生成适用于数字头像、虚拟主持人和配音应用的逼真说话人像视频。
借助 OmniHuman 1.5 API,面部表情会根据音频语调和内容动态生成。模型可生成自然的眼部运动、眉部动作和整体面部动画,与音频的情绪语境相匹配。
OmniHuman API 可生成与音频同步的细微身体动作和手势。上半身动作、头部倾斜和自然摆动,相比静态说话人像方案,能够创建更具吸引力、更逼真的视频内容。
OmniHuman 1.5 API 支持多种语言的音频输入,包括中文、英语、日语、韩语、西班牙语和印尼语。无论音频使用哪种语言,模型都能准确生成对应的唇部动作。
OmniHuman 1.5 API 支持可选文本提示词,用于精确控制场景、动作和镜头角度。开发者可以定义具体动作、环境和视觉风格,以自定义生成结果。
只需几个简单步骤,即可开始使用 OmniHuman 1.5 API...
创建账户并注册访问权限,以获取你的 OmniHuman 1.5 API Key。此 API key 用于验证所有发送到 OmniHuman API 的请求,并将用量关联到你的账户。
在将 API 集成到你的系统之前,可使用 playground 在交互式环境中测试 OmniHuman 1.5 API。上传人像图片和音频文件,调整提示词,并预览生成结果。
测试完成后,将 OmniHuman 1.5 API 集成到你的后端或应用逻辑中。定义如何通过 API 请求传递人像图片、音频文件、提示词和生成参数。
使用 OmniHuman 1.5 API 将你的集成部署到生产环境。处理异步生成任务、跟踪任务状态,并将生成的视频结果交付给用户。
部署后,可通过优化图像质量、音频清晰度和提示词一致性,使用 OmniHuman 1.5 API 扩展人物动画生成能力。该 API 支持面向生产环境的大批量工作负载。
要使用 OmniHuman 1.5 API 获得稳定、高质量的结果,请遵循以下图像和音频输入优化指南。
提供清晰、光线充足且主体面部清楚可见的人像图片。图片应具备良好分辨率,并突出呈现面部。避免使用严重遮挡、极端角度或光线较差的图片。
音频文件时长必须少于 35 秒。如果音频超过此限制,请将其拆分为更短的片段。清晰且没有过多背景噪声的音频可生成更好的口型同步效果。
当你需要特定动作、表情或场景设置时,请提供详细提示词来描述期望的输出。提示词有助于引导模型生成符合你创意愿景的动画。
OmniHuman 1.5 API 支持创建逼真的数字头像和虚拟主持人。仅需一张人像和一段音频旁白,即可生成用于产品演示、教程和演讲的说话人像视频。
凭借多语言支持,OmniHuman 1.5 API 可基于同一张人像图片生成不同语言的口型同步视频,帮助实现高效的配音工作流,从而推动内容本地化。
OmniHuman API 可快速创建引人入胜的社交媒体内容。为 TikTok、Instagram Reels 和 YouTube Shorts 生成说话人像视频,并在多个视频中保持一致的角色外观。
对于教育内容,OmniHuman 1.5 API 可帮助创建更具吸引力的讲师出镜视频。生成外观一致的虚拟讲师,以自然的表情和动作讲授课程内容。
apipass.dev 提供高性价比的 OmniHuman 1.5 API 定价,面向真实生产工作负载而设计。该定价模型支持以可预测的成本进行可扩展的人物动画生成。
OmniHuman 1.5 API 文档为开发者在整个集成生命周期中提供清晰、结构化的指导,涵盖从 API key 设置、playground 测试到部署和扩展的全过程。
借助 7×24 小时 OmniHuman 1.5 API 支持,apipass.dev 可确保服务持续可用,并随时提供快速响应的技术协助。
所有 API 都需要通过 Bearer Token 进行身份验证。
Authorization: Bearer
创建新的 OmniHuman 1.5 生成任务
该 API 接受具有以下结构的 JSON payload:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "input": {
5 "image_url": "string",
6 "audio_url": "string",
7 "prompt": "string (optional)",
8 "fast_mode": "boolean (optional)"
9 },
10 "channel": "auto"
11}model必填string用于生成的模型名称
"bytedance/omni-human-1-5"
callBackUrl可选string用于任务完成通知的回调 URL。
"https://your-domain.com/api/callback"
channel可选string你可以通过 channel 参数在 APIPASS 中指定对应的服务商;这些服务商负责实际的图像和视频生成任务。APIPASS 目前提供三种服务商选项:
channel 参数的默认值为 auto。启用后,APIPASS 会根据实时价格和稳定性指标,在可用服务商之间自动分配任务,以平衡最低成本和可靠性能。除非你有自定义路由需求,否则请保留默认值 auto。
可用选项:
auto
input 对象包含以下参数:
input.image_url必填string包含人物主体、人脸或角色的输入图像 URL。
支持的类型:image/jpeg、image/png、image/webp;最大大小:10MB
"https://example.com/portrait.jpg"
input.audio_url必填string输入音频文件的 URL。时长必须少于 35 秒。
支持的类型:MP3、WAV;最大时长:35 秒
"https://example.com/audio.mp3"
input.prompt可选string可选提示词,用于精确控制场景、动作、镜头运动等。支持中文、英文、日文、韩文、西班牙文和印尼文。
最大长度:2000 个字符
"A woman plays the piano and sings."
input.fast_mode可选boolean启用快速模式,通过牺牲部分效果来提升生成速度。默认值:true
true
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "bytedance/omni-human-1-5",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "image_url": "https://example.com/portrait.jpg",
9 "audio_url": "https://example.com/audio.mp3",
10 "prompt": "A woman plays the piano and sings.",
11 "fast_mode": true
12 }
13 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}code状态码,200 表示成功,其他表示失败
message响应消息,失败时为错误说明
data.taskId用于查询任务状态的任务 ID

ByteDance
ByteDance
起价
0 积分
ByteDance
ByteDance
起价
0 积分
ByteDance
ByteDance
Turn text, images, video clips, and audio into cinematic, audio-synced videos with a single API call.
起价
0 积分
MiniMax
MiniMax
起价
0 积分
ByteDance
ByteDance
Generate cinematic 4K AI videos up to 30 seconds with Seedance 2.5's multimodal power.
起价
0 积分
Google Veo 3.1 is the latest state-of-the-art generative video model designed to transform text and image prompts into high-fidelity cinematic visuals. Building upon its predecessors, Veo 3.1 features significant upgrades in prompt adherence, visual realism, and native audio generation, creating 8-second clips with synchronized sound effects and dialogue.
起价
0 积分
wan
wan
起价
0 积分
Runway
Runway
起价
0 积分
Kling
Kling
Transform text prompts and images into high-quality videos with advanced AI. Generate cinematic content with customizable duration, aspect ratio, and audio capabilities.
起价
0 积分
MiniMax
MiniMax
Generate high-quality AI videos from text prompts or images with MiniMax's Hailuo 2.3 model. Support for both 6s and 10s durations, 768p and 1080p resolutions, with intelligent prompt optimization.
起价
0 积分
grok
grok
Grok Imagine is xAI’s AI video generation model for creating high-quality videos with realistic motion, native audio, and synchronized speech. Grok Imagine 1.5 introduces faster generation speeds, improved motion physics, and stronger visual consistency for modern AI video applications.
起价
0 积分
Kling
Kling
起价
0 积分
Luma
Luma
起价
0 积分
Kling
Kling
Kling v3 video generation model, supports text-to-video and image-to-video, up to 15 seconds, 1080p pro mode
起价
0 积分
Kling
Kling
Generate realistic talking avatar videos from a single image and audio file using Kling AI Avatar v2 API. Create lifelike lip-sync animations with natural expressions and body movements.
起价
0 积分
起价
0 积分
kling
kling
起价
0 积分