아직 동영상이 없습니다. 폼을 제출해 동영상을 생성하세요.
다양한 사용 사례와 매개변수 구성을 살펴보세요
숨겨진 수수료 없이 투명한 가격. 사용량에 따라 지불합니다.
| 규칙 및 양식 | Channel | 크레딧 | 가격 (USD) | 공식/참고 가격 | 일일 절감액 |
|---|---|---|---|---|---|
omni-human-1.5 videoByteDance | Starter | 1per second | $0.005 | - | - |
OmniHuman 1.5 사용 전체 가이드
초상 이미지와 오디오를 결합해 자연스러운 립싱크, 표정, 신체 움직임을 갖춘 사실적인 인간 애니메이션 영상을 생성합니다.

ByteDance가 개발한 OmniHuman 1.5는 단일 초상 이미지와 오디오 입력으로 사실적인 영상 콘텐츠를 생성하는 고급 인간 애니메이션 모델입니다. 이 모델은 제공된 오디오와 동기화된 자연스러운 입술 움직임, 표정, 신체 제스처를 합성합니다. 중국어, 영어, 일본어, 한국어, 스페인어, 인도네시아어를 포함한 여러 언어를 지원합니다. OmniHuman 1.5 API는 이 기능에 대한 프로그래밍 방식의 접근을 제공하여 개발자가 애플리케이션, 플랫폼, 프로덕션 워크플로에 인간 애니메이션 생성을 통합할 수 있게 합니다.
표준 모드는 품질과 생성 속도의 균형을 제공하며, 콘텐츠 제작, 마케팅 자료, 소셜 미디어 영상 등 대부분의 사용 사례에 적합합니다.
빠른 모드는 품질보다 생성 속도를 우선시하여 더 빠른 처리 시간을 제공합니다. 최대 시각적 충실도보다 속도가 더 중요한 빠른 프로토타이핑, 테스트, 대량 프로덕션 시나리오에 이상적입니다.
OmniHuman 1.5 API는 오디오 입력을 기반으로 매우 정확한 립싱크를 생성합니다. 입 움직임이 음성과 자연스럽게 맞춰져 디지털 아바타, 가상 발표자, 더빙 애플리케이션에 적합한 사실적인 토킹 헤드 영상을 제작합니다.
OmniHuman 1.5 API를 사용하면 오디오의 톤과 콘텐츠를 기반으로 표정이 동적으로 생성됩니다. 이 모델은 오디오의 감정적 맥락에 맞는 자연스러운 눈 움직임, 눈썹 제스처, 전반적인 얼굴 애니메이션을 만들어냅니다.
OmniHuman API는 오디오와 동기화된 섬세한 신체 움직임과 제스처를 생성합니다. 상반신 움직임, 고개 기울임, 자연스러운 흔들림을 통해 정적인 토킹 헤드 방식보다 더 몰입감 있고 생동감 있는 영상 콘텐츠를 만듭니다.
OmniHuman 1.5 API는 중국어, 영어, 일본어, 한국어, 스페인어, 인도네시아어를 포함한 여러 언어의 오디오 입력을 지원합니다. 오디오에서 사용되는 언어와 관계없이 입 움직임이 정확하게 생성됩니다.
OmniHuman 1.5 API는 장면, 움직임, 카메라 각도를 정밀하게 제어할 수 있도록 선택적 텍스트 프롬프트를 허용합니다. 개발자는 특정 동작, 환경, 시각적 스타일을 정의하여 생성 결과를 맞춤 설정할 수 있습니다.
몇 가지 간단한 단계만으로 OmniHuman 1.5 API를 시작하세요...
계정을 만들고 액세스 등록을 완료하여 OmniHuman 1.5 API Key를 받으세요. 이 API 키는 OmniHuman API로 전송되는 모든 요청을 인증하고 사용량을 계정에 연결합니다.
API를 시스템에 통합하기 전에 playground를 사용해 대화형 환경에서 OmniHuman 1.5 API를 테스트하세요. 초상 이미지와 오디오 파일을 업로드하고, 프롬프트를 조정하며, 생성 결과를 미리 확인할 수 있습니다.
테스트 후 OmniHuman 1.5 API를 백엔드 또는 애플리케이션 로직에 통합하세요. 초상 이미지, 오디오 파일, 프롬프트, 생성 파라미터가 API 요청을 통해 어떻게 전달될지 정의합니다.
OmniHuman 1.5 API를 사용하여 통합 기능을 프로덕션 환경에 배포하세요. 비동기 생성 작업을 처리하고, 작업 상태를 추적하며, 생성된 영상 결과물을 사용자에게 제공하세요.
배포가 완료되면 이미지 품질, 오디오 명확도, 프롬프트 일관성을 최적화하여 OmniHuman 1.5 API로 인간 애니메이션 생성을 확장하세요. 이 API는 프로덕션 사용을 위한 대량 워크로드를 지원합니다.
OmniHuman 1.5 API로 안정적이고 고품질의 결과를 얻으려면 최적의 이미지 및 오디오 입력을 위한 다음 지침을 따르세요.
피사체의 얼굴이 선명하게 보이는 밝고 깨끗한 초상 이미지를 제공하세요. 이미지는 충분한 해상도를 갖추고 얼굴이 뚜렷하게 드러나야 합니다. 심한 가림, 극단적인 각도, 조명이 좋지 않은 이미지는 피하세요.
오디오 파일은 길이가 35초 미만이어야 합니다. 오디오가 이 제한을 초과하는 경우 더 짧은 세그먼트로 나누세요. 과도한 배경 소음이 없는 깨끗한 오디오는 더 나은 립싱크 결과를 제공합니다.
특정 움직임, 표정 또는 장면 설정이 필요한 경우 원하는 결과를 자세히 설명하는 프롬프트를 제공하세요. 프롬프트는 모델이 사용자의 창의적 의도에 맞는 애니메이션을 생성하도록 안내하는 데 도움이 됩니다.
OmniHuman 1.5 API를 사용하면 사실적인 디지털 아바타와 가상 발표자를 만들 수 있습니다. 단일 초상 이미지와 오디오 내레이션으로 제품 데모, 튜토리얼, 프레젠테이션용 토킹 헤드 영상을 생성하세요.
다국어 지원을 통해 OmniHuman 1.5 API는 동일한 초상 이미지로 다양한 언어의 립싱크 영상을 생성하여 콘텐츠 현지화를 지원하고 효율적인 더빙 워크플로를 가능하게 합니다.
OmniHuman API는 몰입도 높은 소셜 미디어 콘텐츠를 빠르게 제작할 수 있게 합니다. 여러 영상에서 일관된 캐릭터 외형을 유지하면서 TikTok, Instagram Reels, YouTube Shorts용 토킹 헤드 영상을 생성하세요.
교육 콘텐츠의 경우 OmniHuman 1.5 API는 매력적인 강사 진행형 영상을 만드는 데 도움이 됩니다. 자연스러운 표정과 움직임으로 강의 콘텐츠를 전달하는 일관된 가상 강사를 생성하세요.
apipass.dev는 실제 프로덕션 워크로드를 위해 설계된 합리적인 OmniHuman 1.5 API 가격을 제공합니다. 이 가격 모델은 예측 가능한 비용으로 확장 가능한 인간 애니메이션 생성을 지원합니다.
OmniHuman 1.5 API 문서는 전체 통합 라이프사이클 전반에서 개발자에게 명확하고 구조화된 가이드를 제공합니다. API 키 설정과 playground 테스트부터 배포 및 확장까지 지원합니다.
24/7 OmniHuman 1.5 API 지원을 통해 apipass.dev는 지속적인 서비스 가용성과 항상 신속한 기술 지원을 보장합니다.
모든 API는 Bearer Token을 통한 인증이 필요합니다.
Authorization: Bearer
새 OmniHuman 1.5 생성 작업을 생성합니다
이 API는 다음 구조의 JSON 페이로드를 받습니다:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "input": {
5 "image_url": "string",
6 "audio_url": "string",
7 "prompt": "string (optional)",
8 "fast_mode": "boolean (optional)"
9 },
10 "channel": "auto"
11}model필수string생성에 사용할 모델 이름
"bytedance/omni-human-1-5"
callBackUrl선택적string작업 완료 알림을 위한 콜백 URL입니다.
"https://your-domain.com/api/callback"
channel선택적stringchannel 파라미터를 통해 APIPASS 내 해당 제공업체를 지정할 수 있습니다. 이러한 제공업체가 실제 이미지 및 비디오 생성 작업을 처리합니다. APIPASS는 현재 세 가지 제공업체 옵션을 제공합니다:
channel 파라미터의 기본값은 auto입니다. 활성화하면 APIPASS가 실시간 가격 및 안정성 지표를 기반으로 사용 가능한 제공업체 전반에 작업을 자동 할당하여 최소 비용과 안정적인 성능의 균형을 맞춥니다. 사용자 지정 라우팅 요구 사항이 없는 한 기본값 auto를 유지하세요.
사용 가능한 옵션:
auto
input 객체에는 다음 파라미터가 포함됩니다:
input.image_url필수string사람, 얼굴 또는 캐릭터가 포함된 입력 이미지의 URL입니다.
허용되는 유형: image/jpeg, image/png, image/webp; 최대 크기: 10MB
"https://example.com/portrait.jpg"
input.audio_url필수string입력 오디오 파일의 URL입니다. 길이는 35초 미만이어야 합니다.
허용되는 유형: MP3, WAV; 최대 길이: 35초
"https://example.com/audio.mp3"
input.prompt선택적string장면, 동작, 카메라 움직임 등을 정밀하게 제어하기 위한 선택적 프롬프트입니다. 중국어, 영어, 일본어, 한국어, 스페인어, 인도네시아어를 지원합니다.
최대 길이: 2000자
"A woman plays the piano and sings."
input.fast_mode선택적boolean일부 효과를 희생하여 생성 속도를 높이는 빠른 모드를 활성화합니다. 기본값: true
true
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "bytedance/omni-human-1-5",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "image_url": "https://example.com/portrait.jpg",
9 "audio_url": "https://example.com/audio.mp3",
10 "prompt": "A woman plays the piano and sings.",
11 "fast_mode": true
12 }
13 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}code상태 코드입니다. 200은 성공, 그 외는 실패를 의미합니다
message응답 메시지이며, 실패 시 오류 설명을 포함합니다
data.taskId작업 상태 조회에 사용하는 작업 ID

ByteDance
ByteDance
시작가
0 크레딧
ByteDance
ByteDance
시작가
0 크레딧
ByteDance
ByteDance
Turn text, images, video clips, and audio into cinematic, audio-synced videos with a single API call.
시작가
0 크레딧
MiniMax
MiniMax
시작가
0 크레딧
ByteDance
ByteDance
Generate cinematic 4K AI videos up to 30 seconds with Seedance 2.5's multimodal power.
시작가
0 크레딧
Google Veo 3.1 is the latest state-of-the-art generative video model designed to transform text and image prompts into high-fidelity cinematic visuals. Building upon its predecessors, Veo 3.1 features significant upgrades in prompt adherence, visual realism, and native audio generation, creating 8-second clips with synchronized sound effects and dialogue.
시작가
0 크레딧
wan
wan
시작가
0 크레딧
Runway
Runway
시작가
0 크레딧
Kling
Kling
Transform text prompts and images into high-quality videos with advanced AI. Generate cinematic content with customizable duration, aspect ratio, and audio capabilities.
시작가
0 크레딧
MiniMax
MiniMax
Generate high-quality AI videos from text prompts or images with MiniMax's Hailuo 2.3 model. Support for both 6s and 10s durations, 768p and 1080p resolutions, with intelligent prompt optimization.
시작가
0 크레딧
grok
grok
Grok Imagine is xAI’s AI video generation model for creating high-quality videos with realistic motion, native audio, and synchronized speech. Grok Imagine 1.5 introduces faster generation speeds, improved motion physics, and stronger visual consistency for modern AI video applications.
시작가
0 크레딧
Kling
Kling
시작가
0 크레딧
Luma
Luma
시작가
0 크레딧
Kling
Kling
Kling v3 video generation model, supports text-to-video and image-to-video, up to 15 seconds, 1080p pro mode
시작가
0 크레딧
Kling
Kling
Generate realistic talking avatar videos from a single image and audio file using Kling AI Avatar v2 API. Create lifelike lip-sync animations with natural expressions and body movements.
시작가
0 크레딧
시작가
0 크레딧
kling
kling
시작가
0 크레딧