아직 이미지가 없습니다. 폼을 제출해 이미지를 생성하세요.
다양한 사용 사례와 매개변수 구성을 살펴보세요
숨겨진 수수료 없이 투명한 가격. 사용량에 따라 지불합니다.
| 규칙 및 양식 | Channel | 크레딧 | 가격 (USD) | 공식/참고 가격 | 일일 절감액 |
|---|---|---|---|---|---|
test otherGoogle | Regular | 999per run | $4.541 | - | - |
Gemini Omni 사용 전체 가이드
Google의 옴니모달 Gemini 모델을 단일 통합 엔드포인트를 통해 사용하여 텍스트 프롬프트에서 자연스럽고 표현력이 풍부한 다국어 오디오를 생성하세요.

ApiPass의 Gemini Omni Audio API를 사용하면 음색, 톤, 분위기, 억양, 페르소나를 포함한 음성을 정의하고 이름을 지정해 재사용 가능한 오디오 프로필로 등록할 수 있으며, 이 프로필은 휴대 가능한 오디오 ID를 반환합니다. 비디오를 생성하거나 캐릭터에 애니메이션을 적용할 때마다 음성을 다시 설명하는 대신, 한 번 음성을 만들어 두고 텍스트-비디오, 이미지-비디오, 비디오 편집 생성 전반에서 이를 참조할 수 있으며, 동일한 순방향 패스에서 생성된 동기화된 오디오를 함께 사용할 수 있습니다. Gemini Omni는 텍스트, 이미지, 오디오, 비디오를 동시에 처리하여 더 응집력 있고 일관되며 제어 가능한 출력을 제공하는 네이티브 멀티모달 모델이므로, 여기에서 생성한 음성 프로필은 ApiPass의 나머지 Gemini Omni 제품군이 생성하는 시각 결과물과 완벽하게 동기화됩니다.
Vertex AI 온보딩, 결제 계정, IAM 역할 설정을 건너뛰세요. 단일 ApiPass API 키만으로 Gemini Omni Audio를 즉시 사용할 수 있습니다.
텍스트와 오디오를 하나의 모델에서 네이티브로 추론하는 Google의 플래그십 옴니모달 아키텍처로 구동됩니다.
사람과 대화하는 듯한 획기적으로 향상된 오디오 품질을 제공하는 동일한 세대의 Gemini 오디오를 기반으로 하며, 24개 언어의 30개 HD 음성으로 더 풍부하고 자연스러운 음성 상호작용을 지원합니다.
한 번 제출하면 taskId를 받고, recordInfo를 폴링하거나 callBackUrl을 사용해 푸시 알림을 받을 수 있습니다. 서버를 차단하지 않고 장시간 실행되는 생성 작업에 적합합니다.
여러 언어로 말하면 모델이 사전 설정 없이도 자연스럽게 언어를 전환합니다. 더 이상 언어는 장벽이 아닙니다.
하나의 ApiPass 대시보드에서 모든 Gemini, Veo, Nano-Banana 모델의 비용, 지연 시간(costTime), 성공률을 추적하세요.
Google의 Gemini Omni 백본을 사용해 일반 텍스트 프롬프트를 표현력 있는 스튜디오 품질의 음성 및 오디오 출력으로 변환합니다.
사용자의 감정 표현을 이해하고 더 섬세한 대화에 맞게 적절히 응답할 수 있는 Gemini의 오디오 스택을 활용하여, 생성된 출력에 자연스러운 억양과 감정 표현을 담습니다.
모든 요청은 taskId를 반환합니다. 결과(생성된 오디오 파일의 resultUrls 포함)는 recordInfo를 통해 조회하거나 callBackUrl로 직접 전달받을 수 있습니다.
TTS, STT, LLM 제공업체를 복잡하게 조합하지 않고도 챗봇에 자연스러운 다국어 음성을 제공하세요.
스크립트, 기사 또는 긴 형식의 콘텐츠를 현실적인 운율이 담긴 내레이션 오디오로 변환하세요.
이러닝, 마케팅 또는 게임을 위해 20개 이상의 언어로 더빙과 보이스오버를 자동 생성하세요.
로봇처럼 들리지 않고 사람처럼 들리는 스크린 리더, 실시간 내레이션, 읽기 보조 앱을 구축하세요.
공식 오디오 기능이 주로 실시간 대화형 에이전트에 최적화되어 있는 반면, ApiPass Gemini Omni Audio 기능은 에셋 생성에 최적화되어 Gemini Omni 비디오 생성에 바로 연결되는 재사용 가능한 음성 프로필을 생성합니다.
Gemini의 오디오, 비디오, 멀티모달 기능에 대한 공식 액세스는 서로 다른 엔드포인트, 콘솔, 프리뷰 트랙으로 나뉘어 있습니다. ApiPass는 단일 API 키, 단일 대시보드, 일관된 JSON 스키마 뒤에 Omni 제품군(오디오, 캐릭터, 비디오)을 통합합니다.
딱딱한 사전 녹음 IVR 메뉴를 온디맨드로 생성되는 동적이고 맥락 인식 가능한 음성 응답으로 대체하세요.
블로그 게시물, 트윗 또는 스크립트를 공유 가능한 오디오 클립과 팟캐스트 에피소드로 변환하는 SaaS 제품을 구동하세요.
수십 개 언어에서 원어민 수준의 발음 샘플과 인터랙티브 대화를 생성하세요.
사전 녹음된 대사에 의존하지 않고 런타임에 생성되는 고유하고 표현력 있는 음성을 NPC에게 제공하세요.
apipass.dev에서 가입하고 대시보드에서 bearer token을 복사하세요.
https://api.apipass.dev/api/v1/jobs/createTask 로 POST를 보내고 "model": "google/gemini-omni-audio", 입력 프롬프트, 선택적 callBackUrl을 포함하세요. 응답으로 taskId를 받게 됩니다.
콜백을 기다리거나, state가 success가 된 후 GET https://api.apipass.dev/api/v1/jobs/recordInfo?taskId=... 를 호출해 resultJson.resultUrls 필드에서 완료된 오디오 URL을 가져오세요.
모든 API는 Bearer Token을 통한 인증이 필요합니다.
Authorization: Bearer
새 Nano Banana 2 이미지 생성 또는 편집 작업을 제출합니다
API는 다음 구조의 JSON 페이로드를 받습니다:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "channel": "auto",
5 "input": {
6 // Input parameters
7 }
8}model필수string생성에 사용할 모델 이름
"google/nano-banana-2"
callBackUrl선택적string작업 완료 알림을 받을 콜백 URL입니다. 생략하면 콜백이 전송되지 않습니다.
"https://your-domain.com/api/callback"
channel선택적stringchannel 매개변수를 통해 APIPASS 내 해당 제공업체를 지정할 수 있습니다. 이러한 제공업체는 실제 이미지 및 비디오 생성 작업을 처리합니다. APIPASS는 현재 세 가지 제공업체 옵션을 제공합니다:
channel 매개변수의 기본값은 auto입니다. 활성화하면 APIPASS가 실시간 가격 및 안정성 지표를 기반으로 사용 가능한 제공업체에 작업을 자동 할당하여 최소 비용과 안정적인 성능의 균형을 맞춥니다. 별도의 라우팅 요구 사항이 없는 한 기본값 auto를 유지하세요.
사용 가능한 옵션:
auto
input 객체에는 다음 매개변수가 포함됩니다:
input.prompt필수string생성하려는 이미지에 대한 텍스트 설명
최상의 결과를 위해 피사체, 스타일, 조명, 구도를 설명하세요
"A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic"
input.image_input선택적array(URL)변환하거나 참조로 사용할 입력 이미지입니다. 최대 14개의 이미지를 지원합니다.
허용되는 유형: image/jpeg, image/png; 최대 크기: 이미지당 30MB; 최대 파일 수: 14
["https://example.com/reference.jpg"]
input.aspect_ratio선택적string생성된 이미지의 종횡비입니다. image_input이 제공되면 기본값은 match_input_image이며, 그렇지 않으면 1:1입니다.
사용 가능한 옵션:
"16:9"
input.resolution선택적string생성된 이미지의 해상도입니다. 해상도가 높을수록 더 많은 디테일을 제공하지만 생성 시간이 더 오래 걸립니다. 기본값: 1K.
사용 가능한 옵션:
"1K"
input.output_format선택적string출력 이미지의 형식입니다. 기본값: jpg.
사용 가능한 옵션:
"jpg"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "google/nano-banana-2",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "prompt": "A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic",
9 "aspect_ratio": "16:9",
10 "resolution": "1K",
11 "google_search": false,
12 "image_search": false,
13 "output_format": "jpg"
14 }
15 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}code상태 코드입니다. 200은 성공, 그 외는 실패를 의미합니다
message응답 메시지입니다. 실패 시 오류 설명이 포함됩니다
data.taskId작업 상태 및 결과를 조회하기 위한 작업 ID