まだ画像はありません。フォームを送信して画像を生成してください。
さまざまなユースケースとパラメータ設定を確認できます
透明な価格設定、隠れた手数料なし。使用量に応じてお支払い。
| ルールとモダリティ | Channel | クレジット | 価格(USD) | 公式/参考価格 | 1日の節約額 |
|---|---|---|---|---|---|
test otherGoogle | Regular | 999per run | $4.541 | - | - |
Gemini Omni の完全ガイド
Google のオムニモーダル Gemini モデルを単一の統合エンドポイント経由で使用し、テキストプロンプトから自然で表現力豊かな多言語音声を生成します。

ApiPass の Gemini Omni Audio API では、声の音色、トーン、ムード、アクセント、ペルソナを定義・命名・登録し、再利用可能な音声プロファイルとしてポータブルな音声 ID を返すことができます。動画を生成したりキャラクターをアニメーション化したりするたびに声を再説明する代わりに、一度声を作成すれば、テキストから動画、画像から動画、動画編集の各生成で参照でき、同じフォワードパス内で生成された同期音声を利用できます。Gemini Omni はテキスト、画像、音声、動画を同時に処理し、より一貫性があり、安定し、制御しやすい出力を実現するネイティブなマルチモーダルモデルであるため、ここで作成した音声プロファイルは、ApiPass 上の Gemini Omni ファミリーの他の機能で生成されるビジュアルと完全に同期します。
Vertex AI のオンボーディング、請求先アカウント、IAM ロールの設定を省略できます。1 つの ApiPass API キーだけで、Gemini Omni Audio をすぐに利用できます。
テキストと音声を 1 つのモデル内でネイティブに横断推論する、Google のフラッグシップ オムニモーダルアーキテクチャを搭載しています。
人と話しているように感じられるほど音質が大幅に向上した Gemini 音声世代を基盤としており、24 言語の 30 種類の HD 音声で、より豊かで自然な音声インタラクションを実現します。
一度送信すると taskId を受け取り、recordInfo をポーリングするか callBackUrl を使ってプッシュ通知を受け取れます。サーバーをブロックせずに長時間の生成を行うのに最適です。
複数の言語で話しても、事前設定なしでモデルが自然に切り替えます。言語はもはや障壁ではありません。
1 つの ApiPass ダッシュボードで、すべての Gemini、Veo、Nano-Banana モデルのコスト、レイテンシ(costTime)、成功率を追跡できます。
Google の Gemini Omni バックボーンを使用して、プレーンテキストのプロンプトを表現力豊かなスタジオ品質のスピーチや音声出力に変換します。
ユーザーの感情表現を理解し、よりニュアンスのある会話に適切に応答できる Gemini の音声スタックを活用することで、生成される出力には自然なイントネーションと感情表現が反映されます。
すべてのリクエストは taskId を返します。結果(生成された音声ファイルへの resultUrls を含む)は recordInfo 経由で取得するか、callBackUrl に直接配信できます。
TTS、STT、LLM プロバイダーをつなぎ合わせることなく、チャットボットに自然な多言語音声を持たせることができます。
台本、記事、長文コンテンツを、リアルな韻律を備えたナレーション音声に変換します。
e ラーニング、マーケティング、ゲーム向けに、20 以上の言語で吹き替えやボイスオーバーを自動生成します。
ロボットのようではなく人間らしく聞こえるスクリーンリーダー、リアルタイムナレーション、読書支援アプリを構築できます。
公式の音声機能が主にリアルタイムの対話型エージェント向けに最適化されているのに対し、ApiPass の Gemini Omni Audio 機能はアセット作成向けに最適化されており、Gemini Omni の動画生成に直接組み込める再利用可能な音声プロファイルを生成します。
Gemini の音声、動画、マルチモーダル機能への公式アクセスは、異なるエンドポイント、コンソール、プレビュートラックに分かれています。ApiPass は Omni ファミリー(音声、キャラクター、動画)を、単一の API キー、単一のダッシュボード、一貫した JSON スキーマの背後に統合します。
硬い事前録音の IVR メニューを、オンデマンドで生成される動的で文脈認識型の音声応答に置き換えます。
ブログ記事、ツイート、台本を共有可能な音声クリップやポッドキャストエピソードに変換する SaaS 製品を強化します。
数十の言語にわたって、ネイティブ品質の発音サンプルやインタラクティブな会話を生成します。
事前録音されたセリフに頼るのではなく、実行時に生成されるユニークで表現力豊かな声をノンプレイヤーキャラクターに与えます。
apipass.dev でサインアップし、ダッシュボードから bearer token をコピーします。
https://api.apipass.dev/api/v1/jobs/createTask に POST を送信し、"model": "google/gemini-omni-audio"、入力プロンプト、任意の callBackUrl を指定します。レスポンスで taskId を受け取ります。
コールバックを待つか、state が success になった後に GET https://api.apipass.dev/api/v1/jobs/recordInfo?taskId=... を実行して、resultJson.resultUrls フィールドから完成した音声 URL を取得します。
すべてのAPIはBearer Tokenによる認証が必要です。
Authorization: Bearer
新しい Nano Banana 2 の画像生成または編集タスクを送信します
この API は、以下の構造を持つ JSON ペイロードを受け付けます:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "channel": "auto",
5 "input": {
6 // Input parameters
7 }
8}model必要string生成に使用するモデル名
"google/nano-banana-2"
callBackUrlオプションstringタスク完了通知用のコールバック URL。省略した場合、コールバックは送信されません。
"https://your-domain.com/api/callback"
channelオプションstringchannel パラメータを使用して、APIPASS 内の対応するプロバイダーを指定できます。これらのプロバイダーは実際の画像および動画生成タスクを処理します。APIPASS は現在、3 つのプロバイダーオプションを提供しています:
channel パラメータのデフォルト値は auto です。有効にすると、APIPASS はリアルタイムの価格と安定性指標に基づいて、利用可能なプロバイダー間でタスクを自動的に割り当て、最小コストと信頼性の高いパフォーマンスのバランスを取ります。カスタムルーティング要件がない限り、デフォルトの auto 値を維持してください。
利用可能なオプション:
auto
input オブジェクトには以下のパラメータが含まれます:
input.prompt必要string生成したい画像のテキスト説明
最良の結果を得るには、被写体、スタイル、ライティング、構図を記述してください
"A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic"
input.image_inputオプションarray(URL)変換または参照として使用する入力画像。最大 14 枚の画像に対応しています。
対応タイプ: image/jpeg, image/png; 最大サイズ: 画像 1 枚あたり 30MB; 最大ファイル数: 14
["https://example.com/reference.jpg"]
input.aspect_ratioオプションstring生成画像のアスペクト比。image_input が指定されている場合はデフォルトで match_input_image、それ以外の場合は 1:1 になります。
利用可能なオプション:
"16:9"
input.resolutionオプションstring生成画像の解像度。解像度が高いほど詳細になりますが、生成に時間がかかります。デフォルト: 1K。
利用可能なオプション:
"1K"
input.output_formatオプションstring出力画像の形式。デフォルト: jpg。
利用可能なオプション:
"jpg"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "google/nano-banana-2",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "prompt": "A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic",
9 "aspect_ratio": "16:9",
10 "resolution": "1K",
11 "google_search": false,
12 "image_search": false,
13 "output_format": "jpg"
14 }
15 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}codeステータスコード。200 は成功、それ以外は失敗を示します
messageレスポンスメッセージ。失敗時はエラー内容を示します
data.taskIdタスクのステータスと結果を照会するためのタスク ID