还没有图片。提交表单以生成图片。
探索不同用例和参数配置
透明定价,无隐藏费用。按需支付。
| 规则与模式 | 渠道 | 积分 | 价格(美元) | 官方/参考价格 | 每日节省 |
|---|---|---|---|---|---|
test otherGoogle | Regular | 999per run | $4.541 | - | - |
Gemini Omni 使用完整指南
通过单一统一端点,使用 Google 的全模态 Gemini 模型,从文本提示生成自然、富有表现力且支持多语言的音频。

ApiPass 上的 Gemini Omni 音频 API 让你可以定义、命名并注册一个声音——包括音色、语调、情绪、口音和人设——作为可复用的音频配置文件,并返回可移植的音频 ID。这样一来,在生成视频或为角色制作动画时,你无需每次都重新描述声音,只需创建一次声音,然后在文本转视频、图像转视频和视频编辑生成中反复引用,并在同一次前向生成过程中产出同步音频。由于 Gemini Omni 原生支持多模态——可同时处理文本、图像、音频和视频,以获得更连贯、一致且可控的输出——你在这里创建的声音配置文件能够与 ApiPass 上 Gemini Omni 系列其他能力生成的画面完美同步。
跳过 Vertex AI 入门配置、结算账户和 IAM 角色。只需一个 ApiPass API key,即可立即使用 Gemini Omni 音频能力。
由 Google 旗舰级全模态架构驱动,可在同一个模型中原生理解并推理文本与音频。
基于同一代 Gemini 音频生成技术,带来显著提升的音频质量,听起来像是在与真人对话,并通过 30 种 HD 声音、24 种语言提供更丰富、更自然的语音交互。
提交一次请求即可获得 taskId,随后可轮询 recordInfo,或使用 callBackUrl 接收推送通知——非常适合长时间运行的生成任务,避免阻塞你的服务器。
可使用多种语言表达,模型会在不同语言之间轻松切换,无需任何预先配置;语言不再是障碍。
在一个 ApiPass 控制台中统一跟踪所有 Gemini、Veo 和 Nano-Banana 模型的成本、延迟(costTime)和成功率。
使用 Google 的 Gemini Omni 底层能力,将普通文本提示转换为富有表现力、具备录音棚品质的语音和音频输出。
借助 Gemini 的音频栈,模型能够理解并恰当地回应用户的情绪表达,从而生成带有自然语调和情感色彩、更细腻的对话输出。
每个请求都会返回 taskId;结果(包括指向生成音频文件的 resultUrls)可通过 recordInfo 查询,或直接发送到你的 callBackUrl。
无需拼接 TTS、STT 和 LLM 服务商,也能为你的聊天机器人赋予自然、多语言的声音。
将脚本、文章或长篇内容转换为带有真实韵律的旁白音频。
为在线学习、营销或游戏内容自动生成 20+ 种语言的译制配音和旁白。
构建听起来像真人而非机器人的屏幕阅读器、实时旁白和阅读辅助应用。
官方音频能力主要针对实时对话智能体进行优化,而 ApiPass 的 Gemini Omni 音频能力则面向素材创作优化——生成可复用的声音配置文件,可直接接入 Gemini Omni 视频生成流程。
Gemini 的音频、视频和多模态官方能力分散在不同端点、控制台和预览通道中。ApiPass 将 Omni 系列——音频、角色、视频——整合在一个 API key、一个控制台和一致的 JSON schema 之后。
用按需生成的动态、上下文感知语音响应,替代生硬的预录 IVR 菜单。
为 SaaS 产品赋能,将博客文章、推文或脚本转换为可分享的音频片段和播客节目。
生成接近母语者水准的发音示例和互动对话,覆盖数十种语言。
为非玩家角色赋予独特且富有表现力的声音,在运行时生成台词,而无需依赖预录音频。
在 apipass.dev 注册,并从控制台复制你的 bearer token。
向 https://api.apipass.dev/api/v1/jobs/createTask 发送 POST 请求,携带 "model": "google/gemini-omni-audio"、你的输入提示,以及可选的 callBackUrl。你将在响应中收到 taskId。
可以等待回调,或在 state 为 success 后,通过 GET https://api.apipass.dev/api/v1/jobs/recordInfo?taskId=... 从 resultJson.resultUrls 字段获取已完成的音频 URL。
所有 API 都需要通过 Bearer Token 进行身份验证。
Authorization: Bearer
提交新的 Nano Banana 2 图像生成或编辑任务
该 API 接受具有以下结构的 JSON 请求体:
1{
2 "model": "string",
3 "callBackUrl": "string (optional)",
4 "channel": "auto",
5 "input": {
6 // Input parameters
7 }
8}model必填string用于生成的模型名称
"google/nano-banana-2"
callBackUrl可选string用于任务完成通知的回调 URL。如果省略,则不会发送回调。
"https://your-domain.com/api/callback"
channel可选string你可以通过 channel 参数指定 APIPASS 内对应的提供商;这些提供商负责处理实际的图像和视频生成任务。APIPASS 目前提供三种提供商选项:
channel 参数的默认值为 auto。启用后,APIPASS 会根据实时价格和稳定性指标,在可用提供商之间自动分配任务,以平衡最低成本和可靠性能。除非你有自定义路由需求,否则请保留默认值 auto。
可用选项:
auto
input 对象包含以下参数:
input.prompt必填string你想生成的图像的文本描述
描述主体、风格、光照和构图,可获得最佳效果
"A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic"
input.image_input可选array(URL)用于转换或作为参考的输入图像。最多支持 14 张图像。
接受的类型:image/jpeg、image/png;最大大小:每张图片 30MB;最多文件数:14
["https://example.com/reference.jpg"]
input.aspect_ratio可选string生成图像的宽高比。当提供 image_input 时默认为 match_input_image,否则默认为 1:1。
可用选项:
"16:9"
input.resolution可选string生成图像的分辨率。更高分辨率会产生更多细节,但生成耗时更长。默认值:1K。
可用选项:
"1K"
input.output_format可选string输出图像的格式。默认值:jpg。
可用选项:
"jpg"
1curl -X POST "https://api.apipass.dev/api/v1/jobs/createTask" \
2 -H "Content-Type: application/json" \
3 -H "Authorization: Bearer YOUR_API_KEY" \
4 -d '{
5 "model": "google/nano-banana-2",
6 "callBackUrl": "https://your-domain.com/api/callback",
7 "input": {
8 "prompt": "A serene alpine lake reflecting snow-capped mountains at golden hour, photorealistic",
9 "aspect_ratio": "16:9",
10 "resolution": "1K",
11 "google_search": false,
12 "image_search": false,
13 "output_format": "jpg"
14 }
15 }'1{
2 "code": 200,
3 "message": "success",
4 "data": {
5 "taskId": "task_12345678"
6 }
7}code状态码,200 表示成功,其他表示失败
message响应消息,失败时为错误描述
data.taskId用于查询任务状态和结果的任务 ID