Gemini 使用说明
Modelink 接入的是 Google Vertex AI 官方标准资源池,所有请求均路由至 Global 区域。受 Vertex AI 官方机制限制,平台无法提供固定的 RPM 保证,建议在业务侧实现请求重试机制。
控制思考(thinking_level)
Gemini 3 模型引入 thinking_level 参数,将思考预算简化为多个级别。如果不需要复杂推理,可以限制 thinking_level 以获得更快、延迟更低的回答。
LOW:限制模型使用较少 token 进行思考,适合不需要大量推理的简单任务,也适合需要快速处理的高吞吐量场景。HIGH:允许模型使用更多 token 进行思考,适合多步规划、经过验证的代码生成或高级函数调用等复杂提示。这是 Gemini 3 Pro 的默认级别。
对于 Gemini 3 Pro,无法关闭思考功能。更多说明可参考 Vertex AI 思考文档。
视频理解
FPS 参数
视频理解支持两种协议、两个接入点,均支持 FPS 参数配置:
| 协议 | 接入点 | 说明 |
|---|---|---|
| OpenAI 标准接口(推荐) | https://api.modelink.ai/v1 | 适配 chat/completions 标准协议,支持 FPS 参数 |
| Vertex AI 原生接口 | https://api.modelink.ai/bypass/vertex | 原生 Vertex 协议,支持 FPS 参数 |
OpenAI 标准接口请求示例:
curl --location --request POST 'https://api.modelink.ai/v1/chat/completions' \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data-raw '{
"stream": false,
"model": "gemini-3.0-pro-preview",
"messages": [
{
"content": [
{ "text": "What is this", "type": "text" },
{
"type": "file",
"file": {
"file_id": "gs://cloud-samples-data/video/animals.mp4",
"format": "video/mp4",
"detail": "low",
"video_metadata": {
"fps": 5,
"start_offset": "30s",
"end_offset": "60s"
}
}
}
],
"role": "user"
}
]
}'Vertex AI 原生接口请求示例(以 streamGenerateContent 流式接口为例):
curl --location --request POST 'https://api.modelink.ai/bypass/vertex/v1/models/gemini-3.1-pro-preview:streamGenerateContent?alt=sse' \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data-raw '{
"contents": [
{
"role": "user",
"parts": [
{ "text": "What is this" },
{
"fileData": {
"fileUri": "gs://cloud-samples-data/video/animals.mp4",
"mimeType": "video/mp4"
},
"videoMetadata": {
"fps": 5,
"startOffset": "30s",
"endOffset": "60s"
}
}
]
}
]
}'分辨率与 token 数
不同分辨率对应的 token 数可参考 Gemini media resolution 文档。

能否同时进行视频理解和图片理解
单独传入图片或单独传入视频均可正常理解,但二者混合在同一请求中时无法正常处理。gemini-3.0-pro-preview 模型不支持在同一请求中同时理解图片和视频。
大文件理解
进行视频、图片、音频理解时,提供的 uri 可以是以下三种来源:
- Cloud Storage 存储桶 URI:对象必须可公开读取。
- HTTP 网址:文件网址必须可公开读取。每个请求可指定一个视频文件、一个音频文件和最多 10 个图片文件;音频、视频和文档大小不得超过 15 MB。
- YouTube 视频网址:视频必须是公开的,每个请求仅支持一个 YouTube 视频网址。
更多说明可参考 Vertex AI 视频理解文档。
生图
控制生图数量
Gemini 模型无法通过请求参数指定输出图片数量。推荐通过多次调用来生成多张图片,也可以在 prompt 中提示模型「生成 N 张图片」,其中 N 为期望生成的图片数量。
不同分辨率对应的 token 数量与计费
| 模型 | 图片输出价格(人民币/美元) | 每 token 价格 | 2K 图片单价 | 4K 图片单价 |
|---|---|---|---|---|
| gemini-3.0-flash-image-preview | 20.00 /M | $0.00012 | $0.1344 | $0.24 |
| ¥864.00 /M | ¥0.000864 | ¥0.968 | ¥1.728 | |
| gemini-3.1-flash-image-preview | $60.00 /M | $0.00006 | $0.0672 | $0.12 |
| ¥432.00 /M | ¥0.000432 | ¥0.72576 | ¥1.08864 |
汇率按 1 美元 ≈ 7.2 人民币计,汇率仅供参考,以实际结算为准。可参考 Gemini 图片生成文档。



生图费用计算公式:
总费用 = 输入单价 × 输入 tokens
+ 文本输出单价 × 文本输出 tokens
+ 图片输出单价 × 图片输出 tokens
以一个 gemini-3.0-flash-image-preview 请求为例(输入 tokens = 6,文本输出 tokens = 1021,图片输出 tokens = 1680):
- 输入费用:6 ÷ 1,000,000 × 3.60 = 0.0000216 元
- 文本输出费用:1021 ÷ 1,000,000 × 21.60 = 0.0220536 元
- 图片输出费用:1680 ÷ 1,000,000 × 432.00 = 0.7257600 元
- 总计:约 0.7478 元
信息
生图相关的常见报错(如设置 modalities 后返回空响应、生图接口无响应)可参考
模型专属问题排查。