Gemini 使用说明

Modelink 接入的是 Google Vertex AI 官方标准资源池,所有请求均路由至 Global 区域。受 Vertex AI 官方机制限制,平台无法提供固定的 RPM 保证,建议在业务侧实现请求重试机制。

控制思考(thinking_level)

Gemini 3 模型引入 thinking_level 参数,将思考预算简化为多个级别。如果不需要复杂推理,可以限制 thinking_level 以获得更快、延迟更低的回答。

  • LOW:限制模型使用较少 token 进行思考,适合不需要大量推理的简单任务,也适合需要快速处理的高吞吐量场景。
  • HIGH:允许模型使用更多 token 进行思考,适合多步规划、经过验证的代码生成或高级函数调用等复杂提示。这是 Gemini 3 Pro 的默认级别。

对于 Gemini 3 Pro,无法关闭思考功能。更多说明可参考 Vertex AI 思考文档

视频理解

FPS 参数

视频理解支持两种协议、两个接入点,均支持 FPS 参数配置:

协议接入点说明
OpenAI 标准接口(推荐)https://api.modelink.ai/v1适配 chat/completions 标准协议,支持 FPS 参数
Vertex AI 原生接口https://api.modelink.ai/bypass/vertex原生 Vertex 协议,支持 FPS 参数

OpenAI 标准接口请求示例:

curl --location --request POST 'https://api.modelink.ai/v1/chat/completions' \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data-raw '{
    "stream": false,
    "model": "gemini-3.0-pro-preview",
    "messages": [
        {
            "content": [
                { "text": "What is this", "type": "text" },
                {
                    "type": "file",
                    "file": {
                        "file_id": "gs://cloud-samples-data/video/animals.mp4",
                        "format": "video/mp4",
                        "detail": "low",
                        "video_metadata": {
                            "fps": 5,
                            "start_offset": "30s",
                            "end_offset": "60s"
                        }
                    }
                }
            ],
            "role": "user"
        }
    ]
}'

Vertex AI 原生接口请求示例(以 streamGenerateContent 流式接口为例):

curl --location --request POST 'https://api.modelink.ai/bypass/vertex/v1/models/gemini-3.1-pro-preview:streamGenerateContent?alt=sse' \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data-raw '{
    "contents": [
        {
            "role": "user",
            "parts": [
                { "text": "What is this" },
                {
                    "fileData": {
                        "fileUri": "gs://cloud-samples-data/video/animals.mp4",
                        "mimeType": "video/mp4"
                    },
                    "videoMetadata": {
                        "fps": 5,
                        "startOffset": "30s",
                        "endOffset": "60s"
                    }
                }
            ]
        }
    ]
}'

分辨率与 token 数

不同分辨率对应的 token 数可参考 Gemini media resolution 文档

视频理解分辨率 token 数说明

能否同时进行视频理解和图片理解

单独传入图片或单独传入视频均可正常理解,但二者混合在同一请求中时无法正常处理。gemini-3.0-pro-preview 模型不支持在同一请求中同时理解图片和视频。

大文件理解

进行视频、图片、音频理解时,提供的 uri 可以是以下三种来源:

  1. Cloud Storage 存储桶 URI:对象必须可公开读取。
  2. HTTP 网址:文件网址必须可公开读取。每个请求可指定一个视频文件、一个音频文件和最多 10 个图片文件;音频、视频和文档大小不得超过 15 MB。
  3. YouTube 视频网址:视频必须是公开的,每个请求仅支持一个 YouTube 视频网址。

更多说明可参考 Vertex AI 视频理解文档

生图

控制生图数量

Gemini 模型无法通过请求参数指定输出图片数量。推荐通过多次调用来生成多张图片,也可以在 prompt 中提示模型「生成 N 张图片」,其中 N 为期望生成的图片数量。

不同分辨率对应的 token 数量与计费

模型图片输出价格(人民币/美元)每 token 价格2K 图片单价4K 图片单价
gemini-3.0-flash-image-preview20.00 /M$0.00012$0.1344$0.24
¥864.00 /M¥0.000864¥0.968¥1.728
gemini-3.1-flash-image-preview$60.00 /M$0.00006$0.0672$0.12
¥432.00 /M¥0.000432¥0.72576¥1.08864

汇率按 1 美元 ≈ 7.2 人民币计,汇率仅供参考,以实际结算为准。可参考 Gemini 图片生成文档

分辨率对应 token 数量参考图 1

分辨率对应 token 数量参考图 2

分辨率对应 token 数量参考图 3

生图费用计算公式:

总费用 = 输入单价 × 输入 tokens
       + 文本输出单价 × 文本输出 tokens
       + 图片输出单价 × 图片输出 tokens

费用计算示例请求

以一个 gemini-3.0-flash-image-preview 请求为例(输入 tokens = 6,文本输出 tokens = 1021,图片输出 tokens = 1680):

  • 输入费用:6 ÷ 1,000,000 × 3.60 = 0.0000216 元
  • 文本输出费用:1021 ÷ 1,000,000 × 21.60 = 0.0220536 元
  • 图片输出费用:1680 ÷ 1,000,000 × 432.00 = 0.7257600 元
  • 总计:约 0.7478 元

信息

生图相关的常见报错(如设置 modalities 后返回空响应、生图接口无响应)可参考 模型专属问题排查