如何验证实际调用的模型
当一次回答不符合预期时,很容易怀疑模型被替换、降级,或者使用了非正规资源。但模型的输出不是“身份证”:即使调用同一个模型,两次回答也可能不同。
信息
正价线路承诺: Modelink 官网公开展示、按公开价格销售的线路不使用逆向资源,也永远不会将高级模型请求改为低级模型。
本文所说的“逆向资源”,是指通过逆向工程、非官方账号或会话等非正规方式接入的资源。模型厂商对模型别名进行正常版本更新,不属于平台静默降级。
先记住一个原则
回答质量会受到 Prompt、系统提示、上下文、采样参数、联网工具和安全策略等因素影响。因此:
- 效果不好,只能说明这次回答没有达到预期,不能直接证明模型被替换。
- 输出测试可以发现异常,但不能单独证明底层模型来源。
- 能关联到具体请求的上游调用记录,比回答风格或单次测试更有证明力。
这些举证方式不可靠
- 只测一两次回答:模型输出存在随机性,偶尔答错或发挥不稳定很正常。
- 让另一个模型给单次回答打分:模型裁判也有偏好,容易受回答顺序、长短和措辞影响。
- 直接对比官方聊天网页与 API:网页可能额外使用系统提示、联网搜索、记忆或其他工具。
- 问模型“你是谁”:模型可能产生身份幻觉,详见为什么模型不知道自己是谁。
- 只问一道新闻题、测试题或观察一次拒答:不知道不代表模型更旧,知道也不代表一定使用了目标模型。
- 根据速度、文风、报错或
model字段下结论:这些信息会被网络、负载、参数和网关处理影响。 - 要求两边输出完全一致:相同模型和参数也不保证逐字一致。
交换两个候选回答的展示顺序,分数就可能变化;较长、措辞更自信的回答也可能得到更高分。单次评分只能表达裁判模型的偏好,不能鉴定底层模型身份。
官方聊天网页可能自动添加系统提示、搜索最新资料或调用工具,而普通 API 请求没有这些内容。即使底层模型相同,结果也可能明显不同。公平对比应使用官方 API,并尽量统一模型版本、消息和参数。
截止时间之前发生的事件不一定进入训练数据,进入训练数据也不代表模型每次都能正确回忆。因此,一道题答不出只能说明这次没有答对,不能直接推出模型的知识截止时间或身份。
更可靠的核验方法
1. 先保留核验信息
记录请求时间、精确模型名、调用参数、脱敏后的请求和响应,并保存请求 ID。请求 ID 能帮助平台找到对应调用,但它本身不是模型身份证明。
2. 做同条件、重复的 API 对比
使用目标模型的官方 API 作为对照,并尽量保持以下条件一致:
- 精确模型版本或快照;
- System Prompt、用户消息和上下文;
temperature、top_p、seed等参数;- 联网搜索、知识库和工具开关;
- 评分标准与回答展示顺序。
不要只测试一道题。应覆盖多种任务并重复运行,再判断是否存在持续、明显的能力差异。即使表现接近,也只能说明“结果基本一致”,不能单独证明模型来源。
准备 10~20 道覆盖知识问答、指令遵循、代码和长文本理解的题目,在两边各运行多次。隐藏答案来源后,按事先写好的正确性和格式标准评分。只有持续出现同方向差异时,才值得进一步核查调用链路。
3. 检查模型专属能力
根据模型厂商文档,检查上下文长度、输入输出模态、工具调用和结构化输出等能力。声明支持的能力持续不可用,值得排查;能力符合也只能作为辅助证据,因为网关可能有自己的功能限制。
4. 批量测试知识截止时间
知识截止时间可以帮助检查知识覆盖,但不是一条绝对分界线,更不能靠一道新闻题鉴定模型。
假设官方文档标注知识截止时间为 2024 年 6 月。先关闭联网、搜索、知识库和外部工具,再准备多件分布在截止日前后的事件,例如 2024 年 2 月 Odysseus 月球着陆、2024 年 5 月 GPT-4o 发布、2024 年 7 月巴黎奥运会开幕和 2024 年 10 月诺贝尔奖结果。
对每件事分别询问基本事实和不容易猜中的细节,换不同问法重复测试,并与同一模型版本的官方 API 对照。最终只能表述为“知识覆盖大致一致”或“存在明显偏差”。
模型不知道截止时间之前的事件,可能是训练数据没有覆盖或这次没有正确回忆;模型知道截止时间之后的事件,也可能来自上下文、工具、后续微调或合理猜测。
5. 需要时核验调用链路
如果多次受控测试仍存在明显异常,请携带请求 ID、请求时间和脱敏请求联系支持。平台可以据此复核该次请求的路由和上游调用记录。
模型厂商自己的 API,以及厂商公开授权的云渠道,都属于正规资源。不能仅凭上游域名或响应格式不同,就认定使用了逆向资源。
证据强弱速查
| 方式 | 能说明什么 | 证据强度 |
|---|---|---|
| 关联单次请求的上游调用记录或独立审计 | 核验请求路由或资源来源 | 强 |
| 同条件、多题、多次的官方 API 对比 | 发现持续的能力偏差 | 中 |
| 模型专属能力测试 | 发现声明能力与实际表现不符 | 中 |
| 批量知识截止时间测试 | 检查知识覆盖是否大致符合声明 | 辅助 |
| 单次回答、文风、速度或模型自述 | 只能发现现象,不能定位底层原因 | 弱 |
最短核验清单
- 确认精确模型名和调用参数。
- 保存请求 ID 与请求时间。
- 使用多题、多次、同条件测试,不凭单次输出下结论。
- 仍有疑问时,携带请求 ID 和脱敏请求联系支持核查。