模型选型指南

Modelink 聚合多类主流模型,适合用统一接入方式覆盖不同业务任务。选型时不要只看“最强模型”,应综合任务复杂度、响应速度、上下文长度、稳定性和成本。

按任务选择

任务类型关注点建议
简单问答、分类、摘要成本、响应速度优先选择轻量或高性价比模型
复杂推理、规划、长文档分析推理质量、上下文长度选择推理能力强、上下文窗口大的模型
代码生成、代码审查代码能力、结构化输出选择代码能力强且支持工具调用的模型
中文内容生成与理解中文语义、风格稳定性优先评估中文优化模型
图像、视频、音频等多模态输入输出模态、任务链路选择明确支持对应模态的模型
实时交互首 token 延迟、流式输出选择低延迟模型,并启用流式返回

常见模型系列定位

  • Claude / GPT 系列:适合复杂推理、长上下文、专业写作和代码任务。
  • DeepSeek 系列:适合高性价比推理、代码、通用文本任务。
  • Qwen / 通义千问系列:适合中文理解、多模态和通用企业场景。
  • Kimi 系列:适合长上下文、中文资料分析和复杂对话。
  • Doubao / 豆包系列:适合低延迟、高并发、成本敏感的对话场景。
  • GLM / Minimax 等模型:适合多模态、工具调用、创意生成或特定任务评估。

信息

模型列表会持续更新,生产接入前应以控制台或模型广场中当前可用模型为准。

选型流程

  1. 明确任务输入:文本、图片、文件、视频,或多模态组合。
  2. 明确输出要求:自然语言、JSON、代码、图片、视频或动作结果。
  3. 评估上下文长度:是否包含长文档、知识库、代码库或多轮历史。
  4. 评估实时性:是否要求低延迟、流式输出或批量离线处理。
  5. 评估成本:按输入、输出和缓存命中情况估算 token 用量。
  6. 做 A/B 测试:用真实样例比较多个模型的质量、耗时和成本。

降级策略

生产系统建议准备至少两档模型:

  • 主模型:质量最优,承担关键任务。
  • 备用模型:成本更低或延迟更低,在主模型异常、限流或超时时接管。

对高价值任务,可采用“先低成本模型处理,再由强模型复核”的组合策略。