模型选型指南
Modelink 聚合多类主流模型,适合用统一接入方式覆盖不同业务任务。选型时不要只看“最强模型”,应综合任务复杂度、响应速度、上下文长度、稳定性和成本。
按任务选择
| 任务类型 | 关注点 | 建议 |
|---|---|---|
| 简单问答、分类、摘要 | 成本、响应速度 | 优先选择轻量或高性价比模型 |
| 复杂推理、规划、长文档分析 | 推理质量、上下文长度 | 选择推理能力强、上下文窗口大的模型 |
| 代码生成、代码审查 | 代码能力、结构化输出 | 选择代码能力强且支持工具调用的模型 |
| 中文内容生成与理解 | 中文语义、风格稳定性 | 优先评估中文优化模型 |
| 图像、视频、音频等多模态 | 输入输出模态、任务链路 | 选择明确支持对应模态的模型 |
| 实时交互 | 首 token 延迟、流式输出 | 选择低延迟模型,并启用流式返回 |
常见模型系列定位
- Claude / GPT 系列:适合复杂推理、长上下文、专业写作和代码任务。
- DeepSeek 系列:适合高性价比推理、代码、通用文本任务。
- Qwen / 通义千问系列:适合中文理解、多模态和通用企业场景。
- Kimi 系列:适合长上下文、中文资料分析和复杂对话。
- Doubao / 豆包系列:适合低延迟、高并发、成本敏感的对话场景。
- GLM / Minimax 等模型:适合多模态、工具调用、创意生成或特定任务评估。
信息
模型列表会持续更新,生产接入前应以控制台或模型广场中当前可用模型为准。
选型流程
- 明确任务输入:文本、图片、文件、视频,或多模态组合。
- 明确输出要求:自然语言、JSON、代码、图片、视频或动作结果。
- 评估上下文长度:是否包含长文档、知识库、代码库或多轮历史。
- 评估实时性:是否要求低延迟、流式输出或批量离线处理。
- 评估成本:按输入、输出和缓存命中情况估算 token 用量。
- 做 A/B 测试:用真实样例比较多个模型的质量、耗时和成本。
降级策略
生产系统建议准备至少两档模型:
- 主模型:质量最优,承担关键任务。
- 备用模型:成本更低或延迟更低,在主模型异常、限流或超时时接管。
对高价值任务,可采用“先低成本模型处理,再由强模型复核”的组合策略。