能力矩阵
选择模型前,可以先按能力类型确认任务需要哪些能力。这里不列出接口 schema 或具体请求参数。
| 能力 | 说明 | 典型场景 | 选型关注点 |
|---|---|---|---|
| 文本生成 | 生成、改写、摘要、翻译、问答 | 客服、写作、办公自动化 | 准确性、风格稳定性、成本 |
| 长上下文 | 处理长文档、多轮历史或代码库 | 知识库问答、合同审阅、代码理解 | 上下文窗口、缓存支持、成本 |
| 深度推理 | 分步骤分析复杂问题 | 数学、规划、复杂决策、调试 | 推理质量、响应时间、可解释性 |
| 代码能力 | 生成、解释、审查和修复代码 | 研发辅助、测试生成、代码迁移 | 语言覆盖、工具调用、错误率 |
| 工具调用 | 调用搜索、文件、数据库或业务系统 | Agent、自动化流程、实时数据 | 工具权限、审计、失败恢复 |
| 结构化输出 | 按固定字段、层级和格式返回结果 | 数据抽取、表单填充、工作流编排 | 格式稳定性、校验和重试 |
| 多模态理解 | 理解图片、文件、视频或音频 | 票据识别、图文问答、审核 | 输入类型、上下文限制、准确率 |
| 图像与视频生成 | 根据提示词或参考素材生成内容 | 营销素材、短视频、创意设计 | 生成质量、异步任务、素材合规 |
| 实时搜索 | 获取最新网络或外部数据 | 新闻、行情、政策、事实核验 | 数据来源、时效性、引用和可信度 |
能力说明
- 结构化输出适合让模型返回 JSON、表格或固定字段结果,便于直接进入数据库、工作流或自动化系统。生产环境应为输出结果增加格式校验、缺失字段处理和失败重试。
- 多模态能力强调跨模态理解与生成,例如图文理解、图片描述、视频摘要或文本生成图像。接入前需确认目标模型支持的输入类型、文件大小、上下文窗口和输出形式。
- MCP / 工具调用可让模型访问搜索、数据库、知识库或内部系统。启用前应配置最小权限、调用审计、异常回滚和人工接管路径。
选型建议
- 优先根据任务类型选择必要能力,而不是默认选择最贵模型。
- 对实时场景关注首 token 延迟、流式输出和服务稳定性。
- 对复杂推理场景关注上下文长度、推理质量和错误可控性。
- 对生产环境接入保留降级模型、失败重试和人工接管路径。
- 对多模态和生成类场景提前评估素材权限、版权和内容安全。