术语表
| 术语 | 说明 |
|---|---|
| LLM / 大模型 | 通过海量数据训练、能够理解和生成文本或多模态内容的模型 |
| Token | 模型处理文本的基本计量单位,常用于计费和上下文长度计算 |
| API | 应用程序接口,让业务系统能够调用模型能力 |
| API Key | 用于调用 API 的长期访问凭证,应安全保存 |
| Bearer Token | 通过请求头携带访问令牌的一种认证格式 |
| 推理 Inference | 模型根据输入生成结果的过程 |
| Prompt | 用户给模型的任务说明、问题或上下文 |
| 模型 | 提供生成、理解、推理、工具调用等能力的基础单元 |
| 上下文窗口 | 模型单次请求可处理的输入规模 |
| 上下文记忆 | 多轮对话中保留历史信息以保持连贯性的能力 |
| 深度思考 | 让模型分步骤处理复杂问题的推理模式 |
| MCP | Model Context Protocol,用于标准化大模型与外部工具、数据源和业务系统之间的交互 |
| Agent | 具备角色、目标、上下文和工具权限的自动化执行单元 |
| Tool Calling | 模型或 Agent 调用外部函数、服务或系统能力的机制 |
| 联网搜索 | 通过工具访问互联网以获取最新信息 |
| 多模态 | 模型理解或生成文本、图像、音频、视频等多种模态内容的能力 |
| 结构化输出 | 模型按固定字段、层级或格式输出结果,便于下游系统解析和自动化处理 |
| REST API | 使用 HTTP 方法和标准资源路径进行交互的接口风格 |
| SDK | 软件开发工具包,封装认证、请求、错误处理等常见逻辑 |
| 参数 Parameters | 可指模型内部知识单元规模,也可指调用时控制输出的配置项 |
| Temperature | 控制输出随机性和创意程度的参数概念;低温度更稳定,高温度更多样 |
| Fine-tuning | 在通用模型基础上针对特定任务或领域继续训练 |
| Rate Limit | 对调用频率、并发或用量的限制 |
| Endpoint / Base URL | 客户端访问 Modelink 服务时配置的起始地址 |
| Bypass / 原厂直通 | 尽量保留模型厂商原生协议和特性的接入方式 |
| 按量计费 | 根据实际使用量结算费用 |
| RPM | Requests Per Minute,每分钟请求次数限制 |
| TPM | Tokens Per Minute,每分钟 token 处理量限制 |
| TPD | Tokens Per Day,每日 token 用量限制 |
| Prompt Caching | 对稳定长上下文进行缓存,以降低重复请求成本并提升速度 |
| 传输加密 | 通过 HTTPS 等方式保护客户端与服务端之间的数据传输安全 |