术语表

术语说明
LLM / 大模型通过海量数据训练、能够理解和生成文本或多模态内容的模型
Token模型处理文本的基本计量单位,常用于计费和上下文长度计算
API应用程序接口,让业务系统能够调用模型能力
API Key用于调用 API 的长期访问凭证,应安全保存
Bearer Token通过请求头携带访问令牌的一种认证格式
推理 Inference模型根据输入生成结果的过程
Prompt用户给模型的任务说明、问题或上下文
模型提供生成、理解、推理、工具调用等能力的基础单元
上下文窗口模型单次请求可处理的输入规模
上下文记忆多轮对话中保留历史信息以保持连贯性的能力
深度思考让模型分步骤处理复杂问题的推理模式
MCPModel Context Protocol,用于标准化大模型与外部工具、数据源和业务系统之间的交互
Agent具备角色、目标、上下文和工具权限的自动化执行单元
Tool Calling模型或 Agent 调用外部函数、服务或系统能力的机制
联网搜索通过工具访问互联网以获取最新信息
多模态模型理解或生成文本、图像、音频、视频等多种模态内容的能力
结构化输出模型按固定字段、层级或格式输出结果,便于下游系统解析和自动化处理
REST API使用 HTTP 方法和标准资源路径进行交互的接口风格
SDK软件开发工具包,封装认证、请求、错误处理等常见逻辑
参数 Parameters可指模型内部知识单元规模,也可指调用时控制输出的配置项
Temperature控制输出随机性和创意程度的参数概念;低温度更稳定,高温度更多样
Fine-tuning在通用模型基础上针对特定任务或领域继续训练
Rate Limit对调用频率、并发或用量的限制
Endpoint / Base URL客户端访问 Modelink 服务时配置的起始地址
Bypass / 原厂直通尽量保留模型厂商原生协议和特性的接入方式
按量计费根据实际使用量结算费用
RPMRequests Per Minute,每分钟请求次数限制
TPMTokens Per Minute,每分钟 token 处理量限制
TPDTokens Per Day,每日 token 用量限制
Prompt Caching对稳定长上下文进行缓存,以降低重复请求成本并提升速度
传输加密通过 HTTPS 等方式保护客户端与服务端之间的数据传输安全