AI 评测与验收
用业务测试集、质量指标和安全用例建立 AI 项目的验收标准。
测试集建设
测试集来自真实业务问题、历史工单、专家设计的边界案例和对抗性案例。每条记录应包含问题、期望要点、允许引用、风险级别和评分规则。
质量指标
- 检索:命中率、召回率、首条相关率和权限过滤准确率。
- 生成:正确性、忠实度、完整性、相关性和引用准确性。
- 服务:成功率、首字延迟、总延迟、并发和可用性。
- 经济性:单次成本、单用户成本、缓存命中和预算消耗。
- 安全:越权率、注入成功率、敏感信息泄露率和拒答正确率。
验收方式
自动评测适合持续回归,专家人工评测负责高风险和主观质量判断。不能只以另一个模型的评分作为最终验收依据。
版本回归
模型、Prompt、检索策略、文档和工具任一变化都可能改变结果。每次发布保存完整版本组合,并对核心测试集执行回归。