# AI 评测与验收

用业务测试集、质量指标和安全用例建立 AI 项目的验收标准。

## 测试集建设

测试集来自真实业务问题、历史工单、专家设计的边界案例和对抗性案例。每条记录应包含问题、期望要点、允许引用、风险级别和评分规则。

## 质量指标

- 检索：命中率、召回率、首条相关率和权限过滤准确率。
- 生成：正确性、忠实度、完整性、相关性和引用准确性。
- 服务：成功率、首字延迟、总延迟、并发和可用性。
- 经济性：单次成本、单用户成本、缓存命中和预算消耗。
- 安全：越权率、注入成功率、敏感信息泄露率和拒答正确率。

## 验收方式

自动评测适合持续回归，专家人工评测负责高风险和主观质量判断。不能只以另一个模型的评分作为最终验收依据。

## 版本回归

模型、Prompt、检索策略、文档和工具任一变化都可能改变结果。每次发布保存完整版本组合，并对核心测试集执行回归。
