STANDARD PLAYBOOK

AI 评测与验收

用业务测试集、质量指标和安全用例建立 AI 项目的验收标准。

更新于 2026-09-14AI评测 · 验收 · 幻觉 · 测试集

测试集建设

测试集来自真实业务问题、历史工单、专家设计的边界案例和对抗性案例。每条记录应包含问题、期望要点、允许引用、风险级别和评分规则。

质量指标

  • 检索:命中率、召回率、首条相关率和权限过滤准确率。
  • 生成:正确性、忠实度、完整性、相关性和引用准确性。
  • 服务:成功率、首字延迟、总延迟、并发和可用性。
  • 经济性:单次成本、单用户成本、缓存命中和预算消耗。
  • 安全:越权率、注入成功率、敏感信息泄露率和拒答正确率。

验收方式

自动评测适合持续回归,专家人工评测负责高风险和主观质量判断。不能只以另一个模型的评分作为最终验收依据。

版本回归

模型、Prompt、检索策略、文档和工具任一变化都可能改变结果。每次发布保存完整版本组合,并对核心测试集执行回归。