EVAL
AI Agent 评估与上线验收
用 AI 工具辅助整理样本、生成测试、比较回答、检查工具轨迹和形成上线验收报告。
所属层级 Enterprise Layer
FDE 不能只说 Agent 看起来不错。评估要证明它是否用了正确工具、是否遵守上下文、是否能被人工复核、是否达到上线门槛。
学习产出
扩展学习资源
Anthropic: Evaluating AI Agents 学习 eval 思维:如何证明 Agent 可靠,而不是凭感觉试用。OpenAI Evals 作为评估样本和自动化测试概念参考。RAGAS 参考 RAG 指标,不要求掌握全部框架。
检查清单
AI 与评估
- 有没有 Golden Dataset 或历史样本用于评估?
- 工具调用路径是否可追踪?失败时能否回放?
- 上线前谁验收?上线后如何发现模型退化、幻觉或数据漂移?