这组文章带你为订单助手建立一套可重复评测。你会先写三个 Golden Case,再分别检查回答、工具轨迹和业务结果, 最后学习 Judge 校准与线上反馈闭环。
Eval 不是“感觉不错”
**Evaluation(评测)**把“好”拆成可记录的标准和数据。测试回答“是否满足硬条件”,评测回答“质量达到多少、 哪个版本更好”。两者应一起运行。
快速开始:运行离线评测
-
下载 requirements.txt下载、 offline_eval.py下载 和 judge_calibration.py下载。
-
安装并运行:
python3.12 -m venv .venv source .venv/bin/activate pip install -r requirements.txt python offline_eval.py python judge_calibration.py
第一个脚本运行三个 LangGraph 订单案例,同时检查答案和工具;第二个脚本用人工标签选择 Judge 阈值。
Python 与 Java 示例
| 需求 | Python | Java |
|---|---|---|
| 运行 Agent 数据集 | LangGraph + 普通 evaluator | JUnit 或普通测试循环 |
| 平台化实验和 Trace | LangSmith 等平台 | OpenTelemetry/平台 SDK |
| AgentScope 工具契约测试 | 可调用服务 API | Toolkit + @Tool |
Java 离线工程见 AgentScope Tool Eval下载,无需模型 API Key 即可运行。
建议阅读顺序
- 先确定评测对象和层级。
- 建立小而可信的 Golden Dataset。
- 分别评 RAG、Tool 和完整 Agent。
- 只在代码难以判断时引入 LLM-as-Judge,并先校准。
- 上线后做抽样、告警和反馈回流。
- 最后再选平台和扩展多模态指标。
完成标准
- 数据集记录输入、期望、来源、切分和版本。
- 硬安全条件使用确定性断言,不能被平均分抵消。
- Agent 同时评最终 Outcome、关键轨迹、恢复和成本。
- Judge 与人工标签有一致性报告和固定阈值。
- 线上坏例经过脱敏和审核后进入离线回归集。
版本基线
Python 示例按 LangGraph 1.2.11 运行;Java 示例按 AgentScope Java 2.0.1 编译。
下一步
从 Eval 对象与分层 开始,先决定评哪个组件和哪种业务结果。