跳到正文
Elaine Blog
返回

Agent Evaluation 零基础路线:先定义“好”,再谈优化

Agent Evaluation

这组文章带你为订单助手建立一套可重复评测。你会先写三个 Golden Case,再分别检查回答、工具轨迹和业务结果, 最后学习 Judge 校准与线上反馈闭环。

Eval 不是“感觉不错”

**Evaluation(评测)**把“好”拆成可记录的标准和数据。测试回答“是否满足硬条件”,评测回答“质量达到多少、 哪个版本更好”。两者应一起运行。

快速开始:运行离线评测

  1. 下载 requirements.txt下载offline_eval.py下载judge_calibration.py下载

  2. 安装并运行:

    python3.12 -m venv .venv
    source .venv/bin/activate
    pip install -r requirements.txt
    python offline_eval.py
    python judge_calibration.py

第一个脚本运行三个 LangGraph 订单案例,同时检查答案和工具;第二个脚本用人工标签选择 Judge 阈值。

Python 与 Java 示例

需求PythonJava
运行 Agent 数据集LangGraph + 普通 evaluatorJUnit 或普通测试循环
平台化实验和 TraceLangSmith 等平台OpenTelemetry/平台 SDK
AgentScope 工具契约测试可调用服务 APIToolkit + @Tool

Java 离线工程见 AgentScope Tool Eval下载,无需模型 API Key 即可运行。

建议阅读顺序

  1. 先确定评测对象和层级。
  2. 建立小而可信的 Golden Dataset。
  3. 分别评 RAG、Tool 和完整 Agent。
  4. 只在代码难以判断时引入 LLM-as-Judge,并先校准。
  5. 上线后做抽样、告警和反馈回流。
  6. 最后再选平台和扩展多模态指标。

完成标准

版本基线

Python 示例按 LangGraph 1.2.11 运行;Java 示例按 AgentScope Java 2.0.1 编译。

下一步

Eval 对象与分层 开始,先决定评哪个组件和哪种业务结果。


分享这篇文章:

上一篇
MDX 详细使用指南
下一篇
Eval 对象与分层:从组件到业务结果