Agent Evaluation
从一组离线样本开始,学习 RAG、工具、Judge、在线评测和多模态质量治理。
Agent Evaluation 零基础路线:先定义“好”,再谈优化
从三个订单样本开始,循序学习 Golden Dataset、RAG、Tool、Judge、在线和多模态评测。
Eval 对象与分层:从组件到业务结果
区分模型、检索、工具、轨迹和最终 Outcome,为每层选择确定性测试、人工或 Judge。
Golden Dataset:从 3 个可信案例开始
设计输入、期望、元数据、切分和版本,防止数据泄漏与只测简单案例。
RAG 评测:分别检查检索、证据和回答
学习 Recall@k、Precision@k、Claim 支持率和引用正确性,定位 RAG 问题发生在哪一层。
Tool 与 Agent 评测:不只看最终回答
检查工具必要性、选择、参数、权限、结果使用、轨迹和最终业务 Outcome。
LLM-as-Judge:让模型评模型,但不让它裁决安全
为主观质量设计 Rubric、结构化评分和防注入边界,并了解哪些指标必须由代码判断。
Judge 校准:用人工标签选择阈值
构造校准集、计算一致性和错误代价,避免 Judge 分数看起来精确却无法信任。
在线评测:从生产 Trace 发现新问题
用 Shadow、A/B、抽样评分和反馈回流监控生产质量,同时控制隐私、成本和止损。
评测平台选型:先画能力清单,再看产品名称
按数据集、实验、Evaluator、Trace、人工标注和治理六层做 PoC,避免被单一总分或演示界面误导。
多模态与语音评测:把感知、推理和交互拆开
为图像、文档、ASR、TTS 和实时语音 Agent 设计分层指标、数据集与人工评审。