跳到正文
Elaine Blog
返回

在线评测:从生产 Trace 发现新问题

Agent Evaluation

在线评测运行在真实生产 Trace 上,通常没有标准答案。它适合监控安全、格式、异常、用户反馈和质量漂移,不能替代 发布前的离线 Golden Dataset。

四种在线方法

Shadow 输出不能调用生产写工具,否则它不再是无影响实验。

最小事件流

flowchart LR
    A[Production Trace] --> B[脱敏与采样]
    B --> C[规则检查]
    B --> D[Judge]
    C --> E[指标与告警]
    D --> E
    E --> F[人工复核队列]
    F --> G[离线 Golden Dataset]

采样要按风险分层

普通问答可低比例随机抽样;退款、权限变化和跨租户访问应全量执行便宜规则,并提高人工或 Judge 抽样。只随机抽样会 漏掉低频高风险场景。

A/B 实验避免串组

按用户或 Thread 稳定分桶,同一多轮会话始终使用同一版本。预先定义主指标、护栏指标和停止条件,避免看到局部上涨后 临时挑选指标。

隐私与成本

评测前删除密钥和不必要个人信息。Trace 设置访问控制和保留期限;Judge 输入使用最小字段。为在线评分设置每日预算和 降级策略,不能让评测故障阻塞主要业务。

反馈如何回流

负反馈和异常 Trace 先去重、脱敏、补充期望并人工确认,再进入新 Dataset 版本。生产输入不能未经审核自动成为“真相”。

下一步

阅读 评测平台选型,根据数据、实验、Trace 和治理需求选择工具组合。


分享这篇文章:

上一篇
Judge 校准:用人工标签选择阈值
下一篇
评测平台选型:先画能力清单,再看产品名称