在线评测运行在真实生产 Trace 上,通常没有标准答案。它适合监控安全、格式、异常、用户反馈和质量漂移,不能替代 发布前的离线 Golden Dataset。
四种在线方法
- Rule:对 Schema、敏感信息、工具错误和延迟做确定性检查。
- Sampled Judge:按风险和流量抽样运行 Reference-free Judge。
- Shadow:新版本读取相同输入但不产生真实副作用。
- A/B Test:将随机用户分配到版本,比较业务指标。
Shadow 输出不能调用生产写工具,否则它不再是无影响实验。
最小事件流
flowchart LR
A[Production Trace] --> B[脱敏与采样]
B --> C[规则检查]
B --> D[Judge]
C --> E[指标与告警]
D --> E
E --> F[人工复核队列]
F --> G[离线 Golden Dataset]
采样要按风险分层
普通问答可低比例随机抽样;退款、权限变化和跨租户访问应全量执行便宜规则,并提高人工或 Judge 抽样。只随机抽样会 漏掉低频高风险场景。
A/B 实验避免串组
按用户或 Thread 稳定分桶,同一多轮会话始终使用同一版本。预先定义主指标、护栏指标和停止条件,避免看到局部上涨后 临时挑选指标。
隐私与成本
评测前删除密钥和不必要个人信息。Trace 设置访问控制和保留期限;Judge 输入使用最小字段。为在线评分设置每日预算和 降级策略,不能让评测故障阻塞主要业务。
反馈如何回流
负反馈和异常 Trace 先去重、脱敏、补充期望并人工确认,再进入新 Dataset 版本。生产输入不能未经审核自动成为“真相”。
下一步
阅读 评测平台选型,根据数据、实验、Trace 和治理需求选择工具组合。