评测平台没有通用最佳选择。先确定团队要管理的数据和发布流程,再用同一组案例做 PoC;平台应能导出原始数据, 避免指标和历史被锁在专有界面中。
六层能力清单
- Dataset:版本、Split、元数据和血缘。
- Runner:并发、缓存、重试和实验比较。
- Evaluator:代码、人工、Judge 和 Pairwise。
- Trace:模型、检索、Tool、状态和成本事件。
- Review:人工队列、分歧处理和权限。
- Governance:脱敏、保留、审计和导出。
常见工具定位
pytest/JUnit + 自定义脚本:最适合确定性断言和 CI 门禁。- LangSmith:数据集、实验、Trace、在线与人工评测的一体化平台。
- Ragas:RAG、Tool/Agent 指标与实验库。
- Phoenix:基于 Trace 的可观测与评测。
- Promptfoo:配置驱动的 Prompt/模型回归和红队测试。
先查各项目当前官方文档和许可证,再确定部署方式与版本。
用真实 PoC 验收
选择 20—50 条包含中文、工具、长 Trace、失败和敏感字段的案例,完成以下动作:
- 导入带版本和 Split 的 Dataset。
- 同时运行 Python 与 Java 产生的结果。
- 添加一个代码 Evaluator 和一个校准 Judge。
- 比较两个版本并设置硬门禁。
- 从生产 Trace 创建人工复核项。
- 导出案例、结果、评分和 Trace。
数据模型优先
内部统一 example_id、experiment_id、trace_id、metric key 和版本字段。SDK 只负责适配;这样更换平台时不用重写
业务评测定义。
什么时候自研
只有特殊合规、超大规模成本或内部数据模型无法适配时,才自研控制面。即使自研,也优先复用 OpenTelemetry、对象存储、 队列和标准数据库,不要从零实现 Trace 和权限系统。
参考入口
下一步
阅读 多模态与语音评测,把文本方法扩展到图像、文档和实时语音。