标签: Evaluation
该标签下的全部文章 "Evaluation".
多模态与语音评测:把感知、推理和交互拆开
为图像、文档、ASR、TTS 和实时语音 Agent 设计分层指标、数据集与人工评审。
LLM-as-Judge:让模型评模型,但不让它裁决安全
为主观质量设计 Rubric、结构化评分和防注入边界,并了解哪些指标必须由代码判断。
Eval 对象与分层:从组件到业务结果
区分模型、检索、工具、轨迹和最终 Outcome,为每层选择确定性测试、人工或 Judge。
Agent Evaluation 零基础路线:先定义“好”,再谈优化
从三个订单样本开始,循序学习 Golden Dataset、RAG、Tool、Judge、在线和多模态评测。