多模态评测不能只问“回答对不对”。先检查输入是否被正确感知,再检查跨模态推理,最后检查生成质量与实时交互。
图像和文档的三层评测
- Perception:OCR、区域检测、表格结构和对象识别。
- Reasoning:是否根据图片或页面关系得出正确结论。
- Grounding:答案引用的页码、区域或时间段是否真的支持 Claim。
文档问答数据集应保存原始文件版本、页码和 bounding box,不能只保留提取后的纯文本。
图像生成与编辑
确定性检查包括尺寸、格式、透明通道和安全标签。内容遵循、构图和视觉质量可用人工或多模态 Judge,但要给出参考图、 编辑区域和具体 Rubric。对人物身份、品牌和医疗图像等高风险内容设置独立门禁。
ASR:先听清再理解
**ASR(Automatic Speech Recognition)**把语音转成文字。常用 WER:
def wer(substitutions: int, deletions: int, insertions: int, reference_words: int) -> float:
return (substitutions + deletions + insertions) / reference_words
print(wer(1, 0, 1, 10)) # 0.2
还要按口音、噪声、语速、数字、专有名词和说话人重叠切片,平均 WER 会掩盖局部失败。
TTS 和实时语音
TTS(Text-to-Speech)评自然度、可懂度、发音和说话人一致性。实时 Voice Agent 还要测:
- 首音频延迟和端到端响应时间。
- 打断检测、停止播放和恢复对话。
- 重复、抢话、沉默超时和网络抖动恢复。
- 工具调用与语音播报是否保持同一业务状态。
数据与隐私
语音和图像可能包含生物特征、证件和环境信息。保存前获得授权,做最小化、脱敏、访问控制和保留期限;合成数据不能 完全替代真实设备与噪声条件。
下一步
回到 Agent Evaluation 学习路线 检查完成标准,并把三个示例 扩展成你自己的首批 10—20 个 Golden Case。