跳到正文
Elaine Blog
返回

多模态与语音评测:把感知、推理和交互拆开

Agent Evaluation

多模态评测不能只问“回答对不对”。先检查输入是否被正确感知,再检查跨模态推理,最后检查生成质量与实时交互。

图像和文档的三层评测

  1. Perception:OCR、区域检测、表格结构和对象识别。
  2. Reasoning:是否根据图片或页面关系得出正确结论。
  3. Grounding:答案引用的页码、区域或时间段是否真的支持 Claim。

文档问答数据集应保存原始文件版本、页码和 bounding box,不能只保留提取后的纯文本。

图像生成与编辑

确定性检查包括尺寸、格式、透明通道和安全标签。内容遵循、构图和视觉质量可用人工或多模态 Judge,但要给出参考图、 编辑区域和具体 Rubric。对人物身份、品牌和医疗图像等高风险内容设置独立门禁。

ASR:先听清再理解

**ASR(Automatic Speech Recognition)**把语音转成文字。常用 WER:

def wer(substitutions: int, deletions: int, insertions: int, reference_words: int) -> float:
    return (substitutions + deletions + insertions) / reference_words

print(wer(1, 0, 1, 10))  # 0.2

还要按口音、噪声、语速、数字、专有名词和说话人重叠切片,平均 WER 会掩盖局部失败。

TTS 和实时语音

TTS(Text-to-Speech)评自然度、可懂度、发音和说话人一致性。实时 Voice Agent 还要测:

数据与隐私

语音和图像可能包含生物特征、证件和环境信息。保存前获得授权,做最小化、脱敏、访问控制和保留期限;合成数据不能 完全替代真实设备与噪声条件。

下一步

回到 Agent Evaluation 学习路线 检查完成标准,并把三个示例 扩展成你自己的首批 10—20 个 Golden Case。


分享这篇文章:

上一篇
评测平台选型:先画能力清单,再看产品名称
下一篇
Java 架构师完整学习路线与博客目录