文章
已发布的全部文章。
架构能力模型与自测表
从技术深度、系统思维、交付能力和技术领导力四个维度建立基线,用证据制定下一阶段学习计划。
从开发者到架构师:职责、边界与常见误区
区分开发者、技术负责人和架构师的工作,理解架构师如何用约束、证据和协作推动系统长期演进。
Java 架构师完整学习路线与博客目录
从 Java 基础到架构决策、生产治理和技术领导力的渐进式博客目录,并给出版本基线、实践标准与知识覆盖检查。
多模态与语音评测:把感知、推理和交互拆开
为图像、文档、ASR、TTS 和实时语音 Agent 设计分层指标、数据集与人工评审。
评测平台选型:先画能力清单,再看产品名称
按数据集、实验、Evaluator、Trace、人工标注和治理六层做 PoC,避免被单一总分或演示界面误导。
在线评测:从生产 Trace 发现新问题
用 Shadow、A/B、抽样评分和反馈回流监控生产质量,同时控制隐私、成本和止损。
Judge 校准:用人工标签选择阈值
构造校准集、计算一致性和错误代价,避免 Judge 分数看起来精确却无法信任。
LLM-as-Judge:让模型评模型,但不让它裁决安全
为主观质量设计 Rubric、结构化评分和防注入边界,并了解哪些指标必须由代码判断。
Tool 与 Agent 评测:不只看最终回答
检查工具必要性、选择、参数、权限、结果使用、轨迹和最终业务 Outcome。
RAG 评测:分别检查检索、证据和回答
学习 Recall@k、Precision@k、Claim 支持率和引用正确性,定位 RAG 问题发生在哪一层。