任务完成
结果是否解决了用户提出的问题
AI 功能“看起来不错”,并不等于它已经可以上线。
传统功能通常可以用明确规则验证,而生成式 AI 的输出具有随机性。同一个功能既要检查结果是否正确,也要判断表达是否合适、过程是否稳定,以及用户能否修改或拒绝结果。
评测样本能否覆盖高频场景和边缘问题?
正确率、采纳率和用户满意度之间是什么关系?
严重错误是否应该比普通错误获得更高权重?
离线评测与线上数据不一致时,应该相信哪一个?
结果是否解决了用户提出的问题
是否准确、完整,并符合场景和语气
多次运行时是否出现明显波动
用户能否理解、修改、撤销或重新生成
是否包含幻觉、违规内容或错误操作建议