02 / RESEARCH NOTE

AI 产品评测

AI 功能“看起来不错”,并不等于它已经可以上线。

为什么关注这个问题

传统功能通常可以用明确规则验证,而生成式 AI 的输出具有随机性。同一个功能既要检查结果是否正确,也要判断表达是否合适、过程是否稳定,以及用户能否修改或拒绝结果。

正在思考

四个关键问题

  1. 01

    评测样本能否覆盖高频场景和边缘问题?

  2. 02

    正确率、采纳率和用户满意度之间是什么关系?

  3. 03

    严重错误是否应该比普通错误获得更高权重?

  4. 04

    离线评测与线上数据不一致时,应该相信哪一个?

分析框架

我会从五个环节进行拆解

01

任务完成

结果是否解决了用户提出的问题

02

内容质量

是否准确、完整,并符合场景和语气

03

稳定程度

多次运行时是否出现明显波动

04

用户控制

用户能否理解、修改、撤销或重新生成

05

风险边界

是否包含幻觉、违规内容或错误操作建议

相关实践

在数字人带货视频项目中,我与评测团队整理 badcase,按照文案结构、信息遗漏、表达错误等原因分类,再针对高频问题调整提示词和兜底规则,最终把 badcase 率降到 8%。