评估 · Evaluation
英文:evaluation/ɪˌvæljuˈeɪʃən/(重音在 ua)
产品与评估难度:进阶 ★★
🗣️一句话大白话
给 AI 的输出「定期考试」:准备一批标准问题和期望结果,每次改提示词、换模型、调知识库后跑一遍,看得分升还是降。没有评估的调优 = 凭感觉装修。
🎬真实场景
你改了一版 Prompt,试了两个问题觉得「更好了」就上线。三天后用户发现另一类问题全崩了。有 30 题的评估集:每次改动跑一遍,15 题变好 2 题变坏,一眼看穿。
📮你可以这样说
「「改之前先跑一遍评估集,对比新旧版本得分」——把这一步固化成你的修改流程。」
⚠️边界与常见误解
- ▸评估集要覆盖真实场景:用用户真问过的问题,别自己编理想问题
- ▸评分可以让 AI 打分(LLM-as-judge),但要人工抽查校准这个「打分官」
- ▸评估不是一次的事:模型升级、知识库更新后都要重跑