✏️ AI 术语图鉴

评估 · Evaluation

英文:evaluation/ɪˌvæljuˈeɪʃən/重音在 ua

产品与评估难度:进阶 ★★

🗣️一句话大白话

给 AI 的输出「定期考试」:准备一批标准问题和期望结果,每次改提示词、换模型、调知识库后跑一遍,看得分升还是降。没有评估的调优 = 凭感觉装修。

🎬真实场景

你改了一版 Prompt,试了两个问题觉得「更好了」就上线。三天后用户发现另一类问题全崩了。有 30 题的评估集:每次改动跑一遍,15 题变好 2 题变坏,一眼看穿。

📮你可以这样说

「改之前先跑一遍评估集,对比新旧版本得分」——把这一步固化成你的修改流程。

⚠️边界与常见误解

  • 评估集要覆盖真实场景:用用户真问过的问题,别自己编理想问题
  • 评分可以让 AI 打分(LLM-as-judge),但要人工抽查校准这个「打分官」
  • 评估不是一次的事:模型升级、知识库更新后都要重跑

🔗相关术语