✏️ AI 术语图鉴

Guardrail · 护栏

英文:guardrail/ˈɡɑːrdreɪl/guard + rail 两个音节

产品与评估难度:进阶 ★★

🗣️一句话大白话

给 AI 加的「安全栏杆」:拦住不该输出的内容(违规、隐私、品牌雷区)和不该执行的操作。模型负责聪明,护栏负责不出事。

🎬真实场景

你让客服机器人「凶一点回答」,它死活不肯——不是模型不会,是护栏在出口处把话截了。企业落地 AI,护栏和模型能力一样重要:答错了是体验问题,输出违规是事故。

📮你可以这样说

提示词层的软护栏这样写:「如果用户问 XX,不要回答,统一回复固定话术」;严格的硬护栏要在产品层另外做校验。

⚠️边界与常见误解

  • 提示词护栏可以被绕过(越狱),重要场景必须加产品层硬校验
  • 护栏太严会误伤:正常问题也被拒答,体验变差,要调平衡
  • 护栏不管「说得对不对」,只管「允不允许说」——正确性靠知识库和评估

🔗相关术语