Guardrail · 护栏
英文:guardrail/ˈɡɑːrdreɪl/(guard + rail 两个音节)
产品与评估难度:进阶 ★★
🗣️一句话大白话
给 AI 加的「安全栏杆」:拦住不该输出的内容(违规、隐私、品牌雷区)和不该执行的操作。模型负责聪明,护栏负责不出事。
🎬真实场景
你让客服机器人「凶一点回答」,它死活不肯——不是模型不会,是护栏在出口处把话截了。企业落地 AI,护栏和模型能力一样重要:答错了是体验问题,输出违规是事故。
📮你可以这样说
「提示词层的软护栏这样写:「如果用户问 XX,不要回答,统一回复固定话术」;严格的硬护栏要在产品层另外做校验。」
⚠️边界与常见误解
- ▸提示词护栏可以被绕过(越狱),重要场景必须加产品层硬校验
- ▸护栏太严会误伤:正常问题也被拒答,体验变差,要调平衡
- ▸护栏不管「说得对不对」,只管「允不允许说」——正确性靠知识库和评估