所有文章
阅读时长 2 分钟

提示注入最麻烦的地方,不是几句脏话能不能过滤

外部内容一旦能影响模型,问题就不只是“输入清洗”。真正要守住的是权限、工具调用和输出落到系统里的那条边界。

提示注入纵深防御生产 2026 封面

提示注入不是靠关键词黑名单能消灭的问题。只要模型同时阅读不可信内容并拥有工具权限,攻击者就可能让数据看起来像指令。OWASP 将其列为 LLM 应用的首要风险之一。

把不可信内容降权

网页、邮件、文档和工具返回都应标记为数据,并与系统指令分隔。不要指望模型永远遵守分隔;这是降低成功率的一层,不是安全边界。

真正边界在工具层

工具逐项校验用户身份、资源范围和参数,使用最小权限短期凭证。发送、删除、购买和公开发布要显示具体影响并确认;模型输出不能直接拼接成 SQL 或 shell。

测试完整攻击路径

评测直接注入、文档内间接注入、编码混淆和跨工具数据外泄。记录攻击是否被发现,更要记录最终副作用是否被阻止,因为检测器也会漏报。

上线前检查

  • 不可信文本不能提升权限
  • 高风险副作用需要确定性确认
  • 攻击测试覆盖检索和工具返回

资料来源

相关阅读