8 分钟阅读AI Agent 提示词注入防护渠道安全人工确认

AI Agent 提示词注入防护,先从信任边界做起

AI 伙伴接入群聊、网页和文件后,把第三方内容当作不可信数据,缩小读取与工具权限,并在发送、删除和改权限前保留确定性校验与人工确认。

独立经营者检查一张外部卡片,龙虾连帽服宠物伙伴把其余卡片放进隔离托盘,工具箱保持上锁

AI 伙伴接上群聊、网页和文件以后,一条看似普通的内容就可能改变它接下来做什么。有人可以在消息里夹带忽略原任务、读取别处资料或代替你发送结果的指令。OpenAI 把这类提示词注入解释为一种针对对话式 AI 的社会工程攻击,第三方内容试图让 AI 做出用户没有要求的动作。

我觉得个人经营场景里,最实用的起点是把每条外部内容都当作数据。它可以提供事实和线索,却不能改写任务目标、扩大访问范围,也不能决定消息发给谁。AI 先整理,人和确定性规则共同决定能不能继续。

一条安全提示词挡不住所有外部内容

间接注入可以藏在网页、文件、聊天记录和图片里。OWASP 的提示词注入说明指出,检索增强和微调也无法完整消除这类风险。只让模型记住一句不要听陌生指令,仍然把识别与执行都压在同一次概率判断上。

更稳妥的做法会分开内容与权限。外部消息只进入材料区,工具只拿到当前任务需要的最小范围。模型输出还要经过格式、类型、范围和允许值检查。发送消息、删除文件、修改权限这类有副作用的动作停在确认位置。

先为一条渠道任务画清两道边界

假设你让 AI 伙伴整理本周客户群里的反馈。第一道边界管输入,只读取指定群和指定时间内的消息,不因为消息正文要求就打开其他文件夹或知识库。第二道边界管动作,结果只能进入待确认清单,不能自动回复客户、删除原消息或调整群权限。

  • 把来源留在结果旁边。 每条分类都带回原消息位置,材料不足时进入待确认,不让模型用猜测补齐。
  • 把动作参数交给代码检查。 群组、文件路径、收件人和数量只接受允许范围,任何越界值都停止执行。

Microsoft 的 Agent Safety 文档把用户输入、历史记录、上下文服务、模型与工具都视为需要检查的信任边界,并要求把模型生成的工具参数当成不可信输入。允许列表、类型和范围限制负责挡住确定性错误,人工确认负责处理高风险与不可逆动作。

MotiClaw 任务看板把客户声音分为待处理、推进中、待验收和已完成,并在待验收卡片上提供通过与驳回操作
让渠道内容先停在待处理和待验收位置,确认来源、范围与下一步后再推进。

让外部内容停在待处理位置

这张 MotiClaw 合成示例看板把客户声音分为待处理、推进中、待验收和已完成。待验收卡片保留通过与驳回,适合让一个人先确认来源、任务范围和结果,再决定是否推进。渠道里出现任何试图改写目标的内容,也只能先作为材料进入这条路径。

这里展示的是可复核的任务流。MotiClaw 文档确认 AI 伙伴可以接入飞书,并说明渠道收发与模型调用会按任务所需出网,任务执行、中间产物和日志默认留在设备上。当前证据没有说明产品内置了专用提示词注入检测器,因此防护仍要靠任务范围、最小权限、参数校验和人工确认共同完成。

权限越靠近真实动作,范围就要越小

OpenAI 的安全建议强调,只给 Agent 当前任务需要的数据访问,并在发送邮件、购买等重要动作前仔细复核。OWASP 也建议采用最小权限,把高风险操作交给人工批准。放到一个人的日常工作里,可以先让新渠道只做读取、归类和草稿。连续跑过一段稳定任务以后,再逐项开放可撤销的小动作。

今天就能检查一条现有工作流。写下它允许读取的来源、允许产生的结果,以及必须停下来找你的动作。再把外部内容、模型输出和工具参数都放进不可信一侧。工作数据默认留在本机;仅你主动接入的渠道与模型调用按任务所需出网。边界写得越具体,AI 伙伴越容易把材料整理好,也越难被一条陌生内容带去做越界的事。

3 分钟,让第一个 AI 伙伴上岗

免费下载 MotiClaw 桌面端。工作数据默认留在本机;仅你主动接入的渠道与模型调用按任务所需出网。

免费下载