提示注入是攻击者或不可信内容通过自然语言指令改变大模型原定行为的安全风险。
它既可能来自用户直接输入,也可能隐藏在网页、邮件、文档、工具返回或知识库内容中形成间接注入,诱导模型泄露数据、越权调用工具或忽略既定规则。在 MCP 与 Agent Skills 场景中,防护不能只依赖提示词,还需要最小权限、数据与指令隔离、敏感操作确认、脚本沙箱、来源审查和日志审计共同约束。
提示注入是攻击者或不可信内容通过自然语言指令改变大模型原定行为的安全风险。
它既可能来自用户直接输入,也可能隐藏在网页、邮件、文档、工具返回或知识库内容中形成间接注入,诱导模型泄露数据、越权调用工具或忽略既定规则。在 MCP 与 Agent Skills 场景中,防护不能只依赖提示词,还需要最小权限、数据与指令隔离、敏感操作确认、脚本沙箱、来源审查和日志审计共同约束。