首页 / Skills 资产 / llm-app-security-check
llm-app-security-check
LLM 应用上线前或对接受监管客户时使用。当需要做 Prompt 注入防护评估、数据安全合规检查、或撰写给客户 CISO 看的部署安全简报时,按此检查清单执行。
从 Demo 到生产的分水岭。受监管客户(金融、医疗、政企)2026 年起把这一节当硬门槛。
一、Prompt 注入防护
- [ ] 系统提示与用户输入之间有明确分隔(结构化模板,不拼字符串)
- [ ] 工具调用遵循最小权限:第一版只读不写;写操作走人工确认
- [ ] 对检索内容(RAG 文档、网页、邮件)保持警惕——它们是注入payload 的载体,对"检索到的指令"不执行、只当数据
- [ ] 用 Gandalf(https://gandalf.lakera.ai)做一轮红队自测,记录闯到第几关
- [ ] 高风险场景上护栏框架:NeMo Guardrails(https://github.com/NVIDIA/NeMo-Guardrails)或 Guardrails AI(https://github.com/guardrails-ai/guardrails)
二、数据安全
- [ ] 数据流画出来:哪些数据会到达模型供应商?客户最关心这个
- [ ] 部署形态确认:公有云 API / 客户 VPC / 完全私有化——按客户合规要求选
- [ ] 检索权限即模型权限:用户看不到的文档,模型也必须检不到(在检索层做 ACL 过滤,不是在生成层)
- [ ] 日志里不落敏感原文(或做脱敏),日志保留周期与客户确认
三、输出安全
- [ ] 高危输出(医疗/法务/财务建议)加免责声明与人工审核环节
- [ ] 结构化输出用 JSON Schema 校验,非法输出拦截重试
- [ ] 有"拒答"能力:知识范围外的问题明确说不知道,而不是硬编
四、可观测(出了事能查)
- [ ] 全链路追踪:Langfuse(开源可私有化)/ Arize Phoenix / Logfire 三选一
- [ ] 盯四个指标:延迟、token 用量、错误率、输出漂移(同题不同答的分布变化)
- [ ] 审计日志:谁在什么时候问了什么、调了什么工具、返回了什么
五、给 CISO 的一页简报模板
- 数据流图(一页)2. 部署形态与数据边界 3. 注入防护措施清单 4. 审计与监控方案 5. 已知限制与缓解计划。能主动交出这一页,客户信任度立刻不同。
参考
- Lakera Gandalf 练手场:https://gandalf.lakera.ai
- Langfuse:https://langfuse.com
- NeMo Guardrails:https://github.com/NVIDIA/NeMo-Guardrails