---
name: llm-app-security-check
description: LLM 应用上线前或对接受监管客户时使用。当需要做 Prompt 注入防护评估、数据安全合规检查、或撰写给客户 CISO 看的部署安全简报时，按此检查清单执行。
tags: [security, guardrails, compliance, production]
category: skills
---


# LLM 应用上线安全检查清单

从 Demo 到生产的分水岭。受监管客户（金融、医疗、政企）2026 年起把这一节当硬门槛。

## 一、Prompt 注入防护

- [ ] 系统提示与用户输入之间有明确分隔（结构化模板，不拼字符串）
- [ ] 工具调用遵循**最小权限**：第一版只读不写；写操作走人工确认
- [ ] 对检索内容（RAG 文档、网页、邮件）保持警惕——它们是注入payload 的载体，对"检索到的指令"不执行、只当数据
- [ ] 用 Gandalf（https://gandalf.lakera.ai）做一轮红队自测，记录闯到第几关
- [ ] 高风险场景上护栏框架：NeMo Guardrails（https://github.com/NVIDIA/NeMo-Guardrails）或 Guardrails AI（https://github.com/guardrails-ai/guardrails）

## 二、数据安全

- [ ] 数据流画出来：哪些数据会到达模型供应商？客户最关心这个
- [ ] 部署形态确认：公有云 API / 客户 VPC / 完全私有化——按客户合规要求选
- [ ] **检索权限即模型权限**：用户看不到的文档，模型也必须检不到（在检索层做 ACL 过滤，不是在生成层）
- [ ] 日志里不落敏感原文（或做脱敏），日志保留周期与客户确认

## 三、输出安全

- [ ] 高危输出（医疗/法务/财务建议）加免责声明与人工审核环节
- [ ] 结构化输出用 JSON Schema 校验，非法输出拦截重试
- [ ] 有"拒答"能力：知识范围外的问题明确说不知道，而不是硬编

## 四、可观测（出了事能查）

- [ ] 全链路追踪：Langfuse（开源可私有化）/ Arize Phoenix / Logfire 三选一
- [ ] 盯四个指标：延迟、token 用量、错误率、输出漂移（同题不同答的分布变化）
- [ ] 审计日志：谁在什么时候问了什么、调了什么工具、返回了什么

## 五、给 CISO 的一页简报模板

1. 数据流图（一页）2. 部署形态与数据边界 3. 注入防护措施清单 4. 审计与监控方案 5. 已知限制与缓解计划。能主动交出这一页，客户信任度立刻不同。

## 参考

- Lakera Gandalf 练手场：https://gandalf.lakera.ai
- Langfuse：https://langfuse.com
- NeMo Guardrails：https://github.com/NVIDIA/NeMo-Guardrails
