安全边界
771 字约 3 分钟
domain/aiai/safety
2026-07-24
1. 核心结论
- AI 安全边界是防止 AI 系统产生有害输出的防护措施
- 安全应该贯穿 AI 应用的整个生命周期,而非事后补救
- 输入过滤、输出审查、权限控制是基本的安全措施
- 对抗性测试能发现潜在的安全漏洞
- 安全策略需要持续更新,应对新的威胁
2. 基础概念
Input Filtering:输入过滤,检测和阻止恶意输入。
Output Moderation:输出审查,检测和阻止有害输出。
Prompt Injection:Prompt 注入,通过恶意输入操控模型行为。
Jailbreak:越狱,绕过模型安全限制的技术。
Content Moderation:内容审核,检查内容是否合规。
Guardrails:护栏,系统级的安全防护机制。
Red Teaming:红队测试,模拟攻击发现漏洞。
3. 工作原理
安全防护层次:
- 输入层安全:
- 输入验证和过滤
- Prompt 注入检测
- 敏感信息识别
- 长度和格式限制
- 模型层安全:
- 系统 Prompt 约束
- 安全微调
- RLHF 对齐
- 内置安全过滤
- 输出层安全:
- 内容审核
- 事实检查
- 敏感信息过滤
- 格式验证
- 应用层安全:
- 权限控制
- 操作审计
- 速率限制
- 异常检测
常见安全威胁:
- Prompt 注入:
- 直接注入:在输入中包含恶意指令
- 间接注入:在检索内容中包含恶意指令
- 防御:输入过滤、指令分离、输出验证
- 越狱攻击:
- 角色扮演绕过
- 假设场景绕过
- 防御:强化系统 Prompt、输出审核
- 数据泄露:
- 训练数据泄露
- 上下文数据泄露
- 防御:数据脱敏、访问控制
- 恶意输出:
- 有害内容生成
- 错误信息传播
- 防御:内容审核、事实检查
安全工具:
- OpenAI Moderation API:内容审核
- NeMo Guardrails:NVIDIA 安全框架
- Guardrails AI:输出验证框架
- Lakera Guard:Prompt 注入检测
4. 实战场景
- 客服系统安全过滤
- 内容生成安全审查
- 代码生成安全检查
- 用户输入防护
- 敏感数据处理
- 合规性检查
5. 常见误区
- 只依赖模型内置安全:需要多层防护
- 不测试安全边界:不知道系统弱点
- 忽视间接注入:RAG 系统特别容易受影响
- 安全策略一成不变:需要持续更新
- 过度限制影响体验:平衡安全和可用性
6. 进阶方向
- 自动化安全测试
- 动态安全策略
- 对抗性训练
- 安全可观测性
- 隐私保护技术
- 安全标准认证
7. 推荐资料
- OWASP Top 10 for LLM - https://owasp.org/www-project-top-10-for-large-language-model-applications/
- Anthropic Safety - https://www.anthropic.com/safety
- NeMo Guardrails - https://github.com/NVIDIA/NeMo-Guardrails
- Lakera Guard - https://www.lakera.ai/lakera-guard