AI安全与治理(AI Safety & Governance)
理解 AI Agent 和自动化工具在真实环境中的权限、数据、误操作和治理风险。越高级的 AI 用户,越需要系统化的安全边界意识。
生产方式:人写签发:晓黎学习复核:2026年7月7日被 2 个词条引用
一句话定义
AI 安全与治理 = 在扩大 AI 自动化能力的同时,控制权限边界、失败损失和系统风险。
为什么越高级越需要
越高级的 AI 用户,越容易让 AI 接触更多东西:
- 代码仓库(读写、提交)
- 文件系统(读取、删除、修改)
- 浏览器(访问网页、填写表单)
- API Key(调用外部服务、产生费用)
- 自动化脚本(定时执行、无人值守)
- 生产环境(部署、数据库操作)
能力越强,风险越高。
六大安全维度
| 维度 | 核心问题 | 实践原则 |
|---|---|---|
| 权限边界 | AI 能访问什么、不能访问什么 | 最小权限原则:默认禁止,显式授权 |
| 数据安全 | 什么数据绝对不能给 AI | 密钥、客户信息、商业机密、隐私数据 |
| 操作安全 | 什么操作不能自动执行 | 资金、法律、生产部署、不可逆操作 |
| 可靠性设计 | 出事之后怎么办 | 日志、版本控制、备份、回滚、审批 |
| 约束层级 | 规则靠什么保证 | prompt 约束 vs 系统强制约束(hook/CI) |
| 自动化风险 | 什么不应交给 Agent | 高风险决策、法律合规、人身安全相关 |
约束层级判断
不是所有事情都应该交给模型自觉遵守。
| 约束类型 | 适用场景 | 示例 |
|---|---|---|
| Prompt 约束 | 输出风格、格式偏好 | "请使用中文回答" |
| Hook 约束 | 关键操作拦截 | pre-commit hook 检查代码质量 |
| CI 约束 | 自动化流水线检查 | CI 中运行安全扫描 |
| 系统约束 | 硬性边界 | 沙盒环境、只读挂载、命令黑名单 |
| 人工审核 | 不可逆操作 | 生产部署、资金转账、法律文件签署 |
我的安全实践清单
基于 Claude Code 使用场景:
已做的
- 敏感文件不提交到 Git(.env, credentials)
- API Key 使用环境变量管理
- Git 提交前检查变更内容
- 不使用
--no-verify跳过 hook - 危险命令(rm -rf, git push --force)需要确认
待加强
- 为 Claude Code 工作区设定明确的文件访问边界
- 建立"不应交给 AI 的任务清单"
- 定期审查 AI Agent 的权限范围
- 备份重要文件后再让 AI 批量修改
相关概念
- AI Native — D10 安全可靠性与治理
- Agent Orchestration — 多 Agent 意味着更多权限面
- Eval Harness — 安全是 eval 的维度之一
来源
- 阿迪亚-2026-AI-Native能力Benchmark — D10 安全、可靠性与治理能力
互链
链接来自概念卡正文里的双链,编译时能解到本期词条集的才成为站内链接。
反链(2)
出处
路径是本地知识库(Obsidian 库)里的位置,正文与概念卡逐字对应。
- 概念卡原文AI安全与治理(AI Safety & Governance)
03_RESOURCES/概念/ai-safety-governance.md - 所属知识地图栏目概念页索引 · Agent 架构与 Harness 治理
03_RESOURCES/概念/Index.md - 正文引用的知识库笔记阿迪亚-2026-AI-Native能力Benchmark
03_RESOURCES/摘录/adiya-2026-AI-Native-benchmark.md
编译入库:2026年10月6日。词条由知识库编译而来, 修正要回到概念卡改,再重新编译。