AI安全与治理(AI Safety & Governance)

理解 AI Agent 和自动化工具在真实环境中的权限、数据、误操作和治理风险。越高级的 AI 用户,越需要系统化的安全边界意识。

生产方式:人写签发:晓黎学习复核:2026年7月7日被 2 个词条引用

一句话定义

AI 安全与治理 = 在扩大 AI 自动化能力的同时,控制权限边界、失败损失和系统风险。

为什么越高级越需要

越高级的 AI 用户,越容易让 AI 接触更多东西:

  • 代码仓库(读写、提交)
  • 文件系统(读取、删除、修改)
  • 浏览器(访问网页、填写表单)
  • API Key(调用外部服务、产生费用)
  • 自动化脚本(定时执行、无人值守)
  • 生产环境(部署、数据库操作)

能力越强,风险越高。

六大安全维度

维度核心问题实践原则
权限边界AI 能访问什么、不能访问什么最小权限原则:默认禁止,显式授权
数据安全什么数据绝对不能给 AI密钥、客户信息、商业机密、隐私数据
操作安全什么操作不能自动执行资金、法律、生产部署、不可逆操作
可靠性设计出事之后怎么办日志、版本控制、备份、回滚、审批
约束层级规则靠什么保证prompt 约束 vs 系统强制约束(hook/CI)
自动化风险什么不应交给 Agent高风险决策、法律合规、人身安全相关

约束层级判断

不是所有事情都应该交给模型自觉遵守。

约束类型适用场景示例
Prompt 约束输出风格、格式偏好"请使用中文回答"
Hook 约束关键操作拦截pre-commit hook 检查代码质量
CI 约束自动化流水线检查CI 中运行安全扫描
系统约束硬性边界沙盒环境、只读挂载、命令黑名单
人工审核不可逆操作生产部署、资金转账、法律文件签署

我的安全实践清单

基于 Claude Code 使用场景:

已做的

  • 敏感文件不提交到 Git(.env, credentials)
  • API Key 使用环境变量管理
  • Git 提交前检查变更内容
  • 不使用 --no-verify 跳过 hook
  • 危险命令(rm -rf, git push --force)需要确认

待加强

  • 为 Claude Code 工作区设定明确的文件访问边界
  • 建立"不应交给 AI 的任务清单"
  • 定期审查 AI Agent 的权限范围
  • 备份重要文件后再让 AI 批量修改

相关概念

来源

  • 阿迪亚-2026-AI-Native能力Benchmark — D10 安全、可靠性与治理能力

互链

链接来自概念卡正文里的双链,编译时能解到本期词条集的才成为站内链接。

反链(2)

出处

路径是本地知识库(Obsidian 库)里的位置,正文与概念卡逐字对应。

  • 概念卡原文AI安全与治理(AI Safety & Governance)03_RESOURCES/概念/ai-safety-governance.md
  • 所属知识地图栏目概念页索引 · Agent 架构与 Harness 治理03_RESOURCES/概念/Index.md
  • 正文引用的知识库笔记阿迪亚-2026-AI-Native能力Benchmark03_RESOURCES/摘录/adiya-2026-AI-Native-benchmark.md

编译入库:2026年10月6日。词条由知识库编译而来, 修正要回到概念卡改,再重新编译。