它是什么
AI 安全是识别、评估并降低 AI 系统可能造成伤害的研究、工程和治理实践。它关注系统是否可靠、是否会被滥用或攻击,以及能力、部署环境和人类使用方式共同产生的风险。[S1][S2]
为什么需要它
AI 错误可能只是一次无用回答,也可能影响隐私、财务、公共服务或关键基础设施。风险随场景、人员和权限变化,不能只靠模型发布前的一次安全测试。安全工作的目标是让收益与风险都可见并受到持续管理。
它如何工作
团队先界定用途、相关人员和可能损害,再测量发生可能性与影响,选择数据、模型、权限、人工监督和监测控制。NIST AI RMF 将工作组织为治理、映射、测量和管理;运行后还要处理事件、更新证据和重新评估。[S1]
必须澄清的误会
AI 安全 ≠ AI 风险管理。 风险管理是一套识别、评估、处置与复盘的流程,安全是这套流程要达成的目标状态。
AI 安全 ≠ 负责任人工智能。 负责任 AI 的范围更宽,还包含公平、透明、问责等价值主张;AI 安全更聚焦「不造成伤害」这一条底线。
真实例子
医疗预约助手可以解释流程,但不能自行改变处方。系统只开放必要工具,敏感数据按权限读取,高风险意图转给医务人员;团队测试错误建议、提示注入和身份冒用,并记录事故以更新控制措施。
什么时候适合与不适合
安全措施应与风险相称:过弱会放大伤害,粗糙的一刀切也可能阻断正当使用。先进 AI 的部分风险已有事件和实验支持,部分仍依赖不确定推断。国际报告强调需要区分现有证据、能力趋势与未来情景。[S2]
亲自试一下
为一个 AI 功能建立风险登记表,写下受影响者、失败方式、影响、现有证据、预防控制、检测信号和负责人。至少加入一个正常错误、一个恶意使用和一个系统依赖故障,再确定暂停服务的条件。
接下来学什么
学习AI 风险管理组织治理流程,再进入红队测试、提示词注入和人工监督理解具体控制。
来源与修订
风险管理生命周期与可信特征参考 NIST AI RMF 1.0 [S1];先进 AI 能力、风险、缓解措施及证据不确定性参考 2026 国际 AI 安全报告 [S2]。风险证据会变化,本文核验日期是重要边界。
Learning navigation
学习导航
根据真实关系:当前词条没有可继续的下一站,下面按已核验的语义关系给出最有帮助的邻接概念。
Relation topology
拓扑图谱网络 · 一度关联场
可拖拽节点、滚轮缩放、点击节点探索AI 安全的一层关系
9 个节点 · 9 条直接关系
交互图谱之外,本页下方保留完整文字关系与词条链接。
Related names
相关名词
下面这些名字与「AI 安全」讲的是同一块知识,内容已并入本页, 不再单独作为入口出现。保留链接是为了让旧地址仍然能打开。
- 公平性Fairness
同域内缺少可支撑独立入口的区分度,读者真正要的是「AI 安全」这一层;内容已并入该词条,本页只作旧链接的落点。
- 模型窃取Model Theft
同域内缺少可支撑独立入口的区分度,读者真正要的是「AI 安全」这一层;内容已并入该词条,本页只作旧链接的落点。
- 算法偏见Algorithmic Bias
同域内缺少可支撑独立入口的区分度,读者真正要的是「AI 安全」这一层;内容已并入该词条,本页只作旧链接的落点。
Source register
核验来源
- Artificial Intelligence Risk Management Framework 1.0NIST · 访问于 2026-07-29
- International AI Safety Report 2026International AI Safety Report · 访问于 2026-07-29
发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29