安全、伦理与治理入门已核验核验于 2026-07-29

AI 安全

AI Safety

识别并降低 AI 系统可能造成伤害、失控或滥用风险的研究与工程实践。

本页目录
快速跳转

它是什么

AI 安全是识别、评估并降低 AI 系统可能造成伤害的研究、工程和治理实践。它关注系统是否可靠、是否会被滥用或攻击,以及能力、部署环境和人类使用方式共同产生的风险。[S1][S2]

为什么需要它

AI 错误可能只是一次无用回答,也可能影响隐私、财务、公共服务或关键基础设施。风险随场景、人员和权限变化,不能只靠模型发布前的一次安全测试。安全工作的目标是让收益与风险都可见并受到持续管理。

它如何工作

团队先界定用途、相关人员和可能损害,再测量发生可能性与影响,选择数据、模型、权限、人工监督和监测控制。NIST AI RMF 将工作组织为治理、映射、测量和管理;运行后还要处理事件、更新证据和重新评估。[S1]

必须澄清的误会

AI 安全 ≠ AI 风险管理。 风险管理是一套识别、评估、处置与复盘的流程,安全是这套流程要达成的目标状态。

AI 安全 ≠ 负责任人工智能。 负责任 AI 的范围更宽,还包含公平、透明、问责等价值主张;AI 安全更聚焦「不造成伤害」这一条底线。

真实例子

医疗预约助手可以解释流程,但不能自行改变处方。系统只开放必要工具,敏感数据按权限读取,高风险意图转给医务人员;团队测试错误建议、提示注入和身份冒用,并记录事故以更新控制措施。

什么时候适合与不适合

安全措施应与风险相称:过弱会放大伤害,粗糙的一刀切也可能阻断正当使用。先进 AI 的部分风险已有事件和实验支持,部分仍依赖不确定推断。国际报告强调需要区分现有证据、能力趋势与未来情景。[S2]

亲自试一下

为一个 AI 功能建立风险登记表,写下受影响者、失败方式、影响、现有证据、预防控制、检测信号和负责人。至少加入一个正常错误、一个恶意使用和一个系统依赖故障,再确定暂停服务的条件。

接下来学什么

学习AI 风险管理组织治理流程,再进入红队测试、提示词注入和人工监督理解具体控制。

来源与修订

风险管理生命周期与可信特征参考 NIST AI RMF 1.0 [S1];先进 AI 能力、风险、缓解措施及证据不确定性参考 2026 国际 AI 安全报告 [S2]。风险证据会变化,本文核验日期是重要边界。

Learning navigation

学习导航

根据真实关系:当前词条没有可继续的下一站,下面按已核验的语义关系给出最有帮助的邻接概念。

Relation topology

概念关系

本词条在知识拓扑中的连接关系。涵盖前置依赖、组成要素、对比差异与应用场景。

拓扑图谱网络 · 一度关联场

可拖拽节点、滚轮缩放、点击节点探索

Local relation field

AI 安全的一层关系

9 个节点 · 9 条直接关系

关系类型
图谱进入视口后加载

交互图谱之外,本页下方保留完整文字关系与词条链接。

Related names

相关名词

下面这些名字与「AI 安全」讲的是同一块知识,内容已并入本页, 不再单独作为入口出现。保留链接是为了让旧地址仍然能打开。

  • 公平性Fairness

    同域内缺少可支撑独立入口的区分度,读者真正要的是「AI 安全」这一层;内容已并入该词条,本页只作旧链接的落点。

  • 模型窃取Model Theft

    同域内缺少可支撑独立入口的区分度,读者真正要的是「AI 安全」这一层;内容已并入该词条,本页只作旧链接的落点。

  • 算法偏见Algorithmic Bias

    同域内缺少可支撑独立入口的区分度,读者真正要的是「AI 安全」这一层;内容已并入该词条,本页只作旧链接的落点。

Source register

核验来源

  1. Artificial Intelligence Risk Management Framework 1.0NIST · 访问于 2026-07-29
  2. International AI Safety Report 2026International AI Safety Report · 访问于 2026-07-29

发布 2026-07-29 · 更新 2026-07-29 · 核验 2026-07-29