Cognitive chain · 8 stations · 177/177 terms placed
AI 认知链路
这 8 站回答同一个问题:语言模型缺什么,每一层补什么。它们是严格的工程递进关系,按顺序阅读建立系统认知。
高频词快速定位:日常反复出现的 AI 词,分别在解决什么问题?
将日常新闻、产品宣传和工作交流中最常见的 22 个核心词放回系统层次。先看这里建立全局定位,再顺着下方 8 站深入认知。
范围层
1 个入口- 人工智能Artificial Intelligence
先判断它是不是在说 AI 这个大范围,而不是某一个具体模型或产品。
常见困惑人工智能不等于生成式 AI;前者还包含识别、预测、推荐与控制。
内容层
3 个入口模型层
3 个入口可靠性层
1 个入口- 幻觉Hallucination
识别 AI 为什么会把不确定的内容说得像真的,建立核验意识。
常见困惑幻觉不是语气问题;回答越流畅,越不能替代事实核查。
交互层
3 个入口知识层
1 个入口- 检索增强生成Retrieval-Augmented Generation
回答前先查外部资料,常用于企业知识库、客服和资料问答。
常见困惑RAG 是把证据放进上下文,不是重新训练模型,也不能保证资料本身正确。
行动层
2 个入口接口层
2 个入口实现层
1 个入口- LangChainLangChain
用代码把模型、提示、工具和流程编排起来的常见框架。
常见困惑LangChain 是实现框架,不是 MCP,也不是一个模型或独立的 Agent。
流程层
2 个入口判断层
1 个入口- AI 评估AI Evaluation
用样本和标准判断一次改动到底有没有让系统变好。
常见困惑演示效果好不等于评估通过;评估需要可复现的题目、标准和记录。
安全层
2 个入口地基 · 模型是什么
它为什么不是检索,又为什么必然会编?
说清语言模型在做什么——按概率续写下一段文本,而不是查资料库;因此「编」是它的默认行为,不是故障。
本站概念
22 个概念- 人工智能先读这个AI 基础
让机器执行通常需要人类感知、推理、学习或决策能力的技术与研究领域。
- 生成式 AI先读这个大模型与生成
根据训练中学到的模式生成文本、图像、音频或其他新内容的一类人工智能方法。
- AI 能力边界主干AI 基础
AI 系统在特定输入、任务和运行条件下能够可靠完成工作的范围,以及超出范围后的失败方式。
- 幻觉主干评估与质量
说得流畅、具体、格式像真的,但事实或依据站不住——它是生成方式的必然后果,不是偶发故障。
- 大语言模型主干大模型与生成
一个模型覆盖一大批语言任务的通用模型——它的知识在参数里、说不清依据,也不会因为你这次说了什么而改变。
- Token主干大模型与生成
模型读写文本的最小计量单位——是切分与计费的单位,不等于一个字,也不等于一个词。
- 上下文窗口主干提示与上下文
一次推理能同时参考的 Token 容量——是「当下能看见」的范围,不是记忆,也不是训练语料。
- 自然语言处理深入AI 基础
让计算机分析、理解、生成和转换人类语言的技术领域,覆盖文本与部分语音任务。
- 算力深入算力与产业
完成模型训练或推理所需计算资源与处理能力的总称,常受芯片、内存和能耗限制。
- 微调深入大模型与生成
在已有模型基础上用特定数据继续训练,以适配领域、任务或行为目标的方法。
- 指令微调深入大模型与生成
使用指令与期望回答数据继续训练模型,使其更能理解任务描述并按要求输出。
- 低秩适配深入大模型与生成
通过训练低秩矩阵近似权重变化的参数高效微调方法,使模型适配时无需更新全部原始参数。
- 模型能力深入大模型与生成
模型在给定任务、语言、模态和约束下表现出的可测能力,不等同于所有场景中的系统效果。
- 温度参数深入大模型与生成
调整生成概率分布平滑程度的参数,较低值通常更稳定,较高值通常增加多样性。
- 分类任务深入机器学习
将输入判断为一个或多个离散类别的预测任务,例如垃圾邮件识别或意图分类。
- 机器学习深入机器学习
让系统从数据和反馈中学习模式并改进任务表现的方法,是现代人工智能的重要实现路径。
- 训练数据深入机器学习
用于让模型学习参数、模式或行为的数据集合,其范围和质量直接影响模型能力与偏差。
- 计算机视觉深入多模态
让机器从图像或视频中识别对象、场景、文字和空间关系的技术领域。
- 图像生成深入多模态
根据文本、图像或其他条件合成新图像内容的生成式人工智能任务。
- 多模态人工智能深入多模态
能够处理或生成文本、图像、音频、视频等两种以上信息模态的人工智能系统。
- 视频生成深入多模态
根据文本、图像或视频条件合成连续画面的生成任务,需要同时维持视觉质量和时间一致性。
- 长上下文深入提示与上下文
模型一次能够处理较长输入与历史信息的能力,容量增加不代表所有位置都能同等有效利用。
上手动作
用同一个问题问同一个模型两次(temperature 调到 0 以上),把两次回答的差异记下来——这个差异就是「它在续写、不在检索」的直接证据。
对应判断题
19 题展开阅读清单
5 条沟通 · 怎么把需求说清楚
为什么同样的模型,别人用得比你好?
明白输出质量的差距主要来自你给的上下文与约束,而不是模型本身。
本站概念
12 个概念- 用户提示词先读这个提示与上下文
用户在当前轮次提交的任务、问题和上下文,是模型生成回答的直接输入之一。
- 上下文工程主干提示与上下文
围绕任务选择、组织和更新指令、数据、历史与工具结果,使模型获得合适工作信息的实践。
- 少样本提示主干提示与上下文
在提示中提供少量输入输出示例,帮助模型从上下文推断任务模式和格式。
- 提示词主干提示与上下文
提供给模型的指令、问题、背景或示例,用于表达当前任务和期望输出。
- 系统提示词主干提示与上下文
在一次模型交互中设定总体角色、规则和行为边界的高层指令,通常由应用提供。
- 上下文压缩深入提示与上下文
在保留任务关键信息的同时压缩或摘要上下文,以降低 Token 占用并延长有效工作范围。
- 对话上下文深入提示与上下文
当前对话中的历史消息、状态和约束集合,决定模型能够参考哪些先前信息。
- 事实依据约束深入提示与上下文
用输入资料、检索证据或明确事实边界约束模型输出,使内容能够追溯到给定依据。
- 指令层级深入提示与上下文
系统、开发者、用户与工具信息之间的指令优先顺序,用于处理冲突和行为边界。
- 提示约束深入提示与上下文
对输出内容、格式、范围或行为设置的明确限制,用于降低歧义并支持后续校验。
- 提示词调试深入提示与上下文
通过复现、分离变量、检查上下文和比较输出定位提示问题,并用评测验证修改效果的过程。
- 结构化输出深入提示与上下文
要求模型按照 JSON、字段约束或其他机器可解析结构返回结果的输出方式。
给知识 · 怎么让它知道你家的资料
怎么让它答我司的内部问题?
理解 RAG 的完整链路——切片、向量化、检索、重排——以及每一环出错时最终答案会怎样变形。
本站概念
19 个概念- 知识库先读这个检索与 RAG
按一定结构保存领域事实、文档和关系的数据集合,为搜索、问答和业务规则提供可维护依据。
- 文档切片主干检索与 RAG
把长文档切成「取回来能直接看懂」的知识单元——切片质量常常比换哪个模型更决定检索效果。
- 嵌入主干检索与 RAG
把内容变成一串数字向量的表示方法——让「意思接不接近」第一次变成可以算的东西。
- 重排主干检索与 RAG
用更贵、更准的模型给候选重新打分——它只调整顺序,不创造你没召回到的证据。
- 检索增强生成主干检索与 RAG
生成前先去外部取证据、再把证据放进上下文的方法——改的是模型看到什么,不是模型权重。
- 向量数据库主干检索与 RAG
存向量、按相似度查向量的底座——不生成向量,也不保证你召回到的一定是对的。
- 引用生成深入检索与 RAG
为回答中的主张生成或附加来源指向的过程,需要确保引用内容真实存在并支持对应陈述。
- 上下文检索深入检索与 RAG
围绕当前任务从外部数据源寻找可用上下文的过程,强调结果能直接支持后续生成或决策。
- 数据接入深入检索与 RAG
把外部文件、数据库或业务系统中的数据接入处理管线,并保留必要来源和权限信息的过程。
- 文档解析深入检索与 RAG
从文档中提取文字、结构、表格和元数据,使后续切片、索引与检索可以使用这些内容。
- 混合检索深入检索与 RAG
组合关键词、向量和结构化过滤等多种检索信号,以兼顾精确匹配与语义召回。
- 索引管线深入检索与 RAG
将原始内容解析、清洗、切片、标注并写入检索索引的处理流程,需要支持更新和失败恢复。
- 关键词检索深入检索与 RAG
根据查询词与文档词项的精确或统计匹配查找内容的检索方式,擅长专有名词和明确表达。
- 元数据过滤深入检索与 RAG
在检索时利用时间、权限、类型或业务标签缩小候选范围,避免不适用内容进入结果。
- 查询改写深入检索与 RAG
根据用户意图把原始查询改写为更适合检索系统处理的表达,以提高召回和精确度。
- 检索深入检索与 RAG
根据查询从文档、数据库或其他知识源中找到相关候选信息的过程。
- 语义检索深入检索与 RAG
根据查询与内容的语义相近程度进行检索,即使双方没有使用相同关键词也可能匹配。
- 相似度检索深入检索与 RAG
根据距离或相似度从向量集合中寻找最接近查询表示的候选内容。
- Top-K 召回深入检索与 RAG
从检索结果中保留得分最高的 K 个候选的操作,K 值影响召回、噪声和后续处理成本。
给手脚 · 怎么让它做事
怎么从给答案变成把事办完?
看懂 Agent 与「会聊天的模型」的差别在于工具、规划、记忆,以及人在哪一步介入。
本站概念
36 个概念- 自主智能体先读这个Agent 与自动化
在较少人工逐步指令下持续规划并执行任务的智能体,通常需要更严格的权限和停止条件。
- Agent 记忆主干Agent 与自动化
应用在轮次之外主动写入和取回的状态仓库,让 Agent 跨步骤、跨会话延续任务,而不是每轮从零开始。
- Agent 规划主干Agent 与自动化
Agent 在运行时根据目标、约束和当前状态选择下一步动作的过程,必须自带更新与停止条件。
- AI Agent主干Agent 与自动化
能自己决定下一步做什么、并调用工具把事办完的系统形态——产物是已经发生的事,不只是文字。
- 人在回路主干Agent 与自动化
把人员放在风险最高或信息最不足的那个节点上——关键是人在动作生效前能不能真正否决。
- 工具调用主干Agent 与自动化
模型根据任务选择并调用外部工具,再利用返回结果继续推理或生成输出的能力。
- Agent 沙箱深入Agent 与自动化
限制 Agent 可访问资源、工具和执行范围的隔离环境,用于降低错误或恶意指令造成的影响。
- 浏览器操作深入Agent 与自动化
AI 在浏览器中导航页面、读取状态并执行交互操作的工具使用场景。
- 代码执行深入Agent 与自动化
在受控运行环境中执行代码并读取结果的能力,需要隔离权限、资源和输出。
- 计算机操作深入Agent 与自动化
AI 通过识别界面并执行点击、输入或滚动等操作来完成计算机任务的能力。
- 长期记忆深入Agent 与自动化
跨会话持久保存可复用信息的记忆形式,需要处理隐私、过期、冲突和检索准确性。
- 自我纠错深入Agent 与自动化
系统依据反馈、验证结果或规则修改先前输出与行动的能力,需要明确触发条件和终止规则。
- 短期记忆深入Agent 与自动化
在当前任务或会话范围内保存临时信息的记忆形式,通常随任务结束而清理。
- 任务拆解深入Agent 与自动化
把复杂目标拆成范围明确、可执行和可检查的子任务,以降低一次处理的认知与执行负担。
- AI 采用深入AI 产品体验
用户或组织把 AI 能力纳入实际工作流程并持续使用的过程,受价值、成本、风险和变革管理影响。
- AI 产品引导深入AI 产品体验
帮助新用户理解 AI 产品适用场景、输入方式、能力边界和控制机制的首次使用引导。
- AI 产品深入AI 产品体验
以人工智能能力解决用户问题,并对质量、成本、风险和人机分工负责的产品。
- AI 应用场景深入AI 产品体验
将具体用户任务、可用数据和 AI 能力组合成可评估价值与风险的应用场景。
- 自动驾驶模式深入AI 产品体验
由 AI 在授权范围内自主执行连续步骤、只在例外或高风险节点请求人工介入的模式。
- 置信度校准深入AI 产品体验
让系统表达的确定程度与实际正确概率尽量一致,以支持更合理的人类判断。
- 副驾驶模式深入AI 产品体验
由 AI 提供建议或草稿、用户保留关键决策与最终控制权的人机协作模式。
- 错误恢复深入AI 产品体验
系统出错后帮助用户理解状态、保留已有工作并重试、撤销或转人工的产品与工程能力。
- 解释界面深入AI 产品体验
向用户展示 AI 建议依据、影响因素或可追溯证据的产品界面。
- 降级体验深入AI 产品体验
当模型、网络或依赖能力不可用时提供简化功能、人工路径或明确说明的产品体验。
- 反馈闭环深入AI 产品体验
收集用户修正、结果表现和运行信号并用于后续改进的闭环过程,需要控制偏差和数据质量。
- 人机协作深入AI 产品体验
人与 AI 按各自优势分配生成、判断、执行和复核职责的工作方式。
- 人工升级处理深入AI 产品体验
在系统不确定、失败或风险升高时,把任务和必要上下文交给具备权限的人员处理。
- 延迟预算深入AI 产品体验
产品为一次 AI 交互分配的最大可接受等待时间,用于约束模型、工具和后处理方案。
- 感知延迟深入AI 产品体验
用户主观感受到的等待时长,可通过流式反馈、进度状态和分步呈现改善。
- 问题方案匹配深入AI 产品体验
验证解决方案是否真正缓解目标用户的重要问题,是进入规模化投入前的产品判断。
- 渐进披露深入AI 产品体验
先呈现当前任务必需的信息和控制,再按用户需要逐步展示高级选项的界面原则。
- 任务成功率深入AI 产品体验
在预先定义的成功标准下正确完成任务的次数占总尝试次数的比例,应结合失败类型解释。
- 不确定性呈现深入AI 产品体验
在界面中明确呈现模型的不确定性、证据缺口或需要复核之处的设计方式。
- 撤销操作深入AI 产品体验
将系统恢复到操作前状态的机制,可降低 AI 自动执行错误带来的不可逆影响。
- 用户控制权深入AI 产品体验
让用户能够发起、调整、暂停、撤销或拒绝 AI 行为的产品能力,是可靠人机协作的基础。
- 用户信任深入AI 产品体验
用户基于系统能力、透明度、可靠性和可控性形成的信任判断,需要通过持续真实表现建立。
上手动作
给模型两个工具(读文件 + 写文件),让它完成一次多步任务,观察你在哪一步必须介入。
对应判断题
47 题- 06演示不等于机会
- 08错误成本判断
- 09自动化环节
- 10价值是否真实
- 13工作流还是智能体
- 16结果要能修改
- 17不确定性表达
- 18何时转人工
- 19出错怎么恢复
- 20首次使用引导
- 22线上看什么指标
- 23延迟预算
- 25上线要什么护栏
- 28缺少人工兜底
- 36数据不全机会
- 37错误不可逆
- 38投入产出比
- 39需求与现场
- 42流程还是智能体
- 43检索的边界
- 44档位与延迟
- 45混合方案
- 46专业与普通用户
- 47低频功能设计
- 48用户不信任
- 49上下文丢失
- 50批量操作可控
- 53质量与延迟
- 55护栏误拦
- 57预算约束范围
- 60组织阻力
- 64多接还是守住
- 65放手还是留痕
- 66价值还是成本
- 68铺开还是做深
- 69扩量还是守线
- 71准答还是快答
- 72授权还是兜底
- 74编排还是简单
- 76快用还是可控
- 77代劳还是信任
- 78给全还是减负
- 79因人还是统一
- 80提醒还是打扰
- 88指标还是体验
- 89合规还是顺滑
- 90试点还是铺开
展开阅读清单
1 条给接口 · 怎么标准化地接系统
为什么每个工具不再各接一遍?
说清 MCP 的三个角色(Host / Client / Server)与它解决的问题——把「每个模型 × 每个工具」的对接矩阵收敛成一次实现。
本站概念
19 个概念- 推理服务器先读这个AI 工程运维
接收请求、调度模型计算并返回结果的服务组件,负责并发、批处理和资源管理。
- 模型上下文协议主干Agent 与自动化
把「模型接外部工具与数据」从每个客户端 × 每个系统的重复对接,收敛成一次协议实现。
- 模型 API主干AI 工程运维
通过网络接口向应用提供模型推理能力的服务契约,通常定义输入、输出、鉴权和限额。
- 模型服务主干AI 工程运维
把模型变成可长期调用的服务,并持续管理并发、延迟、版本与容量的工程过程,而不是一次性部署动作。
- API 调用深入Agent 与自动化
应用按接口协议向外部服务发送请求并处理响应的动作,是工具连接现实系统最常见的执行方式。
- 函数调用深入Agent 与自动化
模型按约定结构选择函数并生成参数,由应用执行函数后把结果返回模型的调用机制。
- AI 应用深入AI 工程运维
将模型、数据、提示、工具和界面组合起来,为用户提供完整任务能力的软件应用。
- 金丝雀发布深入AI 工程运维
先向少量流量或用户发布新版本并观察指标,再决定扩大范围或回退的渐进发布策略。
- 持续交付深入AI 工程运维
让通过验证的软件变更持续保持可发布状态的工程实践,通常结合自动构建、测试和审批。
- 成本优化深入AI 工程运维
在满足质量与可靠性要求的前提下降低模型调用、计算、存储和运维成本的实践。
- 备用模型深入AI 工程运维
当主模型不可用、超时或不适合当前任务时接管请求的备用模型。
- 延迟优化深入AI 工程运维
通过模型、缓存、批处理、网络和交互策略降低端到端响应时间的工程实践。
- 模型路由深入AI 工程运维
根据任务类型、质量要求、延迟和成本把请求分配给不同模型或推理配置的机制。
- 提示词缓存深入AI 工程运维
复用模型对相同提示前缀的计算结果,以降低重复输入的延迟和推理成本。
- 限流深入AI 工程运维
限制用户或服务在一定时间内请求数量的机制,用于保护容量、成本和公平使用。
- 回滚深入AI 工程运维
在新版本出现故障或指标恶化时恢复到先前稳定版本的操作,需要数据与配置兼容支持。
- 语义缓存深入AI 工程运维
根据查询语义相似度复用已有结果的缓存方式,需要控制错误命中和内容过期风险。
- 服务等级目标深入AI 工程运维
围绕可用性、延迟或正确率设定的服务目标,用于平衡可靠性投入、风险和迭代速度。
- 流式响应深入AI 工程运维
在完整结果生成前持续向用户发送部分输出,以降低等待感并支持提前阅读。
给流程 · 怎么把做法沉淀下来
怎么不每次都从头教一遍?
理解 Skill / SOP 这层抽象——把「这件事该怎么做」写成可复用的模块,而不是每次重述一遍提示词。
本站概念
19 个概念- 提示词版本管理先读这个提示与上下文
对提示词内容、变量、模型配置和评测结果进行版本记录,使变更可以追踪和回退。
- Agent 技能主干Agent 与自动化
把「这件事该怎么做」写成可复用的文件夹——元数据常驻、正文按需加载,而不是每次重述一遍。
- Agent 工作流主干Agent 与自动化
保留固定步骤骨架与检查点、只在若干判断处把控制权交给模型的工作流,用可控性换一部分适应能力。
- 工作流自动化主干Agent 与自动化
用预先写好的代码路径把模型和工具串起来执行的自动化方式,步骤可枚举、结果可检查。
- LangChain主干AI 工程运维
跑在你自己进程里的应用层代码库,把「调模型、接工具、管提示」这些重复劳动封起来。
- 提示链主干提示与上下文
把复杂任务拆成多个相互衔接的提示步骤,使中间结果可以检查、转换或交给下一步。
- 提示词模板主干提示与上下文
把固定指令结构与可替换变量组合起来的提示格式,便于复用、版本管理和测试。
- Agent 编排深入Agent 与自动化
协调模型、工具、子任务和检查点执行顺序的系统能力,用于管理复杂 Agent 工作流。
- 多智能体系统深入Agent 与自动化
由多个具有不同角色或能力的 Agent 协作完成任务的系统,需要处理通信、冲突和总体控制。
- 状态管理深入Agent 与自动化
记录并更新任务进度、工具结果和控制变量,使多步骤流程能够恢复和继续的机制。
- 验收标准深入AI 产品经理
用可观察、可验证的条件描述功能完成标准,用于对齐开发、测试与业务对「完成」的定义。
- 最小可行产品深入AI 产品经理
用最小成本验证核心假设的最小可用产品版本,目标是学习而非一次做完所有功能。
- 产品需求文档深入AI 产品经理
记录产品目标、用户、功能、验收标准与范围的文档,是需求从想法进入设计与开发协作的契约。
- 项目管理深入AI 产品经理
对范围、进度、资源和风险进行计划与跟踪,保证交付可预测且问题及时暴露。
- 需求分析深入AI 产品经理
把模糊想法拆解为可验证的问题、目标、约束与验收条件,形成可执行需求的过程。
- 产品路线图深入AI 产品经理
按时间与目标组织产品迭代方向的计划,用于对齐干系人预期并说明先做什么、为什么。
- 干系人管理深入AI 产品经理
识别并协调对产品有影响或受产品影响的人,管理预期、冲突与决策节奏。
- 与工程师协作深入AI 产品经理
产品经理与工程师在方案、排期、权衡与风险上的协作方式,关键是清晰目标与可验证验收。
- 用户故事深入AI 产品经理
用「作为…我希望…以便…」句式表达用户价值的最小需求单元,强调角色、意图与价值。
给判断 · 怎么知道它行不行
上线之后,你凭什么说它变好了?
掌握评估与观测的基本动作——先有评测集,再谈好坏;先能观测,再谈优化。
本站概念
30 个概念- 基准测试先读这个评估与质量
使用公开或内部统一任务和指标比较模型、方法或系统表现的基准测试。
- 评测集先读这个评估与质量
按自己的场景组织的输入、期望结果与必要标签的集合,用来把「这次改动有没有变好」变成可重复回答的问题。
- AI 评估主干评估与质量
用样本、标准和可复现的流程回答「到底变好了没有」——没有它,每一次改动都只是感觉。
- 依据一致性主干评估与质量
输出中的主张能否被给定上下文或证据支持的质量维度,用于判断回答是「基于资料」还是「基于想象」。
- 可观测性主干评估与质量
通过指标、日志和追踪理解系统内部状态及问题原因的能力,是定位 AI 应用质量与运行故障的基础。
- A/B 测试深入AI 产品经理
把用户随机分组比较不同方案效果,用于在真实行为上判断改动是否带来因果改善。
- AI 产品经理转岗路径深入AI 产品经理
从产品经理或其他岗位转岗 AI 产品经理的路径、所需能力与常见准备方式。
- AI 产品经理能力地图深入AI 产品经理
AI 产品经理所需的能力集合,涵盖 AI 判断、产品基本功与跨角色协作,用于自我评估与成长。
- AI 产品经理深入AI 产品经理
负责发现 AI 产品机会、定义需求、协调方案并推动上线与持续迭代的产品角色,需要兼顾判断力与产品基本功。
- 商业模式深入AI 产品经理
描述产品如何为目标用户创造价值并获取收入的结构,是产品可持续性的基础。
- 竞品分析深入AI 产品经理
系统比较竞品的目标、能力、定位与反馈,用于发现差异化机会与替代威胁。
- 上线与增长深入AI 产品经理
把产品送达目标用户并推动采用与增长的策略,涵盖定位、渠道、定价与启动节奏。
- 北极星指标深入AI 产品经理
反映用户获得核心价值的单一关键指标,用于对齐团队并判断增长是否健康。
- 需求优先级深入AI 产品经理
依据价值、成本、风险与依赖对需求排序,让有限资源优先解决最重要问题的方法。
- 产品数据分析深入AI 产品经理
通过埋点、漏斗、留存等数据理解用户行为与产品健康度,支撑发现与验证。
- 产品生命周期深入AI 产品经理
产品从概念、增长、成熟到衰退的阶段模型,用于匹配不同阶段的策略与资源。
- 用户访谈深入AI 产品经理
通过一对一提问与追问获取用户真实目标、行为与障碍的定性研究方法,强调开放问题与去引导。
- 用户研究深入AI 产品经理
通过访谈、问卷、观察等方法理解用户目标、情境与痛点,为需求判断提供可复核证据的研究过程。
- 评估量规深入评估与质量
把质量目标拆成具体维度、等级和判断标准的评估说明,用于提高人工或模型评审一致性。
- 忠实度深入评估与质量
生成回答是否忠实使用给定资料且没有添加资料无法支持主张的质量维度。
- 黄金数据集深入评估与质量
经过人工审查、可作为高可信参照的评估数据集,用于判断输出是否满足预期。
- 人工评估深入评估与质量
由人类依据量规判断输出质量、偏好或风险的评估方式,适合机器指标难以覆盖的维度。
- 延迟深入评估与质量
从请求发出到系统返回首个或完整结果所经历的时间,是影响 AI 产品体验和容量设计的重要指标。
- 大模型裁判深入评估与质量
用另一个大语言模型按量规给输出打分的方法,把评估成本压到可日常运行,但必须校准位置偏差与自我偏好。
- 离线评估深入评估与质量
在上线前或离线数据上运行的可重复评估,适合快速比较版本但不能完全替代真实使用观察。
- 在线评估深入评估与质量
在真实或受控线上流量中观察系统效果的评估,需要同时控制实验风险和用户影响。
- 检索精确率深入评估与质量
检索结果中有多少确实与查询相关的指标,用于观察无关候选和上下文噪声。
- 检索召回率深入评估与质量
相关资料中有多少被检索系统成功召回的指标,用于观察是否漏掉必要证据。
- 调用追踪深入评估与质量
记录一次请求跨模型、检索、工具和服务的完整调用链及时间信息,便于调试和审计。
- 提示词评测深入提示与上下文
使用固定任务、样本和标准比较提示词版本效果的过程,避免只凭少量主观示例判断。
上手动作
为你的场景写 10 条有标准答案的测试题,跑一遍并记录通过率,作为后续任何改动的对照基线。
对应判断题
34 题展开阅读清单
1 条给安全 · 什么时候必须有人管
哪些动作永远不能让模型自己决定?
划出必须保留人工与权限边界的那条线——护栏、最小授权、人在回路。
本站概念
20 个概念- AI 安全先读这个安全与治理
识别并降低 AI 系统可能造成伤害、失控或滥用风险的研究与工程实践。
- 提示词注入先读这个安全与治理
不可信内容伪装成指令混进模型输入,试图覆盖原有规则、诱导信息泄露或触发越权动作的一类攻击。
- AI 护栏主干安全与治理
在请求进入模型、工具执行与结果返回这几个时点上施加的运行时约束与检查,覆盖你能预设的那部分风险。
- AI 风险管理主干安全与治理
持续识别、评估、处置和监控 AI 风险,使控制措施与具体场景和影响相匹配。
- 人工监督主干安全与治理
由具备权限和信息的人监督、干预或停止 AI 系统运行的控制安排。
- 问责深入安全与治理
明确谁对 AI 系统的设计、部署、使用和影响承担责任并接受追责的治理要求。
- AI 治理深入安全与治理
组织用于决定 AI 权限、责任、审查、监控和问责方式的制度与管理体系。
- 可审计性深入安全与治理
通过记录数据、版本、决策和操作证据,使 AI 系统能够被独立检查与复盘的能力。
- 内容审核深入安全与治理
根据法律、平台规则和场景标准识别、限制或处理不适当内容的流程,可结合模型与人工审核。
- 著作权深入安全与治理
保护原创表达及相关权利的法律制度,AI 数据使用、生成内容和产品发布都需要评估其适用范围。
- 数据治理深入安全与治理
围绕数据质量、权限、生命周期、责任和使用规则建立的组织管理体系。
- 数据保护深入安全与治理
通过法律、流程和技术措施防止数据被未授权访问、滥用、泄露或丢失。
- 可解释人工智能深入安全与治理
研究和提供模型预测依据、影响因素或可理解近似解释的方法与系统能力。
- 知情同意深入安全与治理
在充分理解用途、风险和选择权的前提下,自愿同意个人数据或 AI 功能的使用。
- 越狱提示深入安全与治理
通过特殊提示绕过模型安全限制并诱导其产生受限内容或行为的攻击方式。
- 隐私深入安全与治理
个人或组织控制其信息如何被收集、使用、共享和保留的权利与实践。
- 红队测试深入安全与治理
以对抗视角主动寻找 AI 系统滥用路径、脆弱性和危险输出的测试实践。
- 负责任人工智能深入安全与治理
在设计、开发和使用 AI 时落实公平、透明、安全、隐私和责任要求的原则与实践。
- 安全过滤器深入安全与治理
在输入或输出环节检测并阻止高风险内容的控制组件,需要评估漏判、误判和绕过风险。
- 透明度深入安全与治理
向相关人员说明 AI 系统用途、能力、限制和重要决策方式的治理原则。
概念认全了,接下来练的是判断
8 站补齐了系统认知:知道语言模型每一层在补什么。但在工程与业务中,真正的难点在于「取舍与决策」。带着这177 个概念,前往判断题库和案例库进行实战演练,链路才算真正闭环。