它是什么
长上下文是模型在一次推理中接收和处理较长输入的能力,可容纳更多消息历史、文档、代码、工具结果及输出预算。容量通常按 Token 描述,并受具体模型与服务限制。[S1] “能够放入窗口”只说明输入被接受,不等于模型能同等可靠地利用每个位置的信息。
为什么需要它
合同审查、代码库分析、长对话和多文档问答常需要跨越远距离信息建立联系。较长窗口可以减少机械切分,并让更多原始证据同时可见。但如果任务只需要少量材料,盲目扩长会增加传输、推理成本与检索难度,甚至稀释真正相关的证据。
它如何工作
输入被转换为一个有顺序的 Token 序列,与本轮输出共同占用窗口。模型通过注意力等机制组合序列信息,但实际召回会受长度、位置、训练分布、干扰内容和任务形式影响。[S1][S2] “Lost in the Middle”实验通过改变相关文档的位置,观察到部分模型在输入开头或结尾表现较好、在中部明显下降。[S2]
必须澄清的误会
长上下文 ≠ 上下文窗口。 上下文窗口是容量的技术定义(多少 token),长上下文是「这个容量足够装下你的一整份材料」的能力描述,说的是同一个参数的不同侧面。
长上下文 ≠ 上下文压缩。 压缩是容量不够时的补救,长上下文是容量本身的扩大;两者常一起用,但不互相替代。
真实例子
法务团队把二十份合同附件交给模型查找续约条件。所有文件都能放入窗口,并不表示埋在第十份附件中的例外条款一定会被发现。团队应先建立文件目录和条款检索,再让模型引用原文位置;同时用把关键条款放在开头、中间和结尾的测试验证召回稳定性。
什么时候适合与不适合
长上下文适合材料之间存在真实跨段依赖、且保留原文比摘要更重要的任务。不适合把整个知识库当作单次输入,或用标称窗口数字代替质量评测。更多内容会占用成本和输出空间,相关信息也可能被干扰项淹没;容量、召回、推理正确率和时延应分别测量。[S1][S2]
亲自试一下
准备一段关键事实和十九段无关材料,分别把事实放在输入开头、中间和结尾,提出同一个问题并要求引用证据。再把材料数量从五段增加到二十段。保持模型配置不变,记录正确率、引用位置、Token 和时延;只有各位置表现稳定,才能声称任务有效利用了该长度。
接下来学什么
先学习上下文窗口理解容量计算,再用上下文检索减少无关材料;当历史持续增长时,比较上下文压缩与保留原文的取舍。
来源与修订
窗口组成、输入输出共同计数及“更多上下文不自动更好”的说明参考 Anthropic 文档 [S1];位置敏感召回与长输入评测方法参考 Lost in the Middle [S2]。本文不写死任何模型的当前 Token 上限,容量数字需按版本复核。
Learning questions
这个概念出现在哪些题里
下面的题目直接引用了本词条,适合先做判断,再回到正文核对边界。
Case practice
这个概念出现在哪些案例里
案例中的这些关卡会把概念放进业务约束、证据与取舍里练一遍。
Learning navigation
学习导航
沿认知链路:你现在在第 1 站,下一站是「沟通 · 怎么把需求说清楚」:先沿主路径补上这一层。
Relation topology
拓扑图谱网络 · 一度关联场
可拖拽节点、滚轮缩放、点击节点探索长上下文的一层关系
4 个节点 · 5 条直接关系
交互图谱之外,本页下方保留完整文字关系与词条链接。
Source register
核验来源
- Context windowsAnthropic · 访问于 2026-07-30
- Lost in the Middle: How Language Models Use Long ContextsarXiv · 访问于 2026-07-30
发布 2026-07-30 · 更新 2026-07-30 · 核验 2026-07-30