上下文窗口 Context Window
用户继续修改一个页面时,把系统规则、当前问题、代码文件和旧聊天一起发给 AI;应用需要展示这一轮还剩多少容量,接近上限时先压缩旧内容或拆成多轮。
AI 与智能体约 10 分钟 · 从真实需求理解
1上下文窗口为什么会装不下?
CONTEXT WINDOW · CAPACITY + BUDGET一次回答能参考的内容,受容量上限限制
CAPACITY → USED → STRATEGY先给输入和输出留出空间,接近上限时要裁剪、摘要或分段。
REQUEST CAPACITY1000 TOKENS
输入材料与回答预留共用这一轮总预算0500 / 1000 tokens1000 TOKENS
- SYSTEM RULES保留登录页的安全规则180 t
- CURRENT QUESTION把登录按钮改成手机友好120 t
- login.js当前表单和校验逻辑260 t
- OLD CHAT早先被否定的配色讨论260 t
- SUMMARY保留结论:按钮要大,配色不改80 t
OUTPUT RESERVE
200 TOKENS留给模型组织并生成回答
WINDOW CHECK先放规则和当前问题
KEEP ADDING ONLY WHAT MATTERS上下文窗口是模型一次回答时能够同时参考的资料和回答内容的总量上限。它不是无限记忆:系统规则、当前问题、文件、聊天历史和准备生成的回答,都要共用这一轮空间。
- 内容越长,越接近窗口上限;最早的要求可能被裁掉,回答也可能在结尾被截断。
- 要给回答预留空间,不能把容量全部塞给输入材料。
- 接近上限时,可以摘要旧内容、裁剪无关材料,或把任务拆成多轮。
2窗口更大,也不代表应该把所有资料都塞进去
上下文窗口说的是这一轮能放下多少内容,不是 AI 拥有多少永久记忆。即使窗口很大,无关的旧讨论也会占空间、分散重点,还可能挤掉回答所需的预算。
- 窗口容量和 Token 计数有关,但窗口描述的是总预算,Token 是被计量的片段单位。
- 聊天记录仍然可见,不代表每条内容都被带进了当前请求。
真正重要的是保留当前规则、问题、关键证据和近期决定;过长时先摘要或拆分,不要只把更多历史继续贴上去。
3一次请求的上下文由哪些部分组成?
SYSTEM 180QUESTION 120login.js 260
规则、问题和文件正在占用空间拆开一次请求,可以看到总容量、已经放入的材料、给回答预留的空间,以及接近上限后采取的整理策略。它们共同决定模型这一轮能参考什么、还能输出多少。
- REQUEST CAPACITY 是这一轮可用的总预算。
- INPUT MATERIALS 是系统规则、问题、文件和历史等实际占用空间的内容。
- OUTPUT RESERVE 是留给模型生成回答的空间,不能被输入完全吃掉。
- TRIM + SPLIT 是接近上限后的处理方式:保留重点、压缩旧内容,或把剩余任务分到下一轮。
4怎样把上下文窗口需求交给 Agent?
继续登录页修改前,请先按一次请求的上下文预算整理材料:保留系统规则、当前问题和 login.js,给回答预留 200 个示意 token;把早先被否定的配色讨论压成“按钮要大、配色不改”的摘要,剩余改动拆到下一轮。不要假设窗口可以无限接收,也不要把可见的全部聊天都原样带入。请支持键盘操作、暗色主题和 390px、320px 下不横向滚动。
5不用背,看看你能不能判断
1 / 3
上下文窗口说的是什么?
请选择一个最符合题意的答案
社区延伸
看别人真实遇到过什么
社区帖子还没有关联到这个词条。