基础入门了解AI · 第 2 篇

Token、上下文与记忆

理解模型如何读取信息,以及为什么对话变长后会遗漏和变贵。

22 分钟零基础

学完能做什么

你会看懂 Token、上下文窗口和外部记忆的区别,知道对话变长后为什么会遗漏信息,并为一个长任务设计可恢复的记录方式。

Token 是什么

Token 是模型读取和生成内容时使用的小片段。它不完全等于“字”或“词”:中英文、标点、代码和数字的切分方式都不一样。

实际使用时不需要手工数每个 Token,但要记住两件事:

  • 你提供的文字、附件、工具返回、系统说明和历史对话都占用容量;
  • 输出也要占容量,不能把窗口全部用来塞输入。

上下文窗口是模型的“当前桌面”

模型只能根据当前请求里能看见的内容工作。上下文窗口可以理解为一张大小有限的桌面:你把新材料放上去,旧材料就可能被压缩、截断或移出。

text
系统规则 + 当前任务 + 历史消息 + 文件片段 + 工具结果 + 预留输出
≤ 上下文窗口

所以“我之前明明说过”不等于这次请求仍然带上了那句话。

对话会忘的四个常见原因

  1. 早期消息被截断:会话超过窗口,前面的内容不再进入请求。
  2. 历史被压缩过度:为了继续对话,系统只保留摘要,细节丢失。
  3. 关键约束淹没在噪声中:内容虽然还在,但重要信息分散、冲突或距离当前问题太远。
  4. 应用没有恢复状态:新开会话后,任务文档、用户偏好和上次进度没有重新载入。

上下文、记忆和知识库不是一回事

类型保存什么典型时效使用方式
上下文当前请求能看到的内容一次请求或会话直接交给模型
任务状态步骤、进度、待确认项、中间结果到任务结束按状态载入必要字段
用户记忆稳定偏好和已确认事实跨任务需要授权、更新和删除机制
知识库可查询的文档和业务资料持续更新按问题只召回相关片段

不要用无限对话历史代替任务状态和文档库。

长任务的五条管理原则

1. 把不变的规则写成任务卡

对象、输出、禁止项、事实来源和验收方法单独保存,每次重要阶段重新提供。

2. 每个阶段留下状态快照

text
已完成:需求列表、第一版大纲
已确认:面向零基础读者,不使用营销话术
待确认:示例是否保留代码
下一步:完成第 2、3 节并做事实检查
权威材料:已确认需求文档 v3

3. 只提供当前需要的材料

不是附件越多越好。先根据当前问题选版本、章节和时间范围,并保留原文引用位置。

4. 新信息要明确替换旧信息

写“从现在起,交付日期以 9 月 12 日为准,废止之前的 9 月 10 日”,不要只在会话末尾再说一个日期。

5. 给输出预留空间

需要长报告时,先分段生成并验收,不要用整个窗口堆原始材料后又要求一次输出完整成品。

动手练习:给一个三天任务设计记忆

假设你要用三天完成一份产品对比报告。请分别写出:

  • 每次都要带上的任务卡;
  • 每天结束时的状态快照;
  • 需要放入资料库的原文;
  • 不应该保存的临时或敏感内容;
  • 第二天新开会话时的恢复顺序。

完成标准是:不看前一天完整对话,仍能从已确认状态继续。

完成检查清单

  • 我知道 Token 是容量和计费的底层单位,但不等于字数。
  • 我能区分上下文、任务状态、用户记忆和知识库。
  • 长任务有任务卡和阶段快照。
  • 新规则会明确废止旧规则。
  • 我不依赖一条无限变长的对话保存所有事实。

下一篇

《模型、Agent、Skill、MCP、API 到底是什么》——把几个常被混用的概念放进同一个真实任务。