|
为了让 AI 更好地理解我,我不得不把自己的想法写清楚。 以前脑子里一团浆糊的需求,为了喂给 AI,必须结构化地表达。这个过程本身就让我想得更清楚了。 AI 的记忆问题,意外地成了一种思维训练。 也许这才是 AI 最大的价值——不是它帮你记住什么,而是它逼你想清楚什么。
QwenChat 的记忆功能深度解析
QwenChat凭借其独特的记忆机制,在众多 AI聊天机器人中脱颖而出。 它的记忆功能主要体现在两个方面: 显式记忆 (SavedMemories)和 隐式记忆 (ChatHistory)。 显式记忆允许用户通过简单的指令,例如“记住 XX”,来主动告知 QwenChat需要记住的信息,例如个人偏好或特定需求。 这些信息会被写入“用户记忆表”,并在后续对话中被 QwenChat优先调用,作为上下文参考。 隐式记忆则基于用户授权, QwenChat可以访问用户的历史会话记录,通过数据聚类和摘要技术,自动学习用户的风格、兴趣和需求。 这些“洞察”会以较低优先级被写入 System-Prompt,从而在更广泛的范围内优化回答。 从实际体验来看, QwenChat兼具这两种记忆模式的优势。 此外, QwenChat还提供了诸如“定制 Qwen”和“会话归档”等有趣的功能,进一步增强了用户体验。
根据我们的统计,目前提供记忆功能的 AI聊天机器人还包括 ChatGPT、Claude、智谱清言和 文小言。 ChatGPT在记忆效果方面表现出色, Kimi结合其强大的搜索能力,也受到用户青睐。 值得注意的是,不同 AI聊天机器人的记忆实现方式有所不同。 ChatGPT和 QwenChat同时具备显式记忆和隐式记忆, Kimi主要依赖被动记忆(系统自动学习),而 Claude、智谱清言和 文小言则主要依赖主动记忆(用户主动触发)。
记忆压缩不是“把聊天记录删掉”,而是把低密度历史变成高信号上下文,让 Agent 在有限窗口里继续保持目标、决策和约束的一致性。 做 Agent 的时候,最容易踩的坑不是模型不会回答,而是它聊着聊着开始“忘事”。前面明明确认过方案 B,后面又重新推荐方案 A;用户已经说预算只有 5 万,下一轮又给出 20 万方案。表面看是模型不稳定,本质上往往是上下文管理失控。 LLM 每次生成回答时,依赖的是本次请求传入的上下文。对话历史、工具返回、检索材料、系统提示词、业务规则,都会挤在同一个 context window 里。窗口有限,成本也有限,噪声更是会干扰推理。 记忆压缩要解决三件事: 第一,别让历史撑爆上下文; 第二,别让无关内容拖慢推理; 第三,别把关键决策、约束和状态压没了。 1. 记忆压缩到底在压什么?
很多人把记忆压缩理解成“只保留最近几轮”。这只是最粗糙的一种做法。真正的工程视角,是把记忆分成三层: 原始日志:每条用户消息、助手回复、 工具调用 、工具结果都完整保留,用于审计和回放。 工作上下文:每次调用模型时真正塞进 prompt 的内容,必须短、准、干净。 长期记忆:用户偏好、关键决策、项目状态、实体关系等高价值信息,不能只靠原始对话保存。 压缩的目标不是删除历史,而是减少“当前这一步要读的 token”。原始日志可以保留在数据库里,模型当前只需要看到与任务相关、信息密度高、互相不冲突的那部分。 这一点和上下文工程的思路一致:Agent 需要把正确的信息放进上下文,而不是把所有信息都放进去。长上下文不是免费的,过多上下文会带来成本、延迟、注意力分散和错误传播。
方法二:摘要压缩,丢之前先提炼
摘要压缩是对滑动窗口的改进。旧历史即将被移出 prompt 时,不直接丢,而是先压成一段摘要。后续 prompt 中保留这段摘要,再加上最近几轮原文。 这个方案最适合长对话。近期消息保留细节,远期历史保留脉络。它的关键不在“总结”,而在“结构化总结”。如果只是让模型随便写一段摘要,很容易把以后需要的细节漏掉。 摘要压缩用摘要替代旧历史,同时保留近期原文 建议用固定模板约束摘要内容:
SUMMARY_SCHEMA = """
请把即将移出窗口的历史压缩为以下字段:
1. 用户目标:当前到底要完成什么;
2. 已确认决策:已经拍板的方案、结论、选择;
3. 关键约束:预算、技术栈、时间、合规、安全边界;
4. 待办事项:下一步需要继续完成的任务;
5. 禁止重复:已经否决的方案、不要再问的问题;
6. 证据来源:这些结论来自哪些轮次或工具结果。
只保留事实,不要发挥。
"""
AI写代码

更稳的做法是层级式摘要。最近 10 轮保持原文,10 到 50 轮压成中期摘要,50 轮之前进一步压成长期摘要。这样既能保留近处细节,也能保留远期决策。
方法三:重要性过滤,按价值筛,不按时间筛
时间不等于重要性。重要性过滤的思路是给每条记忆打分,只有高价值内容才进入 prompt。低价值内容不一定删除,可以保留在原始日志里,只是在当前这一步不展示给模型。 常见评分因素包括:是否包含用户明确决策,是否包含约束条件,是否被后续引用,是否和当前任务阶段相关,是否来自可信工具,是否已经被新的信息覆盖。 方法四:结构化抽取,换一种载体存信息
前三种方法默认历史仍然是“文本”。结构化抽取则进一步追问:我们真的需要把原始对话塞回 prompt 吗?很多业务里,真正有价值的是对话里产生的事实和状态。 比如用户偏好 Python 、预算上限 5 万、方案 B 已确认、方案 A 已否决、必须兼容移动端。这些内容写成结构化字段,比一大段对话更稳定、更短、更容易更新。
结构化抽取的优势是信息密度高、可审计、可更新。缺点是业务设计成本高。你必须先知道哪些字段值得存,字段冲突怎么处理,用户撤回记忆怎么删除,旧记忆什么时候过期。
6月5日消息,OpenAI 正式推出 ChatGPT 记忆系统的第三代架构「Dreaming V3」。该系统将记忆从「用户手动喂信息」的笔记模式,升级为「后台自动合成、持续更新」的动态理解机制。Plus 和 Pro 用户记忆容量翻倍,服务计算效率提升约5倍,免费用户也将在未来数周内获得 Dreaming 功能。
026年6月4日推出的 Dreaming V3 是一次架构级重构。它不再以 Saved Memories 为核心,而是将后台合成机制作为主系统。ChatGPT 能够跨对话提取、合成、更新用户偏好和上下文,并随时间自动修正过时信息。
Dreaming V3 解决了哪些痛点
记忆不再「僵化」。 旧系统的典型问题是:你7月告诉 ChatGPT「我下周要去新加坡」,三个月后它还以为你在新加坡。Dreaming V3 会自动将「用户计划7月去新加坡」更新为「用户7月去过新加坡」,回到日常对话时推荐的餐厅、时区信息都会回归你的常驻地。
偏好自动识别,无需反复交代。 过去你需要手动告诉 ChatGPT 记住你的饮食偏好、工作背景、设备型号。现在 Dreaming V3 会从多次对话中自动合成这些信息。OpenAI 官方博客展示了一个典型案例:一位水下摄影用户询问「我的水下摄影套件需要买什么 TTL 配件」,开启记忆后 ChatGPT 直接给出了针对其 Sony A1 II + Nauticam 壳体 + Backscatter Mini Flash 3 的精确兼容配件推荐,而不是一份泛泛的通用购物清单。
记忆可查看、可编辑、可控制。 新增的「记忆摘要页面」(Memory Summary)让用户可以一目了然地看到 ChatGPT 记住了什么,支持编辑、删除特定条目,也可以指定「在什么场景下提起什么话题」。不想用?随时切换回手动模式。
技术细节:5倍效率提升与容量翻倍
Dreaming V3 的推出伴随着两项关键技术改进:
服务计算成本降低至原来的约五分之一——这是免费用户能够获得 Dreaming 功能的直接原因。OpenAI 此前一直未向免费用户开放 Dreaming,正是因为为数亿用户在后台持续运行记忆合成的计算开销过高。
Plus 和 Pro 用户的记忆容量翻倍。OpenAI 未披露具体数字,但对于长期重度使用 ChatGPT 的用户来说,容量上限一直是实际瓶颈。
竞品对比:Claude、Gemini 的记忆方案差异
ChatGPT 并非唯一提供记忆功能的 AI 助手。Anthropic 的 Claude 同样具备跨对话记忆能力,其在2026年5月的 Code with Claude 大会上也展示了名为「Dreams」的 Agent 记忆整理机制——但该功能面向的是 Managed Agents 开发者 API,而非消费端用户。Google Gemini 则通过与 Google 账户生态的深度绑定(日历、邮件、搜索历史)来实现上下文理解,路径与 ChatGPT 的对话合成模式有本质区别。
核心差异在于:ChatGPT Dreaming V3 是目前消费端最成熟的「对话历史自动合成」记忆方案,覆盖面从付费用户延伸至免费用户;Claude 的记忆方案侧重开发者和 Agent 场景;Gemini 依赖 Google 生态数据而非对话本身。
上线范围与时间
Dreaming V3 于6月4日起面向美国 Plus 和 Pro 用户开放,未来数周内将扩展至其他国家及 Free、Go 用户。用户可在 ChatGPT 设置中的「个性化 > 记忆」入口查看和管理记忆内容。
|