人工智能前沿技术解读 · 按栏目浏览全部文章

寻想集团-超级人工智能有限公司全部文章

你的技术前沿之旅,从这里开始

任务规划与记忆的三种常见做法

把状态放在外部显式存储里,通常比指望模型自己记住更可靠。

哑光黑色桌面上分叉的微光线条最终汇聚到一个暖黄色节点,抽象表现规划与记忆路径。
任务规划与记忆机制示意。

一、把推理与行动交错起来

ReAct 的做法是让模型交替产生思考与动作,用外部环境的观察纠正推理。这类交错结构比一次性长推理更容易在失败处定位问题。

二、记忆分层次

短期记忆保存当前任务的中间结果,长期记忆保存跨任务的事实与偏好。区分两者的意义在于检索策略不同:短期记忆按当前任务过滤,长期记忆需要去重与更新。

三、用外部存储替代隐式记忆

把中间状态写入可读的外部存储,既降低上下文压力,也让失败可以复现。Reflexion 的思路是让系统把反思结果写成文字,供后续轮次使用。

四、规划不等于写完整计划

预先输出完整计划在长任务上容易在第一步就走偏。更稳妥的方式是先做一步、执行、再根据真实结果调整。

五、可核对的来源

Reflexion: Language Agents with Verbal Reinforcement Learning,arXiv:2303.11366。

六、适用边界

本文讨论结构选择。记忆规模与检索效果需按业务实测,没有通用的最优配置。