能执行一次工具调用,与能持续完成一项工作,是两种不同的系统能力。
这里从运行时可靠性出发,整理语义进展、状态保存和恢复决策之间的关系。当前内容是概念梳理与待验证问题,尚不代表经过实验确认的系统结论。
Research notebook
关注长时间运行的智能体:如何知道它仍在推进任务,又如何让中断与恢复变得可靠。
能执行一次工具调用,与能持续完成一项工作,是两种不同的系统能力。
这里从运行时可靠性出发,整理语义进展、状态保存和恢复决策之间的关系。当前内容是概念梳理与待验证问题,尚不代表经过实验确认的系统结论。
Abstract · 中文整理
ReAct 让语言模型交替生成推理过程和任务行动:推理用于跟踪、更新计划及处理异常,行动则从外部知识或环境中获得新信息。作者在问答、事实核查和交互式决策任务中评估这一方式,讨论它对幻觉、错误传播和任务轨迹可解释性的改善。
Abstract · 中文整理
Reflexion 探索如何让语言智能体从试错中学习,而无需更新模型权重。它把任务反馈转成文字反思,存入情景记忆,以影响下一次尝试的决策。论文在序列决策、编程与语言推理任务中进行评估,并分析不同反馈来源、反馈使用方式和智能体配置的作用。