这里的两篇札记分别讨论“如何知道任务仍在推进”和“停滞之后从哪里恢复”。它们共享同一个前提:运行时需要认识任务状态,而不仅是进程状态。
当前仍处于概念整理阶段。后续实验需要检验信号的可靠程度、误干预的代价,以及恢复是否会重复产生外部效果。
Research notebook
从任务是否向前,追问监控与恢复应该依赖什么证据。
这里的两篇札记分别讨论“如何知道任务仍在推进”和“停滞之后从哪里恢复”。它们共享同一个前提:运行时需要认识任务状态,而不仅是进程状态。
当前仍处于概念整理阶段。后续实验需要检验信号的可靠程度、误干预的代价,以及恢复是否会重复产生外部效果。
Abstract · 中文整理
ReAct 让语言模型交替生成推理过程和任务行动:推理用于跟踪、更新计划及处理异常,行动则从外部知识或环境中获得新信息。作者在问答、事实核查和交互式决策任务中评估这一方式,讨论它对幻觉、错误传播和任务轨迹可解释性的改善。
Abstract · 中文整理
Reflexion 探索如何让语言智能体从试错中学习,而无需更新模型权重。它把任务反馈转成文字反思,存入情景记忆,以影响下一次尝试的决策。论文在序列决策、编程与语言推理任务中进行评估,并分析不同反馈来源、反馈使用方式和智能体配置的作用。