CAFE:搜索智能体反馈协同进化
长程搜索智能体只看最终奖励,会遇到一个根本问题:中间步骤出错时,系统既无法及时定位,也无法在错误继续累积前修正轨迹。现有细粒度信号大多仍是事后评估,只能回答“这一步好不好”,却不能直接告诉智能体“现在错在哪里、接下来该怎么改”。CAFE 因此把纠正性反馈变成一种可学习、可在搜索轨迹内部触发的干预。
但这又带来三个耦合难题:
1. Agent 必须学会何时请求反馈,还要区分成功来自请求前的行为,还是反馈后的恢复。
2. Critic 没有标准答案,需要从受到前后行为共同影响的结果中,反推出真正有用的纠正建议。
3. Agent 持续更新后,访问的状态和失败模式也会变化,静态 Critic 很快就会失配。
CAFE 的核心是让同一个共享参数模型交替扮演 Agent 与 Critic,并让两种能力协同演化:
• 在线 Agent 优化:通过 CFE 奖励和反馈感知优势塑造,学习何时请求反馈、如何利用反馈恢复搜索。
• 离线 Critic 优化:使用 RDPO 从最新轨迹中构造偏好对,持续更新 Critic 的纠错能力。
• 交替迭代:Agent 的新失败为 Critic 提供训练材料,Critic 的新反馈又反过来改善 Agent。
实验中,CAFE 在 7 个基准上都降低了答案级幻觉,相比仅使用终端奖励的 GRPO,幻觉率从 17.6% 降至 12.6%。这说明自我改进搜索智能体需要的不只是反馈,而是能跟随策略一起进化的反馈。
LLM


