动态

Contextual AI用Tinker后训练搜索智能体规划行为

Contextual AI用Tinker后训练搜索智能体规划行为
Tinker
Contextual AI 使用 Tinker 对搜索智能体的规划行为进行后训练。他们采用两阶段训练方案:在策略蒸馏和基于 CLP 奖励的 GRPO。了解更多
Abdallah Bashir
搜索智能体,无论是驱动深度研究还是对私有语料库进行多步问答,大部分时间和计算都花在研究循环中:查询、搜索、推理、重复。我们希望让这个循环更快、更准确。因此,我们联合优化了两件事:https://t.co/1apBIH0NZZ
动态Tinker2026-03-06原文

相关内容