群发资讯网

Mercor 公开 397B 专家数据做「办公Agent」

Mercor Research 联合伯克利 SkyRL 团队发的博客技术贴,属于"用专家数据后训练开源模型"系列的第三篇。一句话总结:他们把之前用私有 RL 栈做智能体后训练的配方,改用公开框架 SkyRL 完整复现,并把规模干到了 397B 参数,训练脚本、权重、评估轨迹全开源了

干出了什么结果👇
- 基座 Qwen3.5-397B-A17B(MoE,17B 激活)纯 RL 后训练后,Pass@1 从 16.11% → 27.29%,相对提升 70%
- 训练数据只有 1,928 条专家人工创建的知识工作任务(管理咨询、投行、公司法三大类),纯 RL、没有 SFT 预热
- 在 APEX-Agents 基准上评估:480 个真实感专业服务任务,每个任务在一个"模拟公司世界"里(几十个 PDF/表格/PPT + 聊天邮件服务器),智能体靠 MCP 工具或代码执行干活
- 配套开源了小模型 Qwen3.6-35B-A3B 的版本,也都放出在 GitHub / HuggingFace

#Mercor #大模型后训练 #专家数据