Fireworks推出强化学习精调RFT,提升代理性能
Fireworks 强化学习精调(RFT)上线!经过数月与实际用例的迭代,我们很高兴推出 Fireworks RFT 公开预览版。这是一个托管式 RL 服务,将开放前沿模型(如 DeepSeek V3、Kimi K2)转化为针对工具、代码和推理的自定义代理。我们的设计原则是将 RL 直接集成到你的生产代理中,而不是让你模拟或重新设计代理来实现 RL。Fireworks RFT 训练完整的代理轨迹(多步、工具、重试),使模型学习你的生产工作流程。以下是真实结果:Genspark 深度研究代理 → 质量比 SOTA 封闭模型提升 10%,工具调用增加 33%,成本降低约 50%;Vercel V0 编码代理 → 比封闭模型提升 33%,93-94% 无错误,速度快 40 倍。Fireworks RFT 公开预览版现已开放,立即免费开始训练。https://fireworks.ai/blog/fireworks-rft