AI Feeds
动态
从强化学习视角探讨SFT泛化与奖励矫正
AK
关于SFT的泛化:带奖励矫正的强化学习视角
动态
AK
2025-08-08
原文
打开互动版
相关内容
提醒ChatGPT重置券今晚到期
OpenAI卖篮球引发内部调侃
Andrew Ng发布基于Cerebras晶圆级引擎的快速推理LLM应用课程
比较DeepSeek与K3成本,48倍差距,按任务分配模型
Codex自动化归档查询与组织项目