AI Feeds
动态
Pref-GRPO:成对偏好奖励GRPO用于文本到图像强化学习
AK
Pref-GRPO
基于成对偏好奖励的GRPO用于稳定的文本到图像强化学习
动态
AK
2025-08-29
原文
打开互动版
相关内容
提醒ChatGPT重置券今晚到期
OpenAI卖篮球引发内部调侃
Andrew Ng发布基于Cerebras晶圆级引擎的快速推理LLM应用课程
比较DeepSeek与K3成本,48倍差距,按任务分配模型
Codex自动化归档查询与组织项目