本周AI论文:编程竞赛、视频基准、智能体等
本周顶级AI论文(4月6-12日)
- GrandCode:首个在所有实时竞技编程中击败人类的AI,超越Google的Gemini 3 Deep Think
- Adam's Law:新框架显示LLM偏好频繁文本数据进行提示和微调
- Video-MME-v2:下一代视频基准揭示AI与人类专家之间的巨大差距
- ClawBench:在真实世界任务(如预订航班)上测试AI智能体(Claude 4.6仅得33%)
- SkillClaw:智能体系统的集体技能进化
- HY-Embodied-0.5:腾讯的具身基础模型用于真实世界机器人智能体
- InCoder-32B-Thinking:用于芯片设计和GPU内核的工业代码世界模型
- OpenWorldLib:高级世界模型的统一代码库和定义
- 附加:自蒸馏RLVR和推理SFT中的泛化重新思考
- GrandCode:首个在所有实时竞技编程中击败人类的AI,超越Google的Gemini 3 Deep Think
- Adam's Law:新框架显示LLM偏好频繁文本数据进行提示和微调
- Video-MME-v2:下一代视频基准揭示AI与人类专家之间的巨大差距
- ClawBench:在真实世界任务(如预订航班)上测试AI智能体(Claude 4.6仅得33%)
- SkillClaw:智能体系统的集体技能进化
- HY-Embodied-0.5:腾讯的具身基础模型用于真实世界机器人智能体
- InCoder-32B-Thinking:用于芯片设计和GPU内核的工业代码世界模型
- OpenWorldLib:高级世界模型的统一代码库和定义
- 附加:自蒸馏RLVR和推理SFT中的泛化重新思考