RubricHub 数据集使 Qwen3-14B 超越 GPT-5 DailyPapersRubricHub一个大规模 rubric 数据集,包含约 11 万实例,用于训练开放生成模型。采用自动化粗细粒度框架创建高判别力的评估标准,使 Qwen3-14B 在 HealthBench 上超越 GPT-5。 动态DailyPapers2026-01-19原文 打开互动版