B站上线 AI 无限竞技场:百款模型同场测评,GPT-6 Astra 居首
B站把分散的UP主大模型实测汇成一个公开榜单,用真实工作流替代标准跑分,可以看作国产与海外模型能力对比的社区样本库。
9月16日,B站上线「AI无限竞技场」,一个汇集UP主大模型实测的测评广场。与固定跑分不同,各分区UP主按自己的真实工作流、专业场景或脑洞自主命题,同题比拼上百个模型。首期榜单覆盖 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问等,GPT-6 Astra 登顶,前五名中国产模型占三席。
正文摘录
9 月 16 日,B 站「AI 无限竞技场」正式上线,首期大模型测评榜单同步公布。GPT-6 Astra 在 10 个 UP 主测评中拿下榜首,打败 GLM-5.3 获得榜首次数冠军;前五名中,国产大模型占据三席。 「AI 无限竞技场」是一个汇集了 B 站 UP 主 AI 大模型测评的竞技广场,由各领域 UP 主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种测评主题。 不同于传统跑分评测(即用固定题库打分排名),B 站 AI 无限竞技场不设主题或测评维度限制,来自各个分区的 UP 主们以真实工作流、专业应用、趣味脑洞等自主命题,在同题 PK 中直观呈现各模型的实际表现差异。首期榜单现已涵盖 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax…等主流模型对比测评。 过去一年,B 站 AI 生态迎来爆发式增长。AI 知识内容消费时长同比增长 72%,月均观看 AI 内容的用户超过 1.9 亿。AI 大模型或产品应用,从发布到用户讨论、测评、使用、求助、共建,B 站的直播、视频、弹幕天然适配 AI 科技爱好者们的信息获取和交流需求,活跃生态下,大模型测评也在 B 站社区沉淀,涌现出大量各个领域、维度、主题的测评内容。「AI 无限竞技场」这一测评集合广场顺势而生。 随着更多测评案例加入,这些来自真实场景的样本测试,将让模型能力得到更充分检验,也为用户了解 AI 能力边界提供更全面的内容视角。