讯飞星火X2与Claude Opus高考评测并列第一
讯飞星火X2在高考评测中多项第一,揭示大模型均衡能力与过程规范性的关键作用。
近期媒体对主流大模型进行高考全科与单科评测。讯飞星火X2在物理类总分与Claude Opus并列708分,历史类唯一超700分;数学148分、作文65.5分均居首。其优势源自各科目均衡且步骤规范,适应高考评分标准。
正文摘录
.jpg) 编辑|杨文 这两天,各地高考陆续放榜,大模型「陪考」成绩单也新鲜出炉。 高考结束后,多家媒体对国内外主流大模型进行横向测试,有全科综合,有单科专项,多维度交叉比拼。 先看综合成绩。羊城晚报教育发展研究院拉来 8 位 AI 考生全科作答,由 2 名资深教师独立盲评,总分按历史类和物理类分科方式统计。 结果显示,物理类总分上,Claude Opus 4.8 与讯飞星火X2 以 708 分并列第一;历史类总分突破 700 分的,则只有讯飞星火X2,两类均达到广东屏蔽生水平。  从总分维度看,头部模型之间的得分差距并不悬殊,最终排名更多取决于全科表现的稳定性。 ChatGPT 5.5 Pro 和 Claude Opus 4.8 在长文本输出和议论文论述上均无明显短板,但在历史类总分上未能跻身前两位,说明均衡表现本身也有层级差异。 讯飞星火X2 在两类总分中均取得领先,评测报告给出的解释是,其优势来自语言理解、数理推理和综合分析等不同任务之间的相对均衡,没有单一科目形成明显拉动。 再看单科专项。