行业新闻

NeurIPS 2025 论文 ConfTuner:用 Tokenized Brier Score 校准模型置信度

NUS 团队提出 ConfTuner,只用答案对错标签就能训练模型输出校准过的置信度,平均 ECE 大幅下降。Jev 的走红说明这类「概率即输出」的思路正被重新重视。

TypeSafe AI 的 Jev 模型因「输入状态→输出决策+概率」的形态受到关注,而 NeurIPS 2025 入选论文 ConfTuner 早已探索相似思路。它不只关心模型给出什么答案,而是同时训练 0% 到 100% 各个候选置信度 token 的完整概率分布,让模型说的「我有 80% 把握」更接近真实正确率。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/1331b6e1-9d17-41f4-a06f-d8da9451845a/0(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 最近,TypeSafe AI 推出的 Jev 模型火爆出圈,把「输入状态 → 输出决策 + 概率」这种模型形态重新带回了大众视野。开发者只需提供状态和问题,Jev 就能直接返回预先定义的选项、分数或事件概率,而且结果可以直接被代码调用。 虽然 Jev 目前没有开源,架构和训练细节也未公开,但从它公开的 API 和特性来看,有四个核心亮点: - ✨ 直接输出决策 + 概率 - ⚡️ 支持并行概率预测 - 🎯 概率本身就是预测的核心,而不只是附属品 - ⚖️ 追求概率校准:不只要选对,还要让给出的概率反映真实正确率 这些核心亮点,与 NeurIPS 2025 的入选论文 ConfTuner 不谋而合。两者在概率建模和校准上的技术直觉高度一致: 不仅关注模型最终输出了什么结果,更关注各个候选结果背后完整的概率分布。 新加坡国立大学团队在 ConfTuner 中提出的 Tokenized Brier Score 方法,正是通过直接训练候选置信度的概率分布,让模型表达的「把握」更接近它实际的正确率。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-10-04原文

相关内容