Chinese-Jev:将 System One 模型引入中文任务
System One 模型(如 Jev)为需要「做决策」而非开放式生成的任务提供了高效替代方案,但现有 Jev 模型的中文决策准确率有限,限制了其在通用与专业场景中的实用性。 为此,本文提出 Chinese-Jev,通过统一的数据处理与训练流程弥补这一缺口: - 数据处理:将异构的中文标注统一转换为候选选项上的概率目标,使不同领域与题型共享同一训练形式; - 模型结构:采用轻量级 encoder-only 骨干进行文本编码,并通过面向决策的训练学习为候选答案打分; - 训练策略:先在一千万条通用语料上预训练,再分别针对医疗、法律、金融领域微调,以缓解预训练分布与下游中文场景的错配。 为评估通用与领域中文场景下的决策准确率与校准,我们提出 Chinese-Jev Bench(CJ-Bench)。实验结果表明: 1. 第一阶段预训练后,Chinese-Jev 在通用域任务上准确率超过闭源 Jev 1.24%,并实现 20.3 倍 加速; 2. 领域微调后,医学领域准确率较 Jev 提升 4.0%,在专业领域平均准确率达到 Jev 的 92%,加速 17 倍,平均延迟仅 15 ms; 3. 在移动设备上部署 INT8 量化模型,每次决策的推理延迟约为 1.0 秒。 项目地址:https://gulucaptain.github.io/Chinese-Jev/
论文精读
TL;DR Chinese-Jev 将 System One 决策模型扩展到中文任务,通过统一数据管线与编码器预训练,在通用及医疗/法律/金融领域达到接近或超过 Jev 的准确率,同时实现 17-20 倍加速和 15ms 级延迟。
问题
问题背景
近年来,System One 模型(如 Jev)作为一种决策型架构,正成为生成式 LLM 在分类、选择等任务上的高效替代,尤其适合需要明确选项而非开放生成的应用场景。
现有方法局限
- Jev 等现有模型 主要面向英文数据训练,在中文任务上的决策准确率明显不足,原因在于:预训练分布与中文下游场景严重错位;中文标注数据格式异构,难以统一为候选选项上的概率目标;缺少覆盖通用与垂直领域的中文决策基准。
- 现有公开 System One 模型多采用生成式或重型编码器,推理延迟较高,且未针对医学、法律、金融等专业领域进行适配,导致在垂直场景中置信度校准差,难以直接用于低延迟或端侧部署。
为什么难/重要
- 技术挑战:中文语言本身存在多义性、简繁差异与标注噪声,将异构标注转换为一致的决策监督需要精细的数据工程;同时模型要在精度、校准和推理速度之间取得平衡,任何一个维度的妥协都会阻碍实际落地。
- 业界关注点:低延迟、可端侧部署的决策模型能大幅降低服务成本,而生成式方案每次预测需完整解码,时延高且不可控。一个准确、快速的中文 System One 模型能填补高效推理与垂直领域知识之间的空白,对移动端或实时交互场景尤其关键。
行业类比
类似智能客服意图识别场景:用户问题通常对应有限候选答案,系统只需快速判定类别而非逐字生成,低延迟决策能力比生成能力更直接影响体验与成本。
核心洞察
- 将异构中文标注统一转化为候选选项上的概率分布,而非离散标签,让医疗、法律、金融等不同领域的问答与决策任务共享同一训练目标。这与传统判别模型每个任务独立设计输出头的做法形成对比,不仅简化了多任务训练流程,还使模型能直接输出校准的决策置信度,为后续不确定性估计和阈值调优提供了原生支持。
- 通过轻量编码器 backbone 与决策评分头,Chinese-Jev 在通用域超越 Jev 1.24% 的同时获得 20.3 倍加速,量化后单次决策延迟约 1 秒即可在移动设备运行。这验证了 System One 模型在实时交互场景下替代生成式大模型的可行性,尤其适合需要高频、低延迟判断的应用,同时保持可接受的精度水平。
方法
数据构建与训练流程
Chinese-Jev 的核心是把异构中文标注统一为候选选项上的概率目标,使不同题型和领域共享同一训练形式。
输入:题目文本 + 候选选项 + 原始标注(单选、多选、判断、领域标注等)。
关键模块:
- 数据规范化:通过来源发现与筛选、选项级概率化、决策级去重,并平衡任务类型与领域覆盖;同时构建 CJ-Bench 用于评估。
- 模型架构:采用轻量encoder-only 骨干编码题目与选项,再通过决策读取头为每个选项输出分数;训练时用决策监督目标(例如 soft target 的交叉熵)拟合概率分布,而非生成式逐字解码。
- 训练策略:先在大规模通用语料(1000 万例)上做第一阶段预训练,再分别对医疗、法律、金融领域微调,缓解预训练分布与中文任务场景的偏差。
输出:每个候选选项的决策概率或分数,可直接用于选择答案;部署侧支持 INT8 量化,移动端单次决策约 1.0 秒,常规推理延迟约 15 ms。
与生成式模型或原版 Jev 相比,Chinese-Jev 将异构中文标注统一为选项概率目标,并通过领域微调在保持高效推理的同时提升中文决策精度。
实验
实验设计
实验在通用中文语料(1000 万示例)上进行第一阶段预训练,随后对医疗、法律、金融三个专业领域分别微调。评测采用自建基准 CJ-Bench,覆盖通用与专业领域的中文决策任务,基线包括闭源 Jev 等 System One 模型。评估指标包括准确率、校准和推理延迟,并额外测试了 INT8 量化后的移动端部署延迟。
关键发现
- 通用域:Chinese-Jev 准确率较 Jev 提升 1.24%,同时推理加速 20.3×。
- 医学域:微调后准确率较 Jev 提升 4.0%。
- 专业域整体:平均准确率达到 Jev 的 92%,加速 17×,平均延迟仅 15 ms/例。
- 端侧部署:INT8 量化模型在移动设备上每决策约 1.0 秒。
与基线对比解读
Jev 是闭源 System One 模型,Chinese-Jev 采用轻量 encoder-only 骨干和概率目标训练,在中文场景通过大规模预训练和领域微调显著改善了分布对齐。通用域准确率小幅超越 Jev 的同时获得 20 倍加速,说明决策任务中轻量模型配合针对性训练可达到效率与准确率的更优平衡。专业域平均准确率仍差 8 个百分点,提示跨域迁移仍存在瓶颈,后续可通过扩充领域数据或持续学习进一步缩小差距。移动端 1 秒延迟为实时决策和边缘部署提供了可行路径。
行业影响
落地场景
Chinese-Jev 主要面向需要快速、确定性输出的中文决策任务,典型场景包括:
- 电商平台的评论情感分类、客服工单意图识别;
- 内容平台的敏感词过滤、标题分类;
- 教育场景的练习题自动判分;
- 医疗预问诊分诊、法律文书要素抽取、金融风控规则匹配。
该模型以轻量 encoder-only 架构提供毫秒级响应,适合高吞吐、低延迟的线上服务,也可部署在移动端解决隐私敏感场景的离线决策。
商业价值
核心价值在于降本增效:替换大模型 API 调用,单次推理延迟约 15 ms,相比生成式模型可降低 1-2 个数量级的计算成本;量化后可在手机端运行,省去云端往返,降低带宽与服务器负载。同时提升用户体验:实时反馈、无网络依赖、数据不出设备,尤其适合医疗、金融等合规要求高的行业。对产品而言,能让决策类功能以极低成本嵌入到边缘设备,拓展 AI 覆盖范围。
与现有工作流的集成
Chinese-Jev 提供统一的概率输出格式,易于集成到现有决策系统中:
- 作为规则引擎的前置分类器,快速路由到不同处理分支;
- 与生成式 LLM 协同,先由 System One 模型过滤简单查询,复杂案例再交给 LLM 处理,降低总成本;
- 通过 ONNX / TensorRT 等框架部署,也可转换为 TFLite / Core ML 用于移动端。
项目开放训练 pipeline,团队可在自有数据上微调,适应特定业务词汇和分类体系。
典型 Use Case
- 在线医疗问诊分诊:患者输入症状描述,模型在设备端实时给出科室建议或紧急程度判断,无需上传隐私数据,符合医疗合规要求;
- 电商客服意图分类:用户消息被快速分类为退换货、物流查询、优惠咨询等,直接匹配对应知识库答案,降低人工介入率。
这两种场景均要求低延迟、高准确率,且对数据隐私敏感,适合 Chinese-Jev 这类 System One 模型落地。
局限
- - **数据构建局限**:将异构中文标注统一转换为候选选项上的概率目标,这一过程对非封闭集任务存在简化风险。对主观或模糊决策,强制概率分布可能引入标签噪声并丢失语义细节。论文未分析该转换对标注一致性的影响,也未说明如何处理标注者分歧。通用语料 1000 万示例可能包含大量规则合成数据(附录 A.3),其模式偏向可能抬高准确率但无法反映真实分布。
- - **评估与领域覆盖局限**:CJ-Bench 仅覆盖医疗、法律、金融三个领域,通用任务枚举不充分,难以代表中文决策任务全貌。与闭源 Jev 的对比只在构造的基准上测准确率,未讨论数据泄漏或基准重叠。在专业领域平均准确率仅达 Jev 的 92%,说明部分领域仍明显落后,论文未给出分领域详细结果。移动端 INT8 量化延迟约 1.0 秒/决策,对实时交互可能过高,也未说明内存占用和跨设备鲁棒性。
- - **模型能力与任务范围局限**:编码器-only 骨干加评分读出限制模型只能处理选项给定的决策任务,无法生成自由文本或进行多轮对话;虽然推理速度快,但在复杂推理上的绝对准确率可能仍低于生成式大模型。论文未探索更大骨干或混合推理策略,也没有展示模型在开放域、小样本或对抗输入下的表现,这些限制了其作为通用 System One 模型的适用范围。