面向量子增强扩散语言模型的电路超网络
语言模型可以通过改变作用于单个 token 的计算来实现适配。量子电路提供了其中一种途径,但在大型模型内部评估更宽的电路往往计算代价高昂。 本文提出 HyperQ,为冻结的掩码扩散语言模型加入 token 条件化量子残差分支。该分支位于每个 transformer block 中,读取 token 的隐藏状态,输出该 token 对应电路的各坐标,执行电路,并通过残差连接把测量值加回。骨干网络保持冻结,仅训练新增分支。分支内部,一个轻量的电路超网络 在共享的稀疏电路结构中生成 token 特定的旋转角、耦合强度与测量轴。 所需期望值具有精确的经典表达式,其评估开销随量子比特数线性增长,因此 16 至 64 量子比特的电路都能在 11 亿参数的骨干模型内完成训练。在下游基准上,增大电路宽度使平均分从 47.65 提升到 54.30。当电路宽度为 64 量子比特时,HyperQ 分别超过骨干网络及其低秩适配版本 4.71 分和 3.67 分。 HyperQ 仅在 20,000 条 prompt-response 数据上微调,而经典基线使用了 200,000 条。这些结果支持将 token 条件化的电路生成视为一种可行的量子增强语言建模架构方案。
论文精读
TL;DR HyperQ 为冻结的 masked-diffusion 语言模型添加 token 条件量子残差分支,由电路超网络生成每条 token 的量子电路;仅训练这些分支,即可用 20k 数据让 1.1B 模型超越 LoRA 等经典基线。
问题
问题背景:语言模型对 token 级计算的适配是参数高效微调(PEFT)的核心,主流方法通过改变 token 变换来适应下游任务。量子电路作为一种替代计算机制,可引入经典网络难以表达的纠缠与干涉特征,但如何高效嵌入大规模骨干模型仍是开放问题。
现有方法局限:经典低秩适配(如 LoRA)假设增量矩阵低秩,限制了非线性 token 交互建模;量子 NLP 方法多采用全量子变分电路或量子注意力,要么训练成本高,要么需要替换整个骨干,难以扩展到十亿参数以上模型。在 Transformer 块内直接评估宽量子电路(如 64 qubit)期望值,传统状态向量模拟代价随 qubit 数指数增长,构成主要计算瓶颈。
为什么难/重要:HyperQ 采用稀疏电路结构,其期望值存在精确经典表达式,评估成本随 qubit 数线性增长,使得在冻结骨干内训练 16–64 qubit 电路成为可能。这种 token 条件化电路发射——每个 token 动态生成自己的电路参数——类似于动态路由,是 MLsys 与量子 ML 交叉领域的新兴方向。工程上,量子残差分支作为可训练插件,无需牺牲骨干表达能力,同时引入非经典特征。
行业类比:可将 HyperQ 与 LoRA 对照:LoRA 用低秩矩阵适配冻结模型,HyperQ 用可训练的量子残差分支,但电路参数由轻量超网络根据 token 隐藏状态实时生成,类似于 MoE 中每个 token 选择专家,只是专家为微型量子电路,为语言模型带来新的计算维度。
核心洞察
- HyperQ 的核心创新在于将量子电路作为 token 级自适应计算模块,通过一个轻量级电路超网络为每个 token 发射旋转角度、耦合强度和测量轴,在共享稀疏电路结构下执行量子计算并残差回传。与以往使用固定量子电路或全局量子编码的方法不同,该工作展示了在冻结的 1.1B 参数主干中插入可训练的量子残差分支,且期望值具有精确经典表达式,计算成本随量子比特数线性增长,使得 16 到 64 量子比特的电路能够在经典 GPU 上高效训练。这为在大型语言模型中引入动态量子归纳偏置提供了一条低资源、可扩展的路径。
- 实验中一个反直觉的重要发现是:仅用 20k 提示-响应对微调的 HyperQ,在多个下游基准上平均得分从 47.65 提升到 54.30,并且在 64 量子比特时超过使用 200k 数据微调的主干和 LoRA 对应模型 4.71 和 3.67 分。这说明 token 条件量子分支具有极高的参数效率,其结构化的量子先验可能捕捉到了低秩适配无法覆盖的 token 级语义变化。对实际工程而言,这开辟了一种新的高效微调范式,尤其在数据稀缺场景下,量子增强残差模块可能比传统适配器更具优势,且无需改动原模型权重。
- HyperQ 的另一个关键工程洞察是打破了‘量子增强必然带来指数级经典模拟开销’的假设。通过设计特定的稀疏电路结构,所需的期望值可以精确地以线性于量子比特数的代价计算,而无需真实量子硬件或指数级模拟器。这使得量子模块能够作为大模型中的轻量级插件进行端到端训练和推理,保留了量子形式的结构化先验,同时避免了量子硬件噪声和不可微性带来的工程困难。这种‘量子启发但经典可模拟’的设计思路,为量子-经典混合架构在 NLP 等大规模应用中的实际落地提供了现实可行的参考。
方法
输入与整体框架
HyperQ 以冻结的 masked-diffusion 语言模型为 backbone,输入为 prompt-response 对(微调阶段仅用 20k 条)。每个 token 的 hidden state 被送入各 Transformer block 中新增的 quantum residual branch。
关键模块:量子残差分支
每个分支内有一个轻量 circuit hypernetwork,接收当前 token 隐藏向量,输出该 token 专属的电路参数:rotation angles、coupling strengths、measurement axes,但这些参数作用于共享的稀疏电路结构。随后在经典模拟器上执行该电路,得到期望值。核心工程点是:所需期望值存在精确经典表达式,计算成本随 qubit 数量线性增长,因此可以训练 16–64 qubits 而不引入指数级模拟开销,适用于 1.1B 参数 backbone。
残差融合与输出
测量值通过 residual connection 加回 token 表示,使 backbone 输出被量子电路非线性调制。backbone 参数完全冻结,仅训练新增分支。训练目标沿用 masked-diffusion 的 denoising 损失;下游基准显示 64 qubits 时平均分从 47.65 升至 54.30。
与同类方法差异
不同于 LoRA 等低秩适配器用线性低秩矩阵修改隐藏状态,HyperQ 通过 token-conditioned 量子电路生成非线性、可解释的残差信号,同时借助经典的期望值线性扩展实现大规模训练,在更少微调数据下取得更强性能。
实验
实验设计
HyperQ 在 1.1B 参数 的冻结 masked-diffusion LM 每个 transformer block 中插入 token-conditioned quantum residual branch。分支内的 circuit hypernetwork 从隐藏状态发射 token 特定的 旋转角 / 耦合强度 / 测量轴,采用共享稀疏电路结构;期望值具有线性经典表达式,支持 16–64 qubits。训练仅更新新增分支,主干保持冻结;微调使用 20,000 prompt-response pairs,经典基线使用 200,000。
关键发现
- 电路宽度从 16 增至 64 qubits,下游平均分由 47.65 提升至 54.30。
- 64 qubits 下 HyperQ 超过冻结 backbone 4.71 分,超过低秩适配(LoRA)对应方案 3.67 分。
- 仅用 20k 样本达到经典基线 200k 样本的性能,数据效率显著。
- 训练成本主要来自轻量分支与线性经典模拟,避免大模型全参数更新。
基线对比解读
与 LoRA 相比,HyperQ 不是在权重空间叠加低秩矩阵,而是在每一层加入 token 动态电路,实现条件计算与残差注入;其表达能力来自电路参数化,且主干参数无需存储梯度。与冻结 backbone 相比,新增分支补充了任务相关表征,不会产生灾难性遗忘。该结果提示 电路超网络 可作为参数高效微调的一种替代路径,但当前仅在 masked-diffusion 设定与量子可经典模拟的场景下验证。
行业影响
落地场景
HyperQ 适合低资源任务适配与大模型服务中的场景化微调。例如:
- 电商文案生成:新品类或新品牌只有少量示例,用 HyperQ 在冻结的 1.1B 骨干上快速注入商品特征,生成差异化描述。
- 客服对话系统:企业需要快速定制垂直领域话术,HyperQ 分支可在 20k 条 prompt-response 对上完成微调,而传统 LoRA 需要 200k 条。
商业价值
- 降本:数据标注量从 200k 降到 20k,大幅减少标注与训练成本;冻结骨干仅训练量子残差分支,GPU 显存占用与 LoRA 相当。
- 提效:64 qubit 下较 LoRA 提升 3.67 分,且推理时量子期望值有精确经典表达式,计算成本随 qubit 数线性增长,无需真实量子硬件即可部署。
- 体验提升:在少样本场景下提供更稳定的生成质量,适合快速迭代的产品需求。
与现有产品/工作流的接口
- 即插即用:HyperQ branch 可视为一种参数高效微调插件,插入每个 transformer block 的残差流,与现有 Hugging Face/PyTorch 模型栈兼容,训练时冻结主干、只更新新增分支。
- 部署集成:推理阶段的电路测量值可转换为轻量级线性代数 kernel,封装为自定义 ONNX 算子或 TensorRT plugin,无需量子后端。
- 训练流程:复用现有 masked diffusion 训练框架,只需在 loss 反向传播时更新 branch 参数,可在多卡分布式训练中按 adapter 模式加载。
局限
- 实验仅在 masked diffusion language model 上进行,未验证在 autoregressive LLM 等其他主流架构上的效果。微调数据规模为 20,000 prompt-response pairs,虽然比 classical baselines 少一个数量级,但绝对量仍偏小,可能限制泛化性的充分评估。下游 benchmark 平均分数从 47.65 提升到 54.30,但未报告统计显著性或误差范围,实际应用中的稳健性有待进一步验证。
- 虽然期望值存在线性复杂度的经典表达式,训练与推理仍然依赖经典模拟,尚未在真实量子硬件上验证。量子电路可能仅充当一种参数化非线性变换,并未明确利用量子纠缠等独特性质带来经典方法无法复现的优势。相比 LoRA 等经典参数高效微调方法,HyperQ 需要额外的电路模拟开销,在部署效率和成本上可能不具优势。
- 电路结构是共享稀疏的,超网络仅调整旋转角度、耦合强度和测量轴,限制了 token-specific 表达的多样性。更灵活的电路拓扑或自适应结构可能进一步提升效果,但当前工作未探索。此外,emitted circuit motifs 的分析更多是事后描述,缺乏严格的理论解释或可解释性保证,难以指导进一步优化。