写作 / 人工智能
Coeff-Tuning 的注意力头混合,究竟解决了什么?
从注意力头混合的核心方法出发,重看 Coeff-Tuning 的 toy example,并讨论它证明了什么、尚未证明什么。
参数高效微调通常作用在线性层上。LoRA、DoRA 修改权重更新的参数化方式,Adapter、SSF 则在特征路径中加入少量可训练参数。Coeff-Tuning 选择了另一个位置:不直接改写特征投影,而是学习不同注意力头之间的组合方式。
这篇文章关心的不是它是否在表格中优于其他方法,而是一个更窄的问题:论文用来解释方法必要性的 toy example,究竟证明了什么?
方法:在注意力头之间学习一个混合矩阵

一个具有 H 个头的注意力层会产生 H 个注意力矩阵。Coeff-Tuning 引入一个从单位矩阵初始化的可学习矩阵 alpha,用它对这些矩阵进行线性组合:
F_hat[h] = sum_i alpha[h, i] * F[i]
当 alpha 是单位矩阵时,模型退化为原始多头注意力;训练后,某个头可以吸收其他头的注意力结构。新增参数量只有 H x H,并且可以与 LoRA 等作用在线性投影上的方法共同使用。

这个设计的直觉很清楚:标准多头注意力先把特征划分到不同子空间,各个头独立计算注意力;alpha 在注意力矩阵已经形成之后,重新建立跨头的信息通道。
Toy example 为什么看起来有说服力
论文构造了一个二维、长度为 8 的 token 序列,目标是用一层注意力把输入点映射到给定输出。原始设置采用两个头,每个头的维度为 1。

论文展示了三种结果:没有 value 投影时无法完成映射;加入 value 投影后,输出仍受到限制;加入 alpha 后,模型能够拟合目标。因此论文把改善归因于注意力头混合提供的新函数空间。
这里存在一个容易被忽略的混杂变量:二维特征被拆成了两个一维头。每个头只能在一个一维子空间中形成 query、key 和 value,这本身就是很强的表示瓶颈。
一个不同的对照:不拆分二维特征
我把同一个 toy task 改成单头、dim_head=2,即让注意力直接在完整二维空间中工作,而不引入 alpha。在这个设置下,模型同样可以拟合目标输出。
这不能直接否定 Coeff-Tuning。单头二维注意力与双头一维注意力不是完全等价的参数化,比较时同时改变了头数和每头维度。但它至少说明:原 toy example 中的失败不能只归因于“缺少 alpha”;它也可能来自低维多头拆分造成的表示瓶颈。alpha 在这里补偿了头之间无法通信的限制,但这不等于它对一般注意力层都是理论上必要的。
更准确的结论应当是:
在每个注意力头的子空间非常窄时,头混合可以恢复一部分被分头操作隔断的表达能力。
怎样做一个更强的验证
如果要把这个观察提升为更可靠的结论,至少需要补充四组控制:
- 固定总内部维度与参数预算,分别改变头数和
dim_head。 - 在多组随机目标、随机种子和 token 数量上重复实验。
- 比较单位矩阵、稠密可学习矩阵、受约束矩阵和无头混合的结果。
- 除最终拟合误差外,报告注意力矩阵的秩、头间相似度和输出子空间变化。
这些控制能够区分两个命题:Coeff-Tuning 是为标准多头注意力普遍增加了新的有效函数空间,还是主要修复了特定分头配置下的表达损失。
它仍然是一种有价值的微调位置

即使弱化 toy example 的“必要性”解释,这个方法仍有实际价值。它增加的参数极少,修改位置与权重低秩更新正交,而且把“哪些头应该共享关系结构”变成了可以从下游数据学习的问题。
对我而言,这篇论文最值得保留的启发不是一个新的 PEFT 排行,而是一个方法论提醒:当某个轻量参数带来明显改进时,需要继续追问它是在增加新的能力,还是在补偿原参数化已经引入的限制。