CurveTQ:通过曲率加权搜索实现 LLM 权重的免旋转网格量化
CurveTQ: Rotation-Free Trellis Quantization of LLM Weights via Curvature-Weighted Search
基于摘要分析。该研究针对 LLM 两比特权重量化中的旋转开销与曲率信息利用问题,提出 CurveTQ:将 Hessian 分解得到的逐坐标权重直接纳入 Viterbi 分支度量,在原始权重基底中进行曲率加权 trellis 搜索,避免解码时撤销随机正交变换。 核心机制:摘要指出,QTIP、Proteus 等方法采用随机正交旋转与欧氏距离搜索,Hessian 信息主要通过编码块之间的误差反馈起作用。作者推导,误差反馈会将损失转化为逐坐标舍入误差的加权和,其权重来自 Hessian 的 LDL 分解对角项;CurveTQ 将这些权重用于块内搜索。作者据此认为,旋转通过消除块内曲率变化发挥作用,与原始基底下的加权搜索具有替代关系。系统另以因子化尺度场和闭式分位数表处理权重幅度及边缘分布形状,并为每个编码块存储起始状态,以适应误差反馈传入的残差。 作者报告,在三个模型上,原始基底下的加权搜索与全维随机化 Hadamard 变换的下游 Accuracy 相差约一个百分点,而旋转后再加权的增益较小。在三个 4–8B Instruct 模型的两比特量化评估中,即使 QTIP 和 Proteus 也使用 CurveTQ 的起始状态机制,CurveTQ 的平均下游 Accuracy 仍高出 1–3 个百分点;单独加入起始状态机制则使两种基线各提升 1–3 个百分点。作者还报告其在一个 35B mixture of experts 模型上领先,并称据其所知这是该类模型上的首个 trellis 编码结果。在所有已测试的 batch size 和位宽下,作者报告 CurveTQ 解码器在三者中最快。 核对重点包括 Hessian 加权目标的推导条件、曲率估计成本、尺度场与起始状态的存储开销,以及速度比较是否计入完整解码流程。摘要未提供模型名称、下游任务、校准数据、具体 Accuracy、硬件或吞吐量;实验协议、消融及统计信息尚未验证。该方法面向 LLM 权重压缩,其在 EEG/BCI 模型上的适用性尚未验证,相关已有工作尚未检索确认。
值得核对曲率加权 Viterbi 搜索能否替代随机旋转,以及编码块起始状态对量化精度的独立贡献;作者报告了精度与解码速度收益,但具体评估协议尚未验证。
来源:arXiv · 架构与算子 · arxiv.org