腾讯发布混元Hy4 preview轻量版模型,将模型权重从1.5TB压缩到214GB,压缩率达86%。测试结果显示,压缩后的模型在长文理解、多轮长上下文检索等方面与原版基本处于同一水平,数学能力有小幅回落,能覆盖日常编程辅助、工具调用、长文档处理和常规问答。
此前在8月28日,腾讯发布并开源了Hy4 preview,在多个编程、智能体和科研基准测试中得分超过DeepSeek V4 Pro 0824等模型,位居开源模型第一梯队。
量化版表现优异
MIX-STQ1_0量化版在多个主流评测集上和BF16原版的差距在一两分以内。在长上下文评测集MRC、真实工具调用Agent评测MCP-Atlas等任务中分差不到1分,整体领先UD-IQ1_M量化版本。
此外,研究人员验证了通过异构设备拼接运行旗舰大模型的可行性。腾讯混元团队基于分布式集群推理框架prima.cpp,在一台4090笔记本和一台四卡A4000服务器上,将214GB的Hy4 preview轻量版模型协同跑到了1.02 token/s,比笔记本单机offload快了约6倍。
两大核心技术实现极致压缩
腾讯混元通过Sherry稀疏三值量化算法和MIX-STQ1_0混合精度策略两大技术,实现了压缩模型权重且性能无大幅降低。
1. Sherry稀疏三值量化算法
以优化路由专家部分,将最激进一档权重压到平均1.25比特。每四个权重为一组量化成{-1、0、+1},并强制每组恰好1个为0。基于此,腾讯混元在llama.cpp里实现了STQ1_0推理内核,在比特数最低的同时,速度和IQ1_M基本持平,比IQ1_S更快。
2. MIX-STQ1_0混合精度策略
按校准数据逐层决定每层比特压缩程度。针对模型各层对压缩耐受能力的差异,敏感的层保留IQ2_XXS(2.06bpw),不敏感的层使用压缩更强的STQ1_0(1.31bpw)。在不增加平均比特预算的前提下,整体量化误差更低,且比UD-IQ1_M少占超5GiB空间。
结语
腾讯混元此次针对MoE模型专家层参数分布特点进行定制化压缩,不再简单对全模型统一降比特,而是按照各层敏感度差异化分配精度,将模型压缩带来的性能损耗降至最低,为超大MoE模型的轻量化落地提供了参考。
原始来源: 智东西 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。