AI

腾讯混元Hy4 preview轻量版发布:权重压缩86%性能几乎不减

腾讯发布混元Hy4 preview轻量版模型,将模型权重从1.5TB压缩至214GB。该模型采用自研Sherry稀疏三值量化算法与MIX-STQ1_0混合精度策略,在长文理解、多轮长上下文检索等方面与原版表现基本一致。此外,开发者可通过异构设备拼接协同运行该模型,为超大MoE模型的轻量化本地部署提供了新思路。

来源:智东西

腾讯发布混元Hy4 preview轻量版模型,将模型权重从1.5TB压缩到214GB,压缩率达86%。测试结果显示,压缩后的模型在长文理解、多轮长上下文检索等方面与原版基本处于同一水平,数学能力有小幅回落,能覆盖日常编程辅助、工具调用、长文档处理和常规问答。

此前在8月28日,腾讯发布并开源了Hy4 preview,在多个编程、智能体和科研基准测试中得分超过DeepSeek V4 Pro 0824等模型,位居开源模型第一梯队。

量化版表现优异

MIX-STQ1_0量化版在多个主流评测集上和BF16原版的差距在一两分以内。在长上下文评测集MRC、真实工具调用Agent评测MCP-Atlas等任务中分差不到1分,整体领先UD-IQ1_M量化版本。

此外,研究人员验证了通过异构设备拼接运行旗舰大模型的可行性。腾讯混元团队基于分布式集群推理框架prima.cpp,在一台4090笔记本和一台四卡A4000服务器上,将214GB的Hy4 preview轻量版模型协同跑到了1.02 token/s,比笔记本单机offload快了约6倍。

两大核心技术实现极致压缩

腾讯混元通过Sherry稀疏三值量化算法和MIX-STQ1_0混合精度策略两大技术,实现了压缩模型权重且性能无大幅降低。

1. Sherry稀疏三值量化算法
以优化路由专家部分,将最激进一档权重压到平均1.25比特。每四个权重为一组量化成{-1、0、+1},并强制每组恰好1个为0。基于此,腾讯混元在llama.cpp里实现了STQ1_0推理内核,在比特数最低的同时,速度和IQ1_M基本持平,比IQ1_S更快。

2. MIX-STQ1_0混合精度策略
按校准数据逐层决定每层比特压缩程度。针对模型各层对压缩耐受能力的差异,敏感的层保留IQ2_XXS(2.06bpw),不敏感的层使用压缩更强的STQ1_0(1.31bpw)。在不增加平均比特预算的前提下,整体量化误差更低,且比UD-IQ1_M少占超5GiB空间。

结语

腾讯混元此次针对MoE模型专家层参数分布特点进行定制化压缩,不再简单对全模型统一降比特,而是按照各层敏感度差异化分配精度,将模型压缩带来的性能损耗降至最低,为超大MoE模型的轻量化落地提供了参考。

原始来源: 智东西

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度