大模型之家讯 9月1日,腾讯发布混元Hy4 preview的轻量版模型,将模型权重从1.5TB压缩至214GB,压缩率达86%。测试结果显示,压缩后模型在长文理解、多轮长上下文检索等任务上与原版基本处于同一水平,数学能力有小幅回落;在长上下文评测集MRCR、真实工具调用Agent评测MCP-Atlas等任务中分差不到1分。腾讯通过自研的Sherry稀疏三值量化算法(每四权重一组量化为{-1,0,+1},平均1.25bit/权重)和MIX-STQ1_0逐层混合精度策略,实现低比特压缩下性能不大幅下降。研究人员还验证了在一台4090笔记本与一台四卡A4000服务器组成的异构设备上协同跑通214GB轻量版模型,达到1.02 token/s,为超大MoE模型轻量化落地提供了新思路。