大模型之家讯 7月24日,蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-Flash,总参数124B、单次计算仅激活5.1B。该模型从预训练阶段即采用混合注意力架构,以5:1比例交替堆叠KDA线性注意力层与MLA层,每个Token的专家激活比例压缩至1/64,在基础推理、指令遵循及长文本处理等指标上对标参数规模2至3倍的行业领先模型。针对Agent场景,模型扩展了超10000个真实交互训练环境,并通过集群级分级缓存将长输入首字响应延迟降低60%~80%以上。该模型已上线OpenRouter,限时免费一周后将正式开源。