大模型之家讯 近日,vLLM原班人马创办的Inferact开源一套TPU巨型算子(Megakernels),将Kimi K3的92个MoE层写进同一程序,在16颗谷歌TPU v7上运行:开启投机解码时单用户输出速度达709 tokens/s,同样16块英伟达GB200用vLLM为452 tokens/s;关闭投机解码后在1至8并发下均为GB200的1.4至2倍。TPU v7纸面显存带宽(7380GB/s)低于GB200(8000GB/s),提速来自算子融合而非硬件。同一周,浪潮信息在AICC 2026发布元脑SD200 Ultra超节点AI服务器,用128颗本土AI芯片单机运行Kimi K3,Token生成时延压到5.85毫秒,单用户吞吐突破170 tokens/s。其“超级算子”有相当一部分由K3自己编写,在“生成—验证—测量—迭代”闭环中迭代,最终综合推理效能提升3倍以上。