GLM-5.3正式发布:编程能力开源第一,网络安全能力涌现

GLM-5.3正式发布:编程能力开源第一,网络安全能力涌现

8月14日,智谱正式发布新一代开源大模型GLM-5.3。据介绍,GLM-5.3与GLM-5.2采用完全相同的基座模型,所有能力提升均来自极致的后训练Scaling:数十倍的长程任务环境、更丰富多样的环境类型与超长的后训练时间,让模型涌现出超出预期的能力。

编程能力方面,GLM-5.3成为当前编程能力最强的开源模型,在内部自建体感评测中较GLM-5.2提升50%,在Terminal-Bench 3.0、Agents' Last Exam(CLI)等公开基准测试中取得开源第一,编程与智能体能力接近Claude Fable 5。其中,Terminal-Bench 3.0得分由4.6提升至28.3,DeepSWE v1.1由46.2提升至66.9,Agents' Last Exam由23.8提升至28.5,GDPval-AA v2得分达1769。

GLM-5.3正式发布:编程能力开源第一,网络安全能力涌现

在自研的Z.ai Code Bench评测中,GLM-5.3在High档位下准确率达31.4%,超过Claude Opus 4.8最高档位的29.5%,且每项任务平均输出约5万tokens,远低于Opus 4.8的12万tokens,可用更短的执行路径完成任务。

GLM-5.3正式发布:编程能力开源第一,网络安全能力涌现

网络安全能力方面,智谱称GLM-5.3在白盒代码审查与漏洞发现等安全任务中表现持平Mythos 5。CyberGym测试中,GLM-5.3得分84.5%,高于GLM-5.2的77.2%和Mythos 5的83.8%;ExploitBench得分54.4%,是前代的2倍多;ExploitGym测试中,GLM-5.3两小时完成105项漏洞利用任务,六小时完成130项。

GLM-5.3正式发布:编程能力开源第一,网络安全能力涌现

智谱还披露,其联合清华大学、南开大学及云起无垠、绿盟科技、奇安信、腾讯玄武等多家安全团队开展红队测试,累计发现漏洞2436个,其中中高危1097个,覆盖系统内核、浏览器引擎、互联网协议等269个项目,相关漏洞已陆续提交CNNVD/CNVD,并建立Z.ai安全披露账本全程透明追踪。

GLM-5.3正式发布:编程能力开源第一,网络安全能力涌现

上线安排方面,GLM-5.3即日起上线智谱官方编程工具ZCode、效率工具AutoClaw及GLM Coding Plan全量用户,TraeWork、Qoder、OpenCode等编码平台开放抢先体验,API很快上线,完整模型权重将在完成安全加固后于两周内开源。

原创文章,作者:志斌,如若转载,请注明出处:http://damoai.com.cn/archives/18038

(0)
上一篇 1天前
下一篇 2024年6月16日 下午9:15

相关推荐

发表回复

登录后才能评论