大模型之家讯 8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8,总参数量2.4万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。今日放榜的权威三方榜单Arena中,阿里Qwen模型仅次于Anthropic的Claude系列,整体性能处于全球大模型第一梯队。目前,Qwen3.8的API已上线千问AI平台,并接入阿里今日同步推出的Agent产品"千问办公"。Qwen3.8-Max预计下周开源,同时还将开源 Qwen3.8-27B。
今日起,全球开发者都可通过千问AI平台获得Qwen3.8的API服务,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,而输入与输出的国际价格仅为Opus5的40%与24%,实现相近智能更高性价比。

图说:权威三方榜单Arena全球排行榜更新
此次发布的是千问大模型系列中尺寸最大、性能最强的旗舰模型Qwen3.8-Max,它支持视觉理解,上下文长度达1M Tokens。在模型架构上,Qwen3.8通过稀疏MoE架构与混合注意力机制的联合优化,首次将千问大模型的总参数量拓展至2.4T,激活95B,获得了更高的推理效率、更快的推理速度,整体性能也迎来新突破:在科研复现评测PaperBench等编程智能体评测中,Qwen3.8-Max较上代模型大幅提升28.2分,以93.0分录得评测新高;在WideSearch、Agent's Last Exam等通用智能体评测中,新模型分别取得81.9分和52.4分,位居前沿。同时,Qwen3.8在指令遵循IF Bench评测中斩获82.8分,科学推理GPQA Diamond取得92.6分,系列通用能力均位居前列;在视觉推理BabyVision评测中,Qwen3.8-Max在无工具条件下取得82.0分,超出部分主流模型近两倍,在评估智能体电脑操作能力的OSWorld-Verified评测中,Qwen3.8-Max以86.1分位居主流模型首位。
编程能力(Coding)是前沿大模型的核心能力之一,Qwen3.8实现了自主编程的新突破。在权威CodeArena榜中,Qwen3.8位居全球第四。2年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手,而如今,Qwen3.8可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人干预。只需一句"创建一个自进化的智能体Harness",Qwen3.8就像个资深的工程师,从零开始,自主搭建循环工程(Loop Engineering)框架,编排智能体自动领取和执行任务,人类工程师还可通过钉钉给Qwen3.8提出新要求。Qwen3.8独立编程运行约 16 天后,做出了一个Hermes Agent级别的、真实可用的自进化智能体框架"oh-my-cli",目前该项目现已完全开源,完整过程公开保存在 GitHub 仓库里,可供所有人查看。
Qwen3.8可胜任广泛的、真实的专业工作任务(Cowork)。面对完全不同的专业任务、评判标准和计算需求,Qwen3.8通过真实环境和算力的联合强化学习(RL)扩展,实现了数百种高价值、高频专业任务的真实表现提升,在主流的智能体框架中均可稳定可靠地交付生产级成果:一支法务助理团队在数百份法律文档中标注千余个相关条款,需要一周时间,Qwen3.8一小时内就能做完;一个篮球数据分析团队逐帧标注160个小时以上的比赛录像,Qwen3.8数十分钟就可精准拆解这8400多个攻防回合,并一次性输出球员战术画像和教练报告;一个金融研究团队基于数年的专业知识积累,搜集资本市场全面、实时的变动,才能依次完成的量化策略研究,Qwen3.8自主调动并行的智能体,连续工作数小时后交付完整的 ETF 轮动策略,并持续分析回测、动态修正、最后实现规模化盈利。
在长周期任务中,Qwen3.8涌现出系统级自主规划与全栈闭环自适应学习能力。无论是在高精密、强物理约束的数字芯片设计,还是在高度动态、博弈激烈的商业模拟运营中,Qwen3.8均能通过"执行-反馈-迭代"的自适应闭环,在数千轮的超长程交互中实现算法与策略的深度重构。
Qwen3.8除了拥有强大的文本和推理能力,还提高了AI视觉理解能力的极限。在权威Vision Arena榜单中,Qwen3.8-Max排名全球第二。Qwen3.8不仅能读懂200页的财报PDF、看懂超100小时的长视频,还能将这些"看到"的知识和信息反馈到工作全流程去,帮助模型思考得更周全。在千问团队构建的"应用复刻"基准RecreationBench长程任务中,模型没有源代码,也无法联网,只通过交互与反馈去理解这个应用,却能从零复刻出整个应用。这表明,Qwen3.8已经展现出前沿水准的混合多模态智能体能力,通过"迭代编程—交互反馈"的反复循环,将视觉编程(Visual Coding)推向新的高度。
据了解,阿里真武M890超节点也已成功适配Qwen3.8,通过芯片、云平台与千问大模型的全链路优化,显著提升推理效率、降低推理成本,在Agentic推理场景中最多可实现1.5倍性能提升。
原创文章,作者:志斌,如若转载,请注明出处:http://damoai.com.cn/archives/17764