
大模型之家讯 7月17日,2026世界人工智能大会(WAIC 2026)在上海开幕。云知声携以U2为核心的U-Model家族及三大Agent集群参展,首次对外系统展示从底层模型、多模态感知到场景落地的完整智能体体系,回应大模型从“理解与生成”走向“规划与执行”的行业转向。

U2是云知声面向个人、开发者与组织打造的原生智能体大模型,核心定位不是对话与写作,而是面向复杂任务的自主规划与多步执行。官方将其技术路线概括为“高智能密度×高Token价值”:在同等参数规模下追求更强的推理能力,同时控制每次调用的算力消耗,使更强的智能以更可负担的方式进入真实场景。其在复杂办公、软件工程、深度研究及多工具协同环境中,可自主拆解并推进百步以上工作流,串联需求理解、任务规划、环境交互、工具调用、过程纠错和结果验收的完整闭环。

在全球评测体系中,U2已覆盖长上下文理解(AA-LCR)、知识推理(GPQA Diamond)、指令遵循(IFBench)、智能体执行(SWE-bench Verified)及复杂任务(WildClawBench)等多项高难度基准,综合表现进入LLM Stats总榜前30名,位列全球模型厂商第八位。在公认难度极高的长文本理解基准LongBench-V2上,U2以54.4%准确率超越Claude Opus 4.7,显示出对海量信息的持续捕捉与深层推理能力。
多模态感知层面,云知声展出了U2-ASR语音识别、U2-TTS语音合成与克隆、U1-OCR文档理解三款组件。U2-ASR支持上百种方言及多种外语,复杂嘈杂环境下识别准确率保持90%,AISHELL-1公开测试集达99.2%。U2-TTS基于纯因果注意力机制的流匹配模块与神经声码器联合优化,可生成带语气、情绪乃至呼吸和笑声等拟人化细节的语音;配合5至15秒参考音频的声音克隆能力,合成自然度与相似度MOS评分达4.5以上,且支持音色与情感的组合式生成。U1-OCR突破传统字符识别局限,可还原嵌套表格等复杂版式并智能抽取关键信息,将非结构化文档转化为可计算数据。

医疗垂直领域是本次展出的重点落地场景之一。U2-Med深度整合医疗、医保、医药“三医”知识,贯通临床诊疗、基金监管和药事服务全场景,综测能力达89.1%,病历质控准确率97%,全面超越同级别主流模型。U1-OCR-Med则专攻医疗文书场景,对手写病历、印章遮挡处方和复杂检查报告实现像素级定位与精准抽取。
应用层,云知声展示了医疗专家、数字员工、数字助理三大Agent集群。医疗专家Agent融入诊前、诊中、诊后全流程,实时采集医患对话自动生成病历并对完整性与合规性进行实时校验;数字员工Agent覆盖政务工单、公文收办、费用报销、合同风控等跨系统流转场景;数字助理Agent进入公文撰写审核、会议纪要、招标造价预测及车载语音交互等日常办公与生活场景。三个集群均不再停留于单轮问答功能演示,而是直接进入工作流,与人工协作完成可验证、可交付的任务。
原创文章,作者:志斌,如若转载,请注明出处:http://damoai.com.cn/archives/17339