昨天 • 2026年9月7日 • 周一
17:46

腾讯混元Hy4 preview模型升级,显著降低任务轮次及Token消耗

大模型之家讯 9月7日,腾讯混元与WorkBuddy联合团队宣布,针对Hy4 preview模型复杂任务下的长思考、过度自我验证等问题进行专项优化并全量上线。通过Bench指标与人工评测双重监控,在不损失任务效果的前提下,优化版本显著降低了任务轮次及输入输出token消耗。

腾讯于8月28日发布Hy4 preview模型,总参数770B,激活参数49B,上下文长度1M,预训练和后训练的共同进步使其稳居开源模型第一梯队。此次优化主要针对复杂任务场景下的长思考和过度自我验证问题,通过改进推理机制,在保持任务效果的同时大幅降低了计算成本,对降低企业级应用的使用门槛和运营成本具有重要意义。

13:40

努比亚NaviX Ultra定档9月16日:全球首款AI智能体手机,放弃GUI模拟路线

大模型之家讯 9月7日,努比亚官宣全球首款AI智能体手机NaviX Ultra定档9月16日14:00发布。该机由中兴通讯与字节跳动联合研发,搭载豆包手机助手,被称为豆包手机二代。据晚点LatePost爆料,新机调整了与阿里、腾讯等超级应用的合作方式,将不再在用户授权后读取屏幕并模拟GUI操作。硬件方面,NaviX Ultra有望搭载骁龙8 Elite Gen5旗舰处理器,内置7000mAh硅碳负极电池,支持90W/100W有线快充及无线充电。该机将搭载长鑫存储速率达10667Mbps的LPDDR5X内存,系国产10667Mbps高速率LPDDR5X芯片首次量产应用。合作商包括高通骁龙、京东方、长鑫存储、三星半导体、汇顶科技等。

13:25

科大讯飞发布星火X2.5:293B MoE模型全国产平台训练,定价低至0.24元/百万Token

大模型之家讯 9月7日,科大讯飞正式发布星火Spark-X2.5多语言文本生成模型。该模型采用MoE架构,总参数2930亿、激活参数300亿(293B-A30B),支持256K上下文窗口,覆盖200余种语言,全部基于国产平台完成训练。星火X2.5在代码生成和智能体(Agent)能力上实现全面提升,语言理解、答题、推理等通用任务表现优异。模型已上线讯飞星辰MaaS平台,输入定价1.6元/百万Token,缓存命中仅0.24元/百万Token,输出6元/百万Token。值得注意的是,科大讯飞2026年上半年归母亏损2.04亿元,同比收窄14.68%,大模型商业化仍在推进中。

10:37

央企领投,中科类脑完成数亿元 B+ 轮融资,布局“Token 工厂”

大模型之家讯 近日,合肥中科类脑完成数亿元 B+ 轮融资,中车资本领投,银杏谷资本、水木基金、启迪基金跟投,是继 2025 年获中国移动系亿元级独家投资后的又一里程碑。公司 2017 年成立,是类脑智能技术及应用国家工程实验室唯一产业化单位,自建及接入算力规模超 5000P、使用率 90% 以上,电力侧已为十余省市 100 余座变电站提供智能运维。本轮资金投向推理场景异构算力调度与 Token 优化、“电—算—Token”全链路博弈决策中枢、Token 工厂产业服务能力。“算电协同”已于 2026 年 3 月首次写入政府工作报告;2025 年我国算力中心用电量达 1960 亿千瓦时、同比增长 18.1%(同期全社会仅增 5.2%),预计 2030 年达 8000 亿千瓦时、占全社会用电量约 6%。

10:32

浙大、港大开源 LayerRecall 记忆路由器,长视频“换脸”难题有了轻量解法

大模型之家讯 近日,浙大与港大团队开源轻量化记忆路由器 LayerRecall,解决自回归视频模型“角色离场就换脸换衣服”的长时记忆问题。方法不塞回整段历史,而是同时回答“该想起什么”与“该在哪些层使用”:摘要仅负责检索打分,送入注意力计算的是被选中 chunk 的完整 K/V。在 100 个未参与训练的三镜头 prompt 上,MemoBench 达 0.548、MovieBench 达 0.578,均超最佳基线,VBench-Long 持平骨干,生成耗时仅从 305.9 秒增至 309.4 秒;路由器仅约 165 万参数、6.6MB,可零再训练迁移,LongLive 的 MemoBench 由 0.4985 升至 0.5430,Self-Forcing 由 0.3270 升至 0.4965。

2026年9月6日 • 周日
23:23

阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型

大模型之家讯 9月6日,阿里千问开源了基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型 Qwen-Drive-1.0-4B,官方称其为首个面向自动驾驶的视觉语言基础模型。该模型在预训练阶段统一了 3D 感知与视觉问答,并扩展至运动规划,同时保留预训练 VLM 的原始架构。模型采用分阶段训练方案,结合驾驶监督与通用视觉语言数据,提供 SFT 和 RL 两个规划专家,仅使用公开来源构建规划样本。经强化学习后,该模型仅以微小开环位移误差为代价,在人类偏好对齐和闭环安全性方面实现全面提升。模型已在 GitHub、Hugging Face 和 ModelScope 上线。

2026年9月4日 • 周五
20:21

Anthropic发布MHS硬件标准,为AI Agent操作真实设备建立共享规范

大模型之家讯 9月4日,Anthropic发布Model Hardware Standard(MHS)研究预览版,为AI Agent操作真实设备建立一套共享规范。MHS在设备原有控制方式之上增加一层标准化接口,将设备状态和操作整理为读取、写入等基础指令,并生成Agent可读的「说明书」,涵盖设备测量能力、可调参数、机械臂重量及安全限制等信息。在卡内基梅隆大学的测试中,研究人员将机械臂、移液工作站、读板机和摄像头接入MHS,由Claude Opus 4.8安排运行顺序。团队从设备准备到获得一条完成过自主重跑的稀释曲线,全程仅用约8小时,而供应商搭建类似系统通常需数周。MHS不处理关节级实时控制,而是由模型负责高层理解与调度,底层动作仍由控制器和确定性软件执行。该标准已面向首批科研实验室和先进制造企业开放。

2026年9月2日 • 周三
21:01

蚂蚁集团斩获VLDB工业最佳论文,统一宽表系统35PB语料提速5.6倍

大模型之家讯 9月1日,在波士顿举行的VLDB 2026大会上,蚂蚁集团论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获评工业赛道最佳论文。OmniTable已在生产环境管理超过35PB、3050亿条以上的大模型训练数据,覆盖Web、代码、PDF和SFT等数据域。在一项真实SFT数据准备任务中,端到端周期从约14天缩短至2.5天,手工操作步骤从45步降至12步,提速5.6倍。

OmniTable的核心原则是逻辑统一、物理分离,通过记录级故障隔离、算子融合、自适应调优和后台治理四大能力,在500GB、约6亿条记录的特征任务中,99.995%记录一次处理完成仅耗时6.2小时,而旧流程需三轮排查总耗时约52小时。

14:55

阿里千问Qwen3.8-Max-0902发布,拿下前端编程总榜冠军

大模型之家讯 9月2日,阿里千问宣布Qwen3.8-Max模型升级至0902版本,围绕编程和专业办公进行了进一步后训练。在CodeArena前端编程总榜中,Qwen3.8-Max提升22分至1691分夺得冠军,在多步推理、工具调用、端到端app生成方面均刷新全球上限。在CodeArena性价比榜单中,Qwen3.8-Max-0902每百万Token综合平均价格仅5美元(约33.7元人民币),而排名第二和第三的模型价格分别为20美元和12美元,性价比优势显著。新版已上线千问AI平台对外提供API服务,并同步接入千问办公、Qoder、千问App。

14:46

全球首个多模态世界模型:李飞飞World Labs发布Atlas

大模型之家讯 9月2日,AI教母李飞飞的创企World Labs发布全球首个多模态世界模型Atlas。该模型采用多模态自回归扩散Transformer架构,将所有输入融合到共享空间上下文中,能够以像素级精确的相机控制生成图像和视频帧,输出最长1分钟、1440p分辨率的视频,实现类似子弹时间的拍摄效果。Atlas可执行相机控制生成、空间重建(仅凭25张地面照片即可生成校园空中俯瞰飞行路径)、时空模拟(三台摄像机即可实现子弹时间多视角拍摄)及图像生成(支持文本生成360°全景图)四大任务。目前部分合作伙伴已获得抢先体验资格,将在未来几周内开放早期访问。

点击加载更多