谷歌DeepMind发布Gemini Robotics 2,首度实现人形机器人全身控制
大模型之家讯 7月31日,谷歌DeepMind发布机器人模型Gemini Robotics 2,首度实现人形机器人全身控制,能行走、下蹲、操控物体并自主推理。在演示中,新模型操控Apptronik公司的Apollo人形机器人穿过房间、拿起洒水壶放到架子上,并避开途中障碍物。DeepMind同步发布另外两款机器人AI模型,既可协同工作也可独立运行。其中,Gemini Robotics 2负责将摄像头画面和自然语言指令转换为电机控制指令;Gemini Robotics ER 2则充当机器人推理系统,负责规划多步骤任务,并协调多个机器人共同完成同一目标。
华为开源openPangu-2.0-Pro,5050亿参数盘古大模型上线
大模型之家讯 7月31日,华为正式开源基于昇腾NPU训练的盘古MoE大模型openPangu-2.0-Pro,涵盖模型权重、基础推理代码及技术报告。该模型总参数规模5050亿(505B),每Token激活参数180亿,支持512K上下文长度,训练数据总量约34T tokens,是余承东在HDC 2026上喊话把盘古做到世界第一后的首次重磅发布。技术架构上,openPangu-2.0-Pro采用DSA+SWA独立分层混合注意力架构(层配比1:2)、4支流mHC拓扑、3头MTP自投机模块及Muon优化器,是专为长上下文智能体任务打造的软硬件协同设计体系。在128K上下文下,其最低TPOT时延为9.55ms,单卡吞吐达1326 token/s。技术报告坦承,该模型在处理复杂现实世界软件工程任务时,与顶尖模型仍存在明显差距。
字节跳动推出Seedance 2.5视频模型,单次生成时长突破30秒
大模型之家讯 7月31日,字节跳动发布公告,在国内推出Seedance 2.5视频生成模型,可单次生成30秒高质量视频片段,较此前的15秒提升一倍,并支持多轮延长。该模型延续Seedance 2.0统一的多模态音视频联合生成架构,面向影视、广告、教育、工业制造、具身智能和自动驾驶等场景,支持单次输入最多30张图片、10段视频、10段音频作为参考素材,可同时还原多人物形象与声音并保持主体特征稳定。Seedance 2.5正在陆续上线即梦AI与豆包专业版,API服务也将于近期接入火山方舟。当日,徐工集团、小鹏汽车、灵初智能、微分智飞、穹彻智能等多家企业已确认合作,率先引入该模型能力。
DeepSeek-V4-Flash正式版API上线公测,Agent能力大幅增强
大模型之家讯 7月31日,DeepSeek发布更新日志,宣布DeepSeek-V4-Flash正式版API上线公测。V4-Flash-0731的模型结构、尺寸与preview版本保持一致,仅重新进行后训练,并原生支持Responses API格式、针对性适配Codex。官方基准测试显示其Agent能力大幅增强,远超V4-Pro-Preview:Terminal Bench 2.1达82.7、NL2Repo达54.2、DeepSWE达54.4、Agent Last Exam达25.2。官方表示,本次仅升级V4-Flash的API接口,V4-Pro API及APP/WEB端模型未做更改,V4-Pro正式版将尽快发布。有分析称,V4-Flash正式版能力甚至反超自家先发的Pro版,被业界戏称为倒反天罡。
国家发改委宣布将加快《人工智能法》立法进程
大模型之家讯 7月31日,国家发展改革委政策研究室主任、新闻发言人蒋毅在新闻发布会上表示,上半年我国人工智能自主创新步伐加快,深度求索、月之暗面等本土企业先后发布参数规模达万亿级别的开源大模型,国产大模型全球下载量突破100亿次。蒋毅强调,下一步将统筹高质量发展和高水平安全,让人工智能既跑得快又跑得稳。具体举措包括:聚焦大模型基础理论、训练、推理效率、多模态、智能体等前沿方向加快自主创新;推动国家人工智能应用中试基地布局建设;大力培育智能衍生企业,并将加快《人工智能法》立法进程,力争提供体现中国特色、具有中国智慧的人工智能治理方案。同时将强化风险监测防控,建立健全技术监测、风险预警、应急响应体系,坚持AI发展由人主导、为人所用、与人为善。
MiniMax H3全模态生成模型正式发布,最高支持15秒2K分辨率
大模型之家讯 7月31日,稀宇科技正式发布MiniMax H3全模态生成模型,支持对文本、图像、视频、声音的多模态上下文统一理解,可输出原生双声道音视频,最高支持15秒2K分辨率。据前期邀测反馈,该模型在指令遵循、文字与品牌信息呈现、V2V视频到视频动作迁移等能力上表现出色,适用于广告、电商、品牌、产品设计及UI/UX等场景。技术层面,MiniMax H3新增Caption能力并定制全模态理解管线,大部分素材消耗100K Token推理,最终输出平均约4K Token。其2K视频输出未使用常规超分模块,而是由基础模型对低分辨率结果进行in-context重新生成,可还原传统超分方案无法复原的信息。模型权重将在未来几天开放。受此消息影响,港股MiniMax当日开盘涨近15%。
华为开源5050亿参数盘古openPangu-2.0-Pro模型及技术报告
大模型之家讯 7月31日,华为官宣开源5050亿参数(505B)的openPangu-2.0-Pro大模型,同步开放模型权重、基础推理代码及技术报告。这是继6月30日开源92B参数openPangu-2.0-Flash后,openPangu 2.0系列7大组件开源计划的最新进展。该模型是基于昇腾NPU训练的大规模MoE语言模型,每token激活参数约18B,支持512K上下文长度,训练数据达34T tokens。架构上,模型采用DSA+SWA独立分层混合架构(层配比1:2)、4支流mHC残差连接、3头MTP自投机模块及Muon优化器。华为常务董事余承东此前解释,openPangu-2.0-Pro总参数仅505B,源于华为算力大量支持国内企业需求,且AI算力成本高昂,公司更聚焦时延与吞吐率提升。
OpenAI下调GPT-5.6系列API价格,Luna降价80%最高,Sol新增Fast模式
大模型之家讯 7月31日,OpenAI宣布下调GPT-5.6系列模型API价格:入门款Luna降价80%,每百万Token输入价格降至0.2美元(约合人民币1.35元)、输出降至1.2美元;Terra降价20%,输入降至2美元、输出降至12美元;旗舰款Sol价格不变,新增Fast模式,推理速度最高达标准模式2.5倍,价格为标准模式两倍,并取代此前的Priority Processing服务。OpenAI表示,降价源于GPT-5.6 Sol已参与优化自身生产系统——GPU Kernel优化使服务成本下降20%,推测解码优化使Token生成效率提升15%以上。降价后Luna单次任务成本约0.05美元,性价比超越DeepSeek V4 Pro等竞品。Sam Altman称希望每个模型层级都提供最优价格与智能比,此轮调整同步反映在Codex和ChatGPT Work的额度计算中。
马斯克公布Grok 4.6/4.7发布计划,Grok Voice Think Fast 2.0语音模型登场
大模型之家讯 7月29日,马斯克在X平台透露Grok 4.6将于8月7日发布,参数规模达1.5万亿,在监督微调和强化学习方面显著提升;几周后推出Grok 4.7,参数增至2.1万亿。同日,SpaceXAI发布Grok Voice Think Fast 2.0语音对语音AI模型,AA Speech-to-Speech质量指数达82.9%,在智能体测评中登顶,每分钟音频费用仅0.08美元,定价比OpenAI同类产品便宜约一半。
OpenAI部署GPT-5.6 Sol实现递归自优化,端到端服务成本降低20%
大模型之家讯 7月29日,OpenAI发布技术报告,披露使用GPT-5.6 Sol模型对自身系统实现递归式自我改进(RSI)。该模型被部署到真实生产环境中执行四项优化:分析线上流量识别负载失衡并测试路由策略;通过Codex自主改写Triton/Gluon GPU内核;优化推测性解码使token生成效率提升15%以上;自动搜索不同负载下的最优部署参数。叠加Agent Harness层减少循环重复工作,端到端服务成本最多降低20%。Triton之父Philippe Tillet为五名作者之一。