大模型之家讯 8月5日,字节跳动Seed团队正式发布原生音视频全双工大模型SeedRealtime,采用统一架构原生融合音频、视频与文本,实现边看、边听、边说的实时交互体验。该模型具备三大核心能力:音视频联合理解(结合场景消解同音词歧义、理解视觉时序指代)、主动交互(察觉画面变化时主动提醒并调用工具)、流畅交互节奏(实时感知对话状态,抗干扰防误触发)。端到端人工评测显示,相比级联模型,SeedRealtime的音视频对话节奏问题减少一半,单次对话完整顺畅交流的概率明显提升。目前该模型已在豆包App全量上线,系业界率先实现音视频全双工技术规模化落地。