字节推出SeedRealtime大模型华尔街日报
向全模态自然交互阶段过渡。
8月5日,字节跳动正式推出原生音视频全双工大模型SeedRealtime,并宣布该模型已在豆包App全量上线。用户将豆包更新至最新版本后,可通过“打电话”功能进入视频通话界面,体验实时音视频AI交互。
SeedRealtime采用统一端到端架构,原生融合音频、视频与文本三种模态信号。
与此前业界主流的级联系统不同,后者依赖自动语音识别(ASR)、视觉模型、语音合成(TTS)等多个模块串联,感知、理解和表达分属不同环节,延迟层层叠加,SeedRealtime将声音、画面、时序与表达统一到同一个端到端模型中。模型不再依赖外部语音活动检测(VAD)进行轮次判断,而是在连续的多模态信息流上同步完成感知、理解、决策与表达。
字节方面披露,SeedRealtime在三个方向实现了关键突破。
首先是音视频联合理解。
模型原生支持声音、画面与时序信息的深度融合,能够结合场景消解同音词歧义,也能准确理解视觉中的时序指代。用户说“这个怎么弄”时,模型需要结合当前画面、手势与历史动作判断“这个”具体指向什么。
其次是主动交互能力。
模型具备持续的环境感知与主动表达能力,能在察觉画面状态变化时主动提醒,并能调用工具融入表达。官方演示中,模型可在博物馆持续观察镜头画面、识别指定文物后主动提醒,也可在用户操作咖啡机时根据画面变化实时纠错。
第三是流畅的交互节奏。
模型能够实时感知用户的对话状态,在适当时机自然接话、停顿与回应;同时具备抗干扰能力,能分辨旁人闲聊与背景噪声,避免误触发。在机场等嘈杂场景中,模型能够区分用户与旁人的对话。
字节披露的端到端人工评测数据显示,相比传统级联系统,SeedRealtime将音视频对话中的节奏问题减少约一半。“话未说完被抢断、话音已落却回应迟缓,或是被背景杂音与闲聊误触发”等卡壳现象均有明显下降。同时,单次对话能够完整、顺畅交流的概率也有明显提升。
从行业基本面来看,SeedRealtime的推出符合今年基础模型的演进趋势。自今年上半年以来,头部企业的竞争焦点已明显从单纯追求参数规模,转向多模态实时交互的商业化落地。
豆包App是字节跳动在C端市场的核心AI产品。此次在端内快速全量上线全双工大模型,其业务逻辑在于通过降低交互门槛,进一步争夺用户规模与应用内的停留时长。
不过,音视频全双工技术的常态化运营仍面临直接的工程与商业挑战。连续多模态信息流的实时处理,对云端算力和网络带宽的消耗呈指数级增长。
在C端海量并发请求的场景下,如何将模型的推理成本控制在商业可接受的范围内,是包括字节跳动在内所有AI研发企业必须跨越的门槛。
另一方面,市场对视频通话类AI的真实需求黏性仍需打个问号。主动提醒、实时视频交互等功能,在特定场景下是否会造成用户的体验冗余甚至打扰,目前尚无定论。
SeedRealtime能否在新鲜感褪去后,沉淀出具有高频、刚需属性的核心应用场景,多模态应用生态能否就此闭环,还需要后续真实的留存数据来验证。


