字节跳动推出全双工大模型SeedRealtime并上线豆包App

实现音频、视频与文本的统一架构实时交互 [6]。
此次升级重点解决了多模态交互中的延迟与节奏问题,结合近期特斯拉等车企的接入,豆包大模型正加速向消费级应用与智能座舱场景渗透[1] [6]。
原生音视频全双
工架构落地
SeedRealtime采用统一架构,原生融合音频、视频与文本,能够在连续多模态信息流上进行实时交互 [6]。端到端人工评测结果显示,与级联模型相比,该模型在音视频对话节奏问题上减少了一半[6


本文转载自:未知来源
原文链接:https://bot.taobao.com/tool-today_discovery/detail/b37038fbd814d5462caab3a8bc0ec584.html

本文由 XZ导师app 自动发布 | 发布时间:2026/8/17 13:42:21