📱 豆包上线原生音视频全双工模型,实时对话不再靠模块接力

📱 豆包上线原生音视频全双工模型,实时对话不再靠模块接力

字节跳动 8 月 5 日发布原生音视频全双工大模型 SeedRealtime。该模型以统一架构融合音频、视频与文本,支持在连续多模态信息流上实时交互,具备音视频联合理解、主动环境感知与流畅对话节奏三项核心能力。端到端人工评测显示,其音视频对话节奏问题较级联模型减少一半,"话未说完被抢断"等卡壳现象显著减少。目前该模型已在豆包 App 全量上线。

不同于传统级联系统依赖 ASR、VLM、TTS 多模块串联造成的延迟与信息损耗,SeedRealtime 将感知、理解、决策与表达纳入同一端到端模型同步进行,无需外置 VAD 判断轮次,可实现"边看、边听、边说"的全双工自然交互。

字节跳动 Seed

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    暂无评论内容

免责声明:

本站所有内容和资源均来自网络,仅供用户交流、学习与研究使用。版权归原版权方所有,本站不承担任何版权争议责任。

用户下载后不得用于商业或非法用途,需在24小时内从电脑中删除,否则责任自负。

访问和下载文件即表示您同意仅将其用于参考和学习,其他用途后果自负。

如您喜欢该程序,请支持正版软件,购买注册以获得更好的服务。

本站为非营利性个人网站,所有软件信息来自网络,仅供学习和研究参考,无商业用途。会员捐赠仅用于支持服务器的维护,完全自愿。