字节跳动发布音视频全双工大模型SeedRealtime

又是一件科技圈大事,大家怎么看?8月5日,字节跳动悄悄放了个大招——正式推出原生音视频全双工大模型SeedRealtime。这货不走寻常路,用统一架构原生融合了音频、视频和文本,能在连续的多模态信息流里实时交互,简单说就是让你“边看、边听、边说”,体验丝滑得像面对面聊天。端到端人工评测结果挺有意思:相比传统的级联模型,SeedRealtime在音视频对话节奏上的“bug”少了一半——模型对什么时候说话把握得更自然了,以前那种“话没说完被抢断”“话说完了半天没反应”“被背景杂音或闲聊误触发”的尴尬场面显著减少;同时,单次对话能完整、顺畅交流的概率也明显提升。目前,SeedRealtime已经在豆包App全量上线了,感兴趣的朋友可以去试试看。(广角观察)#大厂科技动态#

Previous:

Next: