数码影音频道 频道

字节SeedRealtime上线:AI首次真正"边看边听边说"

“AI摘要”

字节跳动Seed团队发布原生音视频全双工模型SeedRealtime,已在豆包App全量上线,覆盖2亿日活用户。该模型将音频、视频和文本融合进统一架构,实现边看、边听、边说,无需外部语音检测,具备音视频联合理解、主动交互和流畅节奏三大核心能力,能结合画面理解语境、主动讲解纠错,并减少约一半对话节奏问题。相比四个月前的语音全双工模型Seeduplex,此次升级从“只听只说”迈向“边看边听边说”,在博物馆导览、咖啡机操作、论文阅读等场景落地。虽然Google、OpenAI、腾讯、阿里等也在推进全双工技术,但字节的差异化在于将能力直接嵌入高日活产品。未来需优化时延、主动决策、多人场景理解和工具调用。

8 月 5 日,字节跳动 Seed 团队发布原生音视频全双工大模型 SeedRealtime,已在豆包 App 全量上线。

这不是一次简单的功能更新。它把音频、视频和文本融进同一个端到端模型,让 AI 能在连续的信息流里同步完成感知、理解、决策和表达,做到边看、边听、边说。

豆包是这次落地的主要载体。截至 2026 年 6 月,豆包月活 3.82 亿,日活超过 2 亿。把一套实时音视频全双工模型直接铺到这个量级上,是业内第 一次。

全双工好不好用,看这三个能力

过去做 AI 视频通话,靠的是一串模块接力:先用语音识别(ASR)把声音转成文字,再交给视觉模型看画面,文本模型想清楚了,最后用语音合成(TTS)念出来。链路一长,延迟层层叠加,声音、画面、文字之间的细节也会在每次转换里损耗。

SeedRealtime 不再把感知和表达拆开,而是用统一架构把声音、画面、时序和表达压进一个模型。最直观的变化是,它不再依赖外部语音活动检测(VAD)来判断"现在轮到谁说话"。

卡住实时语音体验的,不是模型不够大,是它能不能在你说话时也同时在听,而这依赖于SeedRealtime的三个核心能力。

音视频联合理解。 模型把声音、画面和时间线深度融合。你指着屏幕说"这个怎么弄",它能结合当前画面、手势和历史动作,判断"这个"到底指什么。碰到"bank"这种同音词,它靠画面区分是银行还是河岸,而不是瞎猜。

主动交互。 模型会持续观察环境,并在状态变化时主动出声。官方演示里,它在博物馆盯着展品,认出指定文物后主动讲解;你在操作咖啡机,它根据画面变化实时纠错。交互从"你问我答"变成了"它也在盯着看"。

流畅节奏。 这是最能感知到的部分。模型实时感知你的对话状态,在合适的时候接话、停顿、回应,也能在嘈杂环境里分辨你是在和旁人闲聊,还是在对它说话。字节披露的端到端人工评测显示,相比级联系统,SeedRealtime 把音视频对话里的节奏问题减少了大约一半,抢话、回应迟滞、被杂音误触发这些卡壳都明显下降,单次对话能完整顺畅进行的概率也更高。

如何解决“在场感”

今年 4 月 9 日,字节先发了语音全双工模型 Seeduplex,同样在豆包全量上线。当时的 A/B 实验里,用户通话满意度绝 对值提升了 8.34%,误打断率减半,抢话比例下降 40%。

从 Seeduplex 到 SeedRealtime,字节只用了四个月,就从"只听只说"走到了"边看边听边说"。视频流的时序对齐比语音更难,分两步走,是先验证语音全双工跑得通、用户愿意用,再叠加视觉。

官方演示里,SeedRealtime 的用法已经铺到了不少日常情境。在博物馆,它持续盯着镜头画面,认出指定文物后主动开口讲解;你操作咖啡机时,它根据画面变化实时纠错;读论文时,它一直监测翻页过程,指定章节一出现就自动提示;对外国游客,它能实时把中文菜单和服务员介绍翻成能听懂的内容。

复杂环境里它更看重"该不该接话"。多人聚会时,它能分清不同人的身份,把发言对应到具体那个人;机场这类嘈杂场所,它能判断你是在和旁人闲聊还是在对它说话,不被背景噪声误触发;儿童学习场景里,它也能一直跟着互动,不被背景里的电话声带偏。

全双工很好,但还可以更好

全双工不是字节一家在做。Google 的 Gemini Live 同样是原生全双工端到端,但中文不是它的专项优化对象;OpenAI 的 GPT-4o、gpt-realtime 也早已支持实时语音。国内这边,腾讯走了开源路线,把 70 亿参数的 Covo-Audio 端到端语音模型开源,明说是 GPT-4o 语音能力的开源替代;阿里通义的 Qwen3-Omni 原生支持音视频输入输出,语音延迟压到了 211 毫秒;面壁的 MiniCPM-o 4.5 只用 9B 体量,就做到了语音、视频、文本的全模态同步交互;智谱的 GLM-4-Voice 也早就上了端到端语音。

路线看着不同,终点却一致:让人机对话无限逼近人和人之间的自然交流。字节的差别在于,它把这套能力直接塞进了 2 亿日活的产品里,而不是停在模型发布这一步。

发布时,字节提到后续会继续优化四个方向:端到端时延、主动感知与决策能力、多人复杂场景理解,以及工具调用能力。点名这四个方向,反过来说明它们今天还没完全解决好。时延、复杂场景、工具调用,每一个都是全双工从"演示能跑"走到"日常能用"要跨的坎。

0
相关文章