8月6日,字节跳动Seed宣布推出原生音视频全双工大模型SeedRealtime。
这款模型的核心突破在于——它不再只是“看”或“听”,而是同时“看、听、说”。
SeedRealtime用统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来 “边看、边听、边说” 的全新体验。这意味着AI可以同时处理你说话的声音、你展示的画面,以及你输入的文字,在同一个对话流里完成多模态理解与回应。
想象一下这个场景: 你拿着手机对着一个看不懂的零件,问“这是什么、怎么用”。SeedRealtime一边“看”零件的画面,一边“听”你的问题,一边“说”出答案。整个过程无缝、实时、自然。
这不是“多模态”,这是“全模态”。
多模态是AI能处理多种类型的输入,但通常是分开处理的——先看图片、再读文字、再听声音,然后拼在一起。全模态是AI在同一个“思维流”里同时处理所有信息,就像人类一样——看到、听到、理解、回应,一气呵成。
字节的这一步,踩在了AI交互演进的关键节点上。
从文本到图像,从语音到视频,AI的能力一直在扩展。但真正让AI从“工具”变成“伙伴”的,是全模态实时交互——你不用切换App、不用打字、不用等待,AI就在那里,看着你、听着你、回应你。
中银国际指出,近日DeepSeek、字节Seedance、MiniMax、月之暗面等国产大模型密集升级,随着国产模型竞争力不断提升、应用向企业生产流程持续渗透,国产算力全产业链景气逻辑持续强化。
SeedRealtime的发布,标志着AI交互正在从“分步式”走向“沉浸式”。 当你不再需要“唤醒”AI,而是AI随时在你身边“看着、听着、说着”——那个我们期待已久的“智能伙伴”,可能比想象中来得更快。
A5创业网 版权所有