13:55官方一手marktechpost@Michal Sutter精选字节跳动Seed团队发布SeedRealtime,一款原生音视频全双工大语言模型。该模型在统一架构中融合音频、视频与文本,可对连续多模态流进行实时交互,而非逐轮问答。官方宣称三项突破,包括联合音视频理解。Seed表示这是迈向全模态交互的一步。AI模型SeedRealtime字节跳动多模态3 个信源在谈事件专题推荐理由:SeedRealtime一个模型能看能听能说,实时双向对话不轮流,字节跳动Seed出品。原文稍后读已读值得跟进有用关注 SeedRealtime
17:42向阳乔木@vista876°字节跳动 SeedRealtime 原生音视频全双工大模型已随豆包 App 最新版全量上线。该模型支持持续视觉感知,用户说“看到错金银铜虎噬鹿屏座就提醒我”,逛展时镜头扫到展品会自动出声提醒。实测中,豆包能边看 YouTube 边回答画面中人物身份,还能解读一闪而过的图表。官方称下一步重点是降低延迟、更自然的节奏,以及多人复杂场景的稳定性。AI产品豆包SeedRealtime字节跳动推荐理由:豆包视频通话上新SeedRealtime,能看着画面主动提醒你找展品,看视频也能实时问答,更新App就能试。原文稍后读已读值得跟进有用关注 豆包
17:13向阳乔木@vista8SeedRealtime 将声音、画面、时序与表达纳入同一个模型,听、看、理解、推理、说话全在一个模型内完成。相比主流多模块级联(ASR 转文字、VLM 理解画面、TTS 合成语音)或依赖外置 VAD 的半双工逻辑,SeedRealtime 在连续音视频流上同步进行感知、理解、决策与表达。实测中,用户指着天龙功放按键问“这个怎么弄”,模型能结合画面、手势和视线方向判断指代。据称 OpenAI GPT Live 仍是音频全双工,SeedRealtime 做到了视频、音频、文本的全模态全双工。AI模型SeedRealtimeOpenAI GPT Live多模态10 个信源在谈事件专题推荐理由:SeedRealtime 一个模型同时搞定看和听,你指着东西问它“这个怎么弄”,它能结合手势秒懂,比 GPT Live 多了视频全双工。原文稍后读已读值得跟进有用关注 SeedRealtime
17:12向阳乔木@vista8豆包 App 的视频通话功能已全量上线,基于 SeedRealtime 原生音视频全双工大模型。实测中,豆包能识别 YouTube 视频中的人物并正确回答身份,还能解读一闪而过的图表内容。对话延迟低,语音自然,没有 GPT Live 的“老外腔”。用户更新到最新版后,点击“打电话”图标并开启摄像头即可使用。AI产品豆包SeedRealtimeGPT Live推荐理由:豆包 App 上线了视频通话,能边看视频边提问,认人、读图表都行,延迟低,比 GPT Live 更自然,不用内测直接玩。原文稍后读已读值得跟进有用关注 豆包
15:12小互@imxiaohu字节跳动推出原生音视频全双工模型SeedRealtime,对标OpenAI的GPT Live。该模型支持同时处理摄像头画面、语音输入和语音输出,实现实时视频对话。在四人聚餐场景中,模型能识别用户逐一介绍的人物,并在多人讨论中持续区分说话者身份。目前该能力已集成到豆包应用,用户可直接体验实时语音视频聊天。AI模型SeedRealtime字节跳动豆包10 个信源在谈事件专题推荐理由:字节发了SeedRealtime,能一边看你手机摄像头画面一边听你说话一边回你,豆包里直接用,跟GPT Live一个路子。原文稍后读已读值得跟进有用关注 SeedRealtime
12:14IT之家(博客/媒体)字节跳动 Seed 于 8 月 5 日发布原生音视频全双工大模型 SeedRealtime,用统一架构融合音频、视频与文本。SeedRealtime 支持边看、边听、边说,能结合画面消解同音词歧义,并在关键目标出现时主动提醒。端到端人工评测显示,相比级联模型,SeedRealtime 的音视频对话节奏问题减少了一半。目前 SeedRealtime 已在豆包 App 全量上线,更新后选择“打电话”即可体验视频通话。AI模型SeedRealtime字节跳动豆包1 个信源在谈事件专题推荐理由:字节跳动把SeedRealtime塞进豆包,打电话就能边看边聊,比级联模型卡壳少一半。原文稍后读已读值得跟进有用关注 SeedRealtime