9月1日
23:15
23:15官方一手歸藏(guizang.ai)@op7418
精选
Runway发布了Solaris模型,号称首个界面世界模型。该模型能逐帧实时生成交互界面,支持用户点击和拖动操作。用户可以拖动改变物体大小和位置,点击弹出UI选项变换样式。目前仍面临延迟、成本和一致性问题。

推荐理由:Runway的Solaris模型能实时生成可交互的界面视频,拖动树木、壁画等元素会实时变化,开创了视频模型新应用。
15:13
8月27日
10:24
10:24官方账号arXiv cs.AI@Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma, Mingbao Lin, Chunyan Miao, Shuicheng Yan
VoiceMem是一种简单的记忆架构,包含并行信息左脑、情感右脑和流式内存I/O机制。实验和实际部署显示,VoiceMem在准确性、情感与个性化以及实时与低成本方面具有优势。左脑在top-5检索中比Mem0等经典系统高出近30分;右脑在三个角色基准测试中达到最先进的性能,比之前最佳系统提高了4.29分;VoiceMem在134毫秒内完成检索,在标准VAD延迟内,不增加额外的对话延迟,同时保持高准确性和低成本。
推荐理由:VoiceMem提供了实时、个性化、情感感知的语音交互的实用记忆基础,在准确性、情感与个性化方面优于Mem0等经典系统,且检索速度快,成本较低,值得一看。
7月25日
13:11
13:11量子位@henry
Vivix推出首个实时互动模型,采用统一流式架构。单卡视频生成速度突破10000 video tokens/s。该模型打通实时多模态生成全链路,支持视频、图像、音频等模态的实时交互。相比传统非实时方案,延迟降低至毫秒级。
推荐理由:Vivix这个新模型单卡就能每秒生成上万视频token,做实时互动视频、多模态聊天特别带劲,比之前那些慢吞吞的方案强多了。
7月24日
02:50
02:50OpenRouter@OpenRouterAI
OpenRouter 上线了微软的 MAI-Voice-2-Flash 模型,相比前代 MAI-Voice-2 推理速度提升2倍。该模型支持15种语言,保持自然韵律和声学质量,并提供细粒度语调控制。专为响应式语音助手和实时交互场景设计。
推荐理由:需要更快更自然的语音合成?微软新模型速度快两倍,15种语言随意切换,适合搭实时语音Agent。
6月17日
23:31
23:31官方账号阿里云 Alibaba Cloud@alibaba_cloud
阿里Token Hub业务集团升级了HappyOyster 1.0,推出冒险(Adventure)与导演(Directing)两种新模式。新版本支持更丰富的环境交互、扩展玩家控制以及可回溯的剧情线,用于游戏、互动剧、直播和文旅场景。该模型由阿里云旗下ATH团队开发,旨在提升沉浸式体验。

推荐理由:阿里新出的HappyOyster 1.0,能让你在游戏和互动剧里回溯剧情、控制场景,比之前版本多了两种玩法模式。
6月12日
12:33
12:33官方账号Mira Murati (TML)@miramurati
Mira Murati 在X上发文强调,协作AI的核心在于实时交互,机器与人需跨所有模态协同工作。她指出解决这一挑战需要社区共同努力,并邀请大家加入。这反映了AI发展从单机智能向人机协作生态的转变,强调多模态实时交互的重要性。
推荐理由:关注人机协作未来的开发者,这条信息点明了AI的下一个关键方向——实时多模态交互,值得思考如何参与其中。
5月22日
5月13日
5月12日