#多模态
Gemini 3.6 Flash 写代码不卡壳了,还能读图表写报告,开发者可以马上在 Android Studio 里试。
Google 新出了 Gemini 3.6 Flash,专门强化了智能体和多模态,适合需要平衡速度和智商的任务;更有便宜的 3.5 Flash Lite 适合大规模调用。
Google DeepMind 刚发了两个新模型,3.6 Flash 和 3.5 Flash-Lite,现在就能在 GeminiApp 和 API 里用,还有一个安全版要试点,开发者可以试试
Google一口气出了两个新模型:3.6 Flash效率更高,3.5 Flash-Lite速度快还便宜,适合做AI智能体。
这篇论文搞了个新度量TPIPS,能按文字指令判断两张图在哪个方面像,比现有单标量打分更细。数据集和模型都开源了。
部署多模态模型时延迟高吞吐低?FlashRT 让智能体自动优化,实测延时降 70 倍,吞吐升 3.6 倍,AMD 平台效果尤其猛。
这篇论文提出了SIEVE,用智能体主动找几处关键证据就能判断视频真假,不用看完整个视频,效果更好还更透明。
一篇关于多模态机器人模仿学习的论文,提出LAG-Fusion解决不同传感器速率不同的异步融合问题,实验证明比同步融合更高效。
阿里发了Qwen-3.8 Max预览版,参数量2.4T,速度比Kimi-K3快一个数量级,限时一折,正式版很快开源,感兴趣可以试试。
字节新出的 Seed Audio 1.0 能精细控制声音时间线,还能跨 20 多种语言保持音色一致,音频可用率超 90%,做视频创作很实用。
想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。
这篇论文给VLM配了三种看图工具(表格、图表、放大),再用GRPO训练工具使用策略,比普通prompt和RL方法更准,适合处理科学图表验证。
这篇论文提出了HCIG和GCCN,在MMSD和MultiBully上分别达到85.74%和69.62%准确率,比传统融合方法更善于捕捉图文矛盾。
想用 AI 管理整个科研流程?SciForge 把论文、代码、数据整合成可追溯的工作状态,还帮你做基因发现和蛋白质设计,开源可玩。
阿里刚发的 HappyOyster 1.0,能根据一句话或一张图生成实时可探索的 3D 世界,还能像导演一样用文字操控剧情,支持 1 分钟以上互动,挺有新意的。
荣耀新系统AgenticOS,8月Robot Phone首发有机械云台,支持多智能体协同,试试看。
Think Machines的Inkling模型很特别,总参数975B但只激活41B,还有1M上下文和多种模态支持,值得上手试试。