10:28Google Gemini App@GeminiAppGoogle 宣布 Gemini Omni 现已面向所有 Google AI Plus、Pro 和 Ultra 订阅用户开放,支持网页版和 Gemini 应用。该功能提供了更强大的多模态交互能力,用户可以在对话中同时处理文本、图像和音频。此次开放标志着 Gemini 在多模态 AI 领域的重要进展,订阅用户可以直接体验。AI产品Gemini多模态订阅服务推荐理由:多模态交互是 AI 的下一个关键方向,Gemini Omni 让订阅用户能同时处理文本、图像和音频,做内容创作或数据分析的团队值得立即体验。原文稍后读已读值得跟进有用关注 Gemini
16:35官方一手marktechpost@Sana Hassan本文是一篇技术教程,详细介绍了如何使用 TuringEnterprises/Open-MM-RL 数据集构建完整的多模态强化学习与可验证奖励(RLVR)管线。教程涵盖数据集加载、模式检查、领域分析、问题长度与答案类型统计、图像分布可视化等预处理步骤。还构建了轻量级奖励函数,支持精确匹配与语义评分,并演示了 GRPO 导出流程。该管线为多模态推理任务提供了可复现的实践框架,适合研究者和开发者快速上手。论文多模态强化学习RLVR推荐理由:多模态 RLVR 是当前强化学习与视觉语言结合的热点方向,这篇教程从数据集到奖励函数再到导出一步到位,做多模态推理或 RL 研究的团队可以直接照着搭,省去自己踩坑的时间。原文稍后读已读值得跟进有用关注 多模态
11:49官方账号arXiv cs.AI@Junyuan Liu, Xinglei Wang, Zichao Zeng, Jiazhuang Feng, Quan Qin, Ilya Ilyankou, Guangsheng Dong, Tao Cheng精选城市表示学习将复杂城市环境编码为通用嵌入,但现有评估多局限于少数城市和任务,且随机划分导致空间泄漏,高估性能。CityRep 提出统一基准,包含空间单元无关的评估框架、基于区块的空间划分协议,以及覆盖 8 城市 8 任务的可扩展套件。评估 11 个模型发现,随机划分会扭曲性能排名,且模型表现因城市和任务差异显著。该基准提供数据集、评估管道和诊断工具,旨在推动城市表示学习的公平比较和泛化能力研究。论文城市表示学习基准测试空间划分推荐理由:城市表示学习领域终于有了一个靠谱的评估标准——CityRep 解决了空间泄漏和跨城市泛化评估的痛点,做城市计算或地理空间 AI 的研究者可以直接用这个基准来检验自己的模型,避免被随机划分的虚假高分误导。原文稍后读已读值得跟进有用关注 城市表示学习
20:56官方账号阿里云 Alibaba Cloud@alibaba_cloud在Qwen Conference 2026上,行业领袖和生态先驱在基础模型论坛中围绕“Qwen的多模态未来”展开圆桌讨论。他们探讨了驱动跨模态对齐的架构变革,并深入分析了AI原生趋势。会议旨在揭示多模态AI的最新进展和未来方向。活动详情可通过链接获取。行业多模态Qwen架构变革推荐理由:关注多模态AI架构演进的开发者,这场圆桌讨论能帮你理解跨模态对齐的核心技术趋势,值得一看。原文稍后读已读值得跟进有用关注 多模态
17:54AI Will@FinanceYF5精选OpenAI 发布 ChatGPT Images 2.0,但核心不是图像模型,而是将图像视为一种语言,融入主干而非附加功能。Altman 强调从 GPT-3 直接跨越到 GPT-5,官方博客以「图像是语言,不是装饰」开篇,表明战略转向。这意味着图像生成与理解将深度集成到对话中,改变用户与 AI 交互的方式。AI产品ChatGPT图像生成多模态7 个信源在谈事件专题推荐理由:OpenAI 把图像从附加功能提升为对话主干,做内容创作或产品设计的团队值得关注——这可能会改变你使用 AI 的方式。原文稍后读已读值得跟进有用关注 ChatGPT
17:53AI Will@FinanceYF5精选OpenAI 将图像输出定价为每百万 tokens 30 美元,与文字定价并列在同一价目表上。这标志着图像不再只是消费品,而是成为 agent 经济中的最小原语,和文字一样可编程调用、按字节计量、流式组合。这种定价模式意味着图像与文字在 AI 系统中被同等对待,开发者可以像调用文字一样调用图像,实现更灵活的 AI 应用。这一变化对构建多模态 agent 的团队影响深远。AI产品OpenAI图像定价agent 经济5 个信源在谈事件专题推荐理由:图像定价与文字统一,意味着多模态 agent 开发成本首次透明化,做 AI 应用和 agent 的团队值得关注这个定价信号。原文稍后读已读值得跟进有用关注 OpenAI
17:38Philipp Schmid@_philschmid精选谷歌Gemini 3.5 Flash在视频理解、图像和音频等多模态任务中表现优异,但目前关注度不高。作者Phil Schmid认为该模型的能力被严重低估。该模型支持多种输入模态,适合复杂的多模态推理场景。AI模型Gemini 3.5 Flash视频理解多模态推荐理由:谷歌的Gemini 3.5 Flash多模态能力被严重低估了原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
14:42官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云将于5月26日在新加坡金沙会展中心举办Agentic AI前沿峰会,汇聚行业先驱与远见者。会议将深入分析Agentic AI的核心基础设施及跨行业多模态工作流。该峰会旨在探讨AI代理技术的最新进展与行业应用,为参会者提供前沿洞察。活动详情可通过链接获取。行业阿里云Agentic AI多模态推荐理由:想了解Agentic AI最新趋势的开发者与行业决策者,这场峰会值得关注——阿里云将展示从底层基础设施到跨行业应用的全景图。原文稍后读已读值得跟进有用关注 阿里云
10:16官方一手Pandaily@contact@pandaily.com (Pandaily)精选字节跳动开源了原生多模态模型Lance,可在40GB显存上本地运行。该模型发布一天内登上了Hugging Face趋势榜。Lance支持图像、文本等多种模态的联合理解与生成。AI模型LanceByteDance多模态推荐理由:字节开源40GB可跑的多模态模型原文稍后读已读值得跟进有用关注 Lance
16:36官方账号阿里云 Alibaba Cloud@alibaba_cloud5月26日,Picsart视频产品主管Narek Hayrapetyan将在新加坡金沙会展中心分享多模态AI如何彻底改变视觉创作。活动由阿里云主办,聚焦AI在图像和视频生成中的实际应用。参与者可现场了解多模态模型如何提升创作效率。行业多模态视频生成大模型推荐理由:听Picsart高管讲多模态创作原文稍后读已读值得跟进有用关注 多模态
16:02官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里巴巴通义大模型业务部多模态交互负责人Steven Hoi教授将于5月26日在新加坡金沙会展中心发表主题演讲,探讨Agent时代的基础模型。该演讲聚焦于基础模型如何支撑智能体应用的发展。活动面向AI从业者和研究者开放注册。行业Agent大模型多模态推荐理由:阿里专家讲Agent时代基础模型原文稍后读已读值得跟进有用关注 Agent
02:16官方账号Logan Kilpatrick@OfficialLoganK精选Gemini 3.5 Flash 在 Roboflow 视觉评估中多项指标超越 3.1 Pro。其平均推理速度快约6倍,大幅降低延迟。该模型在多模态理解上展示出更强能力,尤其适合视觉密集型任务。AI模型Gemini 3.5 FlashGemini 3.1 ProGoogle推荐理由:谷歌新 Flash 视觉又快又准原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
01:48Ethan Mollick@emollick76°Ethan Mollick 指出,Gemini Omni 与其他视频 AI 的关键区别在于其完全多模态能力,可以原生编辑视频。他展示了将1896年经典电影《火车进站》中的火车改为子弹头列车、乐高风格,并添加时间旅行者、蜈蚣和布偶等元素。视频中甚至保留了反射效果,体现了 Gemini Omni 对视频内容的深度理解和编辑能力。这一演示凸显了 Gemini Omni 在视频生成和编辑领域的独特优势。AI产品Gemini Omni多模态视频编辑推荐理由:Gemini Omni 的原生视频编辑能力让创作者可以直接在视频中做复杂修改,做视频内容或 AI 应用的开发者值得关注,看看它如何理解并重构视频场景。原文稍后读已读值得跟进有用关注 Gemini Omni
15:16小互@imxiaohu精选网易有道今日开源 Confucius4 双模型,分别专注于数学视觉推理和语音克隆任务。不同于其他公司追求参数规模,有道更注重工程精度和落地成本。开源直接提供完整权重,而非仅开放 API,降低了开发者使用门槛。数学视觉推理模型可处理几何、图表等复杂视觉数学问题,语音克隆模型则能实现高保真声音复制。此举有望推动多模态和语音技术在教育和内容创作领域的实际应用。AI模型开源/仓库多模态语音克隆推荐理由:做教育 AI 或语音应用的开发者可以直接拿到完整权重,省去从零训练的成本,建议试试这两个模型的实际效果。原文稍后读已读值得跟进有用关注 开源/仓库
07:53AI Will@FinanceYF5Google 发布了名为 Gemini Omni 的新模型,能够从任意输入(如视频)生成任意内容。该模型首先支持视频输入,类似“Nano Banana”但针对视频场景。目前已在 Gemini App、Flow 和 YouTube 中可用,API 支持即将推出。这标志着多模态 AI 能力的重大扩展,让用户能更灵活地创作和交互。AI模型Gemini Omni多模态视频生成推荐理由:多模态 AI 又进一步——Gemini Omni 从视频直接生成内容,做视频创作或内容生产的团队值得关注,API 开放后可以直接集成到工作流中。原文稍后读已读值得跟进有用关注 Gemini Omni
15:14官方一手marktechpost@Asif Razzaq精选字节跳动智能创作实验室推出Lance,一个原生统一多模态模型,仅用3B激活参数即可处理图像与视频的理解、生成和编辑。Lance在图像理解基准MSCOCO上达到44.8的BLEU-4,在视频生成测试集UCF-101上取得FVD 159.3。该模型支持文本到图像、文本到视频、图像编辑、视频编辑等多种任务。Lance以Apache 2.0许可证开源,代码和权重已在GitHub发布。AI模型LanceByteDance多模态推荐理由:3B参数打通图视频理解生成原文稍后读已读值得跟进有用关注 Lance
08:01Google Gemini App@GeminiAppGoogle 宣布全球 AI Plus、Pro 和 Ultra 订阅用户现可在 Gemini 应用中试用 Gemini Omni 功能。该功能允许用户直接在应用内进行多模态交互和创作。Google 鼓励用户分享自己的创作成果。此举标志着 Google 在 AI 多模态能力上的进一步扩展,面向高级订阅用户开放。AI产品Gemini多模态订阅用户推荐理由:Google 将多模态 AI 能力直接集成到 Gemini 应用中,Plus/Pro/Ultra 订阅用户现在就能上手体验,做内容创作或 AI 实验的团队值得一试。原文稍后读已读值得跟进有用关注 Gemini
08:01Guillermo Rauch@rauchg72°Vercel 发布了 AI Gateway 的 WordPress 插件,让 WordPress 站点可以轻松接入多种 AI 模型。该插件支持文本、图像、视频和音频等多种模态,只需一个 API 密钥即可调用。由于 WordPress 占据全球约 42% 的网站,这一插件将极大降低 AI 功能的集成门槛,使大量网站能够快速获得 AI 能力。AI产品AI GatewayWordPressVercel推荐理由:WordPress 站长和开发者可以一键为网站接入多模态 AI,无需复杂配置,覆盖 42% 的网页生态,值得立即尝试。原文稍后读已读值得跟进有用关注 AI Gateway
08:00AI Will@FinanceYF5谷歌宣布将Gemini 3.5模型直接集成到搜索框中,支持图片、视频和文件等多模态输入,用户可以进行跨模态提问。同时,AI Overviews和AI Mode功能合并,提供更智能的搜索体验。这一变化标志着搜索从关键词、语义时代进入AI原生交互阶段,大幅降低用户获取信息的门槛。对于日常依赖搜索获取信息的用户和开发者来说,这是搜索体验的一次重大升级。AI产品谷歌Gemini 3.5AI搜索推荐理由:谷歌把最强AI直接塞进搜索框,做信息检索或内容研究的团队可以立刻体验跨模态提问,搜索效率会有质的提升。原文稍后读已读值得跟进有用关注 谷歌
08:00官方一手歸藏(guizang.ai)@op741872°谷歌在 I/O 大会上宣布将 Antigravit 整个生态整合进 Gemini,Gemini CLI 更名为 Antigravit CLI,并发布对应 SDK。Antigravit 2.0 版本更像 Codex,而非 Cursor。实测 Gemini 3.5 Flash 配合 Antigravit 在排版上表现不错,但权限审批繁琐、缺少内置浏览器等细节体验不足。整体仍处于早期阶段,适合基础任务。AI产品谷歌 I/OAntigravitGemini10 个信源在谈事件专题推荐理由:谷歌把 Antigravit 生态整合进 Gemini,做 AI 编程的开发者可以试试它的多模态排版能力,但别期待太复杂的自动化——权限和体验还差一截。原文稍后读已读值得跟进有用关注 谷歌 I/O
08:00小互@imxiaohu91°Google I/O 2026 开发者大会发布了三款 Gemini 模型:Gemini 3.5 Flash 升级为行动大脑,专注于自主决策与任务执行;Gemini Spark 定位为远端个人 AI 代理入口,强化跨设备协同;Gemini Omni 则是多模态世界模型的雏形,能理解并交互物理世界。这次发布标志着 Google 从单一对话模型向多智能体、多模态生态的全面转型,对开发者和 AI 应用场景有深远影响。AI产品Gemini多模态智能体推荐理由:Google 一口气推出三款定位清晰的模型,从行动大脑到世界模型雏形,做 AI 应用或智能体开发的团队值得关注,这可能是未来一年最值得跟进的生态方向。原文稍后读已读值得跟进有用关注 Gemini
08:00小互@imxiaohu一条推文将 Gemini Omni 形容为“视频版的香蕉”,暗示其具备强大的视频编辑与理解能力。作者认为它远不止视频编辑,而是世界模型的雏形,代表了通用 AGI 的初始形态。该推文引发了对 Gemini Omni 潜力的讨论,认为它可能推动 AI 从语言模型向多模态世界理解迈进。AI产品Gemini Omni世界模型AGI推荐理由:如果你关注多模态 AI 和 AGI 进展,这条推文点出了 Gemini Omni 可能超越视频编辑、成为世界模型雏形的关键判断,值得一看。原文稍后读已读值得跟进有用关注 Gemini Omni
08:00Google Gemini App@GeminiAppGoogle 宣布 Gemini Omni 即日起向所有 Google AI Plus、Pro 和 Ultra 订阅用户开放,可在 gemini.google 网站和移动应用中使用。该功能支持用户创建个性化头像,并鼓励在评论区分享作品。此举标志着 Google 在 AI 多模态交互上的进一步扩展,为付费用户提供了更丰富的创作工具。AI产品Gemini OmniGoogle AI头像生成推荐理由:Gemini Omni 让 Google AI 订阅用户有了新的创作玩法,做内容或社交媒体的团队可以试试用它生成头像,提升互动趣味。原文稍后读已读值得跟进有用关注 Gemini Omni
08:00Philipp Schmid@_philschmidGoogle 正式推出 Gemini 3.5 模型,并同步发布了开发者指南和 AI Studio 平台。开发者指南提供了详细的 API 文档和集成示例,帮助快速上手。AI Studio 则是一个在线实验环境,支持直接测试模型能力。这一更新意味着开发者可以更便捷地利用 Gemini 3.5 构建应用,尤其适合需要多模态理解或长上下文处理的场景。AI产品Gemini 3.5开发者指南AI Studio5 个信源在谈事件专题推荐理由:做 AI 应用开发的团队可以直接用 Gemini 3.5 的 API 和 AI Studio 快速验证想法,省去本地部署的麻烦,值得点开看看文档和示例。原文稍后读已读值得跟进有用关注 Gemini 3.5
08:00IT之家(博客/媒体)83°谷歌在 2026 I/O 开发者大会上宣布,Gemini 3.5 Pro 模型将于下月正式发布。目前该模型已在谷歌内部使用,官方称其进步非常强,但未透露具体细节。这一消息表明谷歌在 AI 模型迭代上持续加速,Gemini 3.5 Pro 有望在性能、多模态或推理能力上带来显著提升,值得开发者和 AI 从业者关注。AI模型Gemini 3.5 Pro谷歌推理模型1 个信源在谈事件专题推荐理由:谷歌 Gemini 系列模型迭代节奏加快,3.5 Pro 内部使用已获「进步超强」评价,做多模态或推理应用的开发者值得提前关注,下月发布后可直接上手体验。原文稍后读已读值得跟进有用关注 Gemini 3.5 Pro
08:00小互@imxiaohuGoogle 推出了全新的 Omni 模型,这是一个多模态 AI 模型,能够同时处理文本、图像、音频等多种输入。该模型在理解和生成跨模态内容方面表现出色,有望推动 AI 交互方式的革新。Omni 模型的出现标志着多模态 AI 技术的重要进展,为开发者提供了更强大的工具来构建更自然的用户界面。AI模型多模态OmniGoogle推荐理由:多模态模型是 AI 交互的下一个前沿,做跨模态应用的开发者可以直接关注 Omni 模型的能力边界,看看能否替代现有方案。原文稍后读已读值得跟进有用关注 多模态
08:00官方一手歸藏(guizang.ai)@op7418谷歌最新的视频模型 Gemini Omni 已开始向部分用户推送,标志着该模型从测试阶段进入更广泛可用阶段。Gemini Omni 支持多模态输入,包括视频、图像和文本,能够进行实时视频理解和交互。这一放量意味着更多开发者可以尝试其视频分析能力,如实时场景理解、物体识别和对话式交互。对于 AI 视频应用和实时多模态交互领域,这是一个重要进展。AI产品谷歌Gemini Omni视频模型推荐理由:做视频分析和多模态应用的开发者终于可以上手测试了——Gemini Omni 的实时视频理解能力可能改变视频交互方式,建议有相关需求的团队尽早体验。原文稍后读已读值得跟进有用关注 谷歌
03:22小互@imxiaohu精选Open Duck机器人搭载了谷歌的Gemma 4模型,实现了视觉识别和自然语言对话。在演示中,它能识别书桌、水杯等物体并描述场景。机器人还能通过语音与用户进行多轮问答。该方案展示了40亿参数模型在边缘设备上的实时推理能力。AI产品Gemma 4Open Duck机器人1 个信源在谈事件专题推荐理由:Gemma 4让机器人会看会聊原文稍后读已读值得跟进有用关注 Gemma 4
18:46官方账号阿里云 Alibaba Cloud@alibaba_cloud精选阿里云宣布将于2026年举办Qwen Conference,主题议程聚焦AI原生云、智能体原生云架构、推理未来和多模态视觉技术。会议承诺无冗余内容,直接提供面向全球规模的工程蓝图。该会议旨在展示阿里云在AI基础设施和智能体领域的最新进展,为开发者和企业提供可落地的技术方案。目前已开放注册。行业AI原生云智能体推理推荐理由:阿里云首次将AI原生云和智能体原生云架构作为核心议题,做云原生和AI基础设施的团队可以提前了解工程蓝图,建议关注注册。原文稍后读已读值得跟进有用关注 AI原生云
18:30berryxia@berryxia72°ZenMux 平台已上线 Gemini 3.5 Flash 模型,用户可免费体验。该模型在递归二叉树生长测试中,从输入提示词到生成完整 HTML 动画网页仅用 77.56 秒,效果自然优雅。Gemini 3.5 Flash 专为 Agent 设计,在 MCP Atlas、Toolathlon 等多项榜单排名第一,多模态能力超越上一代 Gemini 3.1 Pro。支持按量计费和 Builder 套餐,兼容主流 API 格式。AI产品Gemini 3.5 FlashZenMuxAgent推荐理由:AI 开发者可以零成本体验 Google 最新旗舰模型,77 秒生成动画网页展示了其极速推理和 Agent 能力,做创意编程或 Agent 应用的建议立即试用。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
15:14AI Will@FinanceYF583°Google AI 今日宣布推出全新智能搜索框,集成了其最先进的 Gemini 3.5 模型,带来更强的智能体能力。用户可以通过文本、图像、文件和视频等多种模态进行提问,搜索能够跨模态进行推理。该搜索体验将 AI Overviews 和 AI Mode 合并为统一的 AI 搜索体验,支持追问、构建上下文,并提供更个性化的回答。新功能已在全球桌面端和移动端上线。AI产品Gemini 3.5智能搜索多模态推荐理由:Google 将 Gemini 3.5 的智能体能力直接嵌入搜索,意味着日常搜索从关键词匹配升级为多模态推理助手。重度依赖搜索获取信息的用户、研究者和开发者,值得立刻体验这种能理解图片和视频的搜索方式。原文稍后读已读值得跟进有用关注 Gemini 3.5
14:35berryxia@berryxia72°ZenMux 平台已免费上线 Google 最新发布的 Gemini 3.5 Flash 模型,用户可直接体验。该模型在递归二叉树生长测试中,从输入提示词到生成完整 HTML 动画网页仅用 77.56 秒,效果惊艳。Gemini 3.5 Flash 专为 Agent 设计,在 MCP Atlas、Toolathlon 等多项榜单排名第一,多模态理解能力全面超越上一代 Gemini 3.1 Pro。平台支持零延迟首发,兼容主流 API 格式,并提供免费试用额度。AI产品Gemini 3.5 FlashZenMuxAgent推荐理由:Google I/O 刚发布就能免费白嫖,做 Agent 或动画生成的开发者可以立刻上手测试,77 秒出完整 HTML 动画的效率值得一试。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
13:09berryxia@berryxia83°Google DeepMind 推出了 Gemini 3.5 Flash 模型,在 Intelligence Index 上获得 55 分,比上一代 Gemini 3 Flash 高 9 分,超越 Grok 4.3 和 Claude Sonnet 4.6。Agentic 任务 Elo 评分达 1656,幻觉率从 92% 降至 61%,多模态理解 MMMU-Pro 达 84%,输出速度超 280 tokens/s,比前代快 70%。但成本大幅上升,运行一次测试的成本是 Gemini 3 Flash 的 5.5 倍,定价为 $1.5/$9 per 1M input/output tokens,是前代的 3 倍。这标志着智能与速度的 Pareto 前沿被刷新,但“Flash”系列的性价比优势不再。AI模型Gemini 3.5 FlashGoogle DeepMind推理模型推荐理由:Gemini 3.5 Flash 在智能和速度上实现了突破,做 AI 应用或 agent 开发的团队值得关注——性能提升显著,但预算敏感型项目需要重新评估成本。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash
09:28官方账号Google AI@GoogleAI72°Google 宣布推出全新智能搜索框,将 AI Overviews 和 AI Mode 合并为统一的 AI 搜索体验。该搜索框基于最先进的 Gemini 3.5 模型,支持文本、图像、文件和视频等多模态输入,并能跨模态进行推理。用户可提出后续问题、构建上下文,获得更个性化和精准的回复。新搜索体验已在全球桌面端和移动端上线。AI产品Gemini 3.5AI 搜索多模态推荐理由:Google 将 AI 搜索能力整合进一个统一入口,做搜索优化或内容运营的团队值得关注——这意味着用户行为和数据反馈将更集中,直接影响 SEO 策略和内容分发逻辑。原文稍后读已读值得跟进有用关注 Gemini 3.5
08:13berryxia@berryxia83°Google I/O 2026 主题演讲由 Sundar Pichai 主讲,聚焦「Agentic Gemini 时代」,强调 AI 从聊天机器人进化为能自主思考、执行任务、跨设备运行的「世界模型」。主要发布包括 Gemini 3.5 Flash(速度提升 4 倍,默认模型)、Gemini Omni 多模态世界模型(支持任意输入输出,理解物理世界)、Gemini Spark 全天候自主 Agent,以及 Android XR 智能眼镜预览。Google 将 AI 深度整合到 Search、Workspace、Gmail 等产品中,并推出开发者工具 Antigravity 2.0。整体策略务实,注重落地而非参数竞赛。行业Google I/OGemini智能体推荐理由:Google 把 AI 从聊天工具升级为操作系统级智能体,做开发、用搜索、搞创意的团队都能直接受益——Gemini 3.5 Flash 已可用,建议开发者立刻试试。原文稍后读已读值得跟进有用关注 Google I/O
07:26orange.ai@oran_ge83°Google 昨晚发布 Gemini flash 3.5 模型,现已可用。该模型在多项指标上大幅超越 3.1 Pro,与 GPT 5.5 接近,且在 Agentic 和多模态能力上更优。价格仅为 GPT 5.5 的三分之一,缓存价格六分之一,API 定价 $1.50/$9.00 每百万 token。上下文窗口达 1M token,速度是其他旗舰模型的 4 倍,非常适合 Agent 场景。AI模型Geminiflash 3.5推理模型推荐理由:做 Agent 和多模态应用的开发者终于有了性价比更高的选择——Gemini flash 3.5 速度是旗舰模型的 4 倍,价格却只有 GPT 5.5 的三分之一,建议直接试 API。原文稍后读已读值得跟进有用关注 Gemini
04:16官方账号Demis Hassabis@demishassabis精选Demis Hassabis 宣布 Gemini Omni 在多模态理解与编辑方面取得重大进展。该模型能处理照片、视频和音频输入,并构建全新场景。初期从视频开始,未来将支持任意输入与输出。用户可上传自己的视频并在其上迭代想法。AI模型Gemini Omni多模态视频编辑推荐理由:Gemini Omni能处理视频/音频/图片并构建新场景原文稍后读已读值得跟进有用关注 Gemini Omni
03:48官方一手Google Blog: AI(博客/媒体)72°Google 在 Search IO 2026 上宣布了搜索引擎与AI深度融合的新阶段,将传统搜索的精准性与AI的生成能力结合。新功能包括更智能的对话式搜索、多模态理解(图片、视频、文本混合查询)以及个性化结果生成。这一更新旨在提升用户获取信息的效率,同时保持搜索结果的可靠性。Google 强调,AI 不会取代搜索,而是增强其能力,让用户能更自然地探索复杂问题。AI产品AI搜索Google搜索引擎推荐理由:Google 把搜索引擎和AI生成能力真正打通了,做搜索优化或内容运营的团队值得关注——这可能会改变用户获取信息的方式,建议点开看看具体怎么落地。原文稍后读已读值得跟进有用关注 AI搜索
03:17官方账号Google AI@GoogleAI精选谷歌AI推出Gemini Omni,支持通过自然语言描述来编辑视频。用户只需说出想改变的内容,就能调整角色、场景和风格。该功能类似Nano Banana对图片的编辑方式,但应用于视频领域。AI产品GeminiOmniGoogle推荐理由:谷歌让你用语言改视频原文稍后读已读值得跟进有用关注 Gemini
03:17官方账号Google AI@GoogleAI精选GoogleAI 推出 Gemini Omni 模型,支持从文本、图像、音频等多种输入类型生成内容,初始阶段重点支持视频输入。该模型旨在实现“从任何输入创建任何输出”的目标,但官方未公布具体基准测试成绩或模型参数。推文通过 Twitter 线程形式解释其意义,引发社区关注。AI模型Gemini OmniGoogleAI多模态推荐理由:谷歌的万能创作模型来了原文稍后读已读值得跟进有用关注 Gemini Omni