Google 发了两款新模型:一个 4 秒出图、千张只要 3 分 4;另一个视频编辑达到 SOTA 且和 Veo 3.1 Fast 一样便宜。
全部动态
Google 上线了 Interactions API,一个 API 就能调用 Gemini 模型和智能体,还有沙箱、图像音乐生成,异步运行很简单。
这份指南把 Gemini 从基础调用到自主智能体的路径讲清楚了,做 AI 应用开发的团队可以直接照着 11 步上手,省去自己摸索的时间。
Google 一周内连发 6 项更新,覆盖企业智能体、科学推理、端侧模型和创意工具,做 AI 应用开发或科学研究的团队值得逐一了解,尤其是 Co-Scientist 和 Gemma 4 12B 的离线能力值得一试。
做设计、营销或内容创作的团队终于有了开源可部署的高质量生图模型——Ideogram 4.0 的文字绘制和布局控制能力直接对标商用产品,建议下载权重试试。
图像生成赛道竞争白热化,Ideogram 4.0 直接对标 Midjourney v8 和 FLUX,做 AI 绘画的团队值得关注这份横向评测,看看新模型是否值得切换。
文生图竞技场排名大洗牌,做 AI 图像生成或内容创作的团队值得关注——Reve 2.0 的 4K 精度和布局控制能力可能改变高质量图像生成的标准,建议点开看看它如何超越 GPT-Image。
开源图像生成模型终于追上闭源水平了,做 AI 绘画应用或自建图像生成管线的开发者可以直接下载权重和微调,值得试试。
图像编辑模型竞争白热化,微软 MAI-Image-2.5 已超越 Google,做 AI 图像生成或编辑的开发者可以关注这个新选择,看看它和 GPT-Image-2 的差距在哪。
Runway API 把多个热门生成模型整合到一起,做 AI 应用集成的开发者不用再四处对接不同 API,直接在一个地方调用 Seedance 2.0 和 GPT Image 2 等模型,值得试试。
做营销素材和电商设计的团队可以关注——MAI-Image-2.5 的文本渲染能力直接对标谷歌,生成带字海报和产品图更靠谱,值得在内部测试中对比一下。
苹果终于要解决 AI 图像生成画质拉胯的问题了,用 iPhone 做创意设计的用户今年可以期待 Genmoji 和 Image Playground 的质变,建议关注 iOS 27 的更新细节。
做广告投放或内容创作的团队,现在可以让 Manus 智能体直接调用顶级图像/视频模型生成广告素材,省去手动切换工具的麻烦,建议试试这个自动化工作流。
多模态 AI 又进一步——Gemini Omni 从视频直接生成内容,做视频创作或内容生产的团队值得关注,API 开放后可以直接集成到工作流中。
想了解 Google 对 AI 未来的真实战略,而不是产品参数?Pichai 的访谈直接给出了 Omni 和 Spark 的定位,做 AI 产品规划或关注巨头动向的读者值得一看。
多模态生成从文本扩展到视频,做内容创作或视频开发的团队可以直接在 Gemini App 和 YouTube 中体验,建议第一时间试用。
谷歌把办公套件全面语音化,Gmail Live 和 Docs Live 让日常邮件检索和文档起草效率大幅提升,经常处理大量邮件和文档的办公人员可以直接用语音完成操作,值得一试。
做图像生成和编辑的开发者终于有了一个能打的开源模型——HiDream-O1-Image 在多数场景下可替代闭源方案,8B 版本性能媲美 Nano Banana,建议直接上手试试。
此次更新覆盖健康、编程、搜索、文档协作和智能电视等多个场景,显示Google正在将AI能力系统化整合至其生态产品矩阵,对开发者生态和终端用户体验均产生实质影响。