7月10日
01:08
01:08The Rundown AI@therundownai
Reve 2.1 图像生成模型正式发布。在 Text-to-Image Arena 基准中,Reve 2.1 超越 Muse Image 升至第二名,仅次于 gpt-image-2。Reve 表示 2.1 的训练计算量不到竞争对手实验室的十分之一。该模型在排名上实现了反超。
事件专题

推荐理由:Reve 2.1 用不到十分之一的算力就拿到了图像生成第二,性价比拉满,值得看看。
7月9日
18:36
18:36orange.ai@oran_ge
BytePlus 宣布 Seedream 5.0 Pro API 正式可用。该模型专注于设计场景,支持精确编辑、复杂信息可视化、逼真渲染和跨语言图像生成。其画质对标 GPT image 2 级别,可生成企业级视觉素材。同时 ListenHub 和 Cola 正在接入中。
推荐理由:BytePlus 上线了 Seedream 5.0 Pro API,画质和 GPT image 2 看齐,设计场景功能超实用,做图搞创意可以试试。
05:12
7月8日
23:36
23:36官方一手歸藏(guizang.ai)@op7418
Seedream 5.0 的图像模型上线,作者测试了几张图,包括生成游戏截图、科普图、UI 设计稿和剧情介绍图。模型支持 2K 分辨率,比 GPT-4o 更高,但文字细节方面,多文字时仍存在模糊问题。整体进步明显,比之前的图像模型提升较大。

推荐理由:Seedream 5.0 图像模型刚上线,能生成 2K 分辨率图片,比 GPT-4o 清晰,但文字多时会糊。想试试新模型可以看看这些例子。
19:31
19:31官方账号Decoder@Maximilian Schreiner
71°
Meta旗下Superintelligence Labs推出首个图像生成模型Muse Image。该模型类似OpenAI的GPT Image 2,能通过代码执行和网页搜索等工具自主优化生成结果。其@-mention功能允许用户基于他人公开的Instagram照片生成图像,无需对方同意。这种opt-out模式可能违反GDPR和欧盟AI法案。技术亮点与隐私争议并存。
事件专题

推荐理由:Meta新出的Muse Image能像GPT Image 2一样调用工具自动改图,但争议点在于它能拿你Insta照片生成别人头像,隐私风险很大。
06:21
03:18
7月7日
16:39
16:39官方一手Pandaily@contact@pandaily.com (Pandaily)
智谱AI推出免费AI图像生成模型GLM-Image,可在image.z.ai直接使用。该模型支持中文文本渲染,在中文场景下表现优于Midjourney等国外工具。目前GLM-Image完全免费且无水印,用户可生成带有中文文字的图片。
事件专题

推荐理由:智谱AI出了个免费AI生图工具GLM-Image,写中文文字比Midjourney还强,而且没水印,直接用就行。
7月2日
00:34
7月1日
03:08
01:34
01:34官方账号Decoder@Matthias Bastian
Google发布两个新生成式AI模型:Nano Banana 2 Lite可在4秒内生成图像,每张成本0.034美元。Gemini Omni Flash首次通过API支持文本提示生成和编辑视频。Google建议将两个模型串联,从静态图像转换为动画视频。
事件专题

推荐理由:Google新出两个模型:一个4秒出图只要3分钱,另一个能文字生成视频,还能链着玩。
00:52
00:52官方账号Logan Kilpatrick@OfficialLoganK
精选
Google 发布两款新生成式媒体模型 Nano Banana 2 Lite 和 Gemini Omni Flash,集成在 Gemini API 和 AI Studio 中。Nano Banana 2 Lite 图像生成速度低于 4 秒,成本仅 $0.034/千张。Gemini Omni Flash 在视频编辑任务上达到 SOTA,定价 $0.10/秒,与 Veo 3.1 Fast 相同。两者均强调高效与低成本。
事件专题

推荐理由:Google 发了两款新模型:一个 4 秒出图、千张只要 3 分 4;另一个视频编辑达到 SOTA 且和 Veo 3.1 Fast 一样便宜。
6月29日
15:41
10:09
10:09官方账号arXiv cs.AI@Guanbo Huang, Jingjia Mao, Fanding Huang, Fengkai Liu, Xiangyang Luo, Yaoyuan Liang, Jiasheng Lu, Xiaoe Wang, Pei Liu, Ruiliu Fu, Ruqi Huang, Shao-Lun Huang
流匹配(Flow Matching)存在暴露偏差,现有缓解方法依赖静态约束。本文提出DEFAR框架,包含抗漂移修正(ADR)和频率补偿(FC)两个组件。ADR利用推理时漂移信号学习将偏离状态拉回目标方向,FC基于偏差自反馈权重增强缺失的低频成分。在CIFAR-10、CelebA-64、ImageNet-256/512上,DEFAR优于先前基线,且具有良好的可扩展性与推理鲁棒性。
推荐理由:这篇论文让模型靠偏差自己修正偏差,DEFAR在CIFAR和ImageNet上都能超过之前的方案,还更稳。
6月26日
10:47
10:47官方账号arXiv cs.LG@Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu, Tat-Seng Chua
针对文本到图像(T2I)、局部编辑和全局编辑等能力难以统一且相互冲突的问题,论文提出DanceOPD框架。该框架基于流匹配模型,采用策略生成场蒸馏,将每个样本路由至对应能力场,并查询低噪声的学生诱导状态,用速度MSE目标训练。在T2I、编辑、真实性场吸收和CFG吸收等实验上,DanceOPD改善了多能力组合效果,增强了目标能力同时保持基准生成质量。
推荐理由:这篇论文用DanceOPD把T2I、局部编辑和全局编辑统一到一个模型里,解决了相互干扰的问题,效果显著提升。