9月3日
10:09
10:09官方账号arXiv cs.AI@Chuer Chen, Zichen Wang, Yi He, Zhengxi Yu, Nan Cao
精选73°
研究团队推出VMetaphor-Bench,这是首个评估文本到图像模型视觉隐喻生成的基准,包含1500个真实创意图像隐喻,分为3个级别和10个类别。研究采用混合评估框架,通过MLLM-as-judge范式,包含9594道多选题和3个感知维度的评分。对11个代表性T2I模型的评估显示,即使是专有模型在组合结构和跨域映射方面也存在困难。
推荐理由:研究人员发布了首个视觉隐喻生成基准,测试了11个模型,发现即使是最好的模型在隐喻表达方面也有明显不足。
8月26日
00:55
00:55Mustafa Suleyman@mustafasuleyman
72°
MAI-Image-2.6成为AA图像编辑最佳模型,占据3个前五名位置。微软AI最新模型,增强文本渲染、人像和3D图像,提供更精细的商业和真实图像输出。在文本到图像领域,MAI-Image-2.6在5个类别中排名第一,仅次于OpenAI的GPT Image 2。
事件专题

推荐理由:微软AI最新模型MAI-Image-2.6在AA图像编辑领域表现卓越,是图像编辑和文本到图像生成领域的佼佼者,值得一试。
6月23日
6月4日
03:00
03:00官方账号Decoder@Matthias Bastian
78°
Ideogram 发布了其文本到图像模型 4.0 版本,作为开源权重模型,支持原生 2K 分辨率、边界框控制和改进的文本渲染。在 DesignArena 排行榜上,它在所有开源模型中排名第一,仅落后于 OpenAI 和 Google 的闭源系统。商业使用需要付费许可。
事件专题

推荐理由:对于需要高质量图像生成且注重文本准确性的创作者和开发者,Ideogram 4.0 的开源权重版本提供了顶级性能,值得尝试。
5月13日