Iris-3B 发布:跳过 VAE 压缩、逐像素生成的开源图片模型
精选理由
一个不走 VAE 压缩、直接逐像素画图的开源模型,3B+4B 的组合不大,效果一般但架构挺新鲜,搞生成的可以看看。
常见的画图模型依赖 VAE 先压缩图像再解码还原,容易丢失细节或产生纹理失真。Iris-3B 跳过这一环节,直接逐像素生成完整画面,输入提示词后输出 1024 像素图片。该模型采用 3B 图片模型搭配 4B 文本模型的组合,并且开源。文章评价其生成效果不算出色,但架构思路新颖。
原文 · Gorden Sun
Iris-3B:没有VAE的图片生成模型
常见的画图 AI 通常先把图像压缩,再通过解码器还原,过程里容易丢失画面细节或产生纹理失真。Iris-3B 的特点在于直接生成画面上的每一个像素点,跳过了中间压缩还原的环节,输入文字提示词后直接输出 1024 像素的完整图片。
开源,3B图片模型+4B文本模型。效果不算特别好,但是架构很新颖。
模型:https://t.co/1fEoTDn5Ms
- AK10-08 23:06原文