来来来,说多模态路边一条,不是AGI的都来排队道歉(doge)。
在喊出“AGI时代来了”之后,你奥特曼叔叔搬出来的第一个东西,就是多模态!
刚刚,OpenAI发布新一代生图模型,ChatGPT Images 2.5,主打生成更快,细节更好,改图也终于越来越像“真·修图”了。
按照OpenAI的说法,这次升级可以先划四个重点:
-
生图更快,相比Images 2.0,生成延迟最多降低50%; -
画面更自然,参考照片里的人和物更容易保住原本的特征; -
连续修改多轮,前面改好的细节更容易保持一致; -
支持直接在图片上添加批注,告诉AI具体要改哪里。
除此之外,这次还有一个我觉得相当实用的新玩法——
直接拿草图当参考图。
这个东西非常适合一种情况:
脑子里大概知道自己想要什么构图,但一时半会儿又找不到合适的参考图。
现在可以直接在对话框里@Sketch,自己画。
只要用鼠标(或者随便什么)画一张草图,再补充你想要的风格和细节,GPT就会把它作为视觉参考,生成完整图片。
非常好用(就离谱)。
一如既往,对于懒人,OpenAI也准备了一套新的模板,直接套就完事了。
By the way,现在GPT终于支持看百分比的生成进度了,不用再问“在吗”看网断没断了!
重点补的是细节和“别乱动”
如果说上面这些是功能层面的变化,那么从这次技术博客来看,相比4个半月前发布的GPT Image 2,Images 2.5真正值得看的升级,还是生成质量和编辑稳定性本身。
Images 2.5并没有单纯继续往上堆输出分辨率,最高依然是3840px,但新增了xhigh和max质量档位,进一步提升细节、材质纹理、光照,以及参考主体的保真度。
比如官方这张Demo。
给小孩哥换了一身衣服之后,脸部基本没怎么漂,尤其是原图里卷发那种稍微有点毛躁的质感,保留得相当完整。
但你要硬说,这张给小狗换的还是有点没那么……完美。
主体确实改对了,但仔细看影子,后背轮廓似乎还是保留了原来的形状。
按理说,穿上衣服后,影子的后背也应该变平滑。
但像下面这种,把原始照片重新还原、放大,同时重新处理打光,效果还是挺惊艳的。
而相比单纯“把图画得更漂亮”,Images 2.5这次更重要的一个方向就是让修图改图变得更加可控。
官方展示了一组很典型的电商场景:不断给人物换衣服、换背景。
虽然有些图看起来还是稍微有点“AI塑料感”,但人物本身、场景关系和整体构图已经能比较稳定地保留下来。
(尤其可以看看Image 2和2.5在人物与物体比例上的变化。)
更进一步,ChatGPT现在还支持直接在图片上批注修改。
思路很像平时给设计稿提意见:
不用再写一大段“请把画面左上角第二个人脸上的墨镜换成黑框眼镜”,直接圈那个地方,写一句要求就行。
比如我在表情包生成界面里,直接在墨镜的位置批注“换成黑框眼镜”,点发送。
GPT就知道我说的是哪一个。
如果一张图里有很多人物、很多物体,这个功能尤其好用。
与此同时,模型本身的局部编辑能力也在增强。
官方有一组旅行票券的演示,很适合说明这个变化。
放到实际工作里,就很像做一整套不同城市的活动物料:
版式已经定了,需要替换的只是城市信息,但每做一版,你都希望继续沿用前面的设计。
这就牵出了Images 2.5另外一个重点——多轮编辑的一致性。
很多时候,对于设计工作者来说,一张图不可能一遍生成就结束。第一轮把主体生成出来,第二轮改排版,第三轮换文字,第四轮再抠一些细节。
以前经常改着改着就变成:这次这里终于对了,结果刚才已经对的地方又坏了。
OpenAI表示,在更长的对话中,Images 2.5可以更稳定地接着上一轮结果继续修改,同时保住已经确认好的内容和画质。
比如下面这种旅行攻略海报,文字、照片、路线、排版全挤在一张图里,修改时需要同时照顾的元素比单主体图片多得多。
现在可以先换目的地,再继续改单独的文字和细节。
不多说,这完全是设计福音来的,懂得都懂~
生图才是正经事儿
当然,除了编辑之外,Images 2.5对复杂画面、材质和风格指令的理解也一起升级了。
官方放了一大堆Demo。比如碎玻璃:
日杂封面:
还有《银翼杀手》式的科幻画面:
其他的咱就不多放了……
当然了,生图这玩意,本质上还是创造力工具。就像奥特曼说的,它又不是拿来做数学题的。
玩就完事了。
我自己也上手试了一下。
输入就一张马喽的照片,让它给我生成一组“马喽在世界各地旅游打卡”的照片。
GPT直接给我整了4张。
效果怎么说呢——这个马喽是真出息了。
网友们也是直接开玩。
有哥们直接拿它做起了定格动画。
还有人感叹细节已经离谱了。
不过我自己看下来,部分区域还是能感觉到一点熟悉的AI“涂抹感”。
也有人测试了手绘草图。
大方向确实能跟,但一些比例关系还是会出问题。
但材质和体积感的提升还是很明显。
比如下面这双鞋,皮革、鞋底、褶皱和立体感,相比以前确实更扎实了。
当然,也已经有网友给出不同反馈:
细节确实好了不少,但人物肢体反而偶尔更容易翻车。
所以到底是史诗级升级,还是熟悉的“这边补好了,那边又冒出新Bug”,大家实测下来也可以说说。
生成延迟最多减半,API一次上了两个版本
最后再说速度和价格。
对于一天要生几十上百张图的人来说,这次一个很实际的变化是:
Images 2.5生成延迟相比Images 2.0最多降低50%。
听着没有“画质炸裂”那么性感,但真到了反复改图的时候,少等一半其实相当重要。
尤其Images 2.5明显开始强调多轮编辑。
既然要你第一轮改内容、第二轮改版式、第三轮继续抠细节,那生成速度自然也得跟上。
面向开发者,OpenAI这次还同时发布了两个API模型。
一个是GPT-Image-2.5 Flare。
它更强调质量、编辑能力和速度之间的平衡,也是官方推荐的大多数应用默认使用的版本,适合社交内容、快速视觉原型和大批量生图等场景。
另一个是GPT-Image-2.5 Sunburst。
它瞄准的是更精细的创作和编辑需求,比如正式投放的广告素材、产品图片,以及对画质要求更高的视觉内容。
价格方面,Flare和Sunburst目前采用相同的token计费:
-
文本输入:5美元 / 百万tokens -
图像输入:8美元 / 百万tokens -
图像输出:30美元 / 百万tokens
所以整体看下来,Images 2.5这次跟2那种直接生成老照片质感的视觉冲击还差点意思?
(也可能是还没开发出来)
但它确实把生成模型开始真正进入生产流程之后,那些不多轮交互、定点修改的问题进一步清扫了一遍。
换句话说,过去大家用生图模型,多少还有点“抽卡”,现在直接定点p就完事了。
现在,x上的网友也已经玩疯了!
所以就说嘛,AI也不用都去做数学题。
