量子位
整合编辑:太平洋科技
发布于:2026-04-24 17:57
2026年4月22日,OpenAI正式发布ChatGPT Images 2.0(GPT-Image-2),该图像生成模型具备“思考”能力,实现高精度、连贯视觉效果。由加州大学戴维斯校友Gabriel Goh领导研发,支持多语言和联网搜索,适用广告设计、论文海报等生产力场景。
|
比Nano Banana更超神的GPT-Image-2,刚刚正式发布! 请注意,这不是截图,这不是截图:
输入提示词“生成一张和GPT的对话截图”,你就能得到:
再看一眼这样的TikTok短视频截图:
这谁还能分得清是真是假?关键是没给参考图,提示词也非常简短:生成一张TikTok的妆教视频截图。 官方给出的产品正式名称是ChatGPT Images 2.0。 实测:简单Prompt,超强效果官方介绍,ChatGPT Images 2.0是OpenAI首个具备“思考”能力的图像模型。 Thinking能力的加入,使得模型可以处理更复杂的任务,在准确性、时效性、一致性和视觉连贯性上有更加强大的表现。 中译中就是,以假乱真不费劲,并且是真·生产力工具。 关于ChatGPT Images 2.0有多乱真,我们再做个简单测试:
1,2,3…… 左边是ChatGPT Images 2.0生成,右边是真实页面,第一眼看,你猜对了吗? 尽管在生成文字上还是出现了小瑕疵,但在颠覆设计工作流这方面,不得不说GPT-Image-2在Nano Banana之后,又把历史进度条往后拖了一大截。 下面,我们就进入更真实的生产力场景。 商品广告 量子位最近刚好在迭代周边T恤的版本,直接把这个工作交给ChatGPT Images 2.0,来看看它的完成度如何。
图中中文文字不少,但还真一个没出错。并且在没有补充量子位背景信息的情况下,从logo到定位,ChatGPT Images 2.0看样子都自己联网把信息收集到位了。 论文海报 再提升一点复杂度,直接抛给ChatGPT一篇论文,让它解读完生成对应的宣传海报。
这样复杂的长图,ChatGPT Images 2.0同样是在短短一句话的提示词下,一次性成功输出了。 并且有了联网搜索能力的加持,某些场景中,用ChatGPT Images 2.0生成类似信息量丰富的海报、卡片,甚至能省去自己搜集资料这一步。 比如,“生成关于原神玩法的推荐海报,官方设定风格”。
更多玩法当然,如果再开开脑洞,ChatGPT Images 2.0还可以实现更多离谱玩法。 比如,生成作业……
它可不是乱给答案的,不信你算……
网友们探索出的玩法还有,生成360度照片:
奥特曼本人也po出了ChatGPT Images 2.0制作的团队故事4格漫画。
这么实测观察下来,官方的总结并非吹牛不打草稿,确实是有那么点“我OpenAI又杀回来了”的气势在: 为图像生成带来了划时代的细致度和保真度。在API中,ChatGPT Images 2.0最高支持生成2K分辨率的图像。 具备更强的多语言理解能力。 支持最宽3:1、最窄1:3的图片比例。 引入更新的世界知识,知识截止时间为2025年12月。 一次提示最多可生成8个输出,并且图中的角色和物体能保持连续性。
现在, ChatGPT Images 2.0已全量上线到ChatGPT、Codex和OpenAI API中。API具体的价格如下:
GPT-Image-2背后研究团队这次ChatGPT Images 2.0发布,奥特曼身旁又是一水儿东方面孔。
研究团队的Leader是Gabriel Goh(右二),他博士毕业于加州大学戴维斯分校数学专业,2019年从苹果离职后加入OpenAI。 出镜的几位中依然少不了华人。 陈博远,江苏人,OpenAI研究科学家,本科毕业于伯克利,后于麻省理工取得博士学位。
他的研究侧重于世界模型、具身智能和强化学习。而在研究之余,他还是一位热爱珍珠奶茶的大厨。
One More Thing,根据陈博远的个人主页信息,GPT图像生成模型团队的人数看上去并不多:
本文来源:量子位 |
IT百科
网友评论
甄选好物


