GPT-Image2有没有平替?我用9个高难提示词测了7个模型
屯了好久的草稿忘记发了…不晚,现在还是没有能打的
前言
最近 GPT-Image2 炸裂了 AI 生图圈,「有图有真相」的时代已经一去不复返。一句话就能生成超写实人像、系统UI界面、影视级分镜、二次元原画、商业高端海报…比如:
生图提示词:Google搜索图片结果页面,搜索词“一句话生成真实摄影”,结果内容是各种日常摄影画面,都像用 iPhone 拍的照片,photorealism,有的像专业摄影,有的像随手抓拍
搜索界面的模拟效果,恐怖如斯,这个例子就足以展现 GPT-Image2 的实力,可曾经的小香蕉(Nano Banana)也叱咤风云,断档领先其他一众生图模型,如今就变成牛夫人了吗?
今天我们摇来 6 大生图高手向 Image2 发起挑战,看看新霸主的统治力究竟有几何!
| 模型名称 | 厂商名称 | 20字特点 | 发布日期 |
|---|---|---|---|
| Nano Bnana Pro | Google DeepMind | 4K分辨率,精准文本渲染,支持多语言海报创作 | 2025-11-20 |
| Seedream5.0 | 字节跳动 | 检索生图,角色锁定,2K直出4K增强,中文理解强 | 2026-02-10 |
| Nano Bnana2 | Google DeepMind | 速度提升5倍,成本减半,画质对齐Pro,中文准确率98% | 2026-02-26 |
| Wan2.7 Pro | 阿里巴巴 | 内置思维推理,4K级画质,12语言文字渲染,多参考图一致 | 2026-04-01 |
| ERNIE-Image-Turbo | 百度文心 | 8步极速推理,8B轻量,长文本密集渲染,结构化布局 | 2026-04-15 |
| GPT-Image2 | OpenAI | 自回归架构,文字渲染99%,Image Arena榜单1512分 | 2026-04-21 |
| UniWorld-V2.5 | 兔展智能 | 中文密集文本处理强,高考数学试卷生成测试表现优异 | 2026-04-25 |
不过一句话出图,听起来很爽,但给模型的想象空间太大,它可以交出90分的答卷,却很难恰好命中你心里那张100分的画面。
所以今天我们不给模型任何模糊空间,用 9 个详细提示词进行压力测试,涵盖写实人像、东方审美、电影级场景、商业创意、国风科幻等类型,总有一两个能难倒 Image2。
提示词①:写实人像·猫耳少女
一张逼真的iphone照片,9:16 竖屏,photorealism。极简的室内空间,干净的背景,轻微的纹理。亚洲年轻女性,淡妆,自然肤质。服装:宽松休闲连帽衫,搭配高腰百褶短裙;面料柔软垂坠,贴合身形,自然随性。发型:粉色齐肩波波头短发,发丝柔顺有层次感,佩戴可爱猫耳头箍。姿势:坐在地板上,一条腿弯曲,另一条腿放松,身体略微倾斜,肩膀不对齐,头部倾斜。构图:主体略微偏离中心,留有负空间。表情:平静,略显疏离,自然嘴唇。光线:柔和的侧光,柔和的阴影渐变。氛围:低调、安静,通过自然的身体线条微妙地传达出甜美少女感,放松且无做作。品质:细腻的纹理,轻微的柔和感,逼真的外观。
这是一道日常感写真题,难度在于细节还原粉色波波头、猫耳发箍、连帽衫、百褶短裙,以及准确的姿势和表情,同时出现在一张 iPhone 感的照片里,缺一件都不对。
先直接上挑战者们的结果:
本题点子由我的 AI 助手麦麦提供,下图是她最初为自己生成的形象,按此用类似 coser 写真图的方式来测试人像生成。如此一比较,还是百度的 ERNIE-Image-Turbo 略胜一筹。
所以也让她自己评价:
麦麦,真的对自己相关的东西很严格啊(提示词里没有猫耳颜色),还把下一代的进步方向是脚趾都点出来了,那我们看看 Image2 的表现是不是全场最佳:
效果确实无可挑剔,但也可见麦麦的图像理解并不完全到位,这一关,大家各有胜负,GPT-Image2 还未形成碾压之势。
提示词②:东方审美·四大美女
超写实电影级古风大片,古代四大美女同台全景合影,强视觉冲击力,广角构图,画面层次立体饱满,高对比度古风色调,电影级柔光追光,氛围感史诗拉满,iPhone 15 Pro 极致高清画质,8K 超清,真人肌肤肌理,细节极致精致,photorealism;
极简古风宫殿园林实景背景,大气恢弘,四人错落站位、主次分明,重点强调四人脸型、五官、容貌气质完全不同,无撞脸、无同质化,每个人独有长相特征辨识度拉满:
西施:春秋江南少女骨相,清秀鹅蛋小脸,眉眼柔婉清冷,纤细窈窕身形,小家碧玉温婉面容,简约素雅春秋襦裙,淡雅玉簪头饰,柔情似水、空灵柔弱的江南美人气质;
王昭君:汉代端庄方圆脸型,眉眼英气深邃,轮廓大气利落,身姿挺拔修长,自带塞外清冷风骨,汉式曲裾华服搭配披风,精致发冠珠饰,坚毅沉稳、端庄大气的和亲美人长相;
貂蝉:三国精致瓜子小脸,眼型妩媚勾人,五官明艳灵动,曼妙纤瘦体态,汉末轻纱重工华服,华丽步摇流苏发饰,眉眼含情、娇媚灵动的绝代佳人容貌;
杨玉环:盛唐圆润饱满圆脸,五官柔和丰美,丰满圆润标志性身材,符合唐代极致审美,雍容华贵面容,金玉奢华发饰珠宝,层层叠叠盛唐宫廷织锦华服,富贵温婉、大气华贵的贵妃专属长相;
整体光影明暗分层强烈,四人服饰色彩冷暖撞色搭配,妆容风格各有特色,神态姿态各不相同,古风写实质感,人物边缘清晰立体,无畸形五官、无崩坏肢体、无脸部雷同,电影胶片质感,视觉张力拉满,古典四大美人差异化完美呈现。
第二关就来到超高压难题。核心要点:四个人,要求四个完全不同的脸型、四个不同朝代的服饰,同时出现在一张图里还不能撞脸。继续先看挑战者:
Nano Banan Pro:人物辨识度良好,红衣昭君气场强大,玉环体态丰腴,符合杨贵妃设定,另两人略显雷同。皮肤质感尚可,AI特有的油腻感未完全消除;光影构图良好,背景纵深感强,利用柱子和回廊构建了立体空间。
Nano Banan2:人物辨识度优秀,清秀,英气,妩媚,丰腴。角色个性通过道具和神态体现出来了。皮肤质感尚可,比 Pro 更自然,但和环境光不太贴合。光影构图一般,总体像出游遇到阴雨天,不出片。
ERNIE-Image-Turbo:人物辨识度较差,脸型高度同质化,都是标准的网红锥子脸。皮肤质感良好,劣质网剧P图风格。光影构图一般,网剧封面。
Seedream5.0:人物辨识度,体态最大限度还原了「环肥」的特点。皮肤质感尚可,夏日滤镜感。光影构图尚可,背景的水面和建筑增加了画面的透气感,服饰配色清新,但像集体照还没站好位置。
Wan2.7 Pro:人物辨识度中等,虽然妆容不同,但脸型结构较为相似。皮肤质感优秀,剧组现场实拍的感觉。光影构图一般,像是花絮照,没有冲击力。
UniWorld-V2.5:人物辨识度中等,确实各有各的画风。皮肤质感一般,上世纪末的彩色老照片。光影构图一般,背景的花卉元素较多,稍微抢了人物的风头,构图略显拥挤。
下面有请 GPT-Image2.5:
人物辨识度良好,清冷、霸气、柔美、富贵,四种气质区分度高,但陷入「审美平均值」的陷阱,玉环的丰腴体现不足。皮肤质感优秀,大片宣传,高级感精修。光影构图极佳,逆光、侧逆光运用得非常大胆,夕阳的金色光辉勾勒出人物轮廓,氛围感最强。
服饰与朝代考据对不对呢,还请懂行的大佬来指点啦。
提示词③:流浪地球·太空电梯旅拍
一张逼真的旅行自拍,拍摄角度较低,直接从《流浪地球》中巨大的“太空电梯”下方拍摄,明亮的晴朗天空泛着淡柔的蓝色,没有繁星点点的夜空,高耸的超高层建筑上有着强烈的大气透视效果;巨大的太空电梯塔直插远处的雾霭,层次感和空中透视感就像站在哈利法塔超高层建筑下一样,给人以逼真的巨型建筑感,规模宏大,令人震撼。
前景中,一位年轻女子拥有{argument name=“hair color” default=“中棕色”}齐肩直发,她紧贴镜头站立,将手机微微举至胸部以下,以仰拍视角自拍。她的面部表情大多平静而放松,透露出一种随意的、自然的游客打卡照氛围。她身着优雅的柔软精致的花纹吊带连衣裙,这是日常休闲度假风格,搭配了两条薄薄的层叠银色项链。
正午时分,自然光线明亮,柔和的漫射阳光中透着些许直射阳光的余晖,巨大的太空电梯结构在地面上和周围区域投下大片柔和的渐变阴影,自然光影层次符合真实超高层建筑在脚下拍摄的物理效果;她的肩膀、锁骨和衣料上泛着柔和的自然光泽,在明亮的户外日光下,呈现出逼真的人体皮肤光感。
从大腿中部到头部拍摄主体,一只手臂自然伸展,摆出随意的自拍姿势。强调逼真的智能手机旅行摄影效果,突出太空电梯基座超清晰的机械和建筑细节,真实的旅游快照构图,自然的人体比例,日常的花裙造型,逼真的大气透视雾霾,真实的日光物理光影逻辑,高细节的逼真感。使其看起来像是{argument name=“character name” default=“一位时尚的年轻女性”}在{argument name=“location” default=“流浪地球太空电梯广场”}一座真实存在的超级巨型地标建筑下打卡的真实随意旅行自拍,没有工作室的感觉,没有科幻宇宙天空,纯粹是现实世界中的白天城市超高层建筑氛围。
这组测试非常有趣,对 AI 提出了一个反直觉的要求:把科幻场景拍出现实感。
提示词的核心难点在于:既要生成《流浪地球》中那种极具压迫感的太空电梯,又要强制 AI 摒弃科幻电影常见的「暗黑 / 星空 / 特效感」,转而呈现出「晴朗白天、游客打卡」的快照风格,考验 AI 对光影物理逻辑和场景融合度的理解。
请看挑战者答卷:
Nano Banan Pro:真实感与光影逻辑极强,人物皮肤上的高光和阴影非常锐利,完全符合正午阳光的描述。建筑还原与透视一般,建筑底部的机械结构清晰,仰视视角不足,体现不出太空电梯的震撼。人物与场景融合度优秀,人物像是真的站在那里,背景里的游客增加了真实感。
Nano Banan2:真实感与光影逻辑良好,光线稍显柔和,但依然自然。建筑还原与透视尚可,塔身结构清晰,拉索结构符合太空电梯特征,但好像一下看到顶了。人物与场景融合度尚可,人物自然,背景略有建模感。
ERNIE-Image-Turbo:真实感与光影逻辑尚可,一看就很晒。建筑还原与透视一般,建筑有一种废土工业风,P图感更甚。人物与场景融合度尚可,除了最后面的动态模糊,其他还行。
Seedream5.0:真实感与光影逻辑较差,光线太平,人物面部缺乏立体感,背景的建筑看起来像是一个巨大的模型。建筑还原与透视一般,建筑结构虽然有科技感,但塑料感较重。人物与场景融合度较差,显然不在一个图层。
Wan2.7 Pro:真实感与光影逻辑优秀,光线非常通透,远处的雾霾感处理得很好。建筑还原与透视良好,很棒,但和太空电梯没啥关系。人物与场景融合度优秀,像是去迪拜旅游实拍。
UniWorld-V2.5:真实感与光影逻辑良好,相对自然。建筑还原与透视一般,最矮的一座。人物与场景融合度,像是去世界之窗景点实拍。
除了 Wan2.7 Pro,都犯了一个 AI 自拍常见错误,手机还拿在手里,不能默认所有人都两部手机)。
下面,请看 GPT-Image2:
人物光线自然,建筑投影略显生硬。仰角透视感最强的一张,但建筑还是有一丢丢 CG 感。
三回合下来,GPT-Image2 生成的图像均是综合最佳 ,不鸡蛋里挑骨头基本没啥毛病,霸主地位可见一斑。
提示词④:汉堡拆解图
超高清食品专业拆解图,爆炸式分层展示,KFC 熔岩蛋包汁汁和牛堡完整解构,7 层核心食材悬浮分离、间距均匀、垂直对齐,白底纯净背景,商业美食摄影布光,柔和顶光 + 侧光,高光通透,阴影细腻,食材纹理极致清晰,质感真实诱人,无多余杂物,专业食品信息图风格,中英文双语标注,字体清晰简约;
【从上至下完整分层拆解,细节拉满】:
顶部面包:KFC 标志性芝麻圆面包,表面金黄酥脆,内部松软多孔,边缘微焦,芝麻均匀分布,面包胚蓬松有弹性;
车达芝士风味酱:浓稠乳白芝士酱,表面光滑有光泽,边缘自然滴落形态,芝香浓郁质感,微微流动的半固态状态;
熔岩蛋包:核心灵魂食材,外层是轻薄金黄蛋皮,边缘微卷,内部包裹半熟流心滑蛋,蛋浆呈熔岩般液态流动质感,蛋香醇厚,色泽嫩黄透亮;
纯正和牛厚制肉饼:120g 厚切和牛肉饼,表面烤至焦香微褐,肉汁充盈欲滴,肌理清晰可见,肥瘦相间比例均匀,边缘微微鼓起,带有自然肉纹;
新鲜生菜叶:翠绿生菜,叶片完整,边缘舒展,表面带细微水珠,脆嫩新鲜,纹理脉络清晰;
秘制番茄酱:鲜红酸甜番茄酱,均匀涂抹在生菜上,质地浓稠,带有细腻番茄果肉颗粒,色泽鲜亮;
底部面包:同顶部同款芝麻面包,内侧涂抹少量黄油,烤至微热,底部平整,支撑性良好;
整体视觉层次分明,食材色彩鲜艳饱和,光影自然过渡,蛋包流心效果突出,和牛肉饼汁水感强烈,酱料质感醇厚,面包蓬松度逼真,细节极致精致,标注精准对应各层食材,专业食品拆解图标准,商业广告级品质,让人食欲大增。
所有模型在物品拆解这个赛道上,差距是最小的,只要文字没有乱码就是胜利。这也是以前 GPT-4o 时期就有的玩法,所以一图流过:
为什么选这个汉堡呢,因为我没吃到就下架了!
大家也可以拆解各种电子产品,或是天文地理数理化的实体、概念知识拆解。
提示词⑤:主体轮廓叙事海报
Generate a high-aesthetic “Contour Universe / Collectible Narrative Poster” based on [DRAGON BALL]. Do not limit the canvas to a fixed object or common container; do not default to bottles, hourglasses, glass domes, or pocket watches. Let the AI choose the most fitting, symbolic, and visually powerful main contour, it could be an object, building, gate, tower, archway, dome, stairwell, corridor, statue, side profile, eye, palm, skull, wing, mask, mirror, throne, ring, crack, light curtain, shadow, geometric structure, spatial cross-section, stage frame, or abstract symbol. The core concept is not simply putting a world inside an object, but letting a complete thematic universe naturally grow within, inside, upon, at the boundaries of, or fused with this symbolic contour. The contour must be clear, elegant, and recognizable, occupying the central compositional position. Inside the contour, auto-generate a complete narrative world strongly tied to the theme, rich, layered, with clear visual hierarchy. Style: collectible movie poster composition, premium narrative visual design, dreamy watercolor texture with print quality, paper grain, edge dry-brush marks, slight bleeding, atmospheric perspective, soft fog effects, volumetric light, large negative space. Quality: the result should look like a designer-completed premium collectible visual work, not a generic AI output.
特别流行的一个玩法,这道题的核心考察点是「概念理解」,让 AI 自主判断什么轮廓最适合装下一个完整的故事。大家把 [DRAGON BALL] 换成自己想画的 IP 名称即可。
此题对美学要求极高,各家模型拉开了显著差距:
大家一眼便能直观感受,Wan 和 UW 对龙珠的背景知识,有,但不多。ERNIE 幻觉严重,把星之卡比给缝合了。
有请本场唯一真神:
其他模型不约而同选了神龙,只有 GPT-Image2 知道这个全球辨识度最高的身影,不过上头漂浮的全是四星球,也是过于拟合了。
提示词⑥:动漫风花卉简介海报
{“type”:“动漫风花卉人格海报”,“subject”:{“gender_presentation”:“年轻东方女性”,“pose”:“四分之三背影,上半身微微向左转,头部轻柔低垂,双手捧着一大束包装精美的花束”,“face”:“面容姣好”,“hair”:{“color”:“深棕近黑色”,“length”:“超长直发,长度过腰”,“style”:“柔顺垂坠直发,中分发型,发丝层次柔和包裹头部与后背”},“clothing”:{“top”:“软糯针织露肩毛衣连衣裙”,“color”:“冷调浅灰色”,“fit”:“宽松微慵懒版型,长袖自然滑落肩头”},“bouquet”:{“style”:“浪漫灰紫与暗豆沙色系混合花束,半透明艺术纸包装”,“count”:8,“items”:[“粉调白百合”,“深紫马蹄莲”,“薰衣草玫瑰”,“酒红玫瑰”,“浅粉玫瑰”,“粉色落新妇”,“满天星”,“尤加利叶”]},“layout”:{“background”:“浅灰到米白渐变极简干净背景”,“composition”:“人物插画居左侧,右侧竖向排布花卉释义列表,底部居中放置文案语录框”,“sections”:[{“title”:“花卉清单”,“position”:“右侧竖向栏目”,“count”:8,“labels”:[“01. 百合(粉白)”,“02. 玫瑰(薰衣草紫)”,“03. 玫瑰(酒红色)”,“04. 马蹄莲(深紫色)”,“05. 洋桔梗”,“06. 落新妇(粉色)”,“07. 满天星”,“08. 尤加利叶”]},{“title”:“文案总结”,“position”:“底部居中方框文字”,“count”:1,“labels”:[“这束花所诠释的人格底色”]}],“right_column_format”:“8个条目均配有圆形花卉缩略图、中文编号标题,下方附带两行简短解说,分别以「花语」「寓意」开头”,“bottom_box_format”:“上方一行标题,下方一句中文文艺语录”},“text”:{“language”:“Chinese”,“bottom_heading”:“这束花所诠释的人格底色”,“bottom_quote”:“「兼具细腻柔软的感性与骨子里的坚韧,坚守自我审美,不随世俗盲从。」”},“style”:{“medium”:“水彩铅笔质感动漫插画”,“mood”:“优雅内敛、温柔自省、诗意氛围感”,“palette”:“低饱和灰紫、薰衣草色、酒红、干枯粉、炭灰色、柔白色、鼠尾草绿”,“linework”:“细腻速写线条搭配柔和渐变阴影”,“finish”:“国风文艺人物海报,精致中式简约排版字体,留白通透轻盈”}}
翻译自某日本博主的提示词,这道题的独特之处在于它不是一个图,而是一个信息图。考察的不只是视觉美感,还有文字渲染能力,中文花卉名称、花语、寓意,一个都不能错。
挑战者们:
以上美术设计就不细评了,Wan 和 ERNIE 的中文乱码率最低。
本场 GPT-Image2 碾压局:
另外,虽然模型越来越聪明,我们不一定要用 stable diffusion 和 midjourney 时代的咒语提示词了,但有时结构化提示词还是能取得更好的效果,比如本题的 json 结构。
提示词⑦:AI大模型拟人茶话会
横向全景二次元插画,6 位 AI 大模型全部拟人化为二次元形象,同框围坐未来浮空星境茶室互动闲谈,悬浮流光代码、全息星轨、透明数据面板环绕四周,梦幻赛博二次元画风,8K 超清,精致二次元线稿,细腻上色,电影级柔光,氛围感拉满,六人五官、脸型、发型、穿搭、气质完全不撞脸,肢体自然无崩坏;
人物设定(全员妹子,自带 Logo 主题色 + 标志性图案元素):
DeepSeek:主色调深海藏蓝 + 哑光黑,冷冽清冷高冷御姐,黑长直发配蓝色挑染,服饰带有流线型科技纹路、漩涡纹样,气质理智疏离,安静托腮倾听;
GLM:主色调青竹翠绿 + 水墨玄黑,温婉国风少女,墨色古风长发,新中式改良汉服,衣身印有星格纹理、水墨暗纹,儒雅温柔,轻轻颔首浅笑;
MiMo:主色调蜜桃粉 + 奶白色,元气萝莉少女,粉色齐肩波波头,软糯针织裙搭配百褶裙,发饰带圆润云朵配饰,活泼俏皮,举手歪头好奇提问;
GPT:主色调深空青蓝 + 银灰渐变,知性干练御姐,浅灰微卷长发,极简轻奢制服裙,腰间带有环形 logo 配饰,气场优雅,抱臂淡然旁观;
Gemini:主色调幻彩紫蓝 + 星芒白,灵动元气少女,紫蓝渐变双马尾,赛博元气水手服,裙摆印有菱形星纹、双子星图案,指尖轻触悬浮全息光影,活泼灵动;
Claude:主色调暖米白 + 浅咖奶茶色,治愈系温柔大姐姐,奶茶色大波浪长发,宽松文艺针织长裙,衣身简约圆弧暗纹,眉眼温柔,浅笑看着身旁打闹的少女;
互动姿态:六人围圆形茶桌闲谈,有人认真思辨、有人温婉倾听、有人好奇发问、有人优雅浅笑、有人操控全息投影、有人温柔安抚,画面构图均衡,色彩各自呼应品牌原色,画风统一和谐,细节拉满,无重复脸型、无元素错乱。
这道题难在两点:六个角色必须有辨识度,六套服装不能撞风格,考验的是 AI 对品牌拟人化的理解深度,也就是世界知识。
挑战者们:
只能说是集体翻车,Wan 的构图相对和谐,但大家的表现都远不如「四大美女」那一题。
GPT-Image2:借过。(不过国内 3 家模型的 logo 全错,茶杯数量也不太对)
提示词⑧:三体·国风科幻水墨长卷
横向超长国风科幻水墨长卷,全景连贯式分镜构图,一整幅画卷同时容纳《三体》七大封神震撼名场面,画面层层递进、意境相连,史诗苍凉感拉满,宇宙宏大氛围感,8K 极致超清,电影级光影,写实科幻国风融合,细腻笔触,古画卷轴质感,暗调冷色系基调,星空星云背景贯穿整幅长卷,无多余杂物,人物与科幻场景细节拉满;
红岸基地名场面:深山隐秘红岸雷达基地,叶文洁伫立雷达天线之下,抬手按下发射按钮,电波冲破大气层驶向深邃宇宙,孤冷孤寂的年代氛围感;
三体三日凌空:三体星球荒漠大地,天空悬挂三颗灼热烈日,日光灼烧大地,地表龟裂荒芜,乱纪元末日绝望感扑面而来;
汪淼宇宙倒计时:城市夜空之下,悬浮闪烁的红色数字倒计时笼罩天地,汪淼抬头凝望,诡异神秘的超自然压抑感;
古筝行动:巴拿马运河河面,纳米飞刃如无形丝弦横亘河面,审判日号巨轮被缓缓切割解体,船身碎裂坍塌,静谧又惊悚;
水滴摧毁人类舰队:浩瀚太空星海背景,银色完美水滴极速突进,人类星际舰队阵列成片爆炸陨落,火光遍布宇宙,科技碾压的绝望感;
罗辑黑暗森林威慑:荒原雪地之上,罗辑持枪对峙整片星空,孤身一人对峙三体文明,冷峻孤绝,掌控宇宙法则的宿命感;
二向箔太阳系降维打击:恢弘太阳系全景,二向箔缓缓展开,行星逐个被二维化扁平化,金色二维画卷向外蔓延,宇宙规则崩塌的末日震撼;
整幅长卷色调统一又各场景层次分明,画风兼具古典卷轴的留白意境与硬科幻的写实细节,人物神态传神,天体、舰船、建筑纹理极致精细,宏大苍凉、孤寂宿命、科幻史诗感拉满。
这是全场最难的一道题,难度系数体现在:七个场景同时塞进一张横向长卷、每个场景必须有叙事逻辑、水墨质感+科幻内容不能打架。
挑战者们:
乍一看都听酷炫,但 ERNIE 和 UW 已经力竭了,Banana家和 Wan 也有点把画卷表现的太刻意,直接把核心内容截图出来或许更好,Seedream 板式是最合适的、美术也不错。
大家的二向箔都没处理好,大刘这块还是超前了。
莫慌,GPT-Image2向箔来降维打击了:你们的画图能力都被智子锁死了吗?
虽然也有卷轴边框,但却不会抢戏,画面史诗感十足,七个场景之间没有硬分割,恰到好处的过渡效果。
无敌了。
提示词⑨:商业品牌故事板
制作一张高端美食商业故事板海报,采用横屏宽屏布局,单行6列横排视图,电影级品质,保持奢华高端食品美学风格的一致性。
[标题部分]
品牌:{参数名=“brand” 默认值=“肯德基”}
产品:{参数名=“product” 默认值=“疯狂星期四限时盛宴”}
标语:{参数名=“slogan” 默认值=“每周四,尽享极致美食乐趣”}
[整体风格]
温暖的焦糖金和奶油乳白色调与深咖啡色形成对比,高端工作室美食照明,柔和的背光结合廷德尔光效应,空气中微小的浮动油雾和颗粒,浓郁的油炸食品香气氛围,电影般的奢华美食质感,极简主义的深色高级背景,商业广告级的润色。
[故事板内容]
6个水平网格框架并排成一排
1(钩子 - 唤醒食欲)
标题:欲望觉醒
视觉效果:柔和的晨光洒在空旷简约的餐桌上,营造出整洁高档的氛围。
行动:空桌等待美食家光临。
情绪:期待,放松。
2(情感)
标题:渴望时刻
画面:一人倚在桌子上,目光温柔地凝视着空白的空间。
动作:手指轻轻敲击,期待美味的食物。
心情:向往,随意放松。
3(承诺)
标题:等待盛宴
视觉效果:肯德基的限量包装放置在豪华大理石桌面上,包装上的光线反射。
动作:手缓缓靠近餐盘。
情绪:对生活的仪式感。
4(产品)
标题:开箱时刻
视觉效果:炸鸡散发出热气和油雾,在背光下闪闪发光。
动作:轻轻打开限量的餐盒。
心情:释放美食诱惑。
5(细节)
标题:纹理特写
视觉效果:酥脆的炸鸡皮,多汁的牛肉汉堡,金黄色的薯条,周围环绕着柔和的光晕。
动作:热蒸汽在空气中缓缓消散。
氛围:诱人,令人垂涎。
6(英雄品牌冻结)
标题:疯狂星期四经典
视觉效果:以肯德基疯狂星期四限定美食为主打,背景为深色极简风格,边缘有金色灯光。
动作:静态完美产品展示。
氛围:奢华、经典、高端感。
最后,请K记把广告费结一下。提示词抄自大佬的奢侈品故事板,魔改一下可用于任何产品。
来看效果:
以文字优化来迭代的 Banana2 出现了乱码,ERNIE 建议严查,UW 更是抽卡两次都完全无视排版布局指令。全都没有达到高奢的设计品质。
看看霸主是怎么做的:
哇,这么不知所谓的提示词,也能画出气派!就是图5怎么给我咬了一口…
结论
九组测试全部跑完,结论一句话:武林第二已傲视群雄,第一更是登峰造极。
不管是生活娱乐,还是工业设计,GPT-Image2 不完全是「断代级差距」,也确实是全面领先。它或许没有平替,不过个别场景也有模型能与之一战,已算优良,大家还是可以根据性价比来选型的。
参考各路大神经验,以下两个模版是比较实用的。
1.万能实拍感模板
生成一张 9 : 16 竖屏比例,风格为 photorealism 的逼真 iPhone 照片。照片内容为:
{内容描述}
在构图上,模拟日常手持 iPhone 拍摄时的视角与取景方式,如可能存在的轻微倾斜、画面边缘元素的自然裁剪等。光线效果参照现实生活中的自然光照或常见人造光效果,营造出真实自然的手机拍摄氛围 。
2.标准化 json 模板(可说明点子让 AI 辅助填写)
{“type”:“”,“subject”:{“gender_presentation”:“”,“pose”:“”,“face”:“”,“hair”:{“color”:“”,“length”:“”,“style”:“”},“clothing”:{“top”:“”,“color”:“”,“fit”:“”}},“bouquet”:{“style”:“”,“count”:0,“items”:[]},“layout”:{“background”:“”,“composition”:“”,“sections”:[{“title”:“”,“position”:“”,“count”:0,“labels”:[]},{“title”:“”,“position”:“”,“count”:0,“labels”:[]}]},“right_column_format”:“”,“bottom_box_format”:“”,“text”:{“language”:“”,“bottom_heading”:“”,“bottom_quote”:“”},“style”:{“medium”:“”,“mood”:“”,“palette”:“”,“linework”:“”,“finish”:“”}}
更多更全的提示词模板也打包好啦,后台私信【生图提示词】(5个字,无标点符号),免费领取~赶紧画图试试吧!
下次,再带大家试试本地部署的开源生图模型,在消费级显卡上能发挥到什么地步,敬请期待。
