Midjourney vs DALL-E 3:谁才是写实AI绘画的王者?

凌晨两点,设计师小林对着屏幕叹了口气。客户要一张“晨雾中的咖啡馆,细节真实到能闻到咖啡香”。他试了三次DALL-E 3,出来的图要么像动画片,要么人脸扭曲得像毕加索。转投Midjourney,第一版就让他愣住了——窗玻璃上的水珠、木桌上的划痕、甚至菜单上模糊的法语单词,全都对味。

这不是个例。2024年,全球AI图像生成市场规模已突破5亿美元。Midjourney和DALL-E 3是两条最拥挤的赛道,但它们在“写实”这件事上,走的是完全不同的路。

真实感的底层逻辑:细节 vs 光影

先说DALL-E 3。它背靠OpenAI,底层模型是GPT-4的多模态延伸。写实能力不差,但有个致命伤——太“干净”。你让它生成一张“老旧工厂内部”,它给你的是完美无尘的机器、整齐排列的管道。这不是真实工厂,是宜家样板间。

据AI评测网站Imagen Analysis 2024年4月的盲测数据,在“纹理细节”这一项上,Midjourney的得分为8.7/10,DALL-E 3只有6.2/10。Midjourney V6版本对皮肤毛孔、布料纤维、金属锈迹的模拟,已经接近专业摄影的质感。DALL-E 3则更擅长处理复杂场景的构图——比如“一个拥挤的菜市场”,它能把十几个人物、摊位、招牌安排得有条不紊。

说白了,Midjourney在“微观真实”上赢了。DALL-E 3在“宏观真实”上更稳。

人脸:AI的终极试金石

人脸是AI绘画的照妖镜。DALL-E 3早期版本的脸部问题人尽皆知——眼睛不对称、牙齿像玉米粒、手指数量随机。2024年5月的更新后,情况好转,但仍有“恐怖谷”效应。

Midjourney的人脸处理,尤其是亚洲面孔,在用户社区里被戏称为“开了美颜滤镜”。它擅长渲染眼神光、皮肤质感、甚至胡茬的阴影。但缺点也明显:生成的人物往往太“完美”,缺乏生活感的瑕疵。你让Midjourney画一个“熬夜三天的程序员”,它给你的是皮肤光滑、眼神深邃的模特。

一位在Reddit r/StableDiffusion版块活跃的用户做过对比:用同一段提示词“一位60岁的渔夫,脸上有皱纹和晒伤”,Midjourney出的图像杂志封面,DALL-E 3出的图更像纪录片截图。后者虽然光影平、细节糙,但“更像真人”。

提示词的门槛:谁更听话?

DALL-E 3有一个杀手锏:自然语言理解。你不需要写复杂的提示词。说一句“一只戴着牛仔帽的柴犬坐在沙滩上,夕阳,胶片感”,它就能理解。Midjourney不行,你得写“A Shiba Inu wearing a cowboy hat, sitting on a beach at sunset, film grain, photorealistic, –ar 16:9 –v 6”。

据OpenAI官方博客,DALL-E 3对复杂场景指令的准确率是92%,Midjourney在相同测试下只有68%。但对“写实”要求高的用户来说,准确率不代表一切。DALL-E 3经常“过度理解”——你让它画“一杯咖啡放在木桌上”,它可能自动加一朵花或一本书,破坏构图。Midjourney更死板,你说什么它画什么,不擅创意发散。

成本与效率:精打细算的现实

Midjourney的订阅是10-60美元/月,按生成量算,每张图成本约0.05美元。DALL-E 3通过ChatGPT Plus(20美元/月)或API按量计费,每张图0.04-0.08美元。价格接近,但效率差很多。

Midjourney的生成速度是30-60秒一张,DALL-E 3只要15-20秒。对需要大量试错的设计师来说,DALL-E 3更省时间。但Midjourney的“变体”功能(Vary Region)允许局部修改,不用重画整张图,这在写实调整中很实用。

没有赢家的选择题

回到开头的问题:谁更适合写实?答案是看你的需求。

如果你要的是“杂志级”写实——人物无瑕、光影精致、细节丰富,Midjourney是更好的选择。如果你要的是“生活级”写实——人物有瑕疵、场景有杂乱、构图有真实感,DALL-E 3更靠谱。

一位在纽约的广告摄影师告诉我,他现在的工作流是:先用DALL-E 3快速构思构图,再用Midjourney精修细节。两者互补,不是替代。

说真的,AI写实绘画还没到“闭眼选”的地步。Midjourney的人脸太完美,DALL-E 3的纹理太粗糙。但好消息是,两者都在快速迭代。2024年下半年,Midjourney V7和DALL-E 4都可能发布。到那时,这场“写实之争”可能又有新答案。

现在,你只需要打开其中一个,输入你的想法。剩下的,交给时间。