2025年初,Black Forest Labs推出了新的图像生成模型FLUX.1 Kontext。它迅速在社交媒体和评测中传播开来:博主们展示该模型在构图、风格和速度方面的表现。围绕它的热度堪比最受期待的神经网络发布,因此我们决定检验一下这种炒作是否合理。为了了解它是否具有真正的优势,我们通过四个关键模型运行了相同的场景:Midjourney V7、GPT-4o Image、Ideogram 3.0和FLUX.1 Kontext本身。
我们如何测试
我们为每个模型制定了相同的提示词,并根据四个标准评估结果。这不是实验室研究,而是重复设计师或内容创作者典型任务的实践比较。
以下是检查清单:
- 在不同场景中保持同一角色的一致性;
- 在不影响画面其余部分的情况下,对单个细节进行定点修改;
- 迁移知名艺术家的风格;
- 生成速度。
角色一致性
当您创建一系列插画或故事板时,主角不应在帧与帧之间“变脸”。如果角色在场景之间崩坏,叙事就会丢失,观众无法将图像串联成一个完整的故事。因此,角色的稳定性不仅对艺术创作至关重要,对广告活动、漫画和动态分镜也同样重要。
我们要求模型描绘一位身穿蓝色夹克、有着红色卷发的年轻女性。她应该出现在城市公园、咖啡馆、图书馆和音乐会上——穿着同样的衣服。
FLUX.1 Kontext比其他模型更好地通过了测试:面部特征、发型和夹克在所有场景中都保持可识别性。Midjourney V7接近这一水平,但在最后一个场景中失去了角色的一致性。GPT-4o Image在保持外观方面表现不错,但面部细节存在细微差异。表现最弱的是Ideogram 3.0:女主角在风格之间来回跳跃——时而像卡通角色,时而近乎写实。

局部编辑
第二个重要任务是定点修改图像,而无需完全重绘。这种编辑可以节省时间和资源,尤其是在需要快速修改已完成视觉稿的情况下。但如果模型同时更改了其他元素,这种功能的意义就丧失了。
我们首先生成了一张猫在窗台上的照片,然后要求将项圈颜色改为红色、添加一个金色铃铛,并在旁边放一个插着向日葵的花瓶。
FLUX.1 Kontext正确执行了修改:项圈、铃铛和花瓶都出现在正确的位置。然而,图像的变化比预期的要大——与原始图像相比,猫的头稍微转动了一下。GPT-4o Image也完成了任务,但引入了额外的颜色变化,导致图像看起来有所不同。而Midjourney V7和Ideogram 3.0在测试时无法进行局部编辑,因此无法在这里进行完整比较。

风格迁移
艺术风格有助于为特定品牌、情绪或时代创建图像。良好的风格迁移不仅仅是色彩校正,而是真正将场景“重新装扮”成新的风格。这种手法在品牌设计、时尚拍摄和社交媒体运营中经常需要。
我们要求模型以梵高《星夜》的风格展示一只在田野中奔跑的狗。Midjourney V7表现最佳——风格传达得富有表现力,且非常接近原作。FLUX.1 Kontext紧随其后,出色地再现了梵高标志性的笔触和色调。GPT-4o Image提供了不错但不够鲜明的风格化效果,而Ideogram 3.0在这项测试中明显落败。
速度
在处理大量内容时,生成时间至关重要。如果需要为A/B测试运行数十个变体,或快速制作一系列帖子,每一秒都很宝贵。这里的领先者显而易见:
- FLUX.1 Kontext — 3–5秒;
- Ideogram 3.0 — 10–15秒;
- Midjourney V7 — 15–20秒;
- GPT-4o Image — 20–25秒。
也就是说,最快的参与者能够比最慢的参与者快四到五倍地输出结果。当需要生成的不是一张图而是一整批图时,这一点尤为明显。

如何选择?
没有一个适用于所有情况的绝对赢家,但总体方向是明确的。让我们将结果汇总成表格:
| 模型 | 角色一致性 | 局部编辑 | 风格 | 速度 |
|---|---|---|---|---|
| FLUX.1 Kontext | 优秀 | 良好 | 良好 | 优秀 |
| Midjourney V7 | 良好 | 不可用 | 优秀 | 良好 |
| GPT-4o Image | 良好 | 良好 | 良好 | 中等 |
| Ideogram 3.0 | 较弱 | 不可用 | 中等 | 中等 |
FLUX.1 Kontext看起来是最均衡的解决方案。它速度快,能很好地保持角色一致性,并自信地处理局部编辑和风格化。这样的组合使其成为内容创作者、设计师和营销人员的便捷全能工具,他们需要快速而精准的生成。
同时,对于特定任务,领先者可能另有其人。如果优先考虑富有表现力的艺术风格,值得关注Midjourney V7。如果细节和文本处理的准确性很重要,GPT-4o Image会很有用。而Ideogram 3.0目前在关键参数上处于劣势,尽管它也有本次比较中未涉及的自有功能。



