
我用 20 组文生图 Prompt,对 gpt-image-2 和 gemini-3.1-flash-image-preview 做了一次小样本横向评测,记录输出质量、指令遵循、复杂语义、文字能力、稳定性、生成耗时和实际尺寸。
评测摘要
这次覆盖商品摄影、人像生活方式、海报文字、复杂组合、风格创意和高分辨率输出 6 类任务,采用统一 Prompt 集、统一接口和人工评分表做横向观察。要说明的是,每组 Prompt 每个模型只生成 1 张图,样本偏小,所以本文更像一个可复现的快速评测记录,用来观察模型在不同任务类型下的表现差异,不作为稳定排名或最终结论。
评测方法
测试通过 NoneLinear 提供的 OpenAI 兼容图像接口提交,每条 Prompt 分别发给两个模型,记录接口返回状态、生成耗时、下载后的实际图片尺寸,再按下面的维度人工打分。测试日期 2026-07-16,模型为 gpt-image-2 与 gemini-3.1-flash-image-preview,样本为 20 组 Prompt 乘 2 个模型共 40 张图,每组每个模型 1 张,接口成功率 40/40。
评分维度
总分 25 分,每个维度 1 到 5 分:指令遵循看主体、风格、比例、场景是否符合 Prompt;画面质量看清晰度、构图、光影、细节、审美;复杂语义看多主体、多属性、空间关系、数量是否正确;文字能力看中英文标题、包装字、招牌字是否准确可读;稳定性看是否空图、变形、偏题、尺寸不符、重复失败。另外记录三项不计入总分:生成耗时(请求到返回图片地址的耗时)、实际尺寸(下载后真实宽高)、是否需要重试(空图、报错、严重偏题)。补充说明:对没有文字要求的 Prompt,文字能力按是否出现明显干扰性乱码或错误文字评估,无文字且不影响画面时可给高分;对简单主体 Prompt,复杂语义主要看属性、场景要素和构图要求是否完整。所有评分都基于本次单张样本的人工观察,不能替代多轮统计评测。
结果总览
40 张图里,gpt-image-2 成功 20/20,平均总分 23.85,指令遵循 4.65、画面质量 4.80、复杂语义 4.60、文字能力 4.80、稳定性 5.00,平均耗时 63.6 秒,实际尺寸有 1024x1024、1024x1536、1536x1024、2048x1152、2160x3840;gemini-3.1-flash-image-preview 成功 20/20,平均总分 24.20,指令遵循 4.80、画面质量 4.85、复杂语义 4.90、文字能力 4.65、稳定性 5.00,平均耗时 14.5 秒,实际尺寸有 1024x1024、896x1200、1200x896、1376x768、2752x1536、3072x5504。因为每个任务只生成 1 张,均分仅代表本次样本,不代表长期稳定表现。
分场景观察
商品摄影主要考察主体呈现、材质还原、背景控制和商业质感。gpt-image-2 的主体通常更集中,白底运动鞋和香水瓶更接近商品主图;Gemini 的环境信息更丰富,比如保温杯和拉面会主动构建更完整的生活场景。两种都可用,取向不同:前者偏主体明确的商品呈现,后者偏场景化表达。

人像与生活方式考察人物完整度、姿态自然度、服装表现、环境一致性和摄影感。Gemini 更倾向生成完整环境,雨夜街景、跑步场景和厨房空间信息量更高;gpt-image-2 在棚拍和服装材质上更克制,人物更突出,但部分场景构图偏保守。两者都没出现明显人体结构失败。

海报与文字考察中英文文字可读性、标题准确性、信息层级和画面完整度。两款都能生成可读的核心文字,比如「春日咖啡节」「云雾绿茶」「LUMA」都体现出来了。gpt-image-2 输出更接近平面设计稿、版式集中;Gemini 信息层级和场景元素更丰富,但也更容易多出小字或补充信息,严格商用文字场景仍需人工复核。

复杂组合考察属性绑定、空间关系、数量计数和尺度理解。属性绑定里两款基本满足「红色机器人、蓝色雨伞、黄色小狗、绿色围巾」的组合;空间关系上 Gemini 对「立方体在球体左边、圆柱体在球体后面」表达更接近 Prompt;数量计数上 gpt-image-2 的杯子排列更规整、好核对,Gemini 画面更自然但部分杯体重叠、增加计数成本。

风格创意与高分辨率考察复杂场景组织、风格一致性、图标设计和高分辨率稳定性。奇幻插画和科幻城市任务里两款都能生成完整且细节丰富的画面;图标任务里两者都能输出符合「抽象相机和星光」主题的 1:1 图标;高分辨率竖图上 gpt-image-2 请求 2160x3840 并返回同尺寸,Gemini 请求 aspect_ratio=9:16、size=4K,实际返回 3072x5504,说明两者都能完成高分辨率输出,但尺寸控制机制不同。

本次样本观察
基于这 40 张单次样本:两个模型都没出现接口失败、空图或必须重试,稳定性均分都是 5.00。Gemini 平均耗时明显更短,本次约 14.5 秒,gpt-image-2 约 63.6 秒,耗时差异是本次最显著的客观差别。gpt-image-2 的 size 输出尺寸更直接,实际与请求一致;Gemini 的 aspect_ratio 加 size 会映射到模型侧实际像素,比如 16:9 加 2K 返回 2752x1536,9:16 加 4K 返回 3072x5504。单次评分里 Gemini 平均总分略高但差距很小,由于每组只生成 1 张,不能据此排稳定名次,更严谨的结论需要每组多次采样并统计均值、方差和失败率。
挑文生图模型,也是把 AI 能力接进业务时要做的选型之一。如果你想把这类 AI 工具和数字化能力真正用进自己的业务,可以咨询云巴巴。云巴巴是国内领先的企业数智服务平台,覆盖 AI 大模型、智能体、协同办公、营销获客、安全合规等多个领域的企业级产品与方案,能按你的行业、规模和预算比对选型、匹配资源、协助落地。欢迎咨询云巴巴,获取更多产品方案与专属服务。


以家居卖家多店报表分裂为场景,讲解如何用 Accio Work 的生意地图把多平台利润、流量、库存拉通,一张图看全局。适合多店铺多平台经营的家居卖家参考。

以机械外贸报价整理慢为场景,讲解如何用 Accio Work 的知识库与询盘结构化能力,把配置复杂的报价弹药提前备好。适合机械外贸等配置复杂品类的报价提效参考。

以客服离职交接混乱为场景,讲解如何用 Accio Work 的知识库沉淀机制,把分散的客服话术变成可顶岗的组织资产,适合客服团队标准化与知识沉淀场景参考。

以服装卖家上新拖延为场景,讲解如何用 Accio Work 的多平台发品能力,把跨平台重复上架收口成一次维护、一键发布。

以五金厂跨时区询盘为场景,讲解如何用 Accio Work 的自动接待与询盘分层能力,把夜里流失的海外商机接住并结构化处理。