海艺思创

首页/ AI绘图教程/ OpenAI Images API 图片生成模型怎么选择

AI绘图教程

OpenAI Images API 图片生成模型怎么选择

接入 Images API 时,不必先追求一个“万能模型”。先按任务分成纯文本生成、带参考图编辑、透明背景输出和图片变体,再用同一组样本测试可用参数,才能选出适合自己流程的 model…

OpenAI Images API 图片生成模型怎么选择

先按任务划分候选模型

模型选择应从接口能力开始,而不是只看单张成图。纯文本生成可使用 GPT Image 模型、dall-e-2 或 dall-e-3;图片编辑支持 GPT Image 模型和 dall-e-2;图片变体接口目前只支持 dall-e-2。

  • 需要根据文字从零生成图片:先测试目标模型在生成接口中的表现。
  • 需要上传一张或多张图片后修改、扩展画面:使用编辑接口,并从支持编辑的模型中测试。
  • 需要透明背景:选择支持透明背景的 GPT Image 模型,同时使用 png 或 webp 输出。
  • 需要基于方形 PNG 生成相近变体:固定使用 dall-e-2,输入文件需小于 4MB。

若项目还没有明确用途,先选一个真实任务作为基准,例如“生成一张商品配图”或“替换现有海报中的背景”,不要把不同类型任务混在同一次对比里。

建立可重复的测试准备

为每个任务准备固定输入:同一段提示词、同一尺寸、同一张参考图和相同的保存规则。这样后续调整的差异才主要来自模型与参数。

  1. 写下任务目标、主体不可变特征和允许变化的部分。
  2. 为纯生成、编辑和透明输出分别准备一条测试提示词。
  3. 记录 model、size、quality、output_format、background、n 和请求时间。
  4. 为每次结果保存文件名与任务编号,避免只留下最终选中的图片。

质量档位会影响 GPT Image 模型的生成与编辑请求。具体的 quality 取值与适用方式,可结合OpenAI Images API quality 参数怎么选择一起记录,避免把模型差异和质量差异混为一谈。

按顺序发起最小对比

先让每个候选模型完成一次相同任务,再只改一个变量进行第二轮测试。下面示例以纯文本生成作为起点,模型名称应按你当前可用的模型和项目需求填写。

from openai import OpenAI

client = OpenAI()

result = client.images.generate(
    model="gpt-image-1.5",
    prompt="一只白色陶瓷杯放在浅灰桌面上,柔和自然光,留出右侧排版空间",
    size="1536x1024",
    quality="auto",
    output_format="png"
)

image_base64 = result.data[0].b64_json

GPT Image 模型返回 Base64 编码图片,应由应用解码并保存到自己的存储。dall-e-2 和 dall-e-3 则可使用 url 或 b64_json 响应格式,其中 URL 仅在生成后 60 分钟内有效。

  1. 第一轮:固定提示词和尺寸,只替换 model。
  2. 第二轮:保留表现较符合任务的模型,仅调整质量或尺寸。
  3. 第三轮:使用真实业务素材重复测试,确认结果不是只适合单一示例。
  4. 确定配置后:将 model 与相关参数写入默认配置,不依赖接口默认值。

透明编辑的测试示例

透明背景不是所有模型和格式都能组合使用。使用 background 为 transparent 时,输出格式应选择 png 或 webp;资料显示部分 GPT Image 模型的透明支持处于预览状态,因此应把最终素材放进实际页面或设计软件检查。

with open("product.png", "rb") as image_file:
    result = client.images.edit(
        model="gpt-image-1.5",
        image=image_file,
        prompt="保留产品外形和颜色,移除原背景",
        background="transparent",
        output_format="png",
        input_fidelity="high"
    )

编辑任务需要保持参考图特征时,可测试 input_fidelity。该参数支持 high 和 low,但 gpt-image-1-mini 不支持它;不要把不支持的参数直接复制到所有模型配置中。

用评分表决定生产配置

不要用“看起来最好”作为唯一结论。每张测试图可按 1 到 5 分记录主体符合度、构图可用性、参考图保留程度、透明通道正确性和人工返工量。纯生成任务不必评分参考图保留程度,编辑任务则应提高这一项权重。

建议为每种任务保留一个独立默认配置,例如“横版配图生成”“商品背景编辑”“透明图标输出”。这样当某种素材异常时,可以定位到具体配置,而不是整体更换模型。

常见故障与修正动作

  • 故障:变体请求报错。原因:变体接口只支持 dall-e-2,且输入必须是小于 4MB 的方形 PNG。修正动作:改用 dall-e-2,并预先检查图片格式、尺寸和文件大小。
  • 故障:请求透明背景后得到不透明图片。原因:模型或输出格式不满足透明输出条件,或未设置 background。修正动作:确认使用支持透明的 GPT Image 模型,设置 background 为 transparent,并改用 png 或 webp。
  • 故障:代码读取不到 URL 字段。原因:GPT Image 模型返回 Base64 图片,不使用 url 或 b64_json 响应格式参数。修正动作:读取 b64_json,完成解码和本地或对象存储归档。
  • 故障:编辑后主体特征变化太多。原因:参考图要求没有写清,或模型不支持 input_fidelity。修正动作:明确不可变特征;对支持该参数的模型测试 input_fidelity 为 high,并重新对比结果。
  • 故障:模型切换后请求参数报错。原因:不同模型支持的尺寸、质量、风格和输出参数不同。修正动作:按目标模型重新核对参数组合,测试时一次只新增一个参数。

发布前检查项

  • 已为每个生产任务明确 model,未依赖默认模型。
  • 生成、编辑、透明输出和变体任务分别使用了兼容的接口与参数。
  • 测试记录包含提示词、模型、尺寸、质量、格式和结果文件位置。
  • 透明素材已在深色和浅色背景上检查边缘与透明通道。
  • Base64 或临时 URL 返回结果已保存到自己的存储。
  • 真实业务样本已复测,且人工返工量在团队可接受范围内。

下一步

把这篇的方法练一遍

提示词和步骤可以带到创作里直接试做一版。

去创作 看同栏目更多