下列所有模型通过统一 API、一个 key 即可调用。点击模型查看完整 playground 与文档。
| 模型 | model 参数 | 价格 | 说明 |
|---|---|---|---|
| Gemini 2.5 Flash Image | gemini-2.5-flash-image | $0.02 | Google's Gemini 2.5 Flash Image at a flat $0.02 per image — the cheapest way to generate or edit an image here. Text-to-image and reference-image editing, one API key, no Google Cloud setup. |
| GPT Image 2 | gpt-image-2 | $0.025+ | GPT Image 2 是 OpenAI 的图像生成模型,文本排版精确、像素级编辑稳定、prompt 遵从度高。在 APIMODELS 上文生图与图生图都支持(同一 endpoint 按是否携带参考图自动路由),单次最多 16 张参考图做多图融合/编辑,原生 1K / 2K / 4K 分辨率、分档计价 $0.025 / $0.03 / $0.05 每张,可用 aspect ratio(1:1、2:3、3:2、16:9、9:16 等)控制画幅。 这条是「省事」的通道:画质固定跑 medium 档,请求里传 quality 不会生效,所以价格只跟分辨率走、少一个要决策的字段。更便宜的纯 API 通道 gpt-image-2-lite(1K 低至 $0.008)同理:quality 参数会被忽略、只按分辨率计价。如果你需要自己挑画质,请用同一个底层模型的 gpt-image-2-all —— 它把完整的「分辨率 × 质量」矩阵开放出来(1K/2K/4K × low/medium/high,外加 auto),1K low 低到 $0.01,要极限细节的 high 档也调得到;而且它是 OpenAI SDK 兼容的同步通道,Codex / Cursor 改个 base_url 就能直接调。本页底部「相关模型」里有它的入口。 还有一个差别值得先知道:这条通道的内容审核相对宽松。近 30 天实测,这里 0.93% 的请求被上游安全系统拒绝,而 gpt-image-2-all 是 8.0% —— 底层是同一个模型,只是审核口径不同。如果同一段提示词在那边反复被拒,可以先来这条试。被拒的请求不扣费。 一个 API Key 覆盖全部模型,国内可直连,无需 OpenAI 组织认证,失败不扣费,结果托管在 R2、保留 7 天。 |
| Qwen Image 3.0 | qwen3-image | $0.035 | Qwen Image 3.0 是阿里巴巴的图像生成模型,最见功力的地方是「图里的字」。10px 的小字它能渲染得清晰可辨,12 国语言、20+ 字体原生支持,所以报纸版式、餐厅菜单、试卷、信息图、网页与 UI 稿这类「文字密集又要讲版面」的活,它能一次生成到位,不必事后再往图上贴文字。指令理解也扎实:最长 4.5k token 的提示词它读得完、照着做,复杂图文指令不会做一半丢一半。 在 APIMODELS 上,文生图和图像编辑是同一个模型、同一个端点,靠有没有传参考图自动切换 —— 不传就是文生图,传了(最多 3 张)就是按图编辑或多图融合。输出 1K 或 2K,8 种画幅(1:1、3:2、2:3、4:3、3:4、16:9、9:16、21:9)或 auto 跟随输入图,PNG 格式。异步任务:POST 创建后 GET 轮询,也可以传 callback_url 让我们回调你。 价格 1K 与 2K 同价 $0.035/张,图像编辑时每张参考图另加 $0.004,失败不扣费。出图按我们自己的生产数据:中位 73 秒、九成在 96 秒内,最快见过 36 秒;轮询窗口留 3 分钟足够,别按几十秒就掐。结果文件在我们的存储上保留 7 天,需要长期留存请自行转存。一个 API Key 同时可调图片、视频、大模型与语音,国内可直连。 |
| Qwen Image 3.0 Pro | qwen3-image-pro | $0.037+ | Qwen Image 3.0 Pro 是 Qwen Image 3.0 更高保真的一档。标准版已经把「图里的字」做得很稳,Pro 在此之上把画质推到照片级:微表情、毛孔、发丝这些细节逼近真实摄影,主图、人像、以及那些「细节一糊就露怯」的密集排版,交给它更稳妥。内容承载力同样在线 —— 最长 4.5k token 提示词、12 国语言与多种字体原生渲染,主流网页、游戏、直播界面的仿真也做得出来。 用法与标准版完全一致:同一个端点,不传参考图就是文生图,传了(最多 3 张)就是编辑或多图融合;输出 1K 或 2K、8 种画幅或 auto,PNG;异步创建后轮询或走 callback_url。想省成本就用 qwen3-image,想要照片级细节或要拿去印刷再换 qwen3-image-pro,切换只改 model 一个字段。 价格按分辨率分档:1K $0.037/张、2K $0.075/张,每张参考图另加 $0.004,失败不扣费。Pro 明显更慢而且尾巴长:我们自己的数据是中位 121 秒,但一成会超过 324 秒、最慢见过 359 秒。轮询窗口至少留 8 分钟 —— 按中位数去设窗口正是「任务卡住」的最常见原因。结果文件保留 7 天。一个 API Key 通调全站模型,国内可直连。 |
| Real-ESRGAN Upscaler | real-esrgan | $0.004 | Real-ESRGAN AI upscaler — best for illustration, anime and hand-drawn artwork: enlarge to 4x HD, 8K and 10K print quality with crisp lines and clean flats. Optional face enhancement. $0.004 per image. |
| FLUX.2 Klein 4B | flux-2-klein-4b | $0.006 | FLUX.2 Klein 4B 是 Black Forest Labs 的极速照片级图片模型,大约 1-2 秒出图——适合要量、要快、要写实的场景:草稿迭代、批量出素材、电商与社媒配图。文生图和图生图用同一个模型名:不带参考图就是纯文生,最多带 3 张参考图做图生图(每张会自动压缩到约 1MP),aspect_ratio 传 match_input_image 可跟随参考图比例。输出固定约 2MP,12 种画幅可选,支持 jpg / png / webp。计价是一口价:每张 $0.006,另加每张参考图 $0.0015(最多 3 张)——是平台上最便宜的照片级通道之一。统一图片端点、失败不扣费,详细参数和三语言代码示例见文档页。 |
| GPT Image 2 All | gpt-image-2-all | $0.01+ | GPT Image 2(All)是 OpenAI 兼容的图片 API:把 OpenAI SDK、Codex、Cursor 的 base_url 指向 https://api.apimodels.app/v1,model 填 gpt-image-2-all,images.generate() 与 images.edit() 原样就能跑,不用改代码结构。同步返回、无需轮询 taskId,支持文生图与多图编辑(单次最多 16 张参考图),并支持 mask 局部重绘。 它和 gpt-image-2 底层是同一个模型,区别只有两点:接入方式(这条是 OpenAI 兼容的同步通道,那条是异步 taskId 通道),以及画质要不要你自己挑。这条把完整的「分辨率 × 质量」矩阵开放出来 —— 1K/2K/4K 搭配 low / medium / high,另有 auto(按 medium 计费):1K low $0.01、1K medium $0.025、1K high $0.07;2K 依次 $0.025 / $0.03 / $0.10;4K 依次 $0.05 / $0.05 / $0.23。想压成本就用 1K low,要极限细节就上 high。生成速度 low 约 40 秒、medium 约 60-90 秒、high 约 2 分钟。 反过来,如果你不想纠结画质该填什么,用 gpt-image-2 更省事:它固定跑 medium 档,价格只按分辨率分三档($0.025 / $0.03 / $0.05),少一个要决策的字段。本页底部「相关模型」里有它的入口。 再补一个实测差别:这条通道的内容审核较严格。近 30 天,这里 8.0% 的请求被上游安全系统拒绝,而 gpt-image-2 只有 0.93%。两者底层同一个模型,差的是这条通道的审核阈值 —— 做商业素材通常没问题,但涉及人物肖像、品牌标识、证件类版面时更容易被拦。被拒的请求不扣费,换到 gpt-image-2 往往能过。 一个 API Key,国内可直连,无需 OpenAI 组织认证,失败不扣费。 |
| Nanobananapro-gemini | nanobananapro-gemini | $0.03 | nanobananapro-gemini 是 Gemini 3 Pro Image 的经济渠道版本,$0.03/张,支持文生图与编辑、1K/2K/4K,主打专业素材创作与高保真文字渲染。引擎与 Nano Banana Pro 相同(Gemini 3 Pro),走更便宜的渠道,适合对成本敏感的高量专业出图;要主渠道约 99% 成功率与稳定性,选 nanobananapro。 |
| Nanobanana2-gemini | nanobanana2-gemini | $0.025 | nanobanana2-gemini 是 Gemini 3.1 Flash Image 的经济渠道版本,$0.025/张,为速度与大批量优化,支持文生图与编辑、1K/2K/4K。引擎与 Nano Banana 2 相同(Gemini 3.1 Flash),走更便宜的渠道,适合海量、低成本的快速出图;要主渠道稳定性选 nanobanana2。 |
| SparkPix Image | sparkpix-image | $0.008 | SparkPix Image 是 SparkPix 面向生产场景的文生图模型,主打亚秒级出图(通常 1 秒内)与极低单价($0.008/张),兼顾画质、提示词遵从与出色的图内文字渲染,并支持 LoRA 定制风格。是平台上最快、最便宜的图片档之一,适合社媒视觉、电商铺图、A/B 创意、快速原型等需要海量出图与快速迭代的场景。要编辑 / 融合已有图片,可搭配 SparkPix Image Edit。 |
| SparkPix Image Edit | sparkpix-image-edit | $0.013 | SparkPix Image Edit 是 SparkPix 的多图编辑模型,亚秒级(1 秒内)完成、单价低($0.013/张)。它擅长精准提示词控制、出色的图内文字渲染,并支持多图编辑与融合,可嵌进高频生产管线:换背景、商品合成、版式与文字调整、批量改图。从零生成用 SparkPix Image,改图 / 多图融合用 SparkPix Image Edit。 |
| Kling V3 Image | kling-v3-image | $0.05 | Kling V3 Image 是可灵 V3 的图像生成模型,支持文生图,以及「单图参考」的图生图(image_reference,用于锁定主体或人脸),1K / 2K 分辨率,$0.05/张。适合要保持某个主体 / 人脸一致的出图。需要多图参考与融合、元素一致性与组图输出,选 Kling V3 Omni Image。 |
| Kling V3 Omni | kling-v2-new | $0.05+ | Kling V3 Omni Image 通过 omni-image 接口提供可灵 V3 的全能图像能力:多图参考与融合(image_list)、元素一致性(element_list,让角色 / 商品 / 道具在多图间保持一致)、单图或组图(series)输出,支持 1K / 2K / 4K(1K/2K $0.05、4K $0.10)。适合复杂的多素材合成与成系列出图——产品系列、分镜、套图。只需单主体一致,用更轻的 Kling V3 Image 即可。 |
| Kling Omni-Image | kling-image-o1 | $0.05 | Kling Omni-Image(kling-image-o1)是可灵(Kling)的图像生成与编辑模型,支持 1K / 2K 分辨率,并支持多图输入做创意编辑与合成,$0.05/张。可同时传入多张图做参考与融合,用于创意合成、元素组合、风格借鉴,比单图编辑更灵活,适合在已有素材上做组合与再创作。 |
| Doubao Seedream 5.0 Lite (Official) | doubao-seedream-5-0-260128 | $0.055 | Doubao Seedream 5.0 Lite 是字节跳动豆包的图像模型,通过官方火山方舟(Volcano Ark)接口接入,稳定且为第一方画质。一个接口同时覆盖文生图(不传 image)与图生图 / 多图融合编辑(传一张或多张 image),按是否带参考图自动路由。输出 2K 或 4K 的 PNG、无水印,可直接用于电商与设计生产。注意:图生图若产出仍含真实人物身份,会被火山内容审核拒绝(防深伪),请使用合成脸或非真人素材。约 $0.055/张,远低于官方。 |
| Doubao Seedream 5.0 Pro (Official) | doubao-seedream-5-0-pro | $0.076 / $0.15 | Doubao Seedream 5.0 Pro (Volcano Ark official) — flagship tier with interactive editing (coordinates / box-select / arrows / hand-drawn marks), layer separation, and strong multilingual in-image text rendering. Text-to-image, single- and multi-image (2–10) fusion editing, 1K / 2K single-image output, no watermark. |
| Doubao Seedream 4.5 | doubao-seedream-4-5-251128 | $0.05 | Doubao Seedream 4.5 是字节跳动豆包的高质量图像模型,支持文生图与图片编辑,2K / 4K 分辨率,并支持多图输入,$0.05/张,适合电商与设计的高质量出图与改图。Seedream 5.0 Lite 更新(官方火山方舟、无水印 PNG);4.5 为前一代,2K/4K 生成与编辑依旧扎实,是稳妥的高质量备选。 |
| Grok 4.2 Image | grok-4.2-image | $0.0075 | Grok 4.2 Image 是 apimodels.app 上 Grok 图片生成的便宜档:$0.0075/张,是标准档 Grok Imagine Image($0.03)的四分之一,跑的是同一个模型、同一个端点,生产实测中位 19 秒出图。支持文生图和单参考图编辑(把图片地址放进 image_url、用提示词描述改动 —— 字段名写成 image 会被静默丢掉),画幅 10 个值:1:1、16:9、9:16、4:3、3:4、3:2、2:3、2:1、1:2、auto。分辨率传 resolution 取 1k 或 2k,不传默认 2k,而且两档同价 —— 2K 方图实测 2048×2048、16:9 为 2816×1584,一分钱不多收(对比 grok-imagine-image-pro 的 2K 要 $0.12)。三件事它做不到:四个超宽比例(19.5:9 / 9:19.5 / 20:9 / 9:20,要超宽用 grok-imagine-image)、蒙版修复、多图融合(要多图用 gpt-image-2 的 16 张或 grok-imagine-image-pro 的 3 张)。走量试稿选它,通用出图选 Grok Imagine Image,要 2K 照片级细节上 Pro 档,换档只改 model 一个字段。 |
| Grok Imagine Image | grok-imagine-image | $0.03 | Grok Imagine Image 是 xAI Grok 的图像模型,主打快速出图(约 4 秒)的文生图与图片编辑,图内文字渲染较强,并提供非常宽的宽高比集合(方图、常规横竖屏到 20:9 超宽幅等十余种)。它是主打速度与成本的标准档;需要更高精度与细节、要多轮精修时,可上 Grok Imagine Image Pro。常见做法是标准档跑量、关键图用 Pro 精修。 |
| Grok Imagine Image Pro | grok-imagine-image-pro | from $0.08 | Grok Imagine Image Pro 是 xAI Grok 图像模型的升级档,语义理解更强、细节生成更精细,出图精度更高,并支持多轮优化。适合品牌主视觉、产品精修图、对细节与文字质感要求高的营销素材,以及需要反复打磨的关键画面。只需快速、低成本批量出图时,标准版 Grok Imagine Image 更划算;两者同一接口,可先跑量再精修。 |
| Grok Imagine Image 2.0 | grok-imagine-image-2 | $0.03 起 | Grok Imagine Image 2.0 是 xAI 的图像模型,目标只有一个:做出能直接投入工作的图。它像设计师那样规划排版与版面 —— 我们用一张 2K 海报实测过:指定的标题、日期行和底部小字网址,三处全部逐字正确、清晰可读。它一次调用最多融合 3 张参考图,并且认得清哪个主体该放在哪儿(三个不同物体的融合实测下来,三个都各自可辨,不是照着文字重画的);第 4 张会被明确报错拒绝,而不是静默丢掉 —— 静默丢弃会让你误以为融合成功了。编辑时它保主体也保场景:一张红色茶壶要求改成藏青,壶型、木桌纹理、窗光、窗台植物、背景木椅全部留住,只有颜色变了。 一条实测得出、而非假设的提醒:它是在同一场景下重绘,不是在原图上逐像素修改,所以每次输出的机位、裁切和主体大小都会变。换色、换材质、加减物件、多图融合都很合适;如果你的要求是「只动这一处、其余像素一个都不许变」,那该用 GPT Image 2 或 Nano Banana Pro 那条线。另一条限制同样要说清楚:它做不了透明背景 —— 要求 alpha 通道时,它会把那种灰白棋盘格当成普通像素画出来,返回的 PNG 是 RGB、根本没有 alpha,缩略图上看着像抠好的图,其实不是(2K 编辑和 2K 文生图两条路径我们都试过,结果一样)。需要去背请另接一个专门的抠图步骤。 价格按分辨率 × 质量分四档:1K low $0.03、2K low $0.04、1K medium $0.045、2K medium $0.06(每张)。quality 只有 low 和 medium 两个值、省略即 medium —— 所以不显式传 quality 就是在买 medium 档。四档相对 xAI 官方标价都便宜 25%,其中 2K low 便宜 33%。参考图不额外收费(xAI 按每张输入图 $0.01 加收,我们不转嫁),所以图生图和文生图同价。画幅 14 种,含 19.5:9、9:19.5、20:9、9:20 四种超宽 —— 这四种是逐个实调验过的(19.5:9 实测出 1248×576),不是抄规格表,我们另一条 Grok 渠道恰恰就拒收它们。一个 API Key 直接调,无需单独的 xAI 账号,国内可直连,失败不扣费。 |
| Nanobanana2 | nanobanana2 | $0.05+ | Nano Banana 2 是基于 Google Gemini 3.1 Flash 的快速图像生成与编辑模型,主打出图快、单价低。支持文生图与基于参考图的编辑,覆盖 1K / 2K / 4K,是大批量、对成本敏感场景的首选——社媒视觉、快速迭代、批量创意。需要最高画质与最稳成功率时,可上 Nano Banana Pro(Gemini 3 Pro Image);两者共用同一接口,可自由切换。定价 1K/2K $0.05、4K $0.08。 |
| gemini-3.1-flash-image | gemini-3.1-flash-image | $0.04+ | Google's gemini-3.1-flash-image (GA). 2K images cost $0.06 versus Google's $0.101 — 40% less — and 1K is the same $0.06, so 2K is a free upgrade here. 512 $0.04, 4K $0.10. Half of requests return within 14s. |
| gemini-3-pro-image | gemini-3-pro-image | $0.10+ | Google's gemini-3-pro-image (GA release). Top-quality, high-fidelity image generation and editing with advanced reasoning. Priced by resolution: 1K/2K $0.10 (25% cheaper than official), 4K $0.15 (37.5% cheaper than official). |
| Nanobanana-2-lite | nanobanana-2-lite | $0.025 | Nano Banana 2 Lite 是 Google Gemini 3.1 Flash Image 家族里最便宜的一档:统一 $0.025/张,没有分辨率档位要算。文生图与改图都支持——只给提示词即可出图,也可带最多 10 张参考图再描述要改成什么样。唯一取舍是分辨率,输出固定 1K;需要 2K/4K 请用 $0.05 的 Nano Banana 2。支持 15 种画面比例,含 21:9 电影宽幅与 8:1 横幅。 |
| Gemini 3 Pro Image (Pro) | nanobananapro | $0.06+ | Nano Banana Pro 是基于 Google Gemini 3 Pro 的高端图像生成与编辑模型,主打最高画质与可靠性,实测成功率约 99%。既能文生图,也能基于参考图做编辑,支持 1K / 2K / 4K 输出,适合对出图质量和稳定性要求高的生产场景——商品图、营销创意、设计系统等。需要更快、更低单价的量产场景,可搭配基于 Gemini 3.1 Flash 的 Nano Banana 2;两者在同一套接口下调用,可随时切换。定价 1K/2K $0.06、4K $0.12,远低于官方。 |
按张按模型:Nano Banana 约 $0.02 起,GPT Image 2 为 $0.025(1K)/$0.04(2K)/$0.06(4K),Nano Banana Pro $0.03 起。仅成功扣费,注册送 $0.1。
调 POST /api/v1/images/generations,带 prompt + image(单张)或 images[](GPT Image 2 最多 16 张)。异步:GET ?task_id= 轮询到完成。本页有 cURL/Python/Node 示例。
可以。所有图片模型同一端点、同一把 Key,靠 model 参数切换,无需逐家注册,比各家官方 API 便宜。