Alibaba
Qwen3.8 Max —— 通义千问最新旗舰。默认开思考,深度用 reasoning_effort 分三档(low / medium / xhigh)自己调,拿延迟和输出成本换答案质量。1M token 上下文,工具调用、JSON 输出、流式齐全,OpenAI 兼容。$2.00 / $6.00 每 1M token。我们不在这个模型之外再加一层内容审核:提示词和回复原样透传。但模型自带的安全检查仍然生效 ——输入被判定为不当内容时,请求会以 data_inspection_failed 被拒,所以这不是一个无过滤的端点。生成内容的审核、以及是否符合当地法规与你自己产品的规则,由你自己负责。
Alibaba
Qwen3.8 Flash —— Qwen3.8 里最便宜的推理档:思考控制和 Max 完全一样,价格约为它的十三分之一。1M token 上下文,工具调用、JSON 输出、流式齐全,OpenAI 兼容。$0.15 / $0.47 每 1M token。我们不在这个模型之外再加一层内容审核:提示词和回复原样透传。但模型自带的安全检查仍然生效 ——输入被判定为不当内容时,请求会以 data_inspection_failed 被拒,所以这不是一个无过滤的端点。生成内容的审核、以及是否符合当地法规与你自己产品的规则,由你自己负责。
TypeSafe
Jev —— TypeSafe 的 System One 决策模型,不是聊天模型:把应用当前的 state 和一组带类型的问题(choice / score / noul)发过去,拿回带概率和置信度的答案,不生成文字。输入每百万 token $0.05、输出免费,按 token 精确计费、没有每次最低收费,失败不收费。POST /v1/systemone 的请求和响应与 TypeSafe 官方完全一致,官方 SDK 只改 base_url 和 key 就能用。
Anthropic
Claude Sonnet 5.5 —— Anthropic 2026 年 9 月 28 日发布的 Claude 5.5 家族第二款模型。官方口径:输出比 Sonnet 5 快 30% 以上,单任务成本最多低 30%,Terminal-Bench 4.0 从 10.3% 升到 70.6%。100 万 token 上下文、128K 最大输出、知识截止 2026 年 6 月;自适应思考默认开,effort 默认 high。APIMODELS 上 $1.20 / $6.00 每 1M token,比官方 $2 / $10 低 40%,缓存读 $0.12、缓存写 $1.50。
OpenAI
GPT-6.1 Sol —— OpenAI 2026 年 9 月 29 日发布的 Sol 升级版:同样是官方 $2 / $10,编程与自动化基准分数高于 GPT-6 Sol,缓存输入降到 $0.10。APIMODELS 上 $1.00 / $5.00 每 1M token,正好官方五折,缓存输入 $0.05。105 万上下文、128K 输出、文本与图像输入,知识截止 2026 年 4 月 30 日;reasoning_effort 从 low 到 max 五档可调;>272K 长上下文按输入 2 倍、输出 1.5 倍计费。裸 gpt-6.1 别名即路由到这里。
ElevenLabs
ElevenLabs 最新、音质最高的语音模型:表达更自然,支持音频标签和 85 种语言。上线价每千字符 $0.04,10 月 12 日起恢复 $0.08。
ElevenLabs
v4 音色的实时版,延迟约 100 毫秒,适合语音助手和实时应用,支持 85 种语言。上线价每千字符 $0.02,10 月 12 日起恢复 $0.04。
Alibaba
角色图加一段参考视频:animate 模式让图里的角色照着视频里的人做动作、做表情;replace 模式保留视频的场景、镜头和动作,只把里面的人换成你的角色。成片长度等于参考视频长度,480p 或 720p,保留参考视频的声音。按参考视频秒数计价:480p $0.0742/秒、720p $0.154/秒,5 秒的舞蹈参考 $0.371 或 $0.77,建单那一刻就定死。
Stealth
匿名提供方的 stealth 预览模型,2026 年 9 月 23 日以 stealth/space-bunny-alpha 出现在 OpenRouter:1M 上下文、最长 524K 输出、可调推理强度、工具调用、图片输入。本站 9 月 29 日用 28 个任务实测:21 过、5 部分、2 败 —— Three.js 场景、纯 CSS 3D 页、Chart.js 仪表盘都能直接跑,七言绝句平仄全对,9.1 万 token 文档里 3 个针全捞到,并行调两个工具只要 2 秒;代码逻辑对但它从不检查自己的输出,拿到手要自己测。预览期每百万 token $0.10 / $0.40。
Doubao
字节跳动豆包 Seedream 5.0 Flash —— 主打速度与成本的极速档:文生图与最多 10 张参考图的图生图同一端点,支持保留透明通道的编辑(输入本身带透明通道的 PNG,输出仍保留透明,不是抠图去背)和图层拆分(1 张底图加最多 16 个带名称和坐标的透明图层),1K / 2K 约 10–15 秒出图,按输出张数每张 $0.03,无水印。
Anthropic
Claude Opus 5.5 —— Anthropic 2026 年 9 月 22 日发布的 Claude 5.5 家族首款模型。官方口径:在大多数工作上达到 Fable 5.1 的水平,而典型负载的运行成本比 Opus 5 低 40%,面向长时间运行的 agent 编码与知识工作。100 万 token 上下文、128K 最大输出、知识截止 2026 年 6 月;自适应思考常开、不能关闭,用 effort 控制深度。APIMODELS 上 $2.40 / $12.00 每 1M token,比官方 $4 / $20 低 40%,缓存读 $0.12。
OpenAI
GPT-6 Sol ——OpenAI GPT-6 家族的主力档,2026 年 9 月与 Luna 同发:把 Astra 的大部分能力放进更快、更便宜的模型。$1.00 / $5.00 每 1M token,正好是官方 $2 / $10 的五折,缓存输入 $0.10。105 万上下文、128K 输出、文本与图像输入,知识截止 2026 年 4 月 20 日;reasoning_effort 从 none 到 max 六档可调;>272K 长上下文按输入 2 倍、输出 1.5 倍计费。裸 gpt-6 别名即路由到 Sol。
OpenAI
GPT-6 Luna —— OpenAI GPT-6 家族的高吞吐档,OpenAI 自己的说法是「面向聚焦的高吞吐任务的最高效模型」,2026 年 9 月与 Sol 同发。$0.09 / $0.45 每 1M token,是官方 $0.10 / $0.50 的九折,缓存输入 $0.009。105 万上下文、128K 输出、文本与图像输入,知识截止 2026 年 5 月 18 日;reasoning_effort 从 none 到 max 六档可调,推理 token 按输出计且占 max_tokens 预算;>272K 长上下文按输入 2 倍、输出 1.5 倍计费。
Fish Audio
Fish Audio S2.1 Pro 语音合成,83 个语种共用一个模型,语音克隆前 20 个免费。两个档位同一个模型:标准档 $0.03、经济档 $0.005(慢一倍、无 SLA)。输出 mp3 / wav / pcm / opus,语速 0.5-2.0 可调。⚠️ 按【UTF-8 字节】计价而不是字符:一个汉字 3 字节,所以中文 1000 字标准档是 $0.09 而不是 $0.03。
DeepSeek
DeepSeek V4.1 Flash —— DeepSeek 快速高吞吐模型的 V4.1 新一代,面向通用对话、摘要和 agent 工具调用。1M token 上下文,支持工具调用、JSON 输出与流式,OpenAI 兼容 /v1/chat/completions。$0.135–$0.27 / $0.54–$1.08 每 1M token(输入/输出,谷时 / 峰时),缓存命中 $0.0027–$0.0054,按 DeepSeek 峰谷时段计价。
OpenAI
【Flare 档】走量用的快档:2.5 的全部能力,延迟约为 GPT Image 2 的一半、同一条提示词下约为 Sunburst 的两倍速,默认 medium 画质。1K、2K 同画质档与 Sunburst 同价,选它图的是速度;到了 4K,Flare 的价格更低。价格按「分辨率 × 画质」分十五格(1K $0.008–$0.08 / 2K $0.020–$0.15 / 4K $0.02–$0.3),只为你要的细节付钱。OpenAI 最新的图像模型。相比 GPT Image 2,提升主要在「改图」:可以指定画面里某一处只改那一处,换衣服不动脸、改文字不动背景;同一个角色或产品在多轮编辑里也不走形,不用再往提示语里堆结构化约束。原生透明底 PNG(GPT Image 2 做不到)、更清晰、更快。API 两档:flare(默认,延迟约为 GPT Image 2 的一半)与 sunburst(精度最高)。手绘 Sketch、创作模板、图上评论改图目前只在 ChatGPT 里,API 没有。
OpenAI
【Sunburst 档】放大看的精度档:每张比 Flare 多花约一倍时间,换来皮肤织物纹理、密集排版、金属反光面这些经得起放大的细节,默认 high 画质。1K、2K 同画质档与 Flare 同价,多付的只是时间;4K 单独定价、比 Flare 高。价格按「分辨率 × 画质」分十五格(1K $0.008–$0.08 / 2K $0.020–$0.15 / 4K $0.02–$0.47),只为你要的细节付钱。OpenAI 最新的图像模型。相比 GPT Image 2,提升主要在「改图」:可以指定画面里某一处只改那一处,换衣服不动脸、改文字不动背景;同一个角色或产品在多轮编辑里也不走形,不用再往提示语里堆结构化约束。原生透明底 PNG(GPT Image 2 做不到)、更清晰、更快。API 两档:flare(默认,延迟约为 GPT Image 2 的一半)与 sunburst(精度最高)。手绘 Sketch、创作模板、图上评论改图目前只在 ChatGPT 里,API 没有。
MuleRouter
视频超分:把低分辨率视频提升到 720p / 1080p / 2K / 4K,用来修复老素材、救低码率片源,或把 AI 生成的视频提到能进剪辑的分辨率。按【源片时长】计费,下单前就知道花多少 —— 30 秒的片子转 1080p 恒定 $0.90。720p $0.02/源片秒、1080p $0.03。Topaz 官方是月付订阅、点数每月清零,超额后加购点数 $0.10 一点(约合 HD $0.067/秒);我们低 55%,按用量付费、没有月费、不清零。
全能视频 Omni Flash 轻量版 —— 和稳定版是同一个 Gemini Omni 视频模型,只是走更便宜的渠道,每条便宜约 63%。代价说在前面:这条渠道出片自带水印,我们交付前会自动去掉,但**去完右下角会留下一小块痕迹**,在浅色或细纹理区域(头发、天空、水面)比在杂乱细节上更明显。其余完全一样 —— 同一个模型、同样的提示词处理、同样有音频。支持文生视频与图生视频(最多 3 张参考图),720p 与 1080p **同价**,4 / 6 / 8 / 10 秒,16:9 / 9:16。这一档**不支持**:4K、视频改写(video_list)、复用音色(audio_ids)、一致性角色(character_ids)—— 这些请用稳定版。**介意右下角那块痕迹的,请直接用稳定版。**
OpenAI
GPT-6 Astra ——OpenAI 2026 年 9 月的旗舰,$2.40 / $12.00 每 1M token,比官方 $10 / $50 低 76%,缓存命中 $0.24。强项是电脑操作与长跑 agent:OSWorld 2.0 拿 72.6%(GPT-5.6 Sol 是 65.7%,且官方称单任务耗时减少 47%)、Terminal-Bench 4.0 57.7% 对 37.3%、SRE-Bench 88.0% 对 55.9%。100 万 token 上下文、12.8 万输出,支持读图。⚠️ 通用编码提升有限(FrontierCode 1.1 只有 53.3%,和 Fable 5.1 的 53.5% 打平)。⚠️ 这个 API 到底给什么、不给什么(2026-09-06 在我们自己的端点上逐项实测,不是照抄参数表):函数调用在 /v1/chat/completions 和 /v1/responses 上都能用;内置的 web_search 能用;code_interpreter 能用。**computer_use_preview 和 file_search 用不了** —— 我们两条上游渠道都拒。所以如果你在 ChatGPT 官方 App 里看到它自己开浏览器、自己操作电脑,而你需要的正是这个行为,这个 API 给不了。另外有件事值得分开看:你看到的那套体验很大一部分是 **App 而不是模型** —— 设计工具、深度研究、沙箱电脑环境都是 OpenAI 围着模型搭的产品脚手架,拿官方 API key 同样拿不到。能跨到任何 API 的是模型本身加函数调用,这部分我们完整提供。
Gemini Omni 1.1 Flash —— 一个模型 id、四种模式,按你传什么自动分流:只给提示词是文生视频;first_frame_url(可选加 last_frame_url)是首尾帧图生视频;最多 7 张参考图、可复用音色(audio_ids)与一致角色(character_ids)走参考生成;video_list 传一段 ≤10 秒的源视频就是视频编辑,输出时长跟随源片。全部模式都输出 720p / 1080p / 4K 并自带同步音轨,4 / 6 / 8 / 10 秒,16:9 或 9:16。按输出秒数计费:720p $0.07/秒、1080p $0.10/秒、4K $0.20/秒,每一档都比 Google 官方($0.10 / $0.15 / $0.30)低至少 30%;带视频输入按分辨率一口价 720p/1080p $0.70、4K $1.05,不看长度。
MiniMax
MiniMax H3 Max Turbo —— MiniMax H3 的后训练加速版:秒级出片而不是分钟级,提示词遵循更强、画面更好看,按秒计费,480P $0.06/秒、768P $0.096/秒,5-15 秒任意整秒。文生视频六种画幅,或首帧(可选尾帧)图生视频。不接多张参考图、参考视频和参考音频。上线价。
Anthropic
Claude Fable 5.1 —— Anthropic 2026 年 9 月的旗舰,$5 / $25 每 1M token,正好是官方 $10 / $50 的一半。相比 Fable 5 的最大变化是"能跑多久":Terminal-Bench-Science 0.1 从 24.7% 提到 52.6%(翻一倍还多),Terminal-Bench 4.0 55.8%、CursorBench 3.2.0 73.4% 也都反超;官方演示过 38 小时无人值守的 agent 跑批。1M 上下文、128K 输出、支持读图。走原生 Anthropic Messages API(/v1/messages),Claude Code、Anthropic SDK、Cursor 直接可用,从 Fable 5 切过来只改模型名。
Gemini 3.8 Flash —— 谷歌 2026 年 9 月 2 日发布的 Flash,$0.450 / $2.250 每 1M token,比谷歌官方 $0.75 / $3.75 低 40%(官方 2027 年 1 月 1 日涨到 $1.50 / $7.50,届时差价拉到 70%)。这一代是奔着编码和 agent 去的:DeepSWE v1.1 登顶、Terminal-Bench 2.1 89.4%,HLE-Verified、Vals Finance Agent v2、Harvey 法律 agent 三项都压过 Claude Opus 5。1M 上下文、64K 输出,输入支持文字/图片/音频/视频/PDF。⚠️ 它比前几代更爱"想",思考 token 按输出价计费,首字延迟实测约 13.3 秒 —— 更适合批处理与 agent,不适合交互式聊天。
MiniMax
MiniMax H3 Lite —— MiniMax H3 多模态视频模型的低价档:和 minimax-h3 同一套 H3 权重,走更便宜的渠道,上限 768P。价格是标准版的五分之一:768P $0.02/秒(minimax-h3 是 $0.097/秒)、480P $0.01/秒,768P 10 秒一条 $0.20 而不是 $0.97。少掉的东西说清楚:没有原生 2K、没有 1080P,不接参考视频,画幅只有 16:9 / 9:16。1-15 秒任意整秒,最多 9 张参考图、3 段参考音频或首尾帧,参考素材免费。不是快模型:每条 5-10 分钟,15 秒的可能更久。**适合动画和小幅度动作**;真人片一旦动作幅度大,人物会崩坏 —— 请当草稿样片用。⚠️ **这是草稿档,不是交付档**:动画、口播、小幅运动很稳,但真人素材一旦有打斗、奔跑、跳舞或快速运镜,**人脸和肢体会变形、人物会走形** —— 这是这一档本身的性质,换任何提示词都修不好。建议用它便宜地把构图和节奏定下来,定稿后再用更高档位重出。
Zhipu
GLM-5.3 —— 智谱最新的推理模型,面向长链路 agent 任务和复杂软件工程,100 万 token 上下文,函数调用能力强。OpenAI 兼容 chat-completions 接口,支持提示词缓存,缓存命中按 $0.247 每 1M 输入 token 计。$1.33 / $4.18 每 1M token,三档均为官方价的 95 折。
Alibaba
阿里万相 3.0 全能视频模型:一个模型名同时覆盖文生视频、首帧/首尾帧图生视频,以及全能参考(最多 10 张图 + 5 段视频 + 5 段音频,总时长各 15 秒内;也可以直接喂一份 PPT/Word/Excel/PDF 或一个公开网页)。原生单镜最长 30 秒、30fps,自带同步音轨(关掉不降价)。提示词里可以用「图1」「视频1」指代素材,这是多角色多道具保持一致的关键。按秒计费:480p $0.045/秒、720p $0.09/秒、1080p $0.18/秒。参考图 / 参考音频 / 文档 / 网页一分不收;但传了参考视频时(视频编辑、视频延长、换脸)按【输入视频时长 + 输出时长】计 —— 与上游一致,官方对这类任务同样限制「输入总时长 + 输出时长 ≤ 30 秒」。传 mode:"prime" 切到高速档 —— 同一条任务实测 58 秒出片(标准档 356 秒),单价高 51–56%(480p $0.068/秒、720p $0.14/秒、1080p $0.28/秒)。我们不在这个模型之外再加一层内容审核:提示词和参考素材原样透传。但模型自带的安全检查仍然生效,而且实测确实会拒 —— 输入和输出都会被筛查,参考素材里含真人面孔的情形经常被拒,所以这不是一个无过滤的端点。生成内容的审核、以及是否符合当地法规与你自己产品的规则,由你自己负责;请仅对已获授权 / 已同意的对象使用。
xAI
xAI 的 Grok Imagine 视频模型:文生、图生同一个模型名,自带同步音轨(对话/音效/环境音),1-15 秒任意时长,成片无水印。按秒计价:480p $0.045/秒、720p $0.0529/秒、1080p $0.0882/秒。
Black Forest Labs
Black Forest Labs 的 FLUX.2 Klein 4B——极速照片级图片生成,约 1-2 秒出图。文生图与图生图同一个模型名,最多 3 张参考图(每张自动压缩到约 1MP),输出固定约 2MP、12 种画幅(含 match_input_image 跟随参考图比例)、jpg/png/webp。一口价 $0.006/张 + 每张参考图 $0.0015。
APIMODELS
数字人视频 —— 一段人物视频 + 一段驱动音频,让视频里的人把这段音频说出来:外观、动作、背景和运镜全部保留原样,只有嘴部按新音频重新驱动。成片长度跟着音频走,按驱动音频的秒数计费 $0.01/秒,是图片版对口型($0.02/秒)的一半。请仅对已获授权 / 已同意的对象使用。
xAI
xAI 最新旗舰,主打长跑 Agent 与多步骤任务,在 Artificial Analysis 智能指数上与 GPT-5.6 Sol 持平。500K 上下文、支持图片输入、四档推理强度;工具调用在 12 路并发 + 嵌套 schema 下实测 12/12。比 xAI 官方低 25%。
xAI
xAI Grok Imagine Image 2.0,已上线可直接调用。目标是做出能直接投入工作的图:严格照指令走、细节不放过,像设计师那样规划排版与版面,一次调用最多融合 3 张参考图,并在多轮编辑之间保留同一张脸、同一件商品、同一个品牌标记。适合信息图、创意海报、商品详情页、游戏素材与电商广告。按分辨率 × 质量分四档:1K low $0.03、2K low $0.04、1K medium $0.045、2K medium $0.06,四档都比 xAI 官方标价低 25%(2K low 低 33%),参考图不额外收费,失败不扣费。
Alibaba
阿里巴巴 Qwen Image 3.0 图像模型。文生图与图像编辑同一端点,传参考图(最多 3 张)即进入编辑。强项是密集图内文字:10px 小字清晰可辨、12 国语言、20+ 字体,报纸菜单试卷这类结构化版面能一次生成到位。1K / 2K 同价 $0.035/张,每张参考图 +$0.004,失败不扣费。
Alibaba
阿里巴巴 Qwen Image 3.0 Pro —— 更高保真的一档。微表情、毛孔、发丝逼近真实摄影,适合主图、人像和细节吃紧的密集排版;同样支持文生图与图像编辑(最多 3 张参考图)、12 国语言与 10px 小字。1K $0.037 / 2K $0.075 每张,每张参考图 +$0.004,失败不扣费。
ByteDance
Seedance 2.5 —— 长片与编辑档:单次出片 4-30 秒(duration 传 -1 由模型自己定长度),一个任务最多 50 个参考素材(30 图 + 10 视频 + 10 音频),并新增视频编辑与视频续写。480p / 720p(没有 1080p,1080p 仍归 Seedance 2.0),输出可选 mp4 或 mov,原生同步音频,真人图可直接传。按真实 token 用量计费,折合 480p $0.120/秒、720p $0.270/秒。
OpenAI
OpenAI gpt-image-2 图像模型。文生图 + 多图编辑(单次最多 16 张参考图)、画幅可控,原生 1K / 2K / 4K,分档计价 $0.025 / $0.03 / $0.05 每张。一个 API Key 覆盖全部模型,国内可直连,无需 OpenAI 组织认证,失败不扣费。
OpenAI
GPT Image 2(All)—— OpenAI 兼容的图片 API。把 OpenAI SDK、Codex、Cursor 的 base_url 指向 https://api.apimodels.app/v1、model 用 gpt-image-2-all,images.generate() / images.edit() 直接可用。完整的分辨率 × 质量矩阵:1K / 2K / 4K 搭配 low / medium / high(以及 auto),支持文生图与多图编辑(最多 16 张参考图)。同步返回、无需轮询,按分辨率 × 质量分档计费,$0.01/张起。生成速度:low 约 40 秒、medium 约 60-90 秒、high 约 2 分钟。一个 API Key,国内可直连,无需 OpenAI 组织认证。
基于 Gemini 3 Pro 的高端图片生成。99% 成功率,最佳画质和可靠性。
Gemini 3 Pro Image 经济渠道。$0.03/张,文生图+编辑,1K/2K/4K,高保真文字渲染。
Google gemini-3-pro-image 正式版(GA)。高画质图像生成与编辑,带高级推理、图内文字高保真,适合成品级素材。按分辨率计价:1K/2K $0.08(比官方便宜 40%)、4K $0.13(便宜 46%)。
基于 Gemini 3.1 Flash 的快速图片生成。支持文生图和图片编辑,1K/2K/4K 画质。
Gemini 3.1 Flash Image 经济渠道。$0.025/张,文生图+编辑,为速度与走量优化。
最便宜的 Gemini 3.1 Flash Image 档位,统一 $0.025/张。文生图与改图都支持(最多 10 张参考图),输出仅 1K。
Gemini 3.6 Flash —— 输入价与 3.5 Flash 持平,输出更便宜,适合 agent 类和长链路任务(成本压在输出而不是提示词上)。$0.662 / $3.302 每 1M token。
Google gemini-3.1-flash-image 正式版(GA)。文生图与对话式编辑同一个端点、同一个价:512 $0.04、1K 与 2K 同为 $0.06、4K $0.10 —— 官方 2K 要 $0.101,这一档便宜 40%,而且在我们这儿从 1K 升到 2K 不加钱。一半请求 14 秒内出图(5,802 次调用实测中位数,成功率 97.2%)。
Google Gemini 2.5 Flash Image,每张统一 $0.02,是本站最便宜的图像模型:没有分辨率档也没有画质档,一次调用就是一个价。文生图与参考图编辑都支持。
Doubao
字节跳动豆包 Seedream 5.0 Pro —— 旗舰画质档,主打可控生产:交互式编辑(用坐标、框选、箭头或手绘标记指哪改哪)与 14+ 语言的图内文字渲染。文生图、单图编辑与最多 10 张参考图的多图融合同一端点,单图输出 1K 或 2K、无水印。1K $0.03、2K $0.06 每张。
Anthropic
Claude Opus 5 ——Anthropic 最新的 Opus 档,相比 Opus 4.8 在深度推理、agent 编码与长跑任务上是一次台阶式提升。$3 / $15 每 1M token,官方 $5 / $25,便宜 40%,缓存命中 $0.391 每 1M token。100 万 token 上下文,默认开自适应思考,原生工具调用;/v1/messages 与 /v1/chat/completions 两条路都能调。
Doubao
最新 Doubao Seedream 5.0 Lite 图片生成。支持文生图、图片编辑和多图融合,2K/3K 分辨率。
Doubao
高质量 Doubao Seedream 4.5 图片生成。支持文生图和图片编辑,2K/4K 分辨率。
Kling
可灵 V3 图像生成。文生图 + 单图参考图生图(image_reference 主体/人脸),1K/2K 分辨率,$0.05/张。
Kling
可灵 V3 全能版(omni-image)。多图参考与融合(image_list)、元素一致性(element_list)、单图/组图输出,1K/2K/4K——1K/2K $0.05、4K $0.10/张。
Kling
Kling AI 图片生成与编辑。支持 1k/2k 分辨率和多图输入,实现创意编辑。
xAI
X 平台推出的多模态 AI 模型,根据文本描述生成高质量图像。支持多种尺寸和风格。
xAI
X 平台升级版多模态 AI 模型,更强理解力与生成细节,实现更高精度图像生成。
SparkPix
SparkPix 亚秒级文生图。1 秒内出图、$0.008/张,画质与文字渲染出色,支持 LoRA。
SparkPix
1 秒内完成的多图编辑模型。快速、实惠,支持精准提示词控制、文字渲染和多图编辑。$0.013/张。
Real-ESRGAN
Real-ESRGAN 高清放大 —— 最适合插画、二次元与手绘 / 绘画作品:最高放大 10 倍,到 4K / 8K / 10K 打印级分辨率,线条锐利、平涂干净。可选 GFPGAN 人脸增强。一口价 $0.004/张。
MiniMax
MiniMax H3(海螺 H3)—— 通用多模态视频模型,不是一堆单一用途工具的拼装。它在同一次推理里同时理解文本、图像、视频和音频,判断这条需求真正想要什么,直接给出画面、动作、声音已经彼此对齐的成片,不需要事后再单独配音、对口型或做动作迁移。落到用法上就是一个接口打通全部场景:只填提示词就是文生视频;要控人物、运镜或音色,就加参考素材——最多 9 张参考图、3 段参考视频、3 段参考音频,全部可选、可任意组合。时长 5-15 秒任意整秒(不是固定档位),画幅可选 adaptive / 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16。分辨率两档、都按秒计费:原生 2K $0.145/s(5 秒 $0.725、15 秒 $2.175),够用时可选 768P $0.097/s(5 秒 $0.485、15 秒 $1.455),便宜三分之一。参考图前 5 张免费、第 6 张起每张 $0.054,只对成功请求计费。
xAI
基于 Grok 的高质量视频生成,6 / 10 / 15 秒可选。支持横屏和竖屏宽高比。
xAI
最新 Grok 视频模型,音频视频同步生成,10 秒输出。
ByteDance
Seedance 2.0 最全能渠道 —— 全模态视频生成:文生 / 首帧 / 首尾帧 / 最多 9 张参考图 / 参考视频 / 参考音频 / 联网搜索 / 原生音频,任意组合。支持真人 + 素材创建。480p / 720p / 1080p,时长 4 / 5 / 6 / 8 / 10 / 12 / 15 秒,按秒计费 $0.092/s 起。
ByteDance
Seedance 2.0 Fast —— 最全能 Seedance 2.0 渠道的提速降价版,保留全模态能力(文生 / 首尾帧 / 最多 9 图 / 参考视频 / 参考音频 / 联网搜索 / 原生音频),支持真人 + 素材创建。480p / 720p,4-15 秒,按秒计费 $0.071/s 起。
OpenAI
GPT-5.6 Sol 是 OpenAI GPT-5.6 家族的旗舰(最强推理)模型,gpt-5.6 别名即路由到 Sol。支持推理 token、文本+图像输入,1,050,000 上下文、128K 最大输出,知识截止 2026 年 2 月。已在 APIMODELS 上线,输入 $1.324 / 输出 $6.618 每百万 token(缓存输入 $0.132),约为 OpenAI 官方价的三分之一:一个 API Key 覆盖全部模型,价格低于官方,国内可直连。
OpenAI
GPT-5.6 Terra 是 GPT-5.6 家族平衡智能与成本的 mini 档,推理更强、速度快,文本+图像输入,1,050,000 上下文、128K 最大输出,支持推理 token,知识截止 2026 年 2 月。已在 APIMODELS 上线,输入 $0.551 / 输出 $3.309 每百万 token(恰为 Sol 的一半),约为官方 $2 / $12 的四分之一强,国内可直连。
OpenAI
GPT-5.6 Luna 是 GPT-5.6 家族面向成本敏感、高并发场景的 nano 档,高推理、速度快,文本+图像输入,1,050,000 上下文、128K 最大输出,支持推理 token,知识截止 2026 年 2 月。已在 APIMODELS 上线,输入 $0.16 / 输出 $0.96 每百万 token(较官方 $0.20/$1.20 低 20%),模型名 gpt-5.6-luna-max,按量计费,国内可直连。
ByteDance
Seedance 2.0 Mini —— Seedance 2.0 里最省的一档:输入能力和标准版一样(文生 / 首帧 / 首尾帧 / 最多 9 张参考图 / 参考视频 / 参考音频 / 联网搜索),原生同步音频也保留。480p / 720p、4-15 秒,按秒计费 480p $0.044/秒、720p $0.095/秒,仅成功扣费。适合分镜、草稿与大批量试跑;要 1080p 或最佳运动质量请用 seedance-2.0。请仅对已获授权 / 已同意的对象使用。
xAI
Grok 4.5 是 xAI 最新旗舰模型,在编程、非幻觉率、Agent 工具调用与指令跟随上引领行业,支持非推理与推理两种模式,500K 上下文。通过 OpenAI 格式的 /v1/chat/completions 调用,输入 $1.275 / 输出 $4.25 每百万 token,低于 xAI 官方(官方 $2/$6,输入省 36%、输出省约 29%)。
ByteDance
Seedance 2.0 影视版 —— ByteDance Seedance 2.0 的影视级(Cinematic)版本。最大亮点:真人 / 拟真人脸参考图可直接传,最多 4 张参考图做身份锁定的图生视频,适合影视级人物 / 肖像创作。生成通常需要 60-180 秒。文生 / 图生视频,5 / 10 / 15 秒,按时长计费 $1.00 / 5s 起。请仅对已获授权的对象使用。
Suno
Suno 音乐生成 —— 一句话出整首带人声的歌,旋律、编曲、演唱、歌词一次到位,不是文字转语音。同一个模型名按"传哪些字段"自动路由十几种模式:灵感/自定义歌词/纯音乐、续写、翻唱、局部改写、加伴奏、加人声、重制、哼唱成曲、拼接、歌手风格复用(persona)、音效。版本用 mv 参数选,chirp-v5 / v5-5 / v4-5 / v4 都可以。每次调用返回 2 个版本,带封面和完整歌词,$0.26/次(即单曲 $0.13);音效 $0.05/次;生成歌词与建 persona 免费。
ByteDance
Dreamina Seedance 2.0 —— 国际线,原生最高 4K(10-bit),不做放大。全模态:文生 / 首帧 / 首尾帧 / 最多 9 张参考图 / 参考视频 / 参考音频 / 原生同步音频。480p $0.10/s、720p $0.22/s、1080p $0.55/s、4K $2.57/s,4-15 秒。注意:这条线不接受真人参考素材(上游政策),真人视频请用我们的 Seedance 2.0 / Seedance 2.0 Mini(模型名 seedance-2.0 / seedance-2.0-mini,同一个 Key)。
ByteDance
Dreamina Seedance 2.0 Fast —— 国际线的提速降价档,全模态能力不缩水(文生 / 首尾帧 / 最多 9 张参考图 / 参考视频 / 参考音频 / 原生音频),原生 480p 或 720p。480p $0.0644/s、720p $0.1372/s,4-15 秒。
ByteDance
Dreamina Seedance 2.0 Mini —— 国际线里最便宜的一档,全模态能力保留(文生 / 首尾帧 / 最多 9 张参考图 / 参考视频 / 参考音频 / 原生音频),原生 480p 或 720p。480p $0.0225/s、720p $0.048/s,4-15 秒。走量首选。
Google VEO 3.1 标准档,真 1080p、8 秒一条,音轨随画面生成。文生视频,或 1 张图当首帧、2 张图做首尾帧。每条 $1.00(Google 官方 $3.20);批量出草稿用同为 1080p 的 Fast 档 veo-3.1-fast-fhd,$0.07。
VEO 3.1 快速 720p 档。固定 8 秒,支持参考图,$0.07/条。
Anthropic
Claude Fable 5 是 Anthropic 高端的公开可用大语言模型,在 APIMODELS 上价格约为官方的一半(比官方便宜约 50%,输入 $5 / 输出 $25 每百万 token)。开箱支持 Claude Code、Anthropic SDK 及 Cursor 等 Anthropic 兼容客户端调用。具备超长上下文、多模态(识图)理解、复杂推理与企业级知识工作能力,并带严格安全保护。通过 Anthropic Messages API(/v1/messages)提供原生工具调用,请求参数与 Opus 4.8 一致。
Anthropic
Claude Sonnet 5 是 Claude Sonnet 5.5(Anthropic 最新的 Sonnet,2026 年 9 月 28 日发布)之前的一代 Sonnet,默认且最大都是 100 万 token 上下文窗口(没有更小的上下文变体)、最大 128K 输出 token、自适应思维,工具与平台功能与 Claude Sonnet 4.6 相同,唯一例外是不支持优先级(Priority Tier)。在 APIMODELS 上 $1.60 输入 / $8.00 输出(每百万 token,较官方 $2/$10 低 20%),并支持提示词缓存(缓存命中 $0.10/M、缓存写入 $1.40/M);计费的输出 token 含模型内部思考 token,与 Anthropic 官方口径一致。通过 Anthropic Messages API(/v1/messages)提供原生工具调用,Claude Code、Anthropic SDK 及 Cursor 等 Anthropic 兼容客户端可直接接入,请求参数与 Opus 4.8 一致。
VEO 3.1 快速 1080p 档。固定 8 秒,支持参考图(1 张 = 首帧,2 张 = 首尾帧),$0.07/条(与 720p 同价出 1080p)。
APIMODELS
AI 对口型 —— 一张人像照片 + 一段音频,让照片里的人把这段音频说出来,口型和表情逐帧对上。真人照、插画、AI 生成的脸都能用,输出 mp4。成片时长跟着音频走,所以按秒计费 $0.02/秒(10 秒 = $0.20)。
ElevenLabs
超低延迟模型,支持 32 种语言。适合实时对话场景。
ElevenLabs
高质量低延迟模型,支持 32 种语言。适合对速度有要求的开发场景。
ElevenLabs
最逼真、最富情感的模型,支持 29 种语言。适合配音、有声书和后期制作。
ElevenLabs
最具表现力的模型,支持 70+ 种语言。支持 [laughs]、[whispers] 等音频标签实现情感控制。
ElevenLabs
多角色对话生成,自然对话流。适合播客和有声书制作。
ElevenLabs
从背景噪声、音乐和环境音中提取人声。高质量音频提取。
ElevenLabs
翻译音频/视频并保留情感、节奏和语调。自动唇形同步。
APIMODELS
视频字幕擦除。去除硬字幕、画面文字、水印与角标 logo,在原位重建干净背景;自动模式替你找文字,区域模式按你框的范围处理(水印和台标走这个),支持时间段定位,输出分辨率与输入一致(最高 1080p),$0.015 每秒。
Lightricks
LTX-2.3 视频 —— 文生视频 + 图生视频二合一:只填提示词即文生视频,加一张参考图即图生视频(自动识别)。支持 480p / 720p / 1080p、16:9 / 9:16,文生 5-15 秒、图生 5-20 秒。按秒计费:480p $0.02/s、720p $0.04/s、1080p $0.045/s。
全能视频 Omni Flash 稳定版 —— 功能最全的一档 Gemini Omni 视频模型:文生视频、图生视频(最多 7 张参考图)、视频改写(video_list),另可复用音色(audio_ids)与一致性角色(character_ids)。720p / 1080p / 4K,6 / 8 / 10 秒,16:9 / 9:16,可选 seed。按次计费:720p 与 1080p 同价 $0.35-$0.6、4K $0.7-$1.0;带视频输入按分辨率固定价(720p/1080p $0.8、4K $1.2)。注意配额:图片×1 + 视频×2 + 角色×1 合计 ≤ 7。
全能视频 Omni Flash —— 一个模型同时覆盖文生视频、图生视频与视频编辑:纯文本直接生成,或上传 1 张 / 3 张参考图做单图动态化或多图融合(注意:上游不支持 2 张),也可传参考视频(≤10s)做改写。支持 720p / 1080p / 4K、6 / 8 / 10 秒、可选 16:9 / 9:16,按秒计费:720p $0.06/秒、1080p $0.065/秒、4K $0.12/秒。
ByteDance
字节跳动即梦动作模仿 V2。单图+参考视频精准驱动角色动作,支持多人同框、二次元和宠物,$0.06/秒。
DeepSeek
DeepSeek V4 Flash —— V4 家族里轻量高吞吐的一档,面向通用对话和常规文本任务。1M token 上下文,支持工具调用、JSON 输出与流式,OpenAI 兼容 /v1/chat/completions。$0.135–$0.27 / $0.54–$1.08 每 1M token(输入/输出,按 UTC 时段峰谷浮动),缓存命中 $0.0027–$0.0054,比 DeepSeek 官方价低约 10%。
DeepSeek
DeepSeek V4 Pro —— DeepSeek 的高性能档,推理与 agent 能力对标第一梯队,1M token 上下文。通过 reasoning_content 返回完整思维链,支持工具调用、JSON 输出与流式,OpenAI 兼容。$0.6237–$1.247 / $1.871–$3.742 每 1M token(按 UTC 时段峰谷浮动),缓存命中 $0.0208–$0.0416,比官方价低约 5%。
Alibaba
Qwen3.7 Max —— Qwen3.7 家族的旗舰:本代最强的推理与 agent 能力,1M token 上下文,混合思考(reasoning_content)。支持工具调用、JSON 输出与流式,OpenAI 兼容。$2.25 / $6.75 每 1M token,比阿里官方低 10%。
Alibaba
Qwen3.7 Plus —— Qwen3.7 家族里性价比最高的一档:推理与 agent 能力接近 Max,价格只是其零头,1M token 上下文,混合思考(reasoning_content)。支持工具调用、JSON 输出与流式,OpenAI 兼容。$0.36 / $1.44 每 1M token。
Kling
可灵 AI 对口型视频生成。帧级口型同步,支持真实人物、3D 及 2D 动画角色,支持本地音频和在线配音。
Kling
可灵对口型语音合成。支持多语言多方言、语速调节、情感风格、音色克隆。
OpenAI
GPT-5.4 是 OpenAI 面向复杂专业工作与 Agent 编码的前沿模型。通过 Responses API(/v1/responses)调用,推理强度用请求体的 reasoning.effort(low–xhigh)控制,支持联网搜索、函数调用与多模态输入。OpenAI Codex 设 wire_api = "responses" 即可直接接入。
Zhipu
GLM-5.2 —— 智谱的推理模型,函数调用 / 工具使用能力强,OpenAI 兼容 chat-completions 接口。支持提示词缓存,缓存命中按 $0.26 每 1M 输入 token 计。$1.26 / $3.96 每 1M token。
Kling
角色动作控制视频生成。提供参考图片和动作视频,即可创建动画内容。
OpenAI
GPT-5.5 是 OpenAI 面向 Agent 编码、知识工作、科研与复杂多步任务的高级推理模型。通过 Responses API(/v1/responses)调用,支持可调推理强度(low–xhigh)、联网搜索、函数调用与多模态输入。OpenAI Codex 设 wire_api = "responses" 即可直接接入。
Kling
Kling V3 Omni-Video,支持扩展时长和保留原声的视频编辑功能。
Kling
最新可灵 V3 视频生成。3-15 秒可变时长,支持文生视频和图生视频,可选音频。按秒分档计费(标准 $0.12/s 起,专业+音频 $0.24/s)。
Pruna AI
Pruna AI 快速视频生成。文生/图生/音频生视频,内置音频与对白,1080p 48FPS,草稿模式约 4 倍速预览。
Minimax
MiniMax speech-2.8-hd 最新高保真 TTS,情感语调自然,支持声音克隆与声音设计。$0.063/千字符。
Minimax
MiniMax speech-2.8-turbo 最新快速经济 TTS,性价比高、多语言强,支持声音克隆与声音设计。$0.04/千字符。
Minimax
MiniMax speech-02-hd 高保真 TTS,情感语调自然,支持声音克隆与声音设计。$0.063/千字符。
Anthropic
claude-opus-4-8 是目前 Anthropic 最强的"能一个人扛住长时间复杂工作的工具",特别适合开发者做大项目、建 Agent,或者对质量和自主性要求极高的场景。
Anthropic
Claude Opus 4.7 支持 100 万 token 上下文窗口、128K 最大输出 token、自适应思维,与 Opus 4.6 拥有相同的工具与平台能力。
Anthropic
Claude Opus 4.7 扩展思维版,显式开启长链推理,适用于最复杂的任务。
Gemini 3.5 Flash 已正式发布(GA),性能稳定、可大规模投产。这一代最聪明的 Flash 档,在智能体执行、编码与长链任务上持续领先。$0.662 / $3.971 每 1M token。
最具性价比的多模态模型,速度最快,适用于高频轻量级任务。
最新 Pro 模型,具备增强推理和多模态能力。
Kling
从音频样本创建自定义声音。上传 .mp3/.wav/.mp4/.mov (5-30秒) 或引用视频 ID。
Kling
视频人脸识别,传入 videoUrl 或 videoId,返回 sessionId 和 faceId,用于可灵对口型视频生成。
Anthropic
最新 Opus 模型,具备终极性能和推理能力。
Anthropic
Claude Opus 4.6 扩展思维版,适用于最复杂的推理任务。
Anthropic
Claude Sonnet 4.6,较早一代的 Sonnet,兼顾质量与效率;目前最新的 Sonnet 是 Sonnet 5.5。
Anthropic
Claude Sonnet 4.6 扩展思维版,适用于复杂推理任务。
Kling
从文字描述生成音效。3-10 秒音频,自然音质。
Kling
为视频自动生成音效和背景音乐。支持 ASMR 模式,打造沉浸式内容。
Kling
文字转语音,多种声音可选。可调语速,支持多语言。
Minimax
Minimax (海螺) 高清异步 TTS。表现力丰富,韵律自然。支持声音克隆和声音设计。
Minimax
Minimax (海螺) 快速经济异步 TTS。支持声音克隆、声音设计和发音词典。
xAI
Grok 图片生成的便宜档:$0.0075/张,只要标准档的四分之一。文生图 + 单参考图编辑,原生 1K/2K 同价(2K 不加钱)。
快速高效的多模态模型。适合快速响应和简单任务。
高级多模态推理模型,具备卓越能力。
Gemini 3 Pro 扩展思维版,适用于复杂推理任务。
Anthropic
最新 Opus 模型,具备增强能力和改进推理。
Anthropic
Claude Opus 4.5 扩展思维版,适用于最复杂的推理任务。
Anthropic
快速且经济的轻量级任务模型。适合简单查询和快速响应。
Anthropic
Claude Haiku 4.5 扩展思维版,适用于复杂推理任务。
Anthropic
Claude Sonnet 4.5,Claude 4.5 世代的 Sonnet,性能和效率较更早的 Sonnet 有提升;目前最新的 Sonnet 是 Sonnet 5.5。
Anthropic
Claude Sonnet 4.5 扩展思维版,适用于复杂推理任务。
OpenAI
小型嵌入模型,高效且经济,适用于大多数场景。
OpenAI
大型嵌入模型,精度更高,维度灵活可调。
ByteDance
⚠️ 仅适合测试和个人工作室使用。不稳定渠道:上游繁忙时可能返回「负载已饱和」而出不了片,失败会自动全额退款;生产环境或必须成功的任务请用 seedance-2.5。Seedance 2.5 Global —— 形状固定、一口价的 Seedance 2.5:每次固定出 30 秒 720p,不论怎么传都是 $2.00。同样 30 秒 720p 在 seedance-2.5 上按 $0.270/秒计约 $8.10,所以这条约为四分之一价。只支持文生视频和最多 9 张参考图,**不收参考视频、不收参考音频**(传了直接 400),**没有视频编辑、没有视频续写、不支持真人**;时长和分辨率都不是参数,传别的值会在创建时直接 400 而不是被悄悄改写。音轨恒开且无法关闭。⚠️ 不适合高并发,请逐条发、别一次性打一批。