Claude API 代理,按 Token 计费。兼容 Anthropic API 格式。
Messages API 兼容官方 Anthropic API 格式,支持流式输出、图像识别、工具调用和扩展思考功能。
/api/v1/chat/completions价格单位:每 1M tokens
| 模型 | 输入 | 输出 | 描述 |
|---|---|---|---|
| claude-opus-5 | $3.0000/1M | $15.0000/1M | 最新 Opus · 100万上下文 · 智能体编程 |
| claude-fable-5-1 | $5.0000/1M | $25.0000/1M | Fable 最新一代,与 Fable 5 同价 |
| claude-fable-5 | $5.0000/1M | $25.0000/1M | 公开高性能,多模态 + 超长上下文 |
| claude-opus-4-8 | $3.0000/1M | $13.0001/1M | 最强 Opus,长时复杂任务 |
| claude-opus-4-7 | $3.6760/1M | $18.3820/1M | 1M 上下文,自适应思维 |
| claude-opus-4-7-thinking | $3.6760/1M | $18.3820/1M | Opus 4.7 + 思考 |
| claude-haiku-4-5-20251001 | $0.3530/1M | $1.7650/1M | 快速实惠 |
| claude-haiku-4-5-20251001-thinking | $0.3530/1M | $1.7650/1M | Haiku + 思考 |
| claude-sonnet-4-5-20250929 | $1.0590/1M | $5.2950/1M | Sonnet 4.5 |
| claude-sonnet-4-5-20250929-thinking | $1.0590/1M | $5.2950/1M | Sonnet 4.5 + 思考 |
| claude-sonnet-5 | $1.6000/1M | $8.0000/1M | 最新 Sonnet · 100万上下文 · 自适应思维。输出 token 含思考 token |
| claude-sonnet-4-6 | $1.0590/1M | $5.2950/1M | 最新 Sonnet |
| claude-sonnet-4-6-thinking | $1.0590/1M | $5.2950/1M | 最新 Sonnet + 思考 |
| claude-opus-4-6 | $1.7650/1M | $8.8240/1M | 最新 Opus |
| claude-opus-4-6-thinking | $1.7650/1M | $8.8240/1M | 最新 Opus + 思考 |
| claude-opus-4-5-20251101 | $1.7650/1M | $8.8240/1M | Opus 4.5 |
| claude-opus-4-5-20251101-thinking | $1.7650/1M | $8.8240/1M | Opus 4.5 + 思考 |
curl -X POST https://api.apimodels.app/v1/messages \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-4-5-20250929",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "Hello, Claude!"}
]
}'{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"content": [
{
"type": "text",
"text": "Hello! How can I help you today?"
}
],
"model": "claude-sonnet-4-5-20250929",
"stop_reason": "end_turn",
"usage": {
"input_tokens": 12,
"output_tokens": 10
}
}对于 *-thinking 模型,您可以启用扩展思考功能来处理复杂推理任务。
curl -X POST https://api.apimodels.app/v1/messages \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-4-5-20250929-thinking",
"max_tokens": 16000,
"thinking": {
"type": "enabled",
"budget_tokens": 10000
},
"messages": [
{"role": "user", "content": "Solve this step by step: What is 15% of 340?"}
]
}'设置 stream: true 以接收 Server-Sent Events (SSE)。长生成请务必用流式:非流式请求若 ~100 秒内没有首字节,会撞上 CDN 网关超时、拿到一张 HTML 524 页 —— 而生成在服务端其实已完成并按实际用量计费。预计输出超过几百 token、或使用思考/推理类模型时,请用 stream,或改用异步轮询。
curl -X POST https://api.apimodels.app/v1/messages \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "claude-sonnet-4-5-20250929",
"max_tokens": 1024,
"stream": true,
"messages": [
{"role": "user", "content": "Write a short poem about coding."}
]
}'重复的前缀 —— 系统提示词、整段代码库、一份长文档 —— 可以在上游缓存下来,再次读取时只按输入价的一小部分计费。缓存价按模型各不相同,具体价格看各模型详情页。
Claude:在稳定前缀的最后一个 block 上打 cache_control。命中部分在 usage 里是 cache_read_input_tokens,写入是 cache_creation_input_tokens,5 分钟与 1 小时两档 TTL 拆在 cache_creation 下面。本站两档 TTL 同价,所以显式传 ttl:"1h" 不会多收钱。
⚠️ 缓存前缀必须在多次调用之间逐字节一致 —— 改动一个字符(一个时间戳、工具列表换了顺序)就会 miss,整段按全价输入收。把所有会变的内容放到 prompt 的最后面。
{
"model": "claude-fable-5-1",
"max_tokens": 1024,
"system": [
{
"type": "text",
"text": "<long, unchanging instructions or document>",
"cache_control": { "type": "ephemeral" }
}
],
"messages": [{ "role": "user", "content": "<the part that changes>" }]
}积分按实际 token 用量计算,分四档:全价输入、缓存命中输入、缓存写入、输出。⚠️ 推理 / 思考 token 按输出价计费,而且不在你看得见的答案里 —— Claude 计入 output_tokens,Gemini 是 usageMetadata 里与 candidatesTokenCount 并列的 thoughtsTokenCount,GPT-5.6 是 completion_tokens 里的 reasoning_tokens。爱思考的模型,账单可能是可见回答的好几倍。失败请求不计费。
费用 = (input_tokens * 输入价 + cached_tokens * 缓存读价
+ cache_write_tokens * 缓存写价 + output_tokens * 输出价) / 1,000,000
积分 = 费用 // 金额单位为美元 ($)下列所有模型通过统一 API、一个 key 即可调用。点击模型查看完整 playground 与文档。
| 模型 | model 参数 | 价格 | 说明 |
|---|---|---|---|
| Claude Opus 5 | claude-opus-5 | $3 / $15 | Claude Opus 5 是 Anthropic 最新的 Opus 档模型,相对 Opus 4.8 的提升是台阶式的,集中在深度推理、agent 编码和需要连续跑很久的长任务上 —— 多文件特性开发、大规模重构这类活儿是它最舒服的位置。上下文 100 万 token,自适应思考默认开着、没有思考预算需要你调,原生支持工具调用(function calling)。价格上,我们这边输入 $3 / 输出 $15 每 1M token,Anthropic 官方是 $5 / $25,便宜 40%;提示词缓存命中按 $0.25 每 1M token 计。两条调用路径都通:走原生 Anthropic Messages API(/v1/messages),Claude Code、Anthropic SDK 和 Cursor 直接可用;走 /v1/chat/completions 用 OpenAI SDK 也行,两边的工具调用都正常。有一个坑要先知道,不然你会以为自己的参数没生效:Opus 5 在上游把 temperature、top_p、top_k 这三个参数取消了,你传过去不会报错、而是被静默丢弃 —— 所以想控制输出的风格和随机性,请改用提示词去约束,别指望调这三个数。 |
| Claude Fable 5.1 | claude-fable-5-1 | $5 / $25 | Claude Fable 5.1 是 Anthropic 在 2026 年 9 月发布的旗舰模型,在 APIMODELS 上输入 $5、输出 $25 每 1M token —— 正好是 Anthropic 官方 $10 / $50 的一半。提示词缓存这边也更便宜:缓存读 $0.22(官方 $0.25)、缓存写 $5.778(官方 5 分钟 $12.50 / 1 小时 $20,我们两档同价),所以是输入、输出、缓存读、缓存写四档全部低于官方,不只是输入输出两档。相比 Fable 5,这一代真正拉开差距的是长时间 agent 任务的耐力:Terminal-Bench-Science 0.1 从 24.7% 提到 52.6%(Opus 5 是 29.0%),等于翻了一倍还多;Terminal-Bench 4.0 55.8%(Fable 5 是 42.0%)、CursorBench 3.2.0 73.4%(70.5%)、AutomationBench 31.4%(17.1%)、OSWorld 2.0 严格模式 41.7%(36.1%)、带工具的 Humanity’s Last Exam 65.0%(63.8%),GDPval-AA v2 的 Elo 从 1723 涨到 1853。官方拿它演示过 38 小时无人值守的 agent 连续跑批,以及多小时的科研任务。规格上是 1M token 上下文、最多 128K 输出,输入支持文字与图片。调用走原生 Anthropic Messages API(/v1/messages) —— 也就是 Claude Code、Anthropic 官方 SDK 和 Cursor 这类 Anthropic 兼容客户端的原生路径,原生工具调用与提示词缓存都可用。请求参数与 Fable 5 一致,从 Fable 5 迁过来只需要改一个模型名。通过统一接口调用,一个 API Key 同时可用图片、视频、音频模型。 |
| Claude Fable 5 | claude-fable-5 | $5 / $25 | Claude Fable 5 是 Anthropic 高端的公开可用大语言模型,在 APIMODELS 上价格约为官方的一半(比官方便宜约 50%,输入 $5 / 输出 $25 每百万 token)。开箱支持 Claude Code、Anthropic SDK 及 Cursor 等 Anthropic 兼容客户端调用。具备超长上下文、多模态(识图)理解、复杂推理与企业级知识工作能力,并带严格安全保护。通过 Anthropic Messages API(/v1/messages)提供原生工具调用,请求参数与 Opus 4.8 一致。 |
| Claude Opus 4.8 | claude-opus-4-8 | $3 / $13 | claude-opus-4-8 是目前 Anthropic 最强的"能一个人扛住长时间复杂工作的工具",特别适合开发者做大项目、建 Agent,或者对质量和自主性要求极高的场景。 |
| Claude Opus 4.7 | claude-opus-4-7 | $3.676 / $18.382 | Claude Opus 4.7 支持 100 万 token 上下文窗口、128K 最大输出 token、自适应思维,与 Opus 4.6 拥有相同的工具与平台能力。 |
| Claude Opus 4.7 (Thinking) | claude-opus-4-7-thinking | $3.676 / $18.382 | Claude Opus 4.7 扩展思维版,显式开启长链推理,适用于最复杂的任务。 |
| Claude Opus 4.6 | claude-opus-4-6 | $1.765 / $8.824 | 最新 Opus 模型,具备终极性能和推理能力。 |
| Claude Opus 4.6 (Thinking) | claude-opus-4-6-thinking | $1.765 / $8.824 | Claude Opus 4.6 扩展思维版,适用于最复杂的推理任务。 |
| Claude Sonnet 5 | claude-sonnet-5 | $1.60 / $8.00 | Claude Sonnet 5 是 Anthropic 最新的 Sonnet 模型,默认且最大都是 100 万 token 上下文窗口(没有更小的上下文变体)、最大 128K 输出 token、自适应思维,工具与平台功能与 Claude Sonnet 4.6 相同,唯一例外是不支持优先级(Priority Tier)。在 APIMODELS 上 $1.60 输入 / $8.00 输出(每百万 token,较官方 $2/$10 低 20%),并支持提示词缓存(缓存命中 $0.10/M、缓存写入 $1.40/M);计费的输出 token 含模型内部思考 token,与 Anthropic 官方口径一致。通过 Anthropic Messages API(/v1/messages)提供原生工具调用,Claude Code、Anthropic SDK 及 Cursor 等 Anthropic 兼容客户端可直接接入,请求参数与 Opus 4.8 一致。 |
| Claude Sonnet 4.6 | claude-sonnet-4-6 | $1.059 / $5.295 | 最新 Sonnet 模型,具备最佳性能和效率。 |
| Claude Sonnet 4.6 (Thinking) | claude-sonnet-4-6-thinking | $1.059 / $5.295 | Claude Sonnet 4.6 扩展思维版,适用于复杂推理任务。 |
| Claude Opus 4.5 | claude-opus-4-5-20251101 | $1.765 / $8.824 | 最新 Opus 模型,具备增强能力和改进推理。 |
| Claude Opus 4.5 (Thinking) | claude-opus-4-5-20251101-thinking | $1.765 / $8.824 | Claude Opus 4.5 扩展思维版,适用于最复杂的推理任务。 |
| Claude Sonnet 4.5 | claude-sonnet-4-5-20250929 | $1.059 / $5.295 | 最新 Sonnet 模型,性能和效率均有提升。 |
| Claude Sonnet 4.5 (Thinking) | claude-sonnet-4-5-20250929-thinking | $1.059 / $5.295 | Claude Sonnet 4.5 扩展思维版,适用于复杂推理任务。 |
| Claude Haiku 4.5 | claude-haiku-4-5-20251001 | $0.353 / $1.765 | 快速且经济的轻量级任务模型。适合简单查询和快速响应。 |
| Claude Haiku 4.5 (Thinking) | claude-haiku-4-5-20251001-thinking | $0.353 / $1.765 | Claude Haiku 4.5 扩展思维版,适用于复杂推理任务。 |
| Gemini 3.8 Flash | gemini-3.8-flash | $0.450 / $2.250 | Gemini 3.8 Flash 是谷歌 2026 年 9 月 2 日发布的 Flash 模型,在 APIMODELS 上输入 $0.450、输出 $2.250 每 1M token,比谷歌自己的 $0.75 / $3.75 低 40%;那个价是限时价,2027 年 1 月 1 日起官方涨到 $1.50 / $7.50,届时这里的差价会拉到 70%。谷歌这一代明说是奔着编码和 agent 去的、不是冲最难的前沿推理,公开成绩也是这个走向:DeepSWE v1.1 登顶、Terminal-Bench 2.1 拿到 89.4%,并且在 HLE-Verified(54.9% 对 54.4%)、Vals Finance Agent v2(61.4% 对 58.6%)、Harvey 法律 agent(10.0% 对 6.7%)三项上压过 Claude Opus 5。规格是 1M token 上下文、64K 输出,输入支持文字、图片、音频、视频和 PDF,知识截止 2026 年 3 月。两个需要事先知道的实测短板:一是它比前几代明显更爱"想",而思考 token 按输出价计费 —— 我们自己探针里让它回一个两个词的答案,它烧掉了 83 个思考 token,所以实际账单会高于按可见输出估的数;二是 Artificial Analysis 测到的首字延迟约 13.3 秒(全站中位数是 2.99 秒),适合批处理和 agent 长跑,不适合要求秒回的交互式场景。如果是短请求、高并发、单价和延迟说了算,Gemini 3.1 Flash Lite($0.375 / $2.25)更合适。通过统一接口调用,一个 API Key 同时可用图片、视频、音频模型。 |
| Gemini 3.6 Flash | gemini-3.6-flash | $0.662 / $3.302 | Gemini 3.6 Flash 相比 3.5 Flash,输入价持平、输出更便宜 —— 这个定价结构对 agent 类和长链路任务特别友好:那类任务的成本大头在模型产出而不是提示词上,输出降价直接压低总账。价格 $0.662 / $3.302 每 1M token。通过统一接口调用,一个 API Key 同时可用图片、视频、音频模型。 |
| Gemini 3.5 Flash | gemini-3.5-flash | $0.662 / $3.971 | Gemini 3.5 Flash 已正式发布 (GA),性能稳定,可大规模用于生产。最智能的 Flash 模型,在智能体执行、编码与长链任务上持续领先。 |
| Gemini 3.1 Flash Lite | gemini-3.1-flash-lite | $0.375 / $2.25 | 最具性价比的多模态模型,速度最快,适用于高频轻量级任务。适合大规模 Agent 任务、简单数据提取和超低延迟应用。 |
| Gemini 3.1 Pro Preview | gemini-3.1-pro-preview | $0.882 / $5.294 | 最新 Pro 模型,具备增强推理和多模态能力。 |
| Gemini 3 Flash Preview | gemini-3-flash-preview | $0.2 / $1.2 | 快速高效的多模态模型。适合快速响应和简单任务。 |
| Gemini 3 Pro Preview | gemini-3-pro-preview | $1.6 / $9.6 | 高级多模态推理模型,具备卓越能力。 |
| Gemini 3 Pro (Thinking) | gemini-3-pro-preview-thinking | $1.6 / $9.6 | Gemini 3 Pro 扩展思维版,适用于复杂推理任务。 |
| GPT-6 Astra | gpt-6-astra | $2.40 / $12.00 | GPT-6 Astra 是 OpenAI 在 2026 年 9 月发布的旗舰模型,在 APIMODELS 上输入 $2.40、输出 $12.00 每 1M token,比官方 $10 / $50 低 76%,缓存命中 $0.24。真正拉开差距的是电脑操作(computer use)和长跑 agent:OSWorld 2.0 拿 72.6%,GPT-5.6 Sol 是 65.7%,官方还称单任务耗时减少 47%;Terminal-Bench 4.0 57.7% 对 Sol 的 37.3%;SRE-Bench 单次尝试 88.0% 对 55.9%;ExploitBench 100% 对 78.5%。另一块实打实的进步是长上下文检索 —— OpenAI MRCR v2 八针测试在 512K–1M 区间拿到 96.3%,Sol 只有 73.8%。数理方向也领先:FrontierMath Tier 4 v2 97.6%、GPQA Diamond 96.0%。⚠️ 但要知道哪些**没有**变:通用编码的提升很小,FrontierCode 1.1 只有 53.3%,和 Fable 5.1 的 53.5%、Opus 5 的 53.4% 基本打平,DeepSWE v1.1 是 74.1%;带工具的 Humanity’s Last Exam 反而落后 Claude,57.2% 对 Fable 5.1 的 65.0%。还有被广泛引用的 ARC-AGI-3 99.9% —— 那个成绩需要 OpenAI 自己的有状态适配器,**直接调 API 拿不到**。规格:上下文 105 万 token、最大输出 12.8 万,输入支持文字与图片;单次输入超过 27.2 万 token 时按输入 2 倍、输出 1.5 倍计费,与 GPT-5.6 同一档。通过 OpenAI 兼容的 /v1/chat/completions 或 /v1/responses 调用,一个 API Key 通用,国内可直连、无需组织认证,失败不计费。⚠️ 这个 API 到底给什么、不给什么(2026-09-06 在我们自己的端点上逐项实测,不是照抄参数表):函数调用在 /v1/chat/completions 和 /v1/responses 上都能用;内置的 web_search 能用;code_interpreter 能用。**computer_use_preview 和 file_search 用不了** —— 我们两条上游渠道都拒。所以如果你在 ChatGPT 官方 App 里看到它自己开浏览器、自己操作电脑,而你需要的正是这个行为,这个 API 给不了。另外有件事值得分开看:你看到的那套体验很大一部分是 **App 而不是模型** —— 设计工具、深度研究、沙箱电脑环境都是 OpenAI 围着模型搭的产品脚手架,拿官方 API key 同样拿不到。能跨到任何 API 的是模型本身加函数调用,这部分我们完整提供。 |
| GPT-5.6 Sol | gpt-5-6-sol | $1.324 / $6.618 | GPT-5.6 Sol 是 OpenAI GPT-5.6 家族的旗舰、最强推理模型,大致对应早期 GPT-5 家族无后缀的顶配档;gpt-5.6 别名即路由到 Sol。支持推理 token、文本+图像输入与文本输出,1,050,000 token 上下文、128,000 最大输出 token,知识截止 2026 年 2 月 16 日。已在 APIMODELS 上线,输入 $1.324 / 输出 $6.618 每百万 token(缓存输入 $0.132),约为 OpenAI 官方 $4 / $20 的三分之一,可通过 /v1/chat/completions 与 /v1/responses 两个端点调用,另有 -low/-medium/-high/-xhigh/-max/-ultra 六档推理规格同价:一个 API Key 覆盖全部模型,价格低于官方,国内可直连、无需组织认证,失败不扣费。 |
| GPT-5.6 Terra | gpt-5-6-terra | $0.551 / $3.309 | GPT-5.6 Terra 是 GPT-5.6 家族用于平衡智能与成本的 mini 档,推理更强、速度快,支持文本+图像输入与文本输出,1,050,000 token 上下文、128,000 最大输出 token,支持推理 token,知识截止 2026 年 2 月 16 日。已在 APIMODELS 上线,输入 $0.551 / 输出 $3.309 每百万 token(缓存输入 $0.055),恰为 Sol 的一半、约为官方 $2 / $12 的四分之一强,可用 /v1/chat/completions 与 /v1/responses 两个端点,另有 -low/-medium/-high/-xhigh/-max/-ultra 六档同价:一个 Key 调用全部模型、价格低于官方、国内可直连。 |
| GPT-5.6 Luna | gpt-5-6-luna | $0.16 / $0.96 | GPT-5.6 Luna 是 GPT-5.6 家族面向成本敏感、高并发场景的 nano 档,高推理、速度快,支持文本+图像输入与文本输出,1,050,000 token 上下文、128,000 最大输出 token,支持推理 token,知识截止 2026 年 2 月 16 日。已在 APIMODELS 上线,输入 $0.16 / 输出 $0.96 每百万 token(缓存输入 $0.016),较官方 $0.20/$1.20 低 20%。(OpenAI 已于 2026-08-21 下调 GPT-5.6 全线挂牌价,旧的 $0.20 / $1.20 已作废。)当前上游仅开放 max 推理档,模型名请填 gpt-5.6-luna-max(gpt-5.6-luna 会自动路由到它);按量计费、价格低于官方、国内可直连。 |
| Grok 4.6 | grok-4.6 | $1.50 / $4.50 | Grok 4.6 是 xAI 的旗舰模型,这一代专门冲着【长跑 Agent】和多步骤工作去的 —— 研究一个主题、在代码库里连续改动、把一个想法做成可交付的成品,都能跨很多轮撑下来,过程中还会自己回头验证。Artificial Analysis 智能指数 61,与 GPT-5.6 Sol 持平,并在各项公开评测上全面超过 4.5。500K 上下文,支持文本与图片输入,四档推理强度(low / medium / high 默认 / xhigh)。定价输入 $1.50 / 输出 $4.50 每百万 token,比 xAI 官方($2 / $6)低 25%,缓存输入 $0.375。走 OpenAI 兼容的 /v1/chat/completions;/v1/responses 也可用,而且联网检索只在那条上跑得起来。失败不扣费。⚠️ 两点要知道:默认推理档是 high,实测约 53 秒,客户端超时请设 60 秒以上;计费的输出 token 含推理 token,所以账单可能高于你看到的可见回答,不需要深推理时把 reasoning_effort 调低。 |
| Grok 4.5 | grok-4.5 | $1.275 / $4.25 | Grok 4.5 是 xAI 最新旗舰模型,在编程、非幻觉率、Agent 工具调用与指令跟随能力上引领行业,支持非推理与推理两种模式,500K 上下文。通过 OpenAI 兼容的 /v1/chat/completions 端点调用(anthropic /v1/messages 请改用此端点)。定价低于 xAI 官方:输入 $1.275、输出 $4.25 每百万 token(官方 $2.0/$6.0,输入省 36%、输出省约 29%)。 |
| GPT-5.5 | gpt-5-5 | $3 / $18 | GPT-5.5 是 OpenAI 面向 Agent 编码、知识工作、科研与复杂多步任务的高级推理模型。通过 Responses API(/v1/responses)调用,支持可调推理强度(low–xhigh)、联网搜索、函数调用与多模态输入。OpenAI Codex 设 wire_api = "responses" 即可直接接入。 |
| GPT-5.4 | gpt-5-4 | $1.8 / $10.8 | GPT-5.4 是 OpenAI 面向复杂专业工作与 Agent 编码的前沿模型。通过 Responses API(/v1/responses)调用,推理强度用请求体的 reasoning.effort(low–xhigh)控制,支持联网搜索、函数调用与多模态输入。OpenAI Codex 设 wire_api = "responses" 即可直接接入。 |
| GLM-5.2 | glm-5.2 | $1.26 / $3.96 | GLM-5.2 是智谱(Zhipu)的推理模型,函数调用 / 工具使用能力是它的强项,适合做 agent 编排和结构化输出。通过 OpenAI 兼容的 chat-completions 接口调用,支持提示词缓存 —— 缓存命中部分按 $0.26 每 1M 输入 token 计,多轮长上下文对话能省下可观成本。价格 $1.26 / $3.96 每 1M token。 |
| GLM-5.3 | glm-5.3 | $1.33 / $4.18 | GLM-5.3 是智谱(Zhipu)于 2026 年 8 月发布的推理模型,相比 GLM-5.2 在编码能力和 token 效率上都有提升,主打长链路 agent 任务与复杂软件工程场景,上下文窗口 100 万 token。函数调用 / 工具使用是它的强项,适合做 agent 编排和结构化输出。通过 OpenAI 兼容的 chat-completions 接口调用,支持提示词缓存 —— 缓存命中部分按 $0.247 每 1M 输入 token 计,长对话和重复上下文的成本会明显下降。定价 $1.33 / $4.18 每 1M token,三档均为官方价的 95 折。 |
| DeepSeek V4 Flash | deepseek-v4-flash | $0.297 / $0.891 | DeepSeek V4 Flash 是 DeepSeek V4 家族里的轻量高吞吐档,面向通用对话、摘要、分类这类常规文本任务做了吞吐优化。1M token 上下文,支持工具调用(function calling)、JSON 输出与流式返回,通过 OpenAI 兼容的 /v1/chat/completions 调用 —— 把 base_url 指向 apimodels.app 即可,SDK 不用换。价格 $0.1485–$0.297 / $0.4455–$0.891 每 1M token(按 UTC 时段峰谷浮动)(输入 / 输出),缓存命中 $0.004725–$0.00945,比 DeepSeek 官方价低约 15%。要推理深度和 agent 能力请看 V4 Pro。 |
| DeepSeek V4.1 Flash | deepseek-v4.1-flash | $0.405 / $1.62 | DeepSeek V4.1 Flash 是 DeepSeek 快速高吞吐模型的 V4.1 新一代,适合通用对话、摘要分类和需要工具调用的 agent 场景。1M token 上下文,支持工具调用(function calling)、JSON 输出与流式返回,通过 OpenAI 兼容的 /v1/chat/completions 调用,把 base_url 指向 apimodels.app 即可。价格 $0.2025–$0.405 / $0.81–$1.62 每 1M token(输入 / 输出,谷时 / 峰时),缓存命中 $0.00405–$0.0081。峰时为 UTC 01:00–04:00 与 06:00–10:00,其余时段按谷时价计,提示词缓存命中按缓存价计费。 |
| DeepSeek V4 Pro | deepseek-v4-pro | $1.247 / $3.742 | DeepSeek V4 Pro 是 DeepSeek 的高性能档,推理与 agent 能力是这一代的重点,1M token 上下文。它会通过 reasoning_content 字段把完整思维链返回给你,便于审计推理过程或做二次加工;同时支持工具调用、JSON 输出与流式,OpenAI 兼容 /v1/chat/completions。价格 $0.6237–$1.247 / $1.871–$3.742 每 1M token(按 UTC 时段峰谷浮动),缓存命中 $0.0208–$0.0416,比 DeepSeek 官方价低约 15%。只要通用对话和高吞吐、不需要思维链的话,V4 Flash 更划算。 |
| Qwen3.7 Max | qwen3.7-max | $2.25 / $6.75 | Qwen3.7 Max 是阿里 Qwen3.7 家族的旗舰型号,本代里推理与 agent 能力最强,1M token 上下文,支持混合思考模式(通过 reasoning_content 返回推理过程)。工具调用、JSON 输出、流式全都有,OpenAI 兼容 /v1/chat/completions。价格 $2.25 / $6.75 每 1M token,缓存输入 $0.45,三档均比阿里官方美元价低 10%。⚠️ 思考默认开启,思考 token 计入 completion_tokens 并按输出价计费 —— 简单任务传 enable_thinking:false 可大幅降低成本。 |
| Qwen3.7 Plus | qwen3.7-plus | $0.36 / $1.44 | Qwen3.7 Plus 是阿里 Qwen3.7 家族里性价比最高的一档:推理与 agent 能力接近 Max,价格却只是其中一小部分,1M token 上下文,并支持混合思考模式(通过 reasoning_content 返回推理过程,可按需开关)。工具调用、JSON 输出、流式全都有,OpenAI 兼容 /v1/chat/completions。价格 $0.36 / $1.44 每 1M token。中文任务和长文档处理是它的主场。 |
| Qwen3.8 Max | qwen3.8-max | $2.00 / $6.00 | Qwen3.8 Max 是阿里最新一代通义千问旗舰,以推理为中心 —— 思考默认开启,而且深度可以分档控制:reasoning_effort 传 low / medium / xhigh,按请求在"答得深"和"快且便宜"之间取舍。1M token 上下文,工具调用、JSON 输出、流式全都有,OpenAI 兼容 /v1/chat/completions。⚠️ 思考消耗的 token 算在 completion_tokens 里(短提示下通常占输出的 85–95%),所以想控成本就调 reasoning_effort,别只盯着正文长度。价格 $2.00 / $6.00 每 1M token。我们不在这个模型之外再加一层内容审核:提示词和回复原样透传。但模型自带的安全检查仍然生效 ——输入被判定为不当内容时,请求会以 data_inspection_failed 被拒,所以这不是一个无过滤的端点。生成内容的审核、以及是否符合当地法规与你自己产品的规则,由你自己负责。 |
| Qwen3.8 Flash | qwen3.8-flash | $0.15 / $0.47 | Qwen3.8 Flash 是 Qwen3.8 这一代里最便宜的推理档:思考控制与 Max 一模一样(reasoning_effort 三档),价格约为 Max 的十三分之一,同样是 1M token 上下文。工具调用、JSON 输出、流式齐全,OpenAI 兼容 /v1/chat/completions。批量、简单任务把 reasoning_effort 调到 low 甚至关掉思考,输出成本会降得很明显。价格 $0.15 / $0.47 每 1M token。我们不在这个模型之外再加一层内容审核:提示词和回复原样透传。但模型自带的安全检查仍然生效 ——输入被判定为不当内容时,请求会以 data_inspection_failed 被拒,所以这不是一个无过滤的端点。生成内容的审核、以及是否符合当地法规与你自己产品的规则,由你自己负责。 |
| Text Embedding 3 Small | text-embedding-3-small | $0.018 / 1M tokens | 小型嵌入模型,高效且经济,适用于大多数场景。 |
| Text Embedding 3 Large | text-embedding-3-large | $0.059 / 1M tokens | 大型嵌入模型,精度更高,维度灵活可调。 |
调 POST /api/v1/messages,model 填 claude-opus-4-8 或 gemini-3-pro-preview 等,按前缀自动路由。OpenAI 格式(gpt-/grok-/glm-)走 /v1/chat/completions。
便宜——按 token 计费、低于官方,无月费。一把 Key 覆盖 Claude/Gemini/GPT/Grok/GLM 等,免去多家账号。
支持。stream: true 走 SSE 流式;工具/函数调用透传给上游。改 base URL 即可用 Anthropic / OpenAI SDK。