apimodels-mcp 是一个 MCP 服务器:装上之后,你的 AI 客户端就多了一组调用我们图片、视频、对话、语音模型的工具,用的还是你现有的那把 key。你描述想要什么,助手自己写提示词、生成、看结果、再改提示词重出 —— 不用离开聊天窗口,也不用记模型名。
没有要下载的东西,它通过 npx 按需运行。先到 控制台 → API Keys 拿一把 sk_… key,然后按你用的客户端填。
Settings → Developer → Edit Config,打开 claude_desktop_config.json 加入下面这段,然后重启。
{
"mcpServers": {
"apimodels": {
"command": "npx",
"args": ["-y", "apimodels-mcp"],
"env": {
"APIMODELS_API_KEY": "sk_your_key_here"
}
}
}
}Settings → MCP → Add new MCP server,或直接写 ~/.cursor/mcp.json。
{
"mcpServers": {
"apimodels": {
"command": "npx",
"args": ["-y", "apimodels-mcp"],
"env": { "APIMODELS_API_KEY": "sk_your_key_here" }
}
}
}Settings → MCP Servers → 新建一个 stdio 类型的服务器,填下面三项。启用后在输入框下方的 MCP 控件里为当前对话选中它,并把对话模型换成支持函数调用的(Claude、GPT、Gemini 等)。
| Command | npx |
| Arguments | -y apimodels-mcp |
| Environment variables | APIMODELS_API_KEY=sk_your_key_here |
其它 MCP 客户端都一样:以 stdio 方式运行下面这条命令即可。
APIMODELS_API_KEY=sk_your_key_here npx -y apimodels-mcpnpx 需要本机装了 Node.js。Windows 用户到 nodejs.org 装一个即可,Cherry Studio 也依赖它来拉起 MCP 服务器。
| 工具 | 作用 |
|---|---|
| list_models | 列出可用模型 id(对话 / 图片 / 视频 / 语音)。 |
| chat | 用任意 LLM 做对话或补全(gpt-5-5、claude-opus-4-8、gemini-3-pro-preview 等)。 |
| generate_image | 文生图或图片编辑;返回图片 URL,并附一张模型自己能看的缩略预览。 |
| review_image | 让视觉模型对照你的要求审图,返回「哪里对、哪里错、改后的提示词」。 |
| generate_video | 文生视频(可带参考图);返回视频 URL。 |
| text_to_speech | 文字转语音(MiniMax 音色);返回音频 URL。 |
ElevenLabs 的 TTS 不在这里:它从 POST /v1/tts/stream 直接流式返回音频字节,没有可回传的 URL,走 音频 API 调用。
你可以直接说「做一张 16:9 的横幅,上面写 SAVE 10%,检查拼写,错了就改」,然后让助手自己循环到满意为止。它靠两条路看结果,选哪条取决于你的客户端:
Claude Desktop、Claude Code、Cursor 会把工具返回的图片一并喂给模型,所以 generate_image 附带的那张预览(最长边 1024 的 JPEG)模型是真能看见的,它会照着自己改。不想要预览就传 return_image: false。
Cherry Studio(1.9.11 实测)把工具结果里的图片只渲染给用户,给模型的是一句文字占位 —— 模型其实看不见自己刚做的东西。这种情况用 review_image:它把图和你的要求送给视觉模型,回来的是文字版的「符合项 / 问题 / 修订后的提示词」,同样能闭环,且在任何客户端都成立。
审图默认用 gpt-5.6-luna,一次远低于 $0.01;要更严格的读图可以指定 claude-sonnet-5。对话模型本身只需要支持函数调用 —— Claude、GPT-5.x、gpt-6-astra、Gemini 都可以。比例和分辨率不用你填,助手会按你说的话自己定(说「16:9」就够了)。
generate_image 和 generate_video 的 image_url 收四种写法:公网 https:// 链接、本机文件路径(/Users/me/photo.png、./ref.jpg、~/Pictures/x.webp)、本机地址(http://127.0.0.1:8000/photo.png)、以及 data:image/png;base64,… 。
后三种由 MCP 服务器先替你上传,再拿公网 URL 去生成。这一步只能在你这边做:文件只存在于你的机器上,而 127.0.0.1 在我们服务器上解析出来是我们自己 —— 所以直接把本机路径丢给 REST 接口会被拒(private/reserved IP addresses not allowed)。上传的文件落在你账号的存储里,7 天后自动删除。
| 变量 | 默认值 | 说明 |
|---|---|---|
| APIMODELS_API_KEY | 必填 | 你的 sk_… key。 |
| APIMODELS_BASE_URL | https://api.apimodels.app/v1 | API 地址。 |
| APIMODELS_TIMEOUT_MS | 300000 | 图片 / 视频 / 音频这类异步任务的最长轮询时间(毫秒)。 |
| 症状 | 原因 / 修法 |
|---|---|
| 客户端里看不到这些工具 | 多半是 npx 跑不起来 —— 本机没装 Node.js,或客户端没继承到 PATH。先在终端手动跑一次上面那条 stdio 命令看有没有报错。 |
| 模型说它看不到图 | 你的客户端属于「只把图给你看」那一类(如 Cherry Studio)。改用 review_image,或换 Claude Desktop / Cursor。 |
| 助手一直只聊天、不调用工具 | 对话模型不支持函数调用,或这次对话没启用该 MCP 服务器。换成 Claude / GPT-5.x / Gemini,并在输入框下方确认服务器是勾选状态。 |
| 提示 private/reserved IP addresses not allowed | 你把本机地址直接给了 REST 接口。经 MCP 的 image_url 传就没这个问题 —— 它会先替你上传。 |
可以。装上 apimodels-mcp 后直接用大白话提要求即可。在 Claude Desktop、Claude Code、Cursor 里,生成的图会一并交给模型,它能看见自己的作品并用修正后的提示词重出。在只把图给用户看的客户端(如 Cherry Studio),用 review_image 走文字版闭环:把图和你的要求送给视觉模型,返回问题清单和改好的提示词。
文档里给了 Claude Desktop、Claude Code、Cursor 和 Cherry Studio 的配置,其它 MCP 客户端一样:以 stdio 方式跑 npx -y apimodels-mcp,环境变量带上 APIMODELS_API_KEY 即可。对话模型需要支持函数调用 —— Claude、GPT-5.x、gpt-6-astra、Gemini 都可以。
服务器本身免费开源。你只按助手实际调用的模型付正常的单次价格,且只有成功才扣费。review_image 默认用 gpt-5.6-luna,一次远低于 $0.01。