
qwen3.8-maxO Qwen3.8 Max é o carro-chefe mais recente da linha Qwen. A diferença central em relação ao 3.7 Max é que a profundidade do raciocínio agora é graduável: reasoning_effort aceita low, medium e xhigh (padrão xhigh), então você escolhe por requisição o equilíbrio entre profundidade, latência e custo de saída. Contexto de 1M de tokens, formato OpenAI em /v1/chat/completions, com function calling, JSON e streaming. Na APIMODELS custa $2.00 / $6.00 por 1M de tokens e $0.25 em cache — o mesmo do preço de tabela oficial da Alibaba: nesta geração não fazemos jogo de preço; o que entregamos é dispensar a conta na Alibaba Cloud, acesso direto da China continental e uma única chave com saldo compartilhado para todos os modelos. Sobre conversas longas: preserve_thinking vem ligado por padrão, então o raciocínio de turnos anteriores volta ao modelo e é cobrado como entrada a cada turno seguinte.
View complete API reference with all parameters and examples.
View complete API reference with streaming, thinking, and more.
Billing: Cost = (input_tokens * input_price + output_tokens * output_price) / 1,000,000
reasoning_effort low / medium / xhigh trades depth against latency and output cost
Million-token context window
Reasoning tokens are part of completion_tokens — typically 85-95% of the output on short prompts. Set reasoning_effort to control it.
Function calling + JSON output, OpenAI-compatible
Qwen3.8 Max é uma API de modelo de linguagem da Alibaba. O Qwen3.8 Max é o carro-chefe mais recente da linha Qwen. A diferença central em relação ao 3.7 Max é que a profundidade do raciocínio agora é graduável: reasoning_effort aceita low, medium e xhigh (padrão xhigh), então você escolhe por requisição o equilíbrio entre profundidade, latência e custo de saída. Contexto de 1M de tokens, formato OpenAI em /v1/chat/completions, com function calling, JSON e streaming. Na APIMODELS custa $2.00 / $6.00 por 1M de tokens e $0.25 em cache — o mesmo do preço de tabela oficial da Alibaba: nesta geração não fazemos jogo de preço; o que entregamos é dispensar a conta na Alibaba Cloud, acesso direto da China continental e uma única chave com saldo compartilhado para todos os modelos. Sobre conversas longas: preserve_thinking vem ligado por padrão, então o raciocínio de turnos anteriores volta ao modelo e é cobrado como entrada a cada turno seguinte. Pela plataforma APIMODELS, você acessa este modelo por uma API unificada com preços transparentes de pagamento por uso. Preço atual: Input: $2.00, Output: $6.00 per 1M tokens.
Crie sistemas de conversa inteligentes que respondem automaticamente e melhoram a eficiência do atendimento.
Escreva automaticamente artigos, e-mails, textos publicitários e mais para aumentar a produtividade.
Auxilie na escrita, depuração e revisão de código para acelerar o desenvolvimento.
Entenda e analise dados não estruturados, extraia insights e gere resumos.
O Qwen3.8 Max está disponível pela APIMODELS a: Input: $2.00, Output: $6.00 per 1M tokens. A cobrança é por uso — você paga apenas pelo que gera.
Cadastre-se na APIMODELS, obtenha sua chave de API e chame nosso endpoint unificado. Oferecemos documentação detalhada com exemplos em cURL, Python e Node.js.
A APIMODELS oferece o mesmo modelo Qwen3.8 Max pela nossa plataforma de agregação. Fornecemos uma interface de API unificada, então você não precisa de contas separadas por provedor: uma única chave para acessar todos os modelos.
$2.00 / $6.00 por 1M de tokens, entrada em cache $0.25 — o mesmo do preço de tabela oficial da Alibaba. Nesta geração não fazemos jogo de preço. O que você ganha no lugar de desconto: sem conta na Alibaba Cloud nem verificação, acesso direto da China continental, uma única chave para Claude, Gemini, GPT, Grok e todo o resto com saldo compartilhado, pagamento por uso sem recarga mínima e requisições com falha nunca são cobradas.
Porque o raciocínio vem LIGADO por padrão, e esses tokens ficam dentro de completion_tokens e são cobrados na tarifa de saída, mesmo sem aparecerem na resposta. Medido: um prompt «escreva 60 palavras» devolveu 3.783 tokens de saída, 3.715 deles de raciocínio, com 39 segundos até a primeira saída. O mesmo prompt com enable_thinking:false devolveu 72 tokens em 1,2 segundo. Para trabalho simples ou em massa, desligue ou limite com thinking_budget / reasoning_effort.
POST https://api.apimodels.app/v1/chat/completions com Authorization: Bearer YOUR_API_KEY e corpo {"model":"qwen3.8-max","messages":[{"role":"user","content":"..."}]}. Formato OpenAI padrão: basta apontar base_url=https://api.apimodels.app/v1 no openai-python ou openai-node. Adicione stream:true para streaming. Contexto de 1M de tokens.
Na APIMODELS, o Qwen3.8 Max roda junto com mais de 60 modelos usando uma única chave de API e um único saldo, então escolher é questão de adequação, não de dependência. Ele suporta Reasoning / Thinking, Flagship, 1M Context, Tool Calling, Streaming e você pode avaliá-lo em preço e capacidade frente a outros modelos de modelo de linguagem, trocando ao alterar uma única string com o nome do modelo — sem nova conta ou integração. Veja todas as opções de modelo de linguagem com preços ao vivo em apimodels.app/models.
O Qwen3.8 Max suporta: Reasoning / Thinking, Flagship, 1M Context, Tool Calling, Streaming. Consulte a documentação da APIMODELS para todos os parâmetros e exemplos de chamada.
Sim. A APIMODELS expõe o Qwen3.8 Max por uma única API unificada e uma só chave, sem contas separadas por provedor e sem precisar lidar com o acesso de rede regional de cada provedor.
Aceitamos Stripe (Visa, Mastercard e outros cartões internacionais) e Alipay. O saldo fica disponível imediatamente após o pagamento.