Alimente os agentes do Warp a partir do seu próprio endpoint de inferência.

Updated 2026-07-29

O Warp suporta endpoints de inferência personalizados exatamente para isso: qualquer endpoint que implemente a API OpenAI Chat Completions, gateways e roteadores de modelo explicitamente incluídos. Aponte-o para https://api.apisrouter.com/v1 com uma chave, e os modelos roteados pelo endpoint aparecem no seletor de modelo do Warp sem consumir créditos do Warp AI.

Resposta rápida: configurações, URL, chave, ids de modelo.

Abra as Settings do Warp e busque por "inference endpoint" para ir direto à configuração. Insira a URL do endpoint, https://api.apisrouter.com/v1, sua chave da APIsRouter como credencial, e o id ou ids de modelo que você quer rotear por ele, por exemplo claude-sonnet-4-6 e gpt-5.6-sol. Depois de salvar, esses modelos aparecem no seletor de modelo do Warp ao lado das opções nativas. O comportamento de faturamento é o ponto central: quando você seleciona explicitamente um modelo roteado pelo endpoint no seletor, o Warp roteia a requisição pelo seu endpoint em vez de consumir os créditos de IA do Warp, e o custo cai no seu saldo de gateway onde você consegue ver por requisição. A documentação do Warp descreve esse fluxo como espelhando a configuração deles de Bring Your Own API Key, então vai parecer familiar se você já configurou BYOK antes.

URL do endpoint:  https://api.apisrouter.com/v1
Credencial:       sk-YOUR-APISROUTER-KEY
Id(s) de modelo:  claude-sonnet-4-6
                  gpt-5.6-sol

depois: selecione o modelo roteado pelo endpoint
        no seletor de modelo do Warp

Como o Warp usa o endpoint.

O Warp é o terminal agêntico: seus agentes rascunham comandos, explicam falhas, rodam tarefas de múltiplos passos, e editam código na mesma janela em que você trabalha. A própria documentação do Warp declara a exigência sem rodeios: o endpoint precisa implementar a API OpenAI Chat Completions em /v1/chat/completions, e o post de lançamento deles nomeia roteadores de modelo e gateways hospedados como alvos pretendidos, então um gateway multi-fornecedor é cidadão de primeira classe aqui, não um truque. Duas restrições documentadas valem a pena conhecer antes de começar. Primeiro, o endpoint precisa ser publicamente alcançável: localhost, 127.0.0.1, e URLs de rede privada são rejeitados no momento da configuração, o que descarta apontar o Warp diretamente para um servidor de inferência local mas é irrelevante para um gateway hospedado. Segundo, a seleção Auto de modelo do Warp sempre consome créditos do Warp mesmo com um endpoint personalizado configurado; só escolher explicitamente um modelo roteado pelo endpoint no seletor roteia pelo seu endpoint. Se seu gasto não está aparecendo no console do gateway, verifique qual modelo a sessão de fato usou. A disponibilidade depende do plano: endpoints de inferência personalizados são oferecidos nos planos Free e pagos elegíveis para indivíduos e organizações de dez pessoas ou menos, enquanto organizações maiores precisam dos tiers Business ou Enterprise do Warp. Isso vem direto da documentação do Warp e pode mudar do lado deles.

Escolhendo modelos para trabalho de agente no terminal.

Agentes de terminal cobram de forma diferente do chat: toda explicação de comando, retry, e resumo de saída é uma requisição carregando contexto de sessão. Como o uso roteado pelo endpoint cai no console do gateway por requisição e por modelo, uma semana de uso real te dá um número honesto por modelo candidato, o que vence adivinhar a partir de uma página de preços, incluindo esta.

  • claude-sonnet-4-6 como padrão diário: geração de comando confiável, uso de ferramentas forte, bom julgamento em tarefas de múltiplos passos.
  • gpt-5.6-sol para trabalho rápido e delimitado, onde a latência por turno molda como o terminal parece.
  • claude-opus-4-7 para as sessões difíceis: depuração entre serviços, cadeias de investigação longas, mudanças de infraestrutura que você quer bem raciocinadas.
  • gpt-5.5 como o generalista de ponta para testar em A/B contra o Claude nos seus próprios fluxos de shell.
  • deepseek-v4-pro como a escolha econômica para uso de agente rotineiro de alto volume onde a tarifa importa mais que o polimento de ponta.

Pague pelo uso · abaixo do preço oficial

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ModeloPreço oficialNosso preço
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Claude Opus 4.7$5.00 / $25.00 per M$4.00 / $20.00 per M
GPT-5.5$5.00 / $30.00 per M$4.00 / $24.00 per M
GPT-5.6 Sol$5.00 / $30.00 per M$4.00 / $24.00 per M
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M

Modos de falha específicos do Warp.

Como sempre, prove a metade do gateway com dois comandos curl, a listagem de modelos e uma chat completion, antes de depurar o lado do Warp. Se o curl passa e o Warp falha, o problema está no formulário do endpoint ou na seleção do seletor de modelo, em nenhum outro lugar.

  • Endpoint rejeitado ao salvar: o Warp recusa URLs localhost e de rede privada por design. O endpoint precisa ser publicamente alcançável; uma URL de gateway hospedado passa nessa verificação.
  • O gasto continua caindo nos créditos do Warp: a sessão está na seleção Auto de modelo, que sempre usa créditos do Warp. Escolha explicitamente o modelo roteado pelo endpoint no seletor.
  • Modelo não encontrado: o id que você digitou na configuração do endpoint não corresponde ao catálogo do gateway. Copie os ids da listagem /v1/models byte a byte.
  • 401 do endpoint: o campo de credencial guarda uma chave obsoleta ou truncada. Faça curl na listagem de modelos com a mesma chave para confirmar fora do Warp.
  • Recurso não visível de jeito nenhum: verifique seu plano. Endpoints personalizados estão disponíveis para indivíduos e organizações pequenas nos planos Free e pagos elegíveis; organizações maiores precisam de Business ou Enterprise segundo a documentação do Warp.

Quem roteia o Warp por um gateway.

  • Desenvolvedores que querem o Claude atrás dos agentes do Warp em um saldo pré-pago, com um começo gratuito e sem cartão.
  • Usuários pesados de agente cujo consumo de créditos do Warp ultrapassou o plano, movendo escolhas explícitas de modelo para seu próprio endpoint medido.
  • Compradores de modelo comparando modelos de codificação em fluxos reais de terminal, onde cada candidato é mais um id na configuração do endpoint.
  • Times de dez pessoas ou menos padronizando em uma única chave de gateway para que agentes de terminal, editor e CI compartilhem um único log de uso.
  • Pessoas que já rodam outras ferramentas por um gateway e querem o Warp na mesma chave e console.

Verifique o endpoint e confirme o roteamento.

Rode as duas verificações padrão com a chave e o id exatos que você configurou no Warp. Os dois passando significa que o gateway está pronto e qualquer problema restante está nas configurações do Warp ou na seleção de modelo. Depois rode uma tarefa real de agente no Warp com o modelo do endpoint selecionado explicitamente, e confirme que a requisição aparece no console da APIsRouter com o modelo e as contagens de token esperados. Essa única confirmação pega a pegadinha do modo Auto imediatamente, e a partir daí o console é seu registro por requisição do que o terminal de fato gasta.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude-sonnet-4-6",
       "messages":[{"role":"user","content":"ping"}]}'

Perguntas frequentes

Como eu configuro um endpoint de inferência personalizado no Warp?

Abra as Settings do Warp, busque por "inference endpoint", e insira a URL do endpoint, sua credencial, e os ids de modelo para rotear por ele. Com a APIsRouter a URL é https://api.apisrouter.com/v1 e os modelos aparecem no seletor do Warp assim que salvos.

O endpoint personalizado do Warp funciona com gateways e roteadores de modelo?

Sim, explicitamente. A documentação e o post de lançamento do Warp nomeiam gateways e roteadores compatíveis com OpenAI como alvos suportados; a exigência é que o endpoint implemente a API OpenAI Chat Completions e seja publicamente alcançável.

Requisições roteadas pelo endpoint usam meus créditos de Warp AI?

Não. Quando você seleciona explicitamente um modelo roteado pelo endpoint, o Warp roteia a requisição pelo seu endpoint e seu provedor cobra por ela, não os créditos do Warp. A exceção é a seleção Auto de modelo, que sempre consome créditos do Warp mesmo com um endpoint configurado.

Por que o Warp rejeita minha URL de endpoint?

O Warp recusa localhost, 127.0.0.1, e outras URLs de rede privada ou local no momento da configuração; o endpoint precisa ser publicamente alcançável. Uma URL de gateway hospedado como https://api.apisrouter.com/v1 passa nessa verificação.

Quais planos do Warp incluem endpoints de inferência personalizados?

Segundo a documentação do Warp em meados de 2026: planos Free e pagos elegíveis para usuários individuais e organizações com dez pessoas ou menos; organizações maiores precisam do Warp Business ou Enterprise. Confira a documentação atual do Warp, já que o controle de plano é deles para mudar.

Posso rodar modelos Claude no Warp dessa forma?

Sim. Adicione claude-sonnet-4-6 ou claude-opus-4-7 como ids de modelo na configuração do endpoint e selecione-os no seletor; o gateway os serve pela superfície compatível com OpenAI que o Warp espera, na mesma chave que os ids GPT e DeepSeek.