Alimente os agentes do Warp a partir do seu próprio endpoint de inferência.
Updated 2026-07-29
O Warp suporta endpoints de inferência personalizados exatamente para isso: qualquer endpoint que implemente a API OpenAI Chat Completions, gateways e roteadores de modelo explicitamente incluídos. Aponte-o para https://api.apisrouter.com/v1 com uma chave, e os modelos roteados pelo endpoint aparecem no seletor de modelo do Warp sem consumir créditos do Warp AI.
Resposta rápida: configurações, URL, chave, ids de modelo.
Abra as Settings do Warp e busque por "inference endpoint" para ir direto à configuração. Insira a URL do endpoint, https://api.apisrouter.com/v1, sua chave da APIsRouter como credencial, e o id ou ids de modelo que você quer rotear por ele, por exemplo claude-sonnet-4-6 e gpt-5.6-sol. Depois de salvar, esses modelos aparecem no seletor de modelo do Warp ao lado das opções nativas. O comportamento de faturamento é o ponto central: quando você seleciona explicitamente um modelo roteado pelo endpoint no seletor, o Warp roteia a requisição pelo seu endpoint em vez de consumir os créditos de IA do Warp, e o custo cai no seu saldo de gateway onde você consegue ver por requisição. A documentação do Warp descreve esse fluxo como espelhando a configuração deles de Bring Your Own API Key, então vai parecer familiar se você já configurou BYOK antes.
URL do endpoint: https://api.apisrouter.com/v1
Credencial: sk-YOUR-APISROUTER-KEY
Id(s) de modelo: claude-sonnet-4-6
gpt-5.6-sol
depois: selecione o modelo roteado pelo endpoint
no seletor de modelo do WarpComo o Warp usa o endpoint.
O Warp é o terminal agêntico: seus agentes rascunham comandos, explicam falhas, rodam tarefas de múltiplos passos, e editam código na mesma janela em que você trabalha. A própria documentação do Warp declara a exigência sem rodeios: o endpoint precisa implementar a API OpenAI Chat Completions em /v1/chat/completions, e o post de lançamento deles nomeia roteadores de modelo e gateways hospedados como alvos pretendidos, então um gateway multi-fornecedor é cidadão de primeira classe aqui, não um truque. Duas restrições documentadas valem a pena conhecer antes de começar. Primeiro, o endpoint precisa ser publicamente alcançável: localhost, 127.0.0.1, e URLs de rede privada são rejeitados no momento da configuração, o que descarta apontar o Warp diretamente para um servidor de inferência local mas é irrelevante para um gateway hospedado. Segundo, a seleção Auto de modelo do Warp sempre consome créditos do Warp mesmo com um endpoint personalizado configurado; só escolher explicitamente um modelo roteado pelo endpoint no seletor roteia pelo seu endpoint. Se seu gasto não está aparecendo no console do gateway, verifique qual modelo a sessão de fato usou. A disponibilidade depende do plano: endpoints de inferência personalizados são oferecidos nos planos Free e pagos elegíveis para indivíduos e organizações de dez pessoas ou menos, enquanto organizações maiores precisam dos tiers Business ou Enterprise do Warp. Isso vem direto da documentação do Warp e pode mudar do lado deles.
Escolhendo modelos para trabalho de agente no terminal.
Agentes de terminal cobram de forma diferente do chat: toda explicação de comando, retry, e resumo de saída é uma requisição carregando contexto de sessão. Como o uso roteado pelo endpoint cai no console do gateway por requisição e por modelo, uma semana de uso real te dá um número honesto por modelo candidato, o que vence adivinhar a partir de uma página de preços, incluindo esta.
- claude-sonnet-4-6 como padrão diário: geração de comando confiável, uso de ferramentas forte, bom julgamento em tarefas de múltiplos passos.
- gpt-5.6-sol para trabalho rápido e delimitado, onde a latência por turno molda como o terminal parece.
- claude-opus-4-7 para as sessões difíceis: depuração entre serviços, cadeias de investigação longas, mudanças de infraestrutura que você quer bem raciocinadas.
- gpt-5.5 como o generalista de ponta para testar em A/B contra o Claude nos seus próprios fluxos de shell.
- deepseek-v4-pro como a escolha econômica para uso de agente rotineiro de alto volume onde a tarifa importa mais que o polimento de ponta.
Pague pelo uso · abaixo do preço oficial
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Modelo | Preço oficial | Nosso preço |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Opus 4.7 | $5.00 / $25.00 per M | $4.00 / $20.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| GPT-5.6 Sol | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Modos de falha específicos do Warp.
Como sempre, prove a metade do gateway com dois comandos curl, a listagem de modelos e uma chat completion, antes de depurar o lado do Warp. Se o curl passa e o Warp falha, o problema está no formulário do endpoint ou na seleção do seletor de modelo, em nenhum outro lugar.
- Endpoint rejeitado ao salvar: o Warp recusa URLs localhost e de rede privada por design. O endpoint precisa ser publicamente alcançável; uma URL de gateway hospedado passa nessa verificação.
- O gasto continua caindo nos créditos do Warp: a sessão está na seleção Auto de modelo, que sempre usa créditos do Warp. Escolha explicitamente o modelo roteado pelo endpoint no seletor.
- Modelo não encontrado: o id que você digitou na configuração do endpoint não corresponde ao catálogo do gateway. Copie os ids da listagem /v1/models byte a byte.
- 401 do endpoint: o campo de credencial guarda uma chave obsoleta ou truncada. Faça curl na listagem de modelos com a mesma chave para confirmar fora do Warp.
- Recurso não visível de jeito nenhum: verifique seu plano. Endpoints personalizados estão disponíveis para indivíduos e organizações pequenas nos planos Free e pagos elegíveis; organizações maiores precisam de Business ou Enterprise segundo a documentação do Warp.
Quem roteia o Warp por um gateway.
- Desenvolvedores que querem o Claude atrás dos agentes do Warp em um saldo pré-pago, com um começo gratuito e sem cartão.
- Usuários pesados de agente cujo consumo de créditos do Warp ultrapassou o plano, movendo escolhas explícitas de modelo para seu próprio endpoint medido.
- Compradores de modelo comparando modelos de codificação em fluxos reais de terminal, onde cada candidato é mais um id na configuração do endpoint.
- Times de dez pessoas ou menos padronizando em uma única chave de gateway para que agentes de terminal, editor e CI compartilhem um único log de uso.
- Pessoas que já rodam outras ferramentas por um gateway e querem o Warp na mesma chave e console.
Verifique o endpoint e confirme o roteamento.
Rode as duas verificações padrão com a chave e o id exatos que você configurou no Warp. Os dois passando significa que o gateway está pronto e qualquer problema restante está nas configurações do Warp ou na seleção de modelo. Depois rode uma tarefa real de agente no Warp com o modelo do endpoint selecionado explicitamente, e confirme que a requisição aparece no console da APIsRouter com o modelo e as contagens de token esperados. Essa única confirmação pega a pegadinha do modo Auto imediatamente, e a partir daí o console é seu registro por requisição do que o terminal de fato gasta.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Perguntas frequentes
Como eu configuro um endpoint de inferência personalizado no Warp?
Abra as Settings do Warp, busque por "inference endpoint", e insira a URL do endpoint, sua credencial, e os ids de modelo para rotear por ele. Com a APIsRouter a URL é https://api.apisrouter.com/v1 e os modelos aparecem no seletor do Warp assim que salvos.
O endpoint personalizado do Warp funciona com gateways e roteadores de modelo?
Sim, explicitamente. A documentação e o post de lançamento do Warp nomeiam gateways e roteadores compatíveis com OpenAI como alvos suportados; a exigência é que o endpoint implemente a API OpenAI Chat Completions e seja publicamente alcançável.
Requisições roteadas pelo endpoint usam meus créditos de Warp AI?
Não. Quando você seleciona explicitamente um modelo roteado pelo endpoint, o Warp roteia a requisição pelo seu endpoint e seu provedor cobra por ela, não os créditos do Warp. A exceção é a seleção Auto de modelo, que sempre consome créditos do Warp mesmo com um endpoint configurado.
Por que o Warp rejeita minha URL de endpoint?
O Warp recusa localhost, 127.0.0.1, e outras URLs de rede privada ou local no momento da configuração; o endpoint precisa ser publicamente alcançável. Uma URL de gateway hospedado como https://api.apisrouter.com/v1 passa nessa verificação.
Quais planos do Warp incluem endpoints de inferência personalizados?
Segundo a documentação do Warp em meados de 2026: planos Free e pagos elegíveis para usuários individuais e organizações com dez pessoas ou menos; organizações maiores precisam do Warp Business ou Enterprise. Confira a documentação atual do Warp, já que o controle de plano é deles para mudar.
Posso rodar modelos Claude no Warp dessa forma?
Sim. Adicione claude-sonnet-4-6 ou claude-opus-4-7 como ids de modelo na configuração do endpoint e selecione-os no seletor; o gateway os serve pela superfície compatível com OpenAI que o Warp espera, na mesma chave que os ids GPT e DeepSeek.