Voed de agents van Warp vanuit je eigen inference-endpoint.

Updated 2026-07-29

Warp ondersteunt aangepaste inference-endpoints voor precies dit doel: elk endpoint dat de OpenAI Chat Completions API implementeert, gateways en modelrouters expliciet inbegrepen. Wijs het naar https://api.apisrouter.com/v1 met één sleutel, en via het endpoint gerouteerde modellen verschijnen in de modelkiezer van Warp zonder Warp AI-credits te verbruiken.

Snel antwoord: instellingen, URL, sleutel, model-ID's.

Open de Settings van Warp en zoek naar "inference endpoint" om naar de configuratie te springen. Voer de endpoint-URL in, https://api.apisrouter.com/v1, je APIsRouter-sleutel als credential, en het model-ID of de model-ID's die je ervia wilt routeren, bijvoorbeeld claude-sonnet-4-6 en gpt-5.6-sol. Eenmaal opgeslagen, verschijnen die modellen in de modelkiezer van Warp naast de ingebouwde opties. Het factureringsgedrag is precies het punt: wanneer je expliciet een via het endpoint gerouteerd model uit de kiezer selecteert, routeert Warp het verzoek via jouw endpoint in plaats van de AI-credits van Warp te verbruiken, en de kosten komen terecht op je gatewaysaldo waar je ze per verzoek kunt zien. De documentatie van Warp omschrijft deze flow als een spiegeling van hun Bring Your Own API Key-instelling, dus het zal vertrouwd aanvoelen als je eerder BYOK hebt geconfigureerd.

Endpoint URL:  https://api.apisrouter.com/v1
Credential:    sk-YOUR-APISROUTER-KEY
Model id(s):   claude-sonnet-4-6
               gpt-5.6-sol

then: select the endpoint-routed model
      in Warp's model picker

Hoe Warp het endpoint gebruikt.

Warp is de agentische terminal: zijn agents stellen commando's op, verklaren mislukkingen, voeren meerstaps taken uit en bewerken code vanuit hetzelfde venster waarin je werkt. De eigen documentatie van Warp stelt de vereiste helder: het endpoint moet de OpenAI Chat Completions API implementeren op /v1/chat/completions, en hun lanceringspost noemt modelrouters en gehoste gateways als bedoelde doelen, dus een gateway met meerdere leveranciers is hier een volwaardige speler, geen truc. Twee gedocumenteerde beperkingen zijn het waard om te kennen voordat je begint. Ten eerste moet het endpoint publiekelijk bereikbaar zijn: localhost, 127.0.0.1 en privénetwerk-URL's worden bij het configureren geweigerd, wat uitsluit dat je Warp rechtstreeks naar een lokale inferentieserver wijst, maar dat is niet relevant voor een gehoste gateway. Ten tweede verbruikt de Auto-modelselectie van Warp altijd Warp-credits, zelfs als een aangepast endpoint is geconfigureerd; alleen het expliciet kiezen van een via het endpoint gerouteerd model uit de kiezer routeert via jouw endpoint. Als je uitgaven niet naar de gatewayconsole verschuiven, controleer dan welk model de sessie daadwerkelijk heeft gebruikt. Beschikbaarheid is afhankelijk van het abonnement: aangepaste inference-endpoints worden aangeboden op Free en in aanmerking komende betaalde abonnementen voor individuen en organisaties van tien of minder personen, terwijl grotere organisaties de Business- of Enterprise-tiers van Warp nodig hebben. Dat komt rechtstreeks uit de documentatie van Warp en kan aan hun kant veranderen.

Modellen kiezen voor terminal-agentwerk.

Terminal-agents factureren anders dan chat: elke commando-uitleg, herhaling en outputsamenvatting is een verzoek dat sessiecontext meedraagt. Aangezien via het endpoint gerouteerd gebruik terechtkomt in de gatewayconsole per verzoek en per model, geeft een week echt gebruik je een eerlijk getal per kandidaat-model, wat beter is dan gokken op basis van een prijspagina, deze inbegrepen.

  • claude-sonnet-4-6 als dagelijkse workhorse: betrouwbare commandogeneratie, sterk tool-gebruik, goed beoordelingsvermogen bij meerstaps taken.
  • gpt-5.6-sol voor snel afgebakend werk, waar latentie per beurt bepaalt hoe de terminal aanvoelt.
  • claude-opus-4-7 voor de moeilijke sessies: debuggen over services heen, lange onderzoeksketens, infrastructuurwijzigingen die je doordacht wilt hebben.
  • gpt-5.5 als de frontier-generalist om tegen Claude te A/B-testen op je eigen shellworkflows.
  • deepseek-v4-pro als de waardekeuze voor routinematig agentgebruik met hoog volume, waar tarief zwaarder telt dan frontier-polish.

Betaal naar gebruik · onder officiële prijzen

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ModelOfficiële prijsOnze prijs
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Claude Opus 4.7$5.00 / $25.00 per M$4.00 / $20.00 per M
GPT-5.5$5.00 / $30.00 per M$4.00 / $24.00 per M
GPT-5.6 Sol$5.00 / $30.00 per M$4.00 / $24.00 per M
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M

Faalmodi specifiek voor Warp.

Zoals altijd: bewijs de gateway-helft met twee curl-commando's, de modellijst en één chat completion, voordat je de kant van Warp debugt. Als curl slaagt en Warp faalt, zit het probleem in het endpointformulier of de keuze in de modelkiezer, nergens anders.

  • Endpoint geweigerd bij het opslaan: Warp weigert bewust localhost- en privénetwerk-URL's. Het endpoint moet publiekelijk bereikbaar zijn; een gehoste gateway-URL komt door deze controle.
  • Uitgaven raken nog steeds Warp-credits: de sessie staat op Auto-modelselectie, die altijd Warp-credits gebruikt. Kies expliciet het via het endpoint gerouteerde model in de kiezer.
  • Model niet gevonden: het ID dat je in de endpointconfig hebt getypt, komt niet overeen met de gatewaycatalogus. Kopieer ID's byte voor byte uit de /v1/models-lijst.
  • 401 vanaf het endpoint: het credential-veld bevat een verouderde of afgekapte sleutel. Curl de modellijst met dezelfde sleutel om dit buiten Warp te bevestigen.
  • Functie helemaal niet zichtbaar: controleer je abonnement. Aangepaste endpoints zijn beschikbaar voor individuen en kleine organisaties op Free en in aanmerking komende betaalde abonnementen; grotere organisaties hebben Business of Enterprise nodig, volgens de documentatie van Warp.

Wie routeert Warp via een gateway.

  • Developers die Claude achter de agents van Warp willen op een vooruitbetaald tegoed, met een gratis start en geen kaart.
  • Zware agentgebruikers wier Warp-creditverbruik hun abonnement is ontgroeid, die expliciete modelkeuzes verplaatsen naar hun eigen gemeten endpoint.
  • Modelshoppers die coderingsmodellen vergelijken op echte terminalworkflows, waar elke kandidaat weer een ID is in de endpointconfig.
  • Teams van tien of minder personen die standaardiseren op één gatewaysleutel, zodat terminal-, editor- en CI-agents één gebruikslogboek delen.
  • Mensen die al andere tools via een gateway draaien en Warp op dezelfde sleutel en console willen.

Verifieer het endpoint en bevestig de routering.

Draai de twee standaardcontroles met de exacte sleutel en het exacte ID die je in Warp hebt geconfigureerd. Als beide slagen, is de gateway klaar en zit elk resterend probleem in de instellingen of modelselectie van Warp. Draai vervolgens één echte agenttaak in Warp met het endpointmodel expliciet geselecteerd, en bevestig dat het verzoek verschijnt in de APIsRouter-console met het verwachte model en de verwachte tokenaantallen. Die ene bevestiging vangt meteen de valkuil van Auto-modus, en vanaf dat moment is de console je registratie per verzoek van wat de terminal daadwerkelijk uitgeeft.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude-sonnet-4-6",
       "messages":[{"role":"user","content":"ping"}]}'

Veelgestelde vragen

Hoe configureer ik een aangepast inference-endpoint in Warp?

Open de Settings van Warp, zoek naar "inference endpoint", en voer de endpoint-URL in, je credential, en de model-ID's die je ervia wilt routeren. Bij APIsRouter is de URL https://api.apisrouter.com/v1 en verschijnen de modellen in de kiezer van Warp zodra je hebt opgeslagen.

Werkt het aangepaste endpoint van Warp met gateways en modelrouters?

Ja, expliciet. De documentatie en lanceringspost van Warp noemen OpenAI-compatibele gateways en routers als ondersteunde doelen; de vereiste is dat het endpoint de OpenAI Chat Completions API implementeert en publiekelijk bereikbaar is.

Gebruiken via het endpoint gerouteerde verzoeken mijn Warp AI-credits?

Nee. Wanneer je expliciet een via het endpoint gerouteerd model selecteert, routeert Warp het verzoek via jouw endpoint en factureert jouw provider het, niet Warp-credits. De uitzondering is Auto-modelselectie, die altijd Warp-credits verbruikt, zelfs met een geconfigureerd endpoint.

Waarom weigert Warp mijn endpoint-URL?

Warp weigert bij het configureren localhost, 127.0.0.1 en andere privé- of lokale netwerk-URL's; het endpoint moet publiekelijk bereikbaar zijn. Een gehoste gateway-URL zoals https://api.apisrouter.com/v1 komt door deze controle.

Welke Warp-abonnementen bevatten aangepaste inference-endpoints?

Volgens de documentatie van Warp medio 2026: Free en in aanmerking komende betaalde abonnementen voor individuele gebruikers en organisaties met tien of minder personen; grotere organisaties hebben Warp Business of Enterprise nodig. Controleer de actuele documentatie van Warp, aangezien de abonnementsindeling aan hen is om te wijzigen.

Kan ik op deze manier Claude-modellen draaien in Warp?

Ja. Voeg claude-sonnet-4-6 of claude-opus-4-7 toe als model-ID's in de endpointconfig en selecteer ze in de kiezer; de gateway bedient ze via het OpenAI-compatibele oppervlak dat Warp verwacht, op dezelfde sleutel als GPT- en DeepSeek-ID's.