Betreibe Warps Agents über deinen eigenen Inference Endpoint.

Updated 2026-07-29

Warp unterstützt Custom Inference Endpoints genau für diesen Zweck: jeden Endpoint, der die OpenAI Chat Completions API implementiert, Gateways und Model-Router ausdrücklich eingeschlossen. Zeige ihn auf https://api.apisrouter.com/v1 mit einem Key, und über den Endpoint geroutete Modelle erscheinen in Warps Model-Picker, ohne Warp-AI-Credits zu verbrauchen.

Kurzantwort: Settings, URL, Key, Modell-IDs.

Öffne Warps Settings und suche nach „inference endpoint", um direkt zur Konfiguration zu springen. Gib die Endpoint-URL ein, https://api.apisrouter.com/v1, deinen APIsRouter-Key als Credential, sowie die Modell-ID oder -IDs, die du darüber routen willst, zum Beispiel claude-sonnet-4-6 und gpt-5.6-sol. Nach dem Speichern erscheinen diese Modelle in Warps Model-Picker neben den eingebauten Optionen. Das Abrechnungsverhalten ist der eigentliche Punkt: Wählst du explizit ein über den Endpoint geroutetes Modell aus dem Picker, leitet Warp den Request über deinen Endpoint statt Warp-AI-Credits zu verbrauchen, und die Kosten landen auf deinem Gateway-Guthaben, wo du sie pro Request siehst. Warps Doku beschreibt diesen Ablauf als Spiegelung ihres Bring-Your-Own-API-Key-Setups — falls du schon einmal BYOK konfiguriert hast, wird dir das bekannt vorkommen.

Endpoint URL:  https://api.apisrouter.com/v1
Credential:    sk-YOUR-APISROUTER-KEY
Model id(s):   claude-sonnet-4-6
               gpt-5.6-sol

then: select the endpoint-routed model
      in Warp's model picker

Wie Warp den Endpoint nutzt.

Warp ist das agentische Terminal: Seine Agents entwerfen Befehle, erklären Fehler, führen mehrstufige Aufgaben aus und bearbeiten Code direkt im selben Fenster, in dem du arbeitest. Warps eigene Dokumentation nennt die Anforderung klar: Der Endpoint muss die OpenAI Chat Completions API unter /v1/chat/completions implementieren, und ihr Launch-Post nennt Model-Router und gehostete Gateways ausdrücklich als vorgesehene Ziele — ein Multi-Vendor-Gateway ist hier also ein First-Class-Citizen, kein Trick. Zwei dokumentierte Einschränkungen solltest du vorher kennen. Erstens muss der Endpoint öffentlich erreichbar sein: localhost, 127.0.0.1 und private Netzwerk-URLs werden bereits bei der Konfiguration abgelehnt, was Warp direkt auf einen lokalen Inference-Server zeigen zu lassen ausschließt, für ein gehostetes Gateway aber irrelevant ist. Zweitens verbraucht Warps Auto-Modellauswahl immer Warp-Credits, selbst wenn ein Custom Endpoint konfiguriert ist; nur die explizite Auswahl eines über den Endpoint gerouteten Modells im Picker routet über deinen Endpoint. Wandert dein Verbrauch nicht in die Gateway-Konsole, prüfe, welches Modell die Session tatsächlich verwendet hat. Die Verfügbarkeit hängt vom Plan ab: Custom Inference Endpoints werden im Free-Plan und in berechtigten bezahlten Plänen für Einzelpersonen und Organisationen mit bis zu zehn Personen angeboten, größere Organisationen brauchen Warps Business- oder Enterprise-Tier. Das stammt direkt aus Warps Doku und kann sich dort jederzeit ändern.

Modellwahl für Terminal-Agent-Arbeit.

Terminal-Agents rechnen anders ab als Chat: Jede Befehlserklärung, jeder Retry und jede Output-Zusammenfassung ist ein Request, der Session-Kontext mitträgt. Da über den Endpoint gerouteter Verbrauch pro Request und pro Modell in der Gateway-Konsole landet, liefert dir eine Woche echter Nutzung eine ehrliche Zahl pro Kandidatenmodell — besser als das Raten anhand einer Preisseite, auch dieser hier.

  • claude-sonnet-4-6 als Daily Driver: verlässliche Befehlsgenerierung, starke Tool-Nutzung, gutes Urteilsvermögen bei mehrstufigen Aufgaben.
  • gpt-5.6-sol für schnelle, eng abgegrenzte Aufgaben, bei denen die Latenz pro Turn das Gefühl des Terminals prägt.
  • claude-opus-4-7 für die harten Sessions: Debugging über mehrere Services hinweg, lange Untersuchungsketten, Infrastrukturänderungen, die gut durchdacht sein sollen.
  • gpt-5.5 als Frontier-Generalist für den A/B-Vergleich mit Claude in deinen eigenen Shell-Workflows.
  • deepseek-v4-pro als Value-Pick für hochvolumige Routine-Agent-Nutzung, bei der der Preis mehr zählt als Frontier-Politur.

Nutzungsbasiert · unter offiziellem Preis

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ModellOffizieller PreisUnser Preis
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Claude Opus 4.7$5.00 / $25.00 per M$4.00 / $20.00 per M
GPT-5.5$5.00 / $30.00 per M$4.00 / $24.00 per M
GPT-5.6 Sol$5.00 / $30.00 per M$4.00 / $24.00 per M
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M

Fehlerbilder, die spezifisch für Warp sind.

Wie immer gilt: Beweise die Gateway-Hälfte zuerst mit zwei curl-Befehlen, dem Models-Listing und einer Chat-Completion, bevor du Warps Seite debuggst. Bestehen die curl-Aufrufe und scheitert Warp trotzdem, liegt das Problem im Endpoint-Formular oder in der Model-Picker-Auswahl, sonst nirgendwo.

  • Endpoint wird beim Speichern abgelehnt: Warp verweigert localhost- und Private-Network-URLs by Design. Der Endpoint muss öffentlich erreichbar sein; eine gehostete Gateway-URL besteht diese Prüfung.
  • Verbrauch landet weiterhin bei Warp-Credits: Die Session läuft auf Auto-Modellauswahl, die immer Warp-Credits nutzt. Wähle das über den Endpoint geroutete Modell explizit im Picker aus.
  • Model not found: Die ID, die du in der Endpoint-Konfiguration eingetragen hast, stimmt nicht mit dem Gateway-Katalog überein. Kopiere IDs Zeichen für Zeichen aus dem /v1/models-Listing.
  • 401 vom Endpoint: Das Credential-Feld enthält einen veralteten oder abgeschnittenen Key. Prüfe mit demselben Key außerhalb von Warp per curl das Models-Listing.
  • Feature überhaupt nicht sichtbar: Prüfe deinen Plan. Custom Endpoints sind für Einzelpersonen und kleine Orgs im Free-Plan sowie in berechtigten bezahlten Plänen verfügbar; größere Organisationen brauchen laut Warps Doku Business oder Enterprise.

Wer Warp über ein Gateway routet.

  • Entwickler, die Claude hinter Warps Agents auf einem Prepaid-Guthaben wollen, mit kostenlosem Start und ohne Karte.
  • Intensive Agent-Nutzer, deren Warp-Credit-Verbrauch ihren Plan gesprengt hat, und die explizite Modellauswahl auf ihren eigenen abgerechneten Endpoint verlagern.
  • Modell-Vergleicher, die Coding-Modelle an echten Terminal-Workflows testen, wo jeder Kandidat nur eine weitere ID in der Endpoint-Konfiguration ist.
  • Teams mit bis zu zehn Personen, die sich auf einen Gateway-Key standardisieren, damit Terminal-, Editor- und CI-Agents ein gemeinsames Usage-Log teilen.
  • Leute, die bereits andere Tools über ein Gateway laufen lassen und Warp auf demselben Key und derselben Konsole haben wollen.

Den Endpoint verifizieren und das Routing bestätigen.

Führe die zwei Standard-Checks mit genau dem Key und der ID aus, die du in Warp konfiguriert hast. Bestehen beide, ist das Gateway bereit, und jedes verbleibende Problem liegt in Warps Settings oder der Modellauswahl. Führe dann eine echte Agent-Aufgabe in Warp aus, mit explizit ausgewähltem Endpoint-Modell, und bestätige, dass der Request mit dem erwarteten Modell und den erwarteten Token-Zahlen in der APIsRouter-Konsole erscheint. Diese eine Bestätigung deckt die Auto-Modus-Falle sofort auf, und ab dann ist die Konsole dein Pro-Request-Protokoll dessen, was das Terminal tatsächlich ausgibt.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude-sonnet-4-6",
       "messages":[{"role":"user","content":"ping"}]}'

Häufige Fragen

Wie konfiguriere ich einen Custom Inference Endpoint in Warp?

Öffne Warps Settings, suche nach „inference endpoint" und gib die Endpoint-URL, dein Credential sowie die Modell-IDs ein, die du darüber routen willst. Bei APIsRouter lautet die URL https://api.apisrouter.com/v1, und die Modelle erscheinen nach dem Speichern in Warps Picker.

Funktioniert Warps Custom Endpoint mit Gateways und Model-Routern?

Ja, ausdrücklich. Warps Dokumentation und der Launch-Post nennen OpenAI-kompatible Gateways und Router als unterstützte Ziele; Voraussetzung ist, dass der Endpoint die OpenAI Chat Completions API implementiert und öffentlich erreichbar ist.

Verbrauchen über den Endpoint geroutete Requests meine Warp-AI-Credits?

Nein. Wählst du explizit ein über den Endpoint geroutetes Modell, leitet Warp den Request über deinen Endpoint, und dein Provider rechnet ihn ab, nicht Warp-Credits. Die Ausnahme ist die Auto-Modellauswahl, die auch bei konfiguriertem Endpoint immer Warp-Credits verbraucht.

Warum lehnt Warp meine Endpoint-URL ab?

Warp verweigert localhost, 127.0.0.1 und andere private oder lokale Netzwerk-URLs bereits bei der Konfiguration; der Endpoint muss öffentlich erreichbar sein. Eine gehostete Gateway-URL wie https://api.apisrouter.com/v1 besteht diese Prüfung.

Welche Warp-Pläne enthalten Custom Inference Endpoints?

Laut Warps Doku (Stand Mitte 2026): Free sowie berechtigte bezahlte Pläne für Einzelnutzer und Organisationen mit bis zu zehn Personen; größere Organisationen brauchen Warp Business oder Enterprise. Prüfe Warps aktuelle Dokumentation, da die Plan-Freigabe in deren Hand liegt und sich ändern kann.

Kann ich Claude-Modelle auf diese Weise in Warp laufen lassen?

Ja. Füge claude-sonnet-4-6 oder claude-opus-4-7 als Modell-IDs in der Endpoint-Konfiguration hinzu und wähle sie im Picker aus; das Gateway liefert sie über die OpenAI-kompatible Oberfläche, die Warp erwartet, auf demselben Key wie GPT- und DeepSeek-IDs.