Zasil agentów Warp własnym endpointem wnioskowania.
Updated 2026-07-29
Warp obsługuje niestandardowe endpointy wnioskowania dokładnie do tego celu: dowolny endpoint implementujący OpenAI Chat Completions API, wprost łącznie z bramkami i routerami modeli. Wskaż go na https://api.apisrouter.com/v1 z jednym kluczem, a modele kierowane przez endpoint pojawią się w pickerze modeli Warp bez zużywania kredytów Warp AI.
Szybka odpowiedź: ustawienia, URL, klucz, identyfikatory modeli.
Otwórz Ustawienia Warp i wyszukaj „inference endpoint", żeby przeskoczyć do konfiguracji. Wpisz URL endpointu, https://api.apisrouter.com/v1, swój klucz APIsRouter jako poświadczenie oraz identyfikator albo identyfikatory modeli, które chcesz przez niego kierować, na przykład claude-sonnet-4-6 i gpt-5.6-sol. Po zapisaniu te modele pojawią się w pickerze modeli Warp obok wbudowanych opcji. Sedno tkwi w zachowaniu rozliczeniowym: gdy jawnie wybierzesz z pickera model kierowany przez endpoint, Warp kieruje żądanie przez Twój endpoint zamiast zużywać kredyty AI Warp, a koszt trafia na saldo Twojej bramki, gdzie widzisz go per żądanie. Dokumentacja Warp opisuje ten przepływ jako odzwierciedlający ich konfigurację Bring Your Own API Key, więc będzie znajomy, jeśli konfigurowałeś już BYOK wcześniej.
Endpoint URL: https://api.apisrouter.com/v1
Credential: sk-YOUR-APISROUTER-KEY
Model id(s): claude-sonnet-4-6
gpt-5.6-sol
then: select the endpoint-routed model
in Warp's model pickerJak Warp korzysta z endpointu.
Warp to agentowy terminal: jego agenci szkicują polecenia, wyjaśniają awarie, uruchamiają wieloetapowe zadania i edytują kod z tego samego okna, w którym pracujesz. Własna dokumentacja Warp wprost stawia wymóg: endpoint musi implementować OpenAI Chat Completions API pod /v1/chat/completions, a ich post ogłaszający launch wymienia routery modeli i hostowane bramki jako zamierzone cele, więc wielodostawcza bramka jest tu pełnoprawnym obywatelem, a nie sztuczką. Warto poznać dwa udokumentowane ograniczenia przed rozpoczęciem. Po pierwsze, endpoint musi być publicznie osiągalny: localhost, 127.0.0.1 i adresy sieci prywatnej są odrzucane w momencie konfiguracji, co wyklucza wskazanie Warp bezpośrednio na lokalny serwer wnioskowania, ale jest nieistotne dla hostowanej bramki. Po drugie, wybór modelu Auto w Warp zawsze zużywa kredyty Warp, nawet gdy skonfigurowany jest niestandardowy endpoint; tylko jawne wybranie z pickera modelu kierowanego przez endpoint kieruje ruch przez Twój endpoint. Jeśli Twoje wydatki nie przenoszą się do konsoli bramki, sprawdź, jakiego modelu faktycznie użyła sesja. Dostępność zależy od planu: niestandardowe endpointy wnioskowania są oferowane w planach Free i kwalifikujących się planach płatnych dla osób indywidualnych i organizacji liczących dziesięć osób lub mniej, podczas gdy większe organizacje potrzebują tierów Business albo Enterprise Warp. To pochodzi bezpośrednio z dokumentacji Warp i może się zmienić po ich stronie.
Dobór modeli do pracy agenta terminalowego.
Agenci terminalowi rozliczają się inaczej niż czat: każde wyjaśnienie polecenia, ponowna próba i streszczenie outputu to żądanie niosące kontekst sesji. Ponieważ użycie kierowane przez endpoint trafia do konsoli bramki per żądanie i per model, tydzień prawdziwego użycia daje Ci uczciwą liczbę per kandydujący model, co bije zgadywanie ze strony z cennikiem, łącznie z tą.
- claude-sonnet-4-6 jako model na co dzień: niezawodne generowanie poleceń, mocne użycie narzędzi, dobry osąd przy wieloetapowych zadaniach.
- gpt-5.6-sol do szybkiej, precyzyjnie zakresowanej pracy, gdzie opóźnienie per tura kształtuje odczucie z terminala.
- claude-opus-4-7 do trudnych sesji: debugowania między usługami, długich łańcuchów śledczych, zmian infrastruktury, które chcesz przemyśleć do końca.
- gpt-5.5 jako flagowy generalista do zestawienia A/B z Claude na Twoich własnych workflow powłoki.
- deepseek-v4-pro jako wybór value do rutynowego użycia agenta o dużej objętości, gdzie stawka liczy się bardziej niż flagowy poler.
Płatność za użycie · poniżej cen oficjalnych
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Model | Cena oficjalna | Nasza cena |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Opus 4.7 | $5.00 / $25.00 per M | $4.00 / $20.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| GPT-5.6 Sol | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Tryby awarii charakterystyczne dla Warp.
Jak zawsze, potwierdź połowę dotyczącą bramki dwoma poleceniami curl — listą modeli i jednym chat completion — zanim zaczniesz debugować stronę Warp. Jeśli curl przechodzi, a Warp zawodzi, problem leży w formularzu endpointu albo wyborze w pickerze modeli, nigdzie indziej.
- Endpoint odrzucony w momencie zapisu: Warp celowo odmawia adresów localhost i sieci prywatnej. Endpoint musi być publicznie osiągalny; URL hostowanej bramki przechodzi tę weryfikację.
- Wydatki wciąż uderzają w kredyty Warp: sesja jest na wyborze modelu Auto, który zawsze zużywa kredyty Warp. Jawnie wybierz w pickerze model kierowany przez endpoint.
- Model nie znaleziony: identyfikator, który wpisałeś w konfiguracji endpointu, nie odpowiada katalogowi bramki. Kopiuj identyfikatory z listy /v1/models bit po bicie.
- 401 od endpointu: pole poświadczenia trzyma nieaktualny albo obcięty klucz. Sprawdź curlem listę modeli tym samym kluczem, żeby potwierdzić poza Warp.
- Funkcja w ogóle niewidoczna: sprawdź swój plan. Niestandardowe endpointy są dostępne dla osób indywidualnych i małych organizacji w planach Free i kwalifikujących się planach płatnych; większe organizacje potrzebują Business albo Enterprise, zgodnie z dokumentacją Warp.
Kto kieruje Warp przez bramkę.
- Deweloperzy, którzy chcą mieć Claude za agentami Warp na przedpłaconym saldzie, z darmowym startem i bez karty.
- Intensywni użytkownicy agentów, których zużycie kredytów Warp przerosło ich plan, przenoszący jawne wybory modeli na własny, rozliczany endpoint.
- Osoby porównujące modele do kodowania na prawdziwych workflow terminalowych, gdzie każdy kandydat to jeden kolejny identyfikator w konfiguracji endpointu.
- Zespoły liczące dziesięć osób lub mniej standaryzujące się na jednym kluczu do bramki, żeby agenci terminala, edytora i CI współdzielili jeden log użycia.
- Osoby już uruchamiające inne narzędzia przez bramkę, które chcą mieć Warp na tym samym kluczu i w tej samej konsoli.
Zweryfikuj endpoint i potwierdź routing.
Uruchom dwa standardowe sprawdzenia z dokładnym kluczem i identyfikatorem, które skonfigurowałeś w Warp. Jeśli oba przejdą, bramka jest gotowa, a każdy pozostały problem leży w ustawieniach albo wyborze modelu w Warp. Następnie uruchom jedno prawdziwe zadanie agenta w Warp z jawnie wybranym modelem endpointu i potwierdź, że żądanie pojawia się w konsoli APIsRouter z oczekiwanym modelem i liczbą tokenów. To jedno potwierdzenie od razu wyłapuje pułapkę trybu Auto, a od tej pory konsola to Twój zapis per żądanie tego, ile faktycznie wydaje terminal.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Częste pytania
Jak skonfigurować niestandardowy endpoint wnioskowania w Warp?
Otwórz Ustawienia Warp, wyszukaj „inference endpoint" i wpisz URL endpointu, swoje poświadczenie oraz identyfikatory modeli do kierowania przez niego. Przy APIsRouter URL to https://api.apisrouter.com/v1, a modele pojawiają się w pickerze Warp po zapisaniu.
Czy niestandardowy endpoint Warp działa z bramkami i routerami modeli?
Tak, wprost. Dokumentacja Warp i post ogłaszający launch wymieniają bramki i routery kompatybilne z OpenAI jako obsługiwane cele; wymogiem jest, żeby endpoint implementował OpenAI Chat Completions API i był publicznie osiągalny.
Czy żądania kierowane przez endpoint zużywają moje kredyty Warp AI?
Nie. Gdy jawnie wybierzesz model kierowany przez endpoint, Warp kieruje żądanie przez Twój endpoint, a rozlicza je Twój dostawca, nie kredyty Warp. Wyjątkiem jest wybór modelu Auto, który zawsze zużywa kredyty Warp, nawet przy skonfigurowanym endpoincie.
Dlaczego Warp odrzuca mój URL endpointu?
Warp odmawia localhost, 127.0.0.1 i innych adresów sieci prywatnej albo lokalnej w momencie konfiguracji; endpoint musi być publicznie osiągalny. URL hostowanej bramki, taki jak https://api.apisrouter.com/v1, przechodzi tę weryfikację.
Które plany Warp zawierają niestandardowe endpointy wnioskowania?
Zgodnie z dokumentacją Warp w połowie 2026: Free i kwalifikujące się plany płatne dla użytkowników indywidualnych i organizacji liczących dziesięć osób lub mniej; większe organizacje potrzebują Warp Business albo Enterprise. Sprawdź aktualną dokumentację Warp, bo bramkowanie planów należy do nich i może się zmienić.
Czy mogę w ten sposób uruchamiać modele Claude w Warp?
Tak. Dodaj claude-sonnet-4-6 albo claude-opus-4-7 jako identyfikatory modeli w konfiguracji endpointu i wybierz je w pickerze; bramka obsługuje je przez powierzchnię kompatybilną z OpenAI, jakiej oczekuje Warp, na tym samym kluczu co identyfikatory GPT i DeepSeek.