Alimenta gli agenti di Warp dal tuo endpoint di inferenza.

Updated 2026-07-29

Warp supporta endpoint di inferenza personalizzati esattamente per questo: qualsiasi endpoint che implementi la OpenAI Chat Completions API, gateway e router di modelli esplicitamente inclusi. Puntalo su https://api.apisrouter.com/v1 con una chiave, e i modelli instradati tramite endpoint compaiono nel selettore di modelli di Warp senza consumare i crediti Warp AI.

Risposta rapida: impostazioni, URL, chiave, id dei modelli.

Apri le Impostazioni di Warp e cerca "inference endpoint" per saltare alla configurazione. Inserisci l'URL dell'endpoint, https://api.apisrouter.com/v1, la tua chiave APIsRouter come credenziale, e l'id o gli id di modello che vuoi instradare attraverso di esso, per esempio claude-sonnet-4-6 e gpt-5.6-sol. Una volta salvato, quei modelli compaiono nel selettore di modelli di Warp accanto alle opzioni integrate. Il comportamento di fatturazione è il punto centrale: quando selezioni esplicitamente un modello instradato tramite endpoint dal selettore, Warp instrada la richiesta attraverso il tuo endpoint invece di consumare i crediti AI di Warp, e il costo atterra sul tuo saldo gateway dove puoi vederlo per richiesta. La documentazione di Warp descrive questo flusso come uno specchio della loro configurazione Bring Your Own API Key, quindi ti sembrerà familiare se hai già configurato BYOK in passato.

Endpoint URL:  https://api.apisrouter.com/v1
Credential:    sk-YOUR-APISROUTER-KEY
Model id(s):   claude-sonnet-4-6
               gpt-5.6-sol

then: select the endpoint-routed model
      in Warp's model picker

Come Warp usa l'endpoint.

Warp è il terminale agentico: i suoi agenti redigono comandi, spiegano fallimenti, eseguono task multi-step, e modificano codice dalla stessa finestra in cui lavori. La documentazione stessa di Warp dichiara il requisito con chiarezza: l'endpoint deve implementare la OpenAI Chat Completions API su /v1/chat/completions, e il loro post di lancio nomina router di modelli e gateway hostati come target previsti, quindi un gateway multi-fornitore è un cittadino di prima classe qui, non un trucco. Due vincoli documentati vale la pena conoscerli prima di iniziare. Primo, l'endpoint deve essere raggiungibile pubblicamente: localhost, 127.0.0.1, e URL di rete privata vengono rifiutati al momento della configurazione, il che esclude puntare Warp direttamente a un server di inferenza locale ma è irrilevante per un gateway hostato. Secondo, la selezione automatica del modello di Warp consuma sempre i crediti Warp anche quando è configurato un endpoint personalizzato; solo scegliere esplicitamente un modello instradato tramite endpoint dal selettore instrada attraverso il tuo endpoint. Se la tua spesa non si sposta verso la console del gateway, controlla quale modello ha effettivamente usato la sessione. La disponibilità dipende dal piano: gli endpoint di inferenza personalizzati sono offerti sui piani Free e su piani a pagamento idonei per individui e organizzazioni di dieci o meno persone, mentre le organizzazioni più grandi hanno bisogno dei tier Business o Enterprise di Warp. Questo viene direttamente dalla documentazione di Warp e può cambiare dal loro lato.

Scegliere modelli per il lavoro dell'agente da terminale.

Gli agenti da terminale fatturano diversamente dalla chat: ogni spiegazione di comando, retry, e riassunto dell'output è una richiesta che porta contesto di sessione. Poiché l'utilizzo instradato tramite endpoint atterra nella console del gateway per richiesta e per modello, una settimana di utilizzo reale ti dà un numero onesto per modello candidato, che batte l'indovinare da una pagina prezzi, inclusa questa.

  • claude-sonnet-4-6 come daily driver: generazione di comandi affidabile, forte uso di strumenti, buon giudizio sui task multi-step.
  • gpt-5.6-sol per lavoro veloce e delimitato, dove la latenza per turno modella come si sente il terminale.
  • claude-opus-4-7 per le sessioni difficili: debugging tra servizi, lunghe catene investigative, cambiamenti infrastrutturali che vuoi siano ragionati a fondo.
  • gpt-5.5 come generalista di frontiera da confrontare in A/B con Claude sui tuoi stessi workflow di shell.
  • deepseek-v4-pro come scelta value per l'uso di routine dell'agente ad alto volume dove la tariffa conta più della rifinitura di frontiera.

Pagamento a consumo · sotto i prezzi ufficiali

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ModelloPrezzo ufficialeIl nostro prezzo
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Claude Opus 4.7$5.00 / $25.00 per M$4.00 / $20.00 per M
GPT-5.5$5.00 / $30.00 per M$4.00 / $24.00 per M
GPT-5.6 Sol$5.00 / $30.00 per M$4.00 / $24.00 per M
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M

Modalità di errore specifiche di Warp.

Come sempre, dimostra la metà gateway con due comandi curl, l'elenco dei modelli e una chat completion, prima di fare debug del lato Warp. Se curl passa e Warp fallisce, il problema è nel form dell'endpoint o nella selezione del selettore di modelli, da nessun'altra parte.

  • Endpoint rifiutato al momento del salvataggio: Warp rifiuta per design gli URL localhost e di rete privata. L'endpoint deve essere raggiungibile pubblicamente; un URL gateway hostato supera questo controllo.
  • La spesa continua a colpire i crediti Warp: la sessione è sulla selezione automatica del modello, che usa sempre i crediti Warp. Scegli esplicitamente il modello instradato tramite endpoint nel selettore.
  • Modello non trovato: l'id che hai digitato nella configurazione dell'endpoint non corrisponde al catalogo del gateway. Copia gli id dall'elenco /v1/models byte per byte.
  • 401 dall'endpoint: il campo credenziale contiene una chiave obsoleta o troncata. Esegui curl sull'elenco dei modelli con la stessa chiave per confermare fuori da Warp.
  • Funzionalità non visibile affatto: controlla il tuo piano. Gli endpoint personalizzati sono disponibili per individui e piccole organizzazioni sui piani Free e su piani a pagamento idonei; le organizzazioni più grandi hanno bisogno di Business o Enterprise secondo la documentazione di Warp.

Chi instrada Warp tramite un gateway.

  • Sviluppatori che vogliono Claude dietro gli agenti di Warp su un saldo prepagato, con un inizio gratuito e senza carta.
  • Utenti intensivi dell'agente il cui consumo di crediti Warp ha superato il loro piano, spostando le scelte esplicite di modello sul proprio endpoint a consumo.
  • Chi confronta modelli di coding su workflow reali da terminale, dove ogni candidato è un id in più nella configurazione dell'endpoint.
  • Team di dieci o meno persone che standardizzano su una chiave gateway così che gli agenti di terminale, editor e CI condividano un unico log di utilizzo.
  • Persone che già fanno girare altri strumenti tramite un gateway e vogliono Warp sulla stessa chiave e console.

Verifica l'endpoint e conferma l'instradamento.

Esegui i due controlli standard con la chiave e l'id esatti che hai configurato in Warp. Se entrambi passano, il gateway è pronto e qualsiasi problema rimanente è nelle impostazioni di Warp o nella selezione del modello. Poi esegui un task reale dell'agente in Warp con il modello endpoint selezionato esplicitamente, e conferma che la richiesta compaia nella console di APIsRouter con il modello e i conteggi di token attesi. Quella singola conferma cattura immediatamente la trappola della modalità Auto, e da quel momento in poi la console è il tuo registro per richiesta di quanto spende davvero il terminale.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude-sonnet-4-6",
       "messages":[{"role":"user","content":"ping"}]}'

Domande frequenti

Come configuro un endpoint di inferenza personalizzato in Warp?

Apri le Impostazioni di Warp, cerca "inference endpoint", e inserisci l'URL dell'endpoint, la tua credenziale, e gli id dei modelli da instradare attraverso di esso. Con APIsRouter l'URL è https://api.apisrouter.com/v1 e i modelli compaiono nel selettore di Warp una volta salvato.

L'endpoint personalizzato di Warp funziona con gateway e router di modelli?

Sì, esplicitamente. La documentazione e il post di lancio di Warp nominano gateway e router compatibili OpenAI come target supportati; il requisito è che l'endpoint implementi la OpenAI Chat Completions API e sia raggiungibile pubblicamente.

Le richieste instradate tramite endpoint usano i miei crediti Warp AI?

No. Quando selezioni esplicitamente un modello instradato tramite endpoint, Warp instrada la richiesta attraverso il tuo endpoint e il tuo provider la fattura, non i crediti Warp. L'eccezione è la selezione automatica del modello, che consuma sempre i crediti Warp anche con un endpoint configurato.

Perché Warp rifiuta il mio URL endpoint?

Warp rifiuta localhost, 127.0.0.1, e altri URL di rete privata o locale al momento della configurazione; l'endpoint deve essere raggiungibile pubblicamente. Un URL gateway hostato come https://api.apisrouter.com/v1 supera questo controllo.

Quali piani Warp includono endpoint di inferenza personalizzati?

Secondo la documentazione di Warp a metà 2026: Free e piani a pagamento idonei per utenti individuali e organizzazioni con dieci o meno persone; le organizzazioni più grandi hanno bisogno di Warp Business o Enterprise. Controlla la documentazione attuale di Warp, dato che il gating dei piani è a loro discrezione cambiarlo.

Posso far girare modelli Claude in Warp in questo modo?

Sì. Aggiungi claude-sonnet-4-6 o claude-opus-4-7 come id di modello nella configurazione dell'endpoint e selezionali nel selettore; il gateway li serve sulla superficie compatibile OpenAI che Warp si aspetta, sulla stessa chiave degli id GPT e DeepSeek.