Impulsa los agentes de Warp desde tu propio endpoint de inferencia.
Updated 2026-07-29
Warp admite endpoints de inferencia personalizados para exactamente esto: cualquier endpoint que implemente la API de OpenAI Chat Completions, gateways y enrutadores de modelos explícitamente incluidos. Apúntalo a https://api.apisrouter.com/v1 con una sola clave, y los modelos enrutados por el endpoint aparecen en el selector de modelos de Warp sin consumir créditos de Warp AI.
Respuesta rápida: ajustes, URL, clave, IDs de modelo.
Abre los ajustes (Settings) de Warp y busca "inference endpoint" para saltar directo a la configuración. Introduce la URL del endpoint, https://api.apisrouter.com/v1, tu clave de APIsRouter como credencial, y el id o los ids de modelo que quieras enrutar a través de él, por ejemplo claude-sonnet-4-6 y gpt-5.6-sol. Una vez guardado, esos modelos aparecen en el selector de modelos de Warp junto a las opciones integradas. El comportamiento de facturación es lo importante: cuando seleccionas explícitamente un modelo enrutado por el endpoint desde el selector, Warp enruta la petición a través de tu endpoint en lugar de consumir los créditos de IA de Warp, y el coste recae en tu saldo del gateway, donde puedes verlo por petición. La documentación de Warp describe este flujo como un espejo de su configuración Bring Your Own API Key, así que te resultará familiar si ya has configurado BYOK antes.
Endpoint URL: https://api.apisrouter.com/v1
Credential: sk-YOUR-APISROUTER-KEY
Model id(s): claude-sonnet-4-6
gpt-5.6-sol
then: select the endpoint-routed model
in Warp's model pickerCómo usa Warp el endpoint.
Warp es la terminal agéntica: sus agentes redactan comandos, explican fallos, ejecutan tareas de varios pasos y editan código desde la misma ventana en la que trabajas. La propia documentación de Warp establece el requisito con claridad: el endpoint debe implementar la API de OpenAI Chat Completions en /v1/chat/completions, y su post de lanzamiento menciona explícitamente enrutadores de modelos y gateways alojados como objetivos previstos, así que un gateway multiproveedor es aquí un ciudadano de primera clase, no un truco. Vale la pena conocer dos restricciones documentadas antes de empezar. Primero, el endpoint debe ser públicamente accesible: localhost, 127.0.0.1 y las URLs de red privada se rechazan en el momento de la configuración, lo que descarta apuntar Warp directamente a un servidor de inferencia local, pero es irrelevante para un gateway alojado. Segundo, la selección de modelo Auto de Warp siempre consume créditos de Warp incluso cuando hay un endpoint personalizado configurado; solo elegir explícitamente un modelo enrutado por el endpoint en el selector enruta a través de tu endpoint. Si tu gasto no se refleja en la consola del gateway, comprueba qué modelo usó realmente la sesión. La disponibilidad depende del plan: los endpoints de inferencia personalizados se ofrecen en el plan Free y en los planes de pago elegibles para individuos y organizaciones de diez personas o menos, mientras que las organizaciones más grandes necesitan los niveles Business o Enterprise de Warp. Esto viene directamente de la documentación de Warp y puede cambiar por su parte.
Elegir modelos para el trabajo de agente en terminal.
Los agentes de terminal facturan de forma distinta al chat: cada explicación de comando, reintento y resumen de salida es una petición que carga contexto de sesión. Como el uso enrutado por el endpoint llega a la consola del gateway por petición y por modelo, una semana de uso real te da una cifra honesta por modelo candidato, que vence a adivinar desde una página de precios, incluida esta.
- claude-sonnet-4-6 como opción diaria: generación de comandos fiable, buen uso de herramientas y buen criterio en tareas de varios pasos.
- gpt-5.6-sol para trabajo acotado y rápido, donde la latencia por turno define cómo se siente la terminal.
- claude-opus-4-7 para las sesiones difíciles: depuración entre servicios, cadenas de investigación largas, cambios de infraestructura que quieres razonar a fondo.
- gpt-5.5 como generalista de vanguardia para comparar en A/B contra Claude en tus propios flujos de shell.
- deepseek-v4-pro como la opción económica para uso rutinario de agente en alto volumen, donde la tarifa importa más que el pulido de vanguardia.
Pago por uso · por debajo del precio oficial
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Modelo | Precio oficial | Nuestro precio |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Opus 4.7 | $5.00 / $25.00 per M | $4.00 / $20.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| GPT-5.6 Sol | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Modos de fallo específicos de Warp.
Como siempre, comprueba la mitad del gateway con dos comandos curl, el listado de modelos y una chat completion, antes de depurar el lado de Warp. Si curl funciona y Warp falla, el problema está en el formulario del endpoint o en la selección del selector de modelos, en ningún otro sitio.
- Endpoint rechazado al guardar: por diseño, Warp rechaza URLs de localhost y de red privada. El endpoint debe ser públicamente accesible; una URL de gateway alojado pasa esta comprobación.
- El gasto sigue consumiendo créditos de Warp: la sesión está en selección de modelo Auto, que siempre usa créditos de Warp. Elige explícitamente el modelo enrutado por el endpoint en el selector.
- Modelo no encontrado: el id que escribiste en la configuración del endpoint no coincide con el catálogo del gateway. Copia los ids del listado de /v1/models exactamente, carácter por carácter.
- 401 desde el endpoint: el campo de credencial tiene una clave caducada o truncada. Haz curl al listado de modelos con la misma clave para confirmarlo fuera de Warp.
- La función no aparece en absoluto: revisa tu plan. Los endpoints personalizados están disponibles para individuos y organizaciones pequeñas en el plan Free y en los planes de pago elegibles; las organizaciones más grandes necesitan Business o Enterprise según la documentación de Warp.
Quién enruta Warp a través de un gateway.
- Desarrolladores que quieren Claude detrás de los agentes de Warp con un saldo prepagado, con un inicio gratis y sin tarjeta.
- Usuarios intensivos de agentes cuyo consumo de créditos de Warp superó su plan, moviendo las selecciones explícitas de modelo a su propio endpoint medido.
- Compradores de modelos que comparan modelos de programación en flujos de trabajo reales de terminal, donde cada candidato es un id más en la configuración del endpoint.
- Equipos de diez personas o menos que estandarizan en una sola clave de gateway para que los agentes de terminal, editor y CI compartan un único registro de uso.
- Personas que ya enrutan otras herramientas a través de un gateway y quieren tener Warp en la misma clave y consola.
Verifica el endpoint y confirma el enrutamiento.
Ejecuta las dos comprobaciones estándar con la clave y el id exactos que configuraste en Warp. Si ambas pasan, el gateway está listo y cualquier problema restante está en los ajustes de Warp o en la selección de modelo. Luego ejecuta una tarea de agente real en Warp con el modelo del endpoint seleccionado explícitamente, y confirma que la petición aparece en la consola de APIsRouter con el modelo y los recuentos de tokens esperados. Esa única confirmación detecta de inmediato la trampa del modo Auto, y a partir de ahí la consola es tu registro por petición de lo que realmente gasta la terminal.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Preguntas frecuentes
¿Cómo configuro un endpoint de inferencia personalizado en Warp?
Abre los ajustes de Warp, busca "inference endpoint" e introduce la URL del endpoint, tu credencial y los ids de modelo que quieres enrutar a través de él. Con APIsRouter la URL es https://api.apisrouter.com/v1 y los modelos aparecen en el selector de Warp en cuanto se guarda.
¿El endpoint personalizado de Warp funciona con gateways y enrutadores de modelos?
Sí, explícitamente. La documentación y el post de lanzamiento de Warp mencionan los gateways y enrutadores compatibles con OpenAI como objetivos admitidos; el requisito es que el endpoint implemente la API de OpenAI Chat Completions y sea públicamente accesible.
¿Las peticiones enrutadas por el endpoint usan mis créditos de Warp AI?
No. Cuando seleccionas explícitamente un modelo enrutado por el endpoint, Warp enruta la petición a través de tu endpoint y la factura tu proveedor, no los créditos de Warp. La excepción es la selección de modelo Auto, que siempre consume créditos de Warp incluso con un endpoint configurado.
¿Por qué Warp rechaza la URL de mi endpoint?
Warp rechaza localhost, 127.0.0.1 y otras URLs de red privada o local en el momento de la configuración; el endpoint debe ser públicamente accesible. Una URL de gateway alojado como https://api.apisrouter.com/v1 pasa esta comprobación.
¿Qué planes de Warp incluyen endpoints de inferencia personalizados?
Según la documentación de Warp a mediados de 2026: el plan Free y los planes de pago elegibles para usuarios individuales y organizaciones de diez personas o menos; las organizaciones más grandes necesitan Warp Business o Enterprise. Consulta la documentación actual de Warp, ya que las restricciones por plan pueden cambiar por su parte.
¿Puedo ejecutar modelos de Claude en Warp de esta forma?
Sí. Añade claude-sonnet-4-6 o claude-opus-4-7 como ids de modelo en la configuración del endpoint y selecciónalos en el selector; el gateway los sirve a través de la superficie compatible con OpenAI que Warp espera, con la misma clave que los ids de GPT y DeepSeek.