KoboldAI Lite en un endpoint personalizado compatible con OpenAI.

Updated 2026-07-29

KoboldAI Lite se conecta a endpoints personalizados de forma nativa: el propio README del proyecto lista APIs con forma de OpenAI y de Claude junto a instancias de Kobold y AI Horde. Apunta su campo de URL personalizada a https://api.apisrouter.com/v1 con tu clave, y cada modelo del catálogo, DeepSeek, GLM, Kimi, Claude, Grok, se vuelve seleccionable dentro de la misma interfaz de historias, ya uses el Lite alojado en lite.koboldai.net o la copia incluida con KoboldCpp.

Respuesta rápida: los valores que necesita Lite.

Abre el panel de conexión de IA (el botón AI en el menú superior de Lite), cambia de AI Horde por defecto al grupo de endpoint personalizado, y elige la opción compatible con OpenAI. Las etiquetas exactas cambian ligeramente entre versiones, pero los campos son constantes: una URL de API, una clave, y un modelo elegido después de conectar. Dos detalles específicos de Lite son responsables de la mayoría de los fallos. Primero, la casilla de versión: Lite ofrece un interruptor tipo "Add Ver. Num" que añade /v1 a la URL por ti, así que introducir https://api.apisrouter.com con la casilla marcada y https://api.apisrouter.com/v1 con ella desmarcada resuelven correctamente ambas, mientras que duplicar el /v1 no. Segundo, la persistencia: Lite históricamente ha reiniciado las URLs de endpoint personalizado al reconectar, así que ten la URL a mano en vez de asumir que el campo sobrevive a cada sesión.

API URL:  https://api.apisrouter.com/v1   (or base URL + "Add Ver. Num" ticked)
API key:  sk-...                            (from APIsRouter)
Model:    deepseek-v4-flash                 (or any catalog id after connecting)

Qué es Lite, y cómo llega a un modelo alojado.

KoboldAI Lite es la interfaz web sin instalación del ecosistema Kobold: una app de una sola página para escritura de historias, modo aventura y chat de personaje que corre enteramente en tu navegador. Existe en dos formas que comparten los mismos ajustes: la instancia alojada en lite.koboldai.net, y la copia incluida que KoboldCpp sirve en localhost cuando ejecutas modelos en local. El README del proyecto lo describe como capaz de conectarse a endpoints personalizados incluyendo APIs con forma de OpenAI y de Claude, junto a instancias Kobold locales y remotas y el AI Horde crowdsourced. Como Lite es una app de navegador sin servidor propio, tus peticiones de API van directamente del navegador al endpoint que configures. Ese diseño es la razón por la que la ruta de endpoint personalizado funciona en absoluto, y también por qué existe la sección de CORS más abajo: el endpoint tiene que responder a peticiones con origen de navegador, y cuando alguno no lo hace, Lite ofrece un interruptor de proxy con contrapartidas que vale la pena entender antes de activarlo. Para quienes llegan desde AI Horde: el atractivo de un endpoint de pago por uso frente al clúster de voluntarios es la previsibilidad. Horde es genuinamente gratis con una cola; un endpoint financiado responde de inmediato con el modelo exacto que pediste, y a tarifas de familias económicas una noche de juego cuesta una pequeña fracción de un centavo por mensaje.

Configuración, campo por campo.

Si la lista de modelos queda vacía tras conectar, las causas habituales se ordenan así: un /v1 duplicado o ausente (revisa primero la casilla de versión), una clave pegada con espacios en blanco, o una extensión del navegador bloqueando la petición. Que los mismos tres valores funcionen en un comando curl es la forma más rápida de confirmar que el lado del endpoint está bien y localizar el problema en el navegador.

  • Abre Lite (alojado o incluido) y haz clic en el botón AI del menú superior para abrir el panel de conexión.
  • Cambia la selección de proveedor de AI Horde al grupo de endpoint personalizado, y elige la opción compatible con OpenAI (las etiquetas varían ligeramente según la versión; una opción con forma de Claude está justo al lado).
  • Introduce la URL: https://api.apisrouter.com/v1, prestando atención a la casilla de versión descrita arriba para que /v1 aparezca exactamente una vez.
  • Pega tu clave sk-... en el campo de clave.
  • Conecta, luego elige un modelo de la lista que Lite obtiene, o escribe el id exacto del catálogo si tu versión pide un nombre de modelo manual.
  • Envía un mensaje corto en una historia nueva para confirmar el ciclo completo antes de cargar una sesión larga.

La opción de endpoint de Claude, y cuándo usarla.

El grupo de endpoint personalizado de Lite también incluye una opción con forma de Claude para APIs con el dialecto de Anthropic. APIsRouter también sirve ese dialecto, en /v1/messages, así que los ids de claude son alcanzables por cualquiera de las dos puertas. En la práctica, la ruta compatible con OpenAI es la opción por defecto más simple incluso para modelos de Claude, porque una sola configuración sirve entonces a todas las familias: claude-sonnet-4-6 para prosa de gama alta, deepseek-v4-flash para juego de volumen, glm-5.2 y kimi-k2.6 para rotación, todo como cambios en el campo de modelo en vez de reconfiguraciones. Donde la opción con forma de Claude se gana su lugar es si mantienes preajustes ajustados específicamente al formato de petición de Anthropic o migras ajustes desde otra herramienta con dialecto de Anthropic. Funcionalmente, ambas rutas acaban en los mismos modelos a través de este gateway; elige una y mantén la consistencia para que tus ajustes guardados sigan siendo portables.

Samplers y modos: qué se aplica de verdad sobre un endpoint alojado.

Lite expone todo el zoológico de samplers de modelo local en sus ajustes, y la mayor parte no viaja. En endpoints compatibles con OpenAI, la propia documentación de Lite señala que solo aplican controles de tipo temperatura, top-p y penalización de repetición; samplers exóticos como Min-P, Top-A o TFS son funciones de inferencia local, y aunque Lite puede adjuntarlos como campos extra, los endpoints alojados generalmente ignoran o rechazan parámetros no estándar. Fija la temperatura alrededor de 0.8 a 0.9 para variedad de prosa, deja el top-p cerca de 0.95, y mantén bajas las penalizaciones de repetición; esa es toda la superficie ajustable, y es suficiente. Todos los modos de escritura de Lite funcionan sobre el endpoint personalizado, con una indicación: el modo instruct se traduce de forma más natural a modelos de chat alojados, ya que produce el intercambio estructurado basado en roles con el que esos modelos están entrenados. La coescritura de historias clásica también funciona; espera que los modelos se comporten más como interlocutores conversacionales que como continuadores de texto crudo, porque eso es lo que es un endpoint de chat completions. El presupuesto de contexto sigue la misma regla que todo frontend de roleplay: Lite reenvía el contexto visible de la historia en cada turno, así que fija el tamaño de contexto deliberadamente (una ventana de trabajo de 16K a 32K cubre sesiones largas) en vez de maximizarlo porque la ventana del modelo lo permita. La guía de longitud de contexto enlazada abajo hace esas cuentas entre modelos.

La realidad de los samplers en endpoints compatibles con OpenAI, según las propias notas de ajustes de Lite.
AjustePunto de partidaNota
Temperatura0.8 a 0.9La palanca principal que sobrevive al viaje hasta un endpoint alojado
Top P0.95Déjalo tal cual salvo que la salida se vuelva incoherente
Penalización de repeticiónBajaValores altos estropean los nombres en historias largas
Samplers exóticos (Min-P, Top-A, TFS)IgnorarFunciones de inferencia local; los endpoints alojados los descartan o rechazan
Tamaño de contexto16K a 32KSe reenvía cada turno; el coste escala con él

Pago por uso · por debajo del precio oficial

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ModeloPrecio oficialNuestro precio
DeepSeek V4 Flash$0.14 / $0.28 per M$0.10 / $0.30 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Grok 4.5$2.00 / $6.00 per M$1.60 / $4.80 per M

CORS, el interruptor de proxy, y mantener tu clave sensata.

Como Lite llama al endpoint directamente desde tu navegador, un fallo de conexión con valores correctos suele ser CORS: el endpoint rechazando peticiones con origen de navegador. Lite incluye un interruptor "Use CORS Proxy" exactamente para este caso, y merece una advertencia honesta: enrutar a través de cualquier proxy de terceros coloca a ese proxy dentro de tu tráfico, clave y contenido de la historia incluidos. Prueba primero una conexión directa, confirma que el endpoint funciona vía curl si tienes dudas, y trata el interruptor de proxy como último recurso en vez de opción por defecto. Ejecutar el Lite incluido desde un KoboldCpp local es otra alternativa limpia, ya que los mismos ajustes de endpoint personalizado existen ahí. La higiene de claves importa un poco más en una app de navegador: la clave se guarda en los ajustes locales de tu navegador, así que evita pegarla en máquinas compartidas o públicas, y si alguna vez se filtra, revócala y reemítela en vez de confiar en que no pase nada. Las claves aquí son gratis de crear, así que una clave dedicada para Lite mantiene el registro de uso legible y el radio de impacto pequeño. Una nota de contenido, dicha sin rodeos: un endpoint personalizado cambia a dónde van las peticiones, no qué permiten los modelos. Las políticas de los modelos aguas arriba y los términos de la instancia de Lite que uses siguen aplicando; la página de políticas comparadas enlazada abajo cubre el panorama de forma factual, familia de modelo por familia de modelo.

Preguntas frecuentes

¿Admite KoboldAI Lite endpoints personalizados compatibles con OpenAI?

Sí, de forma nativa. El README del proyecto lista endpoints personalizados incluyendo APIs con forma de OpenAI y de Claude junto a instancias de Kobold y AI Horde. La configuración es una URL, una clave y un modelo, desde el panel de conexión de IA tanto en el Lite alojado como en el incluido con KoboldCpp.

¿Qué URL introduzco para APIsRouter en KoboldAI Lite?

https://api.apisrouter.com/v1, con la casilla de versión gestionada para que /v1 aparezca exactamente una vez: el interruptor tipo "Add Ver. Num" de Lite añade /v1 automáticamente cuando está marcado. Un segmento de versión duplicado o ausente es la causa más común de una lista de modelos vacía.

¿Puedo usar modelos de Claude en KoboldAI Lite?

Sí, de dos formas: a través del endpoint compatible con OpenAI con un id de claude como claude-sonnet-4-6 en el campo de modelo, o a través de la opción de endpoint con forma de Claude de Lite contra /v1/messages. La ruta compatible con OpenAI es la opción por defecto más simple ya que la misma configuración sirve entonces también a todas las demás familias.

¿Por qué parece que mis ajustes de sampler no hacen nada?

La mayor parte del zoológico de samplers de Lite es para inferencia local. Sobre un endpoint compatible con OpenAI solo aplican controles de tipo temperatura, top-p y penalización de repetición; los endpoints alojados ignoran o rechazan samplers exóticos. Si la salida se siente rara, ajusta primero la temperatura y revisa segundo el id del modelo.

¿Por qué falla la conexión de Lite cuando curl funciona?

Casi siempre es CORS: Lite corre en tu navegador, así que el endpoint debe aceptar peticiones con origen de navegador. Opciones en orden aproximado: reintenta con una configuración directa limpia, ejecuta el Lite incluido con un KoboldCpp local, o usa el interruptor de proxy CORS de Lite entendiendo que un tercero pasa entonces a estar dentro de tu tráfico.

¿Es esto mejor que AI Horde?

Son compensaciones distintas. Horde es genuinamente gratis, gestionado por voluntarios y con cola, con los modelos que los voluntarios alojen. Un endpoint de pago por uso responde de inmediato con el modelo exacto que elijas, a tarifas de familias económicas que ponen una noche de juego en una pequeña fracción de un centavo por mensaje. Mucha gente mantiene ambos configurados.