KoboldAI Lite em um endpoint compatível com OpenAI personalizado.
Updated 2026-07-29
O KoboldAI Lite se conecta a endpoints personalizados nativamente: o próprio README do projeto lista APIs no formato OpenAI e no formato Claude ao lado de instâncias Kobold e do AI Horde. Aponte o campo de URL personalizada para https://api.apisrouter.com/v1 com sua chave, e todo modelo do catálogo, DeepSeek, GLM, Kimi, Claude, Grok, se torna selecionável dentro da mesma interface de história, seja usando o Lite hospedado em lite.koboldai.net ou a cópia empacotada com o KoboldCpp.
Resposta rápida: os valores que o Lite precisa.
Abra o painel de conexão de IA (o botão AI no menu superior do Lite), troque do AI Horde padrão para o grupo de endpoint personalizado, e escolha a opção compatível com OpenAI. Os rótulos exatos mudam um pouco entre versões, mas os campos são constantes: uma URL de API, uma chave, e um modelo escolhido depois de conectar. Dois detalhes específicos do Lite causam a maior parte dos problemas quando isso falha. Primeiro, a checkbox de versão: o Lite oferece um toggle estilo "Add Ver. Num" que anexa /v1 à URL para você, então digitar https://api.apisrouter.com com a caixa marcada e https://api.apisrouter.com/v1 com ela desmarcada ambos resolvem corretamente, enquanto duplicar o /v1 não. Segundo, a persistência: o Lite historicamente reseta URLs de endpoint personalizado ao reconectar, então mantenha a URL à mão em vez de assumir que o campo sobrevive a toda sessão.
API URL: https://api.apisrouter.com/v1 (ou base URL + "Add Ver. Num" marcado)
API key: sk-... (da APIsRouter)
Model: deepseek-v4-flash (ou qualquer id do catálogo após conectar)O que é o Lite, e como ele alcança um modelo hospedado.
O KoboldAI Lite é a UI web sem instalação do ecossistema Kobold: um app de página única para escrita de histórias, modo aventura e chat de personagem que roda inteiramente no seu navegador. Ele vem em duas formas que compartilham as mesmas configurações: a instância hospedada em lite.koboldai.net, e a cópia empacotada que o KoboldCpp serve em localhost quando você roda modelos localmente. O README do projeto o descreve como capaz de se conectar a endpoints personalizados incluindo APIs no formato OpenAI e no formato Claude, ao lado de instâncias Kobold locais e remotas e o AI Horde, feito pela comunidade. Como o Lite é um app de navegador sem servidor próprio, suas requisições de API vão diretamente do navegador para qualquer endpoint que você configurar. Esse design é o motivo pelo qual a rota de endpoint personalizado funciona, e também o motivo pelo qual a seção de CORS abaixo existe: o endpoint precisa responder requisições de origem do navegador, e quando um não responde, o Lite oferece um toggle de proxy com trade-offs que vale a pena entender antes de ativá-lo. Para quem vem do AI Horde: o apelo de um endpoint medido sobre o cluster voluntário é a previsibilidade. O Horde é genuinamente gratuito com uma fila; um endpoint pago responde imediatamente com o modelo exato que você pediu, e nas tarifas das famílias de valor uma noite de jogo custa uma fração pequena de um centavo por mensagem.
Configuração, campo por campo.
Se a lista de modelos ficar vazia depois de conectar, as causas de sempre em ordem: um /v1 duplicado ou ausente (verifique a checkbox de versão primeiro), uma chave colada com espaço em branco, ou uma extensão de navegador bloqueando a requisição. As mesmas três valores funcionando em um comando curl é a forma mais rápida de provar que o lado do endpoint está bem e localizar o problema no navegador.
- Abra o Lite (hospedado ou empacotado) e clique no botão AI no menu superior para abrir o painel de conexão.
- Troque a seleção de provider do AI Horde para o grupo de endpoint personalizado, e escolha a opção compatível com OpenAI (os rótulos variam um pouco por versão; uma opção no formato Claude fica ao lado).
- Insira a URL: https://api.apisrouter.com/v1, atento à checkbox de versão descrita acima para que /v1 apareça exatamente uma vez.
- Cole sua chave sk-... no campo de chave.
- Conecte, depois escolha um modelo da lista que o Lite busca, ou digite o id exato do catálogo se sua versão pedir um nome de modelo manual.
- Envie uma mensagem curta em uma história nova para confirmar a ida e volta antes de carregar uma sessão longa.
A opção de endpoint Claude, e quando usá-la.
O grupo de endpoint personalizado do Lite também inclui uma opção no formato Claude para APIs no dialeto Anthropic. A APIsRouter também serve esse dialeto, em /v1/messages, então ids claude são alcançáveis por qualquer uma das duas portas. Na prática, a rota compatível com OpenAI é o padrão mais simples mesmo para modelos Claude, porque uma única configuração então serve todas as famílias: claude-sonnet-4-6 para prosa de alto nível, deepseek-v4-flash para jogo em volume, glm-5.2 e kimi-k2.6 para alternância, tudo como mudanças no campo de modelo em vez de reconfigurações. Onde a opção no formato Claude ganha seu lugar é se você mantém presets ajustados especificamente para o formato de requisição da Anthropic ou migra configurações de outra ferramenta no dialeto Anthropic. Funcionalmente, ambas as rotas terminam nos mesmos modelos por este gateway; escolha uma e mantenha consistência para que suas configurações salvas continuem portáteis.
Samplers e modos: o que de fato se aplica em um endpoint hospedado.
O Lite expõe o zoológico completo de samplers de modelo local nas suas configurações, e a maior parte disso não viaja. Em endpoints compatíveis com OpenAI, a própria documentação do Lite observa que apenas temperatura, top-p e controles estilo penalidade de repetição se aplicam; samplers exóticos como Min-P, Top-A ou TFS são recursos de inferência local, e embora o Lite possa anexá-los como campos extras, endpoints hospedados geralmente ignoram ou rejeitam parâmetros não padrão. Defina a temperatura em torno de 0,8 a 0,9 para variedade de prosa, deixe o top-p perto de 0,95, e mantenha as penalidades de repetição baixas; essa é toda a superfície ajustável, e é suficiente. Todos os modos de escrita do Lite funcionam pelo endpoint personalizado, com uma orientação: o modo instruct mapeia mais naturalmente para modelos de chat hospedados, já que produz a troca estruturada baseada em papéis com a qual esses modelos são treinados. A co-escrita clássica de história também funciona; espere que os modelos se comportem mais como parceiros conversacionais do que continuadores brutos de texto, porque é isso que um endpoint de chat completions é. O orçamento de contexto segue a mesma regra de todo frontend de roleplay: o Lite reenvia o contexto visível da história a cada turno, então defina o tamanho de contexto deliberadamente (uma janela de trabalho de 16K a 32K cobre sessões longas) em vez de maximizá-lo só porque a janela do modelo permite. O guia de tamanho de contexto linkado abaixo faz essa conta entre modelos.
| Configuração | Ponto de partida | Nota |
|---|---|---|
| Temperatura | 0,8 a 0,9 | A principal alavanca que sobrevive à viagem até um endpoint hospedado |
| Top P | 0,95 | Deixe como está a menos que a saída fique incoerente |
| Penalidade de repetição | Baixa | Valores altos bagunçam nomes em histórias longas |
| Samplers exóticos (Min-P, Top-A, TFS) | Ignorar | Recursos de inferência local; endpoints hospedados descartam ou rejeitam |
| Tamanho de contexto | 16K a 32K | Reenviado a cada turno; o custo escala com ele |
Pague pelo uso · abaixo do preço oficial
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Modelo | Preço oficial | Nosso preço |
|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 per M | $0.10 / $0.30 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Grok 4.5 | $2.00 / $6.00 per M | $1.60 / $4.80 per M |
CORS, o toggle de proxy, e mantendo sua chave sã.
Como o Lite chama o endpoint diretamente do seu navegador, uma falha de conexão com valores corretos costuma ser CORS: o endpoint recusando requisições de origem do navegador. O Lite vem com um toggle "Use CORS Proxy" exatamente para esse caso, e ele merece um aviso honesto: rotear por qualquer proxy de terceiros coloca esse proxy dentro do seu tráfego, chave e conteúdo da história incluídos. Tente uma conexão direta primeiro, confirme que o endpoint funciona via curl se estiver em dúvida, e trate o toggle de proxy como último recurso em vez de padrão. Rodar o Lite empacotado a partir de um KoboldCpp local é outra saída limpa, já que as mesmas configurações de endpoint personalizado existem lá. A higiene da chave importa um pouco mais em um app de navegador: a chave fica nas configurações locais do seu navegador, então evite colá-la em máquinas compartilhadas ou públicas, e se ela algum dia vazar, revogue e reemita em vez de torcer. Chaves aqui são gratuitas de criar, então uma chave dedicada para o Lite mantém o log de uso legível e o raio de impacto pequeno. Uma observação sobre conteúdo, dita sem rodeios: um endpoint personalizado muda para onde as requisições vão, não o que os modelos permitem. As políticas de modelo upstream e os termos de qualquer instância do Lite que você usar continuam se aplicando; a página de comparação de políticas linkada abaixo cobre o panorama de forma factual, família de modelo por família de modelo.
Perguntas frequentes
O KoboldAI Lite suporta endpoints personalizados compatíveis com OpenAI?
Sim, nativamente. O README do projeto lista endpoints personalizados incluindo APIs no formato OpenAI e no formato Claude ao lado de instâncias Kobold e do AI Horde. A configuração é uma URL, uma chave e um modelo, a partir do painel de conexão de IA tanto no Lite hospedado quanto no empacotado com KoboldCpp.
Que URL eu insiro para a APIsRouter no KoboldAI Lite?
https://api.apisrouter.com/v1, com a checkbox de versão tratada para que /v1 apareça exatamente uma vez: o toggle estilo "Add Ver. Num" do Lite anexa /v1 automaticamente quando marcado. Um segmento de versão duplicado ou ausente é a causa mais comum de uma lista de modelos vazia.
Posso usar modelos Claude no KoboldAI Lite?
Sim, de duas formas: pelo endpoint compatível com OpenAI com um id claude como claude-sonnet-4-6 no campo de modelo, ou pela opção de endpoint no formato Claude do Lite contra /v1/messages. A rota compatível com OpenAI é o padrão mais simples já que a mesma configuração então serve todas as outras famílias também.
Por que minhas configurações de sampler parecem não fazer nada?
A maior parte do zoológico de samplers do Lite é para inferência local. Em um endpoint compatível com OpenAI apenas temperatura, top-p e controles estilo penalidade de repetição se aplicam; endpoints hospedados ignoram ou rejeitam samplers exóticos. Se a saída parecer errada, ajuste a temperatura primeiro e verifique o id do modelo em segundo lugar.
Por que o Lite falha ao conectar quando o curl funciona?
Quase sempre CORS: o Lite roda no seu navegador, então o endpoint precisa aceitar requisições de origem do navegador. Opções em ordem aproximada: tente de novo uma configuração direta limpa, rode o Lite empacotado com um KoboldCpp local, ou use o toggle de proxy CORS do Lite entendendo que um terceiro passa a estar dentro do seu tráfego.
Isso é melhor que o AI Horde?
Trade-off diferente. O Horde é genuinamente gratuito, mantido por voluntários e com fila, com os modelos que os voluntários hospedarem. Um endpoint medido responde imediatamente com o modelo exato que você escolher, em tarifas de famílias de valor que colocam uma noite de jogo em uma fração pequena de um centavo por mensagem. Muita gente mantém os dois configurados.