KoboldAI Lite sur un endpoint compatible OpenAI personnalisé.

Updated 2026-07-29

KoboldAI Lite se connecte nativement à des endpoints personnalisés : le README du projet lui-même liste des API au format OpenAI et au format Claude, aux côtés des instances Kobold et d'AI Horde. Pointez son champ d'URL personnalisée vers https://api.apisrouter.com/v1 avec votre clé, et chaque modèle du catalogue, DeepSeek, GLM, Kimi, Claude, Grok, devient sélectionnable dans la même interface narrative, que vous utilisiez la version hébergée sur lite.koboldai.net ou la copie embarquée avec KoboldCpp.

Réponse rapide : les valeurs dont Lite a besoin.

Ouvrez le panneau de connexion IA (le bouton AI dans le menu supérieur de Lite), passez d'AI Horde (par défaut) au groupe des endpoints personnalisés, et choisissez l'option compatible OpenAI. Les libellés exacts varient légèrement d'une version à l'autre, mais les champs restent constants : une URL d'API, une clé, et un modèle choisi une fois connecté. Deux détails propres à Lite causent la majorité des échecs. D'abord, la case de version : Lite propose un interrupteur type « Add Ver. Num » qui ajoute /v1 à l'URL à votre place, donc saisir https://api.apisrouter.com avec la case cochée et https://api.apisrouter.com/v1 avec la case décochée fonctionnent correctement tous les deux, alors que doubler le /v1 ne fonctionne pas. Ensuite, la persistance : Lite a historiquement réinitialisé les URL d'endpoint personnalisées à la reconnexion, donc gardez l'URL sous la main plutôt que de supposer que le champ survit à chaque session.

API URL:  https://api.apisrouter.com/v1   (or base URL + "Add Ver. Num" ticked)
API key:  sk-...                            (from APIsRouter)
Model:    deepseek-v4-flash                 (or any catalog id after connecting)

Ce qu'est Lite, et comment il atteint un modèle hébergé.

KoboldAI Lite est l'interface web sans installation de l'écosystème Kobold : une application une-page pour l'écriture d'histoires, le mode aventure et le chat de personnage, qui tourne entièrement dans votre navigateur. Elle existe sous deux formes partageant les mêmes réglages : l'instance hébergée sur lite.koboldai.net, et la copie embarquée que KoboldCpp sert sur localhost quand vous faites tourner des modèles en local. Le README du projet la décrit comme capable de se connecter à des endpoints personnalisés, y compris des API au format OpenAI et au format Claude, aux côtés d'instances Kobold locales et distantes et de l'AI Horde communautaire. Comme Lite est une application navigateur sans serveur propre, vos requêtes API partent directement du navigateur vers l'endpoint que vous configurez. C'est cette conception qui rend la route de l'endpoint personnalisé possible, et c'est aussi pourquoi la section CORS ci-dessous existe : l'endpoint doit répondre aux requêtes en provenance du navigateur, et quand ce n'est pas le cas, Lite propose un interrupteur de proxy dont les compromis méritent d'être compris avant de l'activer. Pour les personnes venant d'AI Horde : l'intérêt d'un endpoint facturé à l'usage face au cluster de bénévoles est la prévisibilité. Horde est réellement gratuit, avec une file d'attente ; un endpoint financé répond immédiatement avec exactement le modèle demandé, et aux tarifs des modèles économiques, une soirée de jeu coûte une infime fraction de centime par message.

Configuration, champ par champ.

Si la liste de modèles reste vide après connexion, les causes habituelles se classent ainsi : un /v1 doublé ou manquant (vérifiez d'abord la case de version), une clé collée avec des espaces, ou une extension de navigateur qui bloque la requête. Faire fonctionner les trois mêmes valeurs dans une commande curl est le moyen le plus rapide de prouver que le côté endpoint est correct et de localiser le problème dans le navigateur.

  • Ouvrez Lite (hébergé ou embarqué) et cliquez sur le bouton AI dans le menu supérieur pour ouvrir le panneau de connexion.
  • Faites passer la sélection de fournisseur d'AI Horde au groupe des endpoints personnalisés, et choisissez l'option compatible OpenAI (les libellés varient légèrement selon la version ; une option au format Claude se trouve juste à côté).
  • Saisissez l'URL : https://api.apisrouter.com/v1, en faisant attention à la case de version décrite plus haut pour que /v1 n'apparaisse qu'une seule fois.
  • Collez votre clé sk-... dans le champ clé.
  • Connectez-vous, puis choisissez un modèle dans la liste que Lite récupère, ou tapez l'id exact du catalogue si votre version demande un nom de modèle manuel.
  • Envoyez un court message dans une nouvelle histoire pour confirmer l'aller-retour avant de charger une longue session.

L'option d'endpoint Claude, et quand l'utiliser.

Le groupe des endpoints personnalisés de Lite inclut aussi une option au format Claude, pour les API au dialecte Anthropic. APIsRouter sert aussi ce dialecte, sur /v1/messages, donc les id claude sont accessibles par les deux portes. En pratique, la route compatible OpenAI reste le choix par défaut le plus simple, même pour les modèles Claude, car une seule configuration sert alors toutes les familles : claude-sonnet-4-6 pour la prose haut de gamme, deepseek-v4-flash pour le jeu en volume, glm-5.2 et kimi-k2.6 en rotation, le tout via de simples changements du champ modèle plutôt que des reconfigurations. L'option au format Claude se justifie si vous gardez des préréglages calibrés spécifiquement pour le format de requête d'Anthropic, ou si vous migrez des réglages depuis un autre outil au dialecte Anthropic. Fonctionnellement, les deux routes aboutissent aux mêmes modèles via cette passerelle ; choisissez-en une et restez cohérent, afin que vos réglages sauvegardés restent portables.

Samplers et modes : ce qui s'applique réellement via un endpoint hébergé.

Lite expose dans ses réglages tout le zoo de samplers des modèles locaux, et la majeure partie ne survit pas au trajet. Sur les endpoints compatibles OpenAI, la documentation de Lite elle-même précise que seuls les contrôles type temperature, top-p et repetition-penalty s'appliquent ; les samplers exotiques comme Min-P, Top-A ou TFS sont des fonctionnalités d'inférence locale, et bien que Lite puisse les joindre en champs supplémentaires, les endpoints hébergés ignorent ou rejettent généralement les paramètres non standard. Réglez temperature autour de 0.8 à 0.9 pour varier la prose, laissez top-p proche de 0.95, et gardez les pénalités de répétition basses ; c'est toute la surface réglable, et c'est suffisant. Tous les modes d'écriture de Lite fonctionnent via l'endpoint personnalisé, avec une seule recommandation : le mode instruct correspond le plus naturellement aux modèles de chat hébergés, car il produit l'échange structuré par rôles sur lequel ces modèles sont entraînés. La co-écriture d'histoire classique fonctionne aussi ; attendez-vous à ce que les modèles se comportent davantage comme des partenaires de conversation que comme de simples continuateurs de texte brut, parce que c'est ce qu'est un endpoint de chat completions. La gestion du budget de contexte suit la même règle que pour tout frontend de roleplay : Lite renvoie le contexte visible de l'histoire à chaque tour, donc réglez la taille de contexte délibérément (une fenêtre de travail de 16K à 32K couvre les longues sessions) plutôt que de la maximiser simplement parce que la fenêtre du modèle le permet. Le guide de longueur de contexte lié ci-dessous fait ce calcul pour plusieurs modèles.

La réalité des samplers sur les endpoints compatibles OpenAI, selon les propres notes de réglages de Lite.
RéglagePoint de départRemarque
Temperature0.8 à 0.9Le levier principal qui survit au trajet vers un endpoint hébergé
Top P0.95À laisser tel quel sauf si la sortie devient incohérente
Repetition penaltyBasseDes valeurs élevées déforment les noms dans les longues histoires
Samplers exotiques (Min-P, Top-A, TFS)IgnorerFonctionnalités d'inférence locale ; les endpoints hébergés les ignorent ou les rejettent
Taille de contexte16K à 32KRenvoyée à chaque tour ; le coût évolue avec elle

Paiement à l'usage · en dessous du tarif officiel

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

ModèlePrix officielNotre prix
DeepSeek V4 Flash$0.14 / $0.28 per M$0.10 / $0.30 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Grok 4.5$2.00 / $6.00 per M$1.60 / $4.80 per M

CORS, l'interrupteur de proxy, et garder sa clé sous contrôle.

Comme Lite appelle l'endpoint directement depuis votre navigateur, un échec de connexion avec des valeurs correctes est généralement une histoire de CORS : l'endpoint refuse les requêtes en provenance du navigateur. Lite propose un interrupteur « Use CORS Proxy » exactement pour ce cas, et il mérite un avertissement honnête : router via n'importe quel proxy tiers place ce proxy à l'intérieur de votre trafic, clé et contenu de l'histoire inclus. Essayez d'abord une connexion directe, confirmez que l'endpoint fonctionne via curl en cas de doute, et traitez l'interrupteur de proxy comme un dernier recours plutôt que comme un défaut. Faire tourner la version embarquée de Lite depuis un KoboldCpp local est une autre solution propre, puisque les mêmes réglages d'endpoint personnalisé y existent. L'hygiène de clé compte un peu plus sur une application navigateur : la clé réside dans les réglages locaux de votre navigateur, donc évitez de la coller sur des machines partagées ou publiques, et si elle fuit un jour, révoquez-la et réémettez-en une plutôt que d'espérer. Les clés sont gratuites à créer ici, donc une clé dédiée pour Lite garde le journal d'usage lisible et limite les dégâts en cas de problème. Une remarque sur le contenu, énoncée clairement : un endpoint personnalisé change la destination des requêtes, pas ce que les modèles autorisent. Les politiques des modèles en amont et les conditions de l'instance Lite que vous utilisez s'appliquent toujours ; la page de comparaison des politiques liée ci-dessous couvre factuellement le paysage, famille de modèles par famille de modèles.

Questions fréquentes

KoboldAI Lite prend-il en charge les endpoints personnalisés compatibles OpenAI ?

Oui, nativement. Le README du projet liste des endpoints personnalisés incluant des API au format OpenAI et au format Claude, aux côtés des instances Kobold et d'AI Horde. La configuration consiste en une URL, une clé et un modèle, depuis le panneau de connexion IA, que ce soit sur le Lite hébergé ou embarqué avec KoboldCpp.

Quelle URL saisir pour APIsRouter dans KoboldAI Lite ?

https://api.apisrouter.com/v1, en gérant la case de version pour que /v1 n'apparaisse qu'une seule fois : l'interrupteur type « Add Ver. Num » de Lite ajoute /v1 automatiquement quand il est coché. Un segment de version doublé ou manquant est la cause la plus courante d'une liste de modèles vide.

Puis-je utiliser des modèles Claude dans KoboldAI Lite ?

Oui, de deux façons : via l'endpoint compatible OpenAI avec un id claude comme claude-sonnet-4-6 dans le champ modèle, ou via l'option d'endpoint au format Claude de Lite, contre /v1/messages. La route compatible OpenAI reste le choix par défaut le plus simple, puisque la même configuration sert alors aussi toutes les autres familles.

Pourquoi mes réglages de sampler semblent-ils n'avoir aucun effet ?

La majeure partie du zoo de samplers de Lite est destinée à l'inférence locale. Via un endpoint compatible OpenAI, seuls les contrôles type temperature, top-p et repetition-penalty s'appliquent ; les endpoints hébergés ignorent ou rejettent les samplers exotiques. Si la sortie semble étrange, ajustez d'abord temperature, puis vérifiez ensuite l'id du modèle.

Pourquoi Lite échoue-t-il à se connecter alors que curl fonctionne ?

Presque toujours du CORS : Lite tourne dans votre navigateur, donc l'endpoint doit accepter les requêtes en provenance du navigateur. Options par ordre approximatif : retentez une configuration directe propre, faites tourner le Lite embarqué avec un KoboldCpp local, ou utilisez l'interrupteur de proxy CORS de Lite en sachant qu'un tiers se trouve alors à l'intérieur de votre trafic.

Est-ce mieux qu'AI Horde ?

C'est un compromis différent. Horde est réellement gratuit, géré par des bénévoles, avec file d'attente, et propose les modèles que les bénévoles hébergent. Un endpoint facturé à l'usage répond immédiatement avec exactement le modèle choisi, à des tarifs de modèles économiques qui ramènent une soirée de jeu à une infime fraction de centime par message. Beaucoup de gens gardent les deux configurés.