Faites tourner AnythingLLM sur n'importe quel modèle via Generic OpenAI.
Updated 2026-07-29
Le fournisseur Generic OpenAI d'AnythingLLM connecte toute l'application à n'importe quel endpoint compatible OpenAI : Base URL https://api.apisrouter.com/v1, une seule clé, un id de chat model, et des limites de tokens honnêtes. Les ids Claude, GPT, Gemini et DeepSeek sont tous éligibles, pour les documents, les agents et le chat à la fois.
Réponse rapide : cinq champs dans LLM Preference.
Ouvrez les paramètres d'AnythingLLM, allez dans la section LLM sous AI Providers (l'écran historiquement intitulé LLM Preference), et cherchez Generic OpenAI dans la liste des fournisseurs. Le sélectionner expose cinq champs : Base URL, API Key, Chat Model Name, Token Context Window et Max Tokens. Remplissez-les comme suit : Base URL https://api.apisrouter.com/v1 (le /v1 appartient à ce champ), votre clé, et l'id exact du catalogue dans Chat Model Name, par exemple claude-sonnet-4-6. Puis les deux nombres : Token Context Window est la fenêtre totale du modèle et Max Tokens plafonne une seule réponse, donc prenez les deux depuis la documentation du modèle plutôt que de deviner. Enregistrez, et chaque espace de travail qui suit le défaut système discute désormais via la passerelle. La documentation qualifie ce fournisseur d'orienté développeur précisément parce qu'il fait confiance à vos saisies ; ce n'est pas une mise en garde contre son usage, juste une affirmation que les cinq champs forment un contrat.
Base URL: https://api.apisrouter.com/v1
API Key: sk-YOUR-APISROUTER-KEY
Chat Model Name: claude-sonnet-4-6
Token Context Window: 200000
Max Tokens: 8192Ce que le fournisseur Generic OpenAI pilote réellement.
AnythingLLM (Mintplex Labs sur GitHub, environ 63 000 étoiles) est l'assistant documentaire privé tout-en-un : des espaces de travail qui embarquent vos fichiers, un chat ancré dans le contexte récupéré, des agents avec usage d'outils, disponible en app desktop et en serveur auto-hébergé. La LLM preference configurée ci-dessus est le cerveau par défaut de tout cela. Les requêtes partent comme des chat completions standard contre votre Base URL avec le Chat Model Name comme chaîne de modèle, donc le fournisseur importe peu : un id Claude est aussi valide qu'un id GPT, et changer revient à éditer un champ. Les espaces de travail peuvent aussi surcharger le défaut système avec leurs propres réglages de fournisseur et de modèle, ce qui permet à un même déploiement de faire tourner claude-sonnet-4-6 pour l'espace de travail juridique et gpt-5.5 pour l'ingénierie sans que l'un sache pour l'autre. Les deux champs de tokens méritent le respect car AnythingLLM les utilise pour budgétiser le contexte. La valeur de la fenêtre de contexte décide de la quantité de texte de document récupéré et d'historique de chat empaquetée dans chaque requête ; la sous-estimer et vos documents soigneusement embarqués se font retrancher de leurs propres réponses, la surestimer et les requêtes rebondissent contre la vraie limite du modèle. C'est la paire de champs derrière la plupart des rapports « le RAG a l'air bête » sur des endpoints génériques.
Les embeddings sont une décision séparée.
AnythingLLM sépare la LLM preference de l'embedding preference, et cette séparation est structurelle. Le chat model répond aux questions ; l'embedder transforme vos documents en vecteurs au moment du téléversement, et ces vecteurs persistent. Changer de chat model est gratuit, à tout moment, par espace de travail. Changer d'embedder invalide la géométrie de tout ce qui est déjà embarqué et implique de ré-embarquer vos documents. La configuration pratique : AnythingLLM embarque un embedder local intégré qui fonctionne hors ligne et ne coûte rien, et de nombreux déploiements le gardent simplement. Si vous pointez plutôt l'embedding preference vers un endpoint distant, confirmez que l'id d'embedding spécifique y est servi avant de téléverser votre base de documents, et traitez ce choix comme marié au vector store. La liberté que cela achète côté chat est tout le sens de l'architecture : une fois les embeddings réglés, le chat model Generic OpenAI est un cadran à faible enjeu. Faites tourner deepseek-v4-pro pendant un mois de résumé intensif, basculez le champ vers claude-sonnet-4-6 pour un trimestre de travail client, et rien concernant vos documents n'a besoin de bouger.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
# Chat Model Name must match one of these ids exactlyChoisir des modèles pour le travail documentaire.
Chaque id facture via la même clé, donc la boucle de comparaison est une simple édition de réglages : même espace de travail, mêmes documents, deux semaines sur chaque candidat, et la dépense par modèle dans la console APIsRouter à côté de votre propre jugement sur les réponses.
- Le QA ancré sur des fragments récupérés est lourd en entrée : claude-haiku-4-5-20251001 et gemini-3.5-flash répondent bien aux questions qui suivent des citations, à des tarifs de volume.
- claude-sonnet-4-6 mérite le défaut là où les réponses partent vers des humains sans relecture : révision de contrats, rédaction de rapports, tout ce qui a des conséquences.
- deepseek-v4-pro est le cheval de bataille longue contexte pour les espaces de travail bâtis sur de gros documents, où la fenêtre et le tarif d'entrée dominent l'expérience.
- Les espaces de travail d'agents ont besoin d'un appel d'outils fiable ; démarrez les agents sur claude-sonnet-4-6, puis testez si un id plus léger tient la route sur vos flux réels.
- Utilisez les surcharges par espace de travail comme politique : le défaut reste rapide, et l'id coûteux ne vit que dans les espaces de travail dont le travail le justifie.
Paiement à l'usage · en dessous du tarif officiel
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Modèle | Prix officiel | Notre prix |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Haiku 4.5 20251001 | $1.00 / $5.00 per M | $0.80 / $4.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| Gemini 3.5 Flash | $1.50 / $9.00 per M | $1.20 / $7.20 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Modes d'échec spécifiques à AnythingLLM.
Les champs de tokens causent les échecs les plus subtils. Une fenêtre de contexte réglée trop bas tronque silencieusement le contexte récupéré, ce qui se présente comme un modèle qui ignore vos documents ; réglez la fenêtre documentée pour l'id dans Chat Model Name. Un Max Tokens réglé trop haut pour le modèle produit des erreurs franches sur les longues réponses ; réglez-le sur ce que le modèle autorise réellement en sortie. Les erreurs franches sont plus honnêtes. Les échecs d'authentification tiennent au champ API Key. Model-not-found signifie que Chat Model Name a dérivé de l'orthographe du catalogue ; le champ est du texte libre et le listing /v1/models fait foi. Les erreurs de connexion sur l'app desktop signifient généralement un proxy ou un pare-feu entre l'app et l'endpoint ; sur les déploiements Docker, rappelez-vous que c'est le conteneur qui doit atteindre la Base URL, pas votre navigateur. Si le chat fonctionne mais qu'un espace de travail se comporte différemment de ce qui est attendu, vérifiez ses réglages de surcharge ; les réglages de fournisseur au niveau de l'espace de travail l'emportent sur le défaut système, et une surcharge oubliée est le mystère classique du « même question, modèle différent ». La présentation « orientée développeur » de la documentation résume tout ce qui précède : le fournisseur fait exactement ce que ses cinq champs disent, ni plus ni moins.
Qui route AnythingLLM via une passerelle.
- Les équipes qui font tourner des assistants documentaires privés et veulent une qualité de réponse frontier sans compte fournisseur par famille de modèles.
- Les utilisateurs desktop qui pointent leur base de documents personnelle vers des ids Claude ou GPT sur un solde prépayé, sans carte requise pour démarrer.
- Les auto-hébergeurs qui gardent l'embedder local intégré et traitent le chat distant comme l'unique voie mesurée, lue par modèle sur un seul journal d'usage.
- Les déploiements segmentés par espace de travail, où les surcharges par espace de travail plus la mesure par clé donnent à chaque équipe son propre modèle et sa propre facture.
- Les créateurs qui comparent des modèles de réponse sur une base de documents fixe, où chaque candidat est une simple édition de réglages plutôt qu'une migration.
Vérifiez l'endpoint et déboguez le premier chat d'espace de travail.
Faites d'abord un curl sur le listing de modèles et sur une completion de chat, en utilisant l'id exact que vous comptez mettre dans Chat Model Name. Une fois les deux validés, la moitié passerelle est prouvée et tout symptôme restant vit dans les cinq champs. Enregistrez ensuite les réglages du fournisseur et posez une question dans un espace de travail avec un document que vous connaissez bien. Une réponse ancrée et citante signifie que tout le pipeline fonctionne. Une réponse qui ignore le document pointe vers la valeur de la fenêtre de contexte ou vers les réglages de récupération propres à l'espace de travail. Les erreurs franches se cartographient proprement : clé, orthographe de l'id, forme de la Base URL. Une fois les chats en circulation, la console APIsRouter affiche le modèle par requête, le nombre de tokens et la dépense. Le QA documentaire multiplie les tokens d'entrée via la récupération, et le journal d'usage est l'endroit où vous apprenez ce que votre base de documents coûte réellement à interroger, par modèle, par jour, et par clé d'espace de travail si vous les séparez.
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Questions fréquentes
Comment définir une Base URL personnalisée dans AnythingLLM ?
Dans les paramètres sous AI Providers, ouvrez l'écran de LLM preference et choisissez Generic OpenAI dans la liste des fournisseurs. Réglez Base URL sur https://api.apisrouter.com/v1, ajoutez votre clé, mettez l'id exact du catalogue dans Chat Model Name, et remplissez les deux champs de tokens depuis la documentation du modèle.
Que contrôlent Token Context Window et Max Tokens ?
La fenêtre de contexte indique à AnythingLLM combien de texte récupéré et d'historique il peut empaqueter par requête ; Max Tokens plafonne une seule réponse. Sous-estimer la fenêtre retranche vos documents des réponses, et surestimer l'un ou l'autre produit des requêtes que le modèle rejette.
AnythingLLM peut-il faire tourner Claude ou DeepSeek via Generic OpenAI ?
Oui. Le fournisseur envoie Chat Model Name comme simple chaîne à la Base URL via des chat completions standard, donc claude-sonnet-4-6, deepseek-v4-pro, gemini-3.5-flash et les ids GPT fonctionnent tous, interchangeables en éditant un champ ou par espace de travail.
Changer de chat model affecte-t-il mes documents embarqués ?
Non. Les préférences de chat et d'embedding sont séparées ; les vecteurs persistent et les chat models s'échangent librement. Seul un changement d'embedder invalide les vecteurs existants et force un ré-embarquement, ce qui explique pourquoi de nombreux déploiements gardent l'embedder local intégré et n'ajustent que le côté chat.
Pourquoi la documentation qualifie-t-elle Generic OpenAI d'orienté développeur ?
Parce qu'il fait confiance à vos saisies au lieu de livrer des préréglages par fournisseur : des ids, URLs ou valeurs de tokens erronés échouent à l'exécution plutôt que d'être détectés par le formulaire. Avec des ids copiés depuis /v1/models et des limites tirées de la documentation du modèle, c'est une voie stable et de premier ordre.
Différents espaces de travail peuvent-ils utiliser différents modèles ?
Oui. Les espaces de travail héritent du défaut système mais peuvent surcharger le fournisseur et le modèle dans leurs propres réglages de chat, donc un même déploiement peut faire tourner un id rapide par défaut et fixer claude-sonnet-4-6 uniquement dans les espaces de travail dont le travail le mérite.