AnythingLLM mit jedem Modell über Generic OpenAI betreiben.
Updated 2026-07-29
AnythingLLMs Generic-OpenAI-Provider verbindet die gesamte App mit jedem OpenAI-kompatiblen Endpoint: Base URL https://api.apisrouter.com/v1, ein Key, eine Chat-Model-ID und ehrliche Token-Limits. Claude-, GPT-, Gemini- und DeepSeek-IDs qualifizieren sich alle, für Dokumente, Agents und Chat gleichermaßen.
Kurzantwort: fünf Felder in LLM Preference.
Öffne AnythingLLMs Settings, geh zum Abschnitt LLM unter AI Providers (der Screen hieß früher LLM Preference), und suche in der Provider-Liste nach Generic OpenAI. Wählst du ihn aus, erscheinen fünf Felder: Base URL, API Key, Chat Model Name, Token Context Window und Max Tokens. Fülle sie so: Base URL https://api.apisrouter.com/v1 (das /v1 gehört in dieses Feld), deinen Key, und die exakte Katalog-ID in Chat Model Name, zum Beispiel claude-sonnet-4-6. Dann die zwei Zahlen: Token Context Window ist das Gesamtfenster des Modells und Max Tokens deckelt eine einzelne Antwort, also nimm beide aus der Dokumentation des Modells statt zu raten. Speichern, und jeder Workspace, der dem System-Default folgt, chattet jetzt über das Gateway. Die Docs kennzeichnen diesen Provider als developer-focused, genau weil er deinen Eingaben vertraut; das ist keine Warnung davor, ihn zu nutzen, nur eine Feststellung, dass die fünf Felder ein Vertrag sind.
Base URL: https://api.apisrouter.com/v1
API Key: sk-YOUR-APISROUTER-KEY
Chat Model Name: claude-sonnet-4-6
Token Context Window: 200000
Max Tokens: 8192Was der Generic-OpenAI-Provider tatsächlich antreibt.
AnythingLLM (Mintplex Labs auf GitHub, rund 63.000 Stars) ist der All-in-one-Private-Document-Assistant: Workspaces, die deine Dateien einbetten, Chat, der in abgerufenem Kontext verankert ist, Agents mit Tool-Nutzung, verfügbar als Desktop-App und selbst gehosteter Server. Die oben konfigurierte LLM Preference ist das Default-Gehirn für all das. Requests verlassen die App als Standard-Chat-Completions gegen deine Base URL mit dem Chat Model Name als model-String, also spielt der Vendor keine Rolle: eine Claude-ID ist so gültig wie eine GPT-ID, und der Wechsel bedeutet, ein Feld zu bearbeiten. Workspaces können den System-Default zudem mit eigenen Provider- und Model-Einstellungen überschreiben, wodurch ein Deployment claude-sonnet-4-6 für den Legal-Workspace und gpt-5.5 für Engineering laufen lässt, ohne dass eines vom anderen weiß. Die beiden Token-Felder verdienen Respekt, weil AnythingLLM sie nutzt, um Kontext zu budgetieren. Der Context-Window-Wert entscheidet, wie viel abgerufener Dokumententext und Chat-Verlauf in jeden Request gepackt wird; unterschätzt du ihn, werden deine sorgfältig eingebetteten Dokumente aus ihren eigenen Antworten herausgekürzt, überschätzt du ihn, prallen Requests am realen Limit des Modells ab. Dieses Feldpaar steht hinter den meisten „RAG wirkt dumm"-Meldungen bei generischen Endpoints.
Embeddings sind eine separate Entscheidung.
AnythingLLM trennt die LLM Preference von der Embedding Preference, und die Trennung ist tragend. Das Chat-Modell beantwortet Fragen; der Embedder verwandelt deine Dokumente beim Upload in Vektoren, und diese Vektoren bleiben bestehen. Chat-Modelle zu wechseln ist kostenlos, jederzeit, pro Workspace. Embedder zu wechseln invalidiert die Geometrie von allem bereits Eingebetteten und bedeutet, deine Dokumente neu einzubetten. Das praktische Setup: AnythingLLM liefert einen eingebauten lokalen Embedder, der offline funktioniert und nichts kostet, und viele Deployments behalten ihn einfach. Zeigst du die Embedding Preference stattdessen auf einen entfernten Endpoint, bestätige, dass die spezifische Embedding-ID dort tatsächlich bedient wird, bevor du deine Dokumentenbasis hochlädst, und behandle diese Wahl als mit dem Vector Store verheiratet. Die Freiheit, die das auf der Chat-Seite kauft, ist der Sinn der Architektur: Sind Embeddings geklärt, ist das Generic-OpenAI-Chat-Modell ein Low-Stakes-Regler. Lass deepseek-v4-pro einen Monat lang für schwere Zusammenfassungen laufen, wechsle das Feld für ein Quartal Kundenarbeit auf claude-sonnet-4-6, und an deinen Dokumenten muss sich nichts bewegen.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
# Chat Model Name must match one of these ids exactlyModelle für Dokumentenarbeit wählen.
Jede ID rechnet über denselben Key ab, also ist die Vergleichsschleife eine Settings-Bearbeitung: derselbe Workspace, dieselben Dokumente, zwei Wochen pro Kandidat, und die Per-Modell-Ausgaben in der APIsRouter-Konsole neben deinem eigenen Urteil über die Antworten.
- Grounded QA über abgerufene Chunks ist input-lastig: claude-haiku-4-5-20251001 und gemini-3.5-flash beantworten Fragen, die Zitaten folgen, gut zu Volumenpreisen.
- claude-sonnet-4-6 verdient sich den Default dort, wo Antworten unbearbeitet an Menschen gehen: Vertragsprüfung, Reportentwürfe, alles mit Konsequenzen.
- deepseek-v4-pro ist das Long-Context-Arbeitspferd für Workspaces auf Basis großer Dokumente, wo Fenster und Input-Pricing das Erlebnis dominieren.
- Agent-Workspaces brauchen verlässliches Tool-Calling; starte Agents auf claude-sonnet-4-6 und teste dann, ob eine leichtere ID sich auf deinen echten Flows hält.
- Nutze Per-Workspace-Overrides als Policy: der Default bleibt schnell, und die teure ID lebt nur in den Workspaces, deren Arbeit sie rechtfertigt.
Nutzungsbasiert · unter offiziellem Preis
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Modell | Offizieller Preis | Unser Preis |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Haiku 4.5 20251001 | $1.00 / $5.00 per M | $0.80 / $4.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| Gemini 3.5 Flash | $1.50 / $9.00 per M | $1.20 / $7.20 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Fehlerbilder speziell für AnythingLLM.
Die Token-Felder verursachen die subtilen Fehler. Ein zu niedrig gesetztes Context Window kürzt abgerufenen Kontext still, was sich als Modell darstellt, das deine Dokumente ignoriert; setze das dokumentierte Fenster für die ID in Chat Model Name. Ein für das Modell zu hoch gesetztes Max Tokens produziert bei langen Antworten harte Fehler; setze es auf das, was das Modell für Output tatsächlich erlaubt. Harte Fehler sind ehrlicher. Authentifizierungsfehler liegen am API-Key-Feld. Model-not-found bedeutet, dass Chat Model Name von der Katalog-Schreibweise abgewichen ist; das Feld ist Freitext, und die /v1/models-Liste ist die Quelle der Wahrheit. Connection-Fehler in der Desktop-App bedeuten meist einen Proxy oder eine Firewall zwischen App und Endpoint; bei Docker-Deployments denk daran, dass der Container die Base URL erreichen muss, nicht dein Browser. Funktioniert Chat, verhält sich ein Workspace aber anders als erwartet, prüfe dessen Override-Einstellungen; Workspace-Level-Provider-Einstellungen gewinnen gegen den System-Default, und ein vergessener Override ist das klassische Mysterium „gleiche Frage, anderes Modell". Die Developer-focused-Formulierung der Docs fasst all das zusammen: der Provider tut exakt, was seine fünf Felder sagen, nicht mehr und nicht weniger.
Wer AnythingLLM über ein Gateway routet.
- Teams, die private Document-Assistants betreiben und Frontier-Antwortqualität ohne Vendor-Konto pro Modellfamilie wollen.
- Desktop-Nutzer, die ihre persönliche Dokumentenbasis auf Claude- oder GPT-IDs auf einem Prepaid-Guthaben zeigen, keine Karte nötig zum Start.
- Self-Hoster, die den eingebauten lokalen Embedder behalten und Remote-Chat als die eine gemessene Spur behandeln, ablesbar in einem Nutzungslog.
- Deployments, segmentiert nach Workspace, wo Per-Workspace-Overrides plus Per-Key-Metering jedem Team sein eigenes Modell und seine eigene Rechnung geben.
- Builder, die Antwortmodelle über eine feste Dokumentenbasis vergleichen, wo jeder Kandidat eine Settings-Bearbeitung statt einer Migration ist.
Endpoint verifizieren und den ersten Workspace-Chat debuggen.
Curle zuerst die Modell-Liste und eine Chat Completion, mit der exakten ID, die du in Chat Model Name eintragen willst. Bestehen beide, ist die Gateway-Hälfte bewiesen, und jedes verbleibende Symptom lebt in den fünf Feldern. Speichere dann die Provider-Einstellungen und stelle eine Frage in einem Workspace mit einem Dokument, das du gut kennst. Eine verankerte, zitierende Antwort bedeutet, die ganze Pipeline funktioniert. Eine Antwort, die das Dokument ignoriert, verweist auf den Context-Window-Wert oder auf die eigenen Retrieval-Einstellungen des Workspace. Harte Fehler lassen sich sauber zuordnen: Key, ID-Schreibweise, Base-URL-Form. Sobald Chats laufen, zeigt die APIsRouter-Konsole Modell, Token-Zahlen und Ausgaben pro Anfrage. Dokumenten-QA vervielfacht Input-Token durch Retrieval, und das Nutzungslog ist, wo du lernst, was deine Dokumentenbasis eine Anfrage tatsächlich kostet, pro Modell, pro Tag, und pro Workspace-Key, falls du sie trennst.
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Häufige Fragen
Wie setze ich eine Custom Base URL in AnythingLLM?
Öffne in Settings unter AI Providers den LLM-Preference-Screen und wähle Generic OpenAI aus der Provider-Liste. Setze Base URL auf https://api.apisrouter.com/v1, füge deinen Key hinzu, trag die exakte Katalog-ID in Chat Model Name ein, und fülle beide Token-Felder aus der Dokumentation des Modells.
Was steuern Token Context Window und Max Tokens?
Das Context Window sagt AnythingLLM, wie viel abgerufenen Text und Verlauf es pro Request packen darf; Max Tokens deckelt eine einzelne Antwort. Ein zu niedriges Fenster kürzt deine Dokumente aus Antworten heraus, und beides zu hoch gesetzt erzeugt Requests, die das Modell ablehnt.
Kann AnythingLLM Claude oder DeepSeek über Generic OpenAI laufen lassen?
Ja. Der Provider schickt Chat Model Name als reinen String über Standard-Chat-Completions an die Base URL, also funktionieren claude-sonnet-4-6, deepseek-v4-pro, gemini-3.5-flash und GPT-IDs alle, wechselbar per Feldbearbeitung oder pro Workspace.
Beeinflusst ein Wechsel des Chat-Modells meine eingebetteten Dokumente?
Nein. Chat- und Embedding-Preference sind getrennt; Vektoren bleiben bestehen, und Chat-Modelle wechseln frei. Nur ein Wechsel des Embedders invalidiert bestehende Vektoren und erzwingt Neu-Embedding, weshalb viele Deployments den eingebauten lokalen Embedder behalten und nur die Chat-Seite tunen.
Warum nennt die Docs-Seite Generic OpenAI developer-focused?
Weil er deinen Eingaben vertraut statt Per-Vendor-Presets auszuliefern: falsche IDs, URLs oder Token-Werte scheitern zur Laufzeit statt vom Formular abgefangen zu werden. Mit IDs, kopiert aus /v1/models, und Limits aus der Modell-Dokumentation ist es ein stabiler, vollwertiger Pfad.
Können verschiedene Workspaces verschiedene Modelle nutzen?
Ja. Workspaces erben den System-Default, können Provider und Modell aber in ihren eigenen Chat-Einstellungen überschreiben, sodass ein Deployment standardmäßig eine schnelle ID laufen lassen und claude-sonnet-4-6 nur in den Workspaces pinnen kann, deren Arbeit sie verdient.