Ejecuta AnythingLLM con cualquier modelo vía Generic OpenAI.
Updated 2026-07-29
El proveedor Generic OpenAI de AnythingLLM conecta toda la app a cualquier endpoint compatible con OpenAI: Base URL https://api.apisrouter.com/v1, una clave, un id de modelo de chat, y límites de tokens honestos. Los ids de Claude, GPT, Gemini y DeepSeek califican todos, tanto para documentos como para agentes y chat.
Respuesta rápida: cinco campos en LLM Preference.
Abre la configuración de AnythingLLM, ve a la sección LLM bajo AI Providers (la pantalla que históricamente se llamó LLM Preference), y busca Generic OpenAI en la lista de proveedores. Al seleccionarlo aparecen cinco campos: Base URL, API Key, Chat Model Name, Token Context Window y Max Tokens. Rellénalos así: Base URL https://api.apisrouter.com/v1 (el /v1 pertenece a este campo), tu clave, y el id exacto del catálogo en Chat Model Name, por ejemplo claude-sonnet-4-6. Luego los dos números: Token Context Window es la ventana total del modelo y Max Tokens limita una sola respuesta, así que toma ambos de la documentación del modelo en lugar de adivinar. Guarda, y cada workspace que siga el valor por defecto del sistema ahora conversa a través del gateway. La documentación marca este proveedor como orientado a desarrolladores precisamente porque confía en tus datos; eso no es una advertencia contra usarlo, solo una afirmación de que los cinco campos son un contrato.
Base URL: https://api.apisrouter.com/v1
API Key: sk-YOUR-APISROUTER-KEY
Chat Model Name: claude-sonnet-4-6
Token Context Window: 200000
Max Tokens: 8192Qué controla realmente el proveedor Generic OpenAI.
AnythingLLM (Mintplex Labs en GitHub, unas 63K estrellas) es el asistente de documentos privados todo en uno: workspaces que incrustan tus archivos, chat basado en contexto recuperado, agentes con uso de herramientas, disponible como app de escritorio y como servidor autoalojado. La preferencia LLM configurada arriba es el cerebro por defecto de todo eso. Las peticiones salen como chat completions estándar contra tu Base URL con el Chat Model Name como el string del modelo, así que el proveedor no importa: un id de Claude es tan válido como uno de GPT, y cambiar significa editar un solo campo. Los workspaces también pueden anular el valor por defecto del sistema con su propio proveedor y configuración de modelo, que es cómo un mismo despliegue ejecuta claude-sonnet-4-6 para el workspace legal y gpt-5.5 para ingeniería sin que ninguno sepa del otro. Los dos campos de tokens merecen respeto porque AnythingLLM los usa para presupuestar el contexto. El valor de la ventana de contexto decide cuánto texto de documentos recuperados e historial de chat se empaqueta en cada petición; si lo subestimas, tus documentos cuidadosamente incrustados se recortan de sus propias respuestas, y si lo sobreestimas, las peticiones rebotan contra el límite real del modelo. Este par de campos está detrás de la mayoría de los reportes de "el RAG se siente tonto" en endpoints genéricos.
Los embeddings son una decisión separada.
AnythingLLM separa la preferencia de LLM de la preferencia de embedding, y esa separación es estructural. El modelo de chat responde preguntas; el embedder convierte tus documentos en vectores al subirlos, y esos vectores persisten. Cambiar el modelo de chat es gratis, cualquier día, por workspace. Cambiar el embedder invalida la geometría de todo lo ya incrustado y significa reincrustar tus documentos. La configuración práctica: AnythingLLM incluye un embedder local integrado que funciona sin conexión y no cuesta nada, y muchos despliegues simplemente lo mantienen. Si en su lugar apuntas la preferencia de embedding a un endpoint remoto, confirma que el id de embedding específico se sirve ahí antes de subir tu base de documentos, y trata esa elección como casada con el vector store. La libertad que esto compra en el lado del chat es el objetivo de la arquitectura: con los embeddings resueltos, el modelo de chat Generic OpenAI es un dial de bajo riesgo. Corre deepseek-v4-pro durante un mes de resumen intensivo, cambia el campo a claude-sonnet-4-6 para un trimestre de trabajo con clientes, y nada en tus documentos necesita moverse.
curl -s https://api.apisrouter.com/v1/models \
-H "Authorization: Bearer $APISROUTER_API_KEY" | head -50
# Chat Model Name must match one of these ids exactlyElegir modelos para trabajo con documentos.
Cada id factura a través de la misma clave, así que el bucle de comparación es una edición de configuración: mismo workspace, mismos documentos, dos semanas con cada candidato, y el gasto por modelo en la consola de APIsRouter junto a tu propio juicio sobre las respuestas.
- El QA fundamentado sobre fragmentos recuperados consume muchos tokens de entrada: claude-haiku-4-5-20251001 y gemini-3.5-flash responden bien preguntas que siguen citas a precios de volumen.
- claude-sonnet-4-6 merece el puesto por defecto donde las respuestas llegan a humanos sin editar: revisión de contratos, redacción de informes, cualquier cosa con consecuencias.
- deepseek-v4-pro es el caballo de batalla de contexto largo para workspaces construidos sobre documentos grandes, donde la ventana y el precio de entrada dominan la experiencia.
- Los workspaces de agentes necesitan llamadas a herramientas fiables; empieza los agentes con claude-sonnet-4-6, y luego prueba si un id más ligero aguanta en tus flujos reales.
- Usa los overrides por workspace como política: el valor por defecto se mantiene rápido, y el id caro vive solo en los workspaces cuyo trabajo lo justifica.
Pago por uso · por debajo del precio oficial
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Modelo | Precio oficial | Nuestro precio |
|---|---|---|
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Claude Haiku 4.5 20251001 | $1.00 / $5.00 per M | $0.80 / $4.00 per M |
| GPT-5.5 | $5.00 / $30.00 per M | $4.00 / $24.00 per M |
| Gemini 3.5 Flash | $1.50 / $9.00 per M | $1.20 / $7.20 per M |
| DeepSeek V4 Pro | $0.43 / $0.87 per M | $0.40 / $0.90 per M |
Modos de fallo específicos de AnythingLLM.
Los campos de tokens causan los fallos sutiles. Una ventana de contexto puesta demasiado baja trunca silenciosamente el contexto recuperado, lo que se presenta como un modelo que ignora tus documentos; configura la ventana documentada para el id en Chat Model Name. Max Tokens puesto demasiado alto para el modelo produce errores duros en respuestas largas; configúralo según lo que el modelo realmente permite para la salida. Los errores duros son más honestos. Los fallos de autenticación son el campo API Key. Modelo no encontrado es Chat Model Name desviándose de la ortografía del catálogo; el campo es texto libre y el listado de /v1/models es la fuente de verdad. Los errores de conexión en la app de escritorio suelen significar un proxy o firewall entre la app y el endpoint; en despliegues Docker, recuerda que es el contenedor el que debe alcanzar la Base URL, no tu navegador. Si el chat funciona pero un workspace se comporta distinto de lo esperado, revisa su configuración de override; la configuración de proveedor a nivel de workspace gana sobre el valor por defecto del sistema, y un override olvidado es el clásico misterio de "misma pregunta, modelo distinto". El enfoque orientado a desarrolladores de la documentación resume todo lo anterior: el proveedor hace exactamente lo que dicen sus cinco campos, ni más ni menos.
Quién enruta AnythingLLM a través de un gateway.
- Equipos que ejecutan asistentes de documentos privados y quieren calidad de respuesta de vanguardia sin una cuenta de proveedor por familia de modelos.
- Usuarios de escritorio que apuntan su base de documentos personal a ids de Claude o GPT sobre un saldo prepago, sin tarjeta necesaria para empezar.
- Autoalojadores que mantienen el embedder local integrado y tratan el chat remoto como el único carril medido, leído en un solo log de uso por modelo.
- Despliegues segmentados por workspace, donde los overrides por workspace más la medición por clave dan a cada equipo su propio modelo y su propia factura.
- Creadores que comparan modelos de respuesta sobre una base de documentos fija, donde cada candidato es una edición de configuración en lugar de una migración.
Verifica el endpoint y depura el primer chat de workspace.
Haz curl al listado de modelos y a una sola chat completion primero, usando el id exacto que planeas poner en Chat Model Name. Con ambos pasando, la mitad del gateway queda probada y cada síntoma restante vive en los cinco campos. Luego guarda la configuración del proveedor y haz una pregunta en un workspace con un documento que conozcas bien. Una respuesta fundamentada y que cita significa que toda la tubería funciona. Una respuesta que ignora el documento apunta al valor de la ventana de contexto o a la propia configuración de recuperación del workspace. Los errores duros se mapean con claridad: clave, ortografía del id, forma de la Base URL. Una vez que los chats fluyen, la consola de APIsRouter muestra el modelo por petición, el recuento de tokens y el gasto. El QA de documentos multiplica los tokens de entrada a través de la recuperación, y el log de uso es donde aprendes lo que realmente cuesta consultar tu base de documentos, por modelo, por día, y por clave de workspace si las separas.
curl -s https://api.apisrouter.com/v1/chat/completions \
-H "Authorization: Bearer $APISROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"claude-sonnet-4-6",
"messages":[{"role":"user","content":"ping"}]}'Preguntas frecuentes
¿Cómo configuro una Base URL personalizada en AnythingLLM?
En la configuración bajo AI Providers, abre la pantalla de preferencia LLM y elige Generic OpenAI en la lista de proveedores. Configura Base URL a https://api.apisrouter.com/v1, añade tu clave, pon el id exacto del catálogo en Chat Model Name, y rellena ambos campos de tokens según la documentación del modelo.
¿Qué controlan Token Context Window y Max Tokens?
La ventana de contexto le dice a AnythingLLM cuánto texto recuperado e historial puede empaquetar por petición; Max Tokens limita una sola respuesta. Subestimar la ventana recorta tus documentos de las respuestas, y sobreestimar cualquiera de los dos produce peticiones que el modelo rechaza.
¿Puede AnythingLLM ejecutar Claude o DeepSeek a través de Generic OpenAI?
Sí. El proveedor envía Chat Model Name como un string simple a la Base URL sobre chat completions estándar, así que claude-sonnet-4-6, deepseek-v4-pro, gemini-3.5-flash y los ids de GPT funcionan todos, intercambiables editando un solo campo o por workspace.
¿Cambiar el modelo de chat afecta a mis documentos incrustados?
No. Las preferencias de chat y de embedding son independientes; los vectores persisten y los modelos de chat se cambian libremente. Solo cambiar el embedder invalida los vectores existentes y obliga a reincrustar, por lo que muchos despliegues mantienen el embedder local integrado y solo ajustan el lado del chat.
¿Por qué la documentación llama a Generic OpenAI orientado a desarrolladores?
Porque confía en tus datos en lugar de ofrecer presets por proveedor: ids, URLs o valores de tokens incorrectos fallan en tiempo de ejecución en lugar de ser detectados por el formulario. Con ids copiados de /v1/models y límites de la documentación del modelo, es una ruta estable y de primera clase.
¿Pueden distintos workspaces usar distintos modelos?
Sí. Los workspaces heredan el valor por defecto del sistema pero pueden anular el proveedor y el modelo en su propia configuración de chat, así que un despliegue puede ejecutar un id rápido por defecto y fijar claude-sonnet-4-6 solo en los workspaces cuyo trabajo lo merece.