Chạy chat RAGFlow trên một base URL OpenAI-API-Compatible.

Updated 2026-07-29

RAGFlow có sẵn provider OpenAI-API-Compatible đúng cho việc này: thêm mỗi model với id của nó, https://api.apisrouter.com/v1 làm base url, và một key. Id Claude, GPT, DeepSeek, GLM, Kimi, và Qwen sau đó phục vụ dataset, chat, và agent của bạn từ một endpoint duy nhất.

Câu trả lời nhanh: thêm model trên trang Model providers.

Đăng nhập vào RAGFlow, nhấn logo của bạn ở góc trên bên phải, và mở Model providers. Dưới Models to be added, tìm thẻ OpenAI-API-Compatible và nhấn Add the model. Trong hộp thoại Add LLM, đặt Model type thành chat, nhập id catalog chính xác vào Model name, điền https://api.apisrouter.com/v1 vào Base url, dán key của bạn vào API-Key, và đặt Max tokens thành kích thước context thực của model. Nhấn OK. Sau đó khiến nó làm gì đó: mở Set default models trên cùng trang và chọn model mới của bạn làm LLM mặc định. Chat assistant, trả lời câu hỏi dataset, và node agent đều phân giải về mặc định đó trừ khi bị ghi đè. Một cạnh sắc đáng biết trước lần chạy đầu: field Max tokens của RAGFlow mặc định là 512 và tooltip riêng của nó cảnh báo rằng một giá trị không hợp lệ gây ra lỗi, nên nhập cửa sổ đã ghi của model là một phần của cài đặt, không phải tối ưu hóa.

Model type:  chat
Model name:  deepseek-v4-pro
Base url:    https://api.apisrouter.com/v1
API-Key:     sk-YOUR-APISROUTER-KEY
Max tokens:  128000

then: Set default models → LLM → deepseek-v4-pro

Cách RAGFlow ràng buộc model với công việc.

RAGFlow (infiniflow trên GitHub, khoảng 85K star) là một engine RAG tài liệu chuyên sâu: phân tích nhận biết bố cục cho PDF và bảng, chia đoạn với trích dẫn có căn cứ, dataset, chat assistant, và workflow agent bên trên. Các phần khác nhau của pipeline đó ràng buộc với các slot model khác nhau, và ràng buộc đó rõ ràng. Chat model sinh câu trả lời. Embedding model vector hóa đoạn cho truy xuất. Rerank model sắp xếp lại ứng viên, và model img2txt mô tả hình ảnh trong lúc phân tích. Provider OpenAI-API-Compatible có thể đăng ký model cho các loại này riêng biệt, mỗi hộp thoại Add LLM tạo một ràng buộc gồm loại, id, base url, và key. Mọi chat model đã đăng ký nói chat completions chuẩn tới base url với Model name làm chuỗi trên dây, nên bất kỳ id nào gateway phục vụ đều hợp lệ, bất kể vendor nào. Sự tách biệt đó quan trọng về mặt vận hành: đổi model trả lời của bạn từ gpt-5.5 sang claude-sonnet-4-6 an toàn bất kỳ ngày nào, nhưng model embedding gắn chặt với các vector đã lập chỉ mục của bạn. RAGFlow thực thi điều này bằng một kiểm tra tương thích khi đổi model embedding trên một dataset đã có đoạn, và quy tắc thực tế đơn giản hơn: chọn cài đặt embedding một lần, và coi chat model là lớp bạn tinh chỉnh tự do.

Một key cho cả model Trung Quốc và phương Tây.

Deployment RAGFlow thiên về song ngữ: các đội có nguồn gốc Trung Quốc xử lý cơ sở tài liệu đa ngôn ngữ, và các đội quốc tế cụ thể muốn model Trung Quốc cho tài liệu tiếng Trung. Phục vụ trực tiếp, sự pha trộn đó gây đau đầu, vì DeepSeek, Zhipu, Moonshot, và Alibaba mỗi cái billing riêng và một số khó thanh toán từ nước ngoài, trong khi Anthropic và OpenAI khó từ hướng ngược lại. Qua một base url OpenAI-API-Compatible, sự pha trộn chỉ là thêm hộp thoại Add LLM: deepseek-v4-pro và glm-5.2 cho corpus nặng tiếng Trung, qwen3.7-max và kimi-k2.6 làm lựa chọn khu vực mạnh thay thế, claude-sonnet-4-6 nơi độ tinh tế câu trả lời quan trọng nhất. Cùng base url, cùng key, id thẳng từ catalog. Với các đội ở châu Á, cùng con đường hoạt động theo hướng ngược lại: id Claude và GPT trở nên với tới được trên số dư trả trước mà không cần thẻ phương Tây, với nhiều cửa hàng RAGFlow đó là khác biệt giữa việc đánh giá một model và chỉ đọc về nó. Còn có một con đường lúc khởi động đáng biết: service_conf.yaml.template chấp nhận một khối user_default_llm (factory, api_key, base_url) để các cài đặt mới lên với endpoint đã nối dây sẵn. Tài liệu RAGFlow nói rõ rằng sau khi đăng nhập, cấu hình chỉ diễn ra trên trang Model providers, nên hãy coi YAML là cấp phát lúc khởi động đầu, không phải cấu hình trực tiếp.

user_default_llm:
  factory: OpenAI-API-Compatible
  api_key: sk-YOUR-APISROUTER-KEY
  base_url: https://api.apisrouter.com/v1

Chọn model cho một pipeline tài liệu.

Chất lượng truy xuất đặt trần và model trả lời quyết định bạn tới gần trần đó bao nhiêu, nên hãy A/B model trả lời trên corpus thực tế của bạn: cùng dataset, cùng câu hỏi, hai assistant ghim vào hai id, và chi tiêu theo từng model trong console APIsRouter cạnh phán đoán của chính bạn về câu trả lời.

  • Trả lời có căn cứ trên đoạn truy xuất là công việc nặng đầu vào nơi model tầm trung tỏa sáng: deepseek-v4-pro và glm-5.2 mang câu trả lời theo dõi trích dẫn tốt trên corpus song ngữ.
  • qwen3.7-max và kimi-k2.6 là những cỗ máy khu vực đáng thử khi câu trả lời phải đọc tự nhiên bằng tiếng Trung; khác biệt chất lượng giữa các model Trung Quốc hiện rõ hơn trong sinh văn bản so với truy xuất.
  • claude-sonnet-4-6 xứng đáng có slot trả lời nơi chất lượng tổng hợp là sản phẩm, tóm tắt điều hành, phân tích hợp đồng, bất cứ gì một người chuyển tiếp không chỉnh sửa.
  • Workflow agent gọi tool cần function calling đáng tin cậy; hãy kiểm tra con đường agent trên claude-sonnet-4-6 trước, sau đó xem id khu vực nào khớp nó trên flow của bạn.
  • Max tokens là theo từng đăng ký, nên hãy đăng ký cùng id hai lần với giới hạn khác nhau nếu một assistant cần câu trả lời dài và một cái khác cần chặt chẽ.

Trả theo mức sử dụng · thấp hơn giá chính thức

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

Mô hìnhGiá chính thứcGiá của chúng tôi
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M
GLM-5.2$1.14 / $4.00 per M$1.10 / $4.00 per M
Qwen 3.7 Max$2.50 / $7.50 per M$2.50 / $7.50 per M
Kimi K2.6$0.95 / $4.00 per M$1.00 / $4.00 per M
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M

Các kiểu lỗi đặc thù của RAGFlow.

Mặc định Max tokens là kinh điển. Để ở 512, câu trả lời dài bị cắt hoặc lỗi theo cách trông như vấn đề model; hãy đặt kích thước context đã ghi lúc đăng ký, như chính tooltip cảnh báo. Một model đã đăng ký nhưng lỗi ngay lập tức thường là cách viết Model name (nó phải khớp chính xác danh sách /v1/models) hoặc một Base url thiếu hậu tố /v1, vì RAGFlow nối thêm route path vào những gì bạn nhập. Không gì xảy ra sau khi đăng ký là một vấn đề mặc định: đăng ký một model không chọn nó. Kiểm tra Set default models, và kiểm tra cài đặt model theo từng assistant, thứ ghi đè mặc định workspace. Sự nhầm lẫn về embedding hoàn thiện danh sách. Nếu bạn ràng buộc một id embedding qua provider compatible, hãy xác nhận endpoint thực sự phục vụ nó trước khi lập chỉ mục; và một khi một dataset đã có đoạn, đổi model embedding của nó bị chặn bởi một kiểm tra tương đồng và có thể cần lập chỉ mục lại từ đầu. Đổi chat model không mang chi phí như vậy, chính vì thế lớp chat là nơi bạn nên thử nghiệm.

Ai định tuyến RAGFlow qua một gateway.

  • Các đội tài liệu song ngữ trộn DeepSeek, GLM, Qwen, và Kimi với id Claude và GPT đứng sau một base url và một key.
  • Các đội ở châu Á muốn câu trả lời chất lượng Claude trên số dư trả trước mà không cần thẻ phương Tây, và đội phương Tây muốn model Trung Quốc mà không cần billing khu vực.
  • Người tự host chạy RAGFlow cho knowledge base nội bộ muốn toàn bộ chi tiêu cloud của deployment trên một log sử dụng.
  • Người xây dựng so sánh model trả lời trên một corpus cố định, nơi mỗi ứng viên là một hộp thoại Add LLM thay vì một tài khoản vendor.
  • Các đội ops cấp phát cài đặt mới từ service_conf.yaml.template với endpoint đã nối dây sẵn lúc khởi động đầu.

Xác minh endpoint và debug chat đầu tiên.

Curl danh sách model trước; field Model name là văn bản tự do, và sao chép id từ danh sách loại bỏ lỗi phổ biến nhất trước khi nó xảy ra. Sau đó chạy một chat completion nhắm vào id bạn định đăng ký. Bên trong RAGFlow, đăng ký model, đặt nó làm LLM mặc định, và kiểm tra trong một chat assistant thuần trước khi liên quan tới dataset. Lỗi xác thực chỉ tới API-Key; not-found chỉ tới Model name; lỗi kết nối chỉ tới Base url hoặc egress container, vì chính server RAGFlow, không phải trình duyệt của bạn, mới cần với tới endpoint. Câu trả lời dài bị cắt hoặc lỗi chỉ ngược lại Max tokens. Khi chat đã chạy, console APIsRouter hiển thị model theo từng request, số lượng token, và chi tiêu. Lưu lượng RAG nặng đầu vào, và log sử dụng là nơi bạn thấy corpus của bạn thực sự tốn bao nhiêu để truy vấn, theo từng model, từng ngày, một trang cho cả id Trung Quốc và phương Tây cùng nhau.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-v4-pro",
       "messages":[{"role":"user","content":"ping"}]}'

Câu hỏi thường gặp

Làm sao để thêm một model OpenAI-API-Compatible trong RAGFlow?

Nhấn avatar của bạn, mở Model providers, tìm OpenAI-API-Compatible dưới Models to be added, và nhấn Add the model. Điền Model type (chat), Model name (id catalog chính xác), Base url https://api.apisrouter.com/v1, API-Key, và một giá trị Max tokens thực tế, sau đó xác nhận bằng OK.

Vì sao câu trả lời của tôi bị cắt hoặc lỗi sau khi thêm một model?

Gần như luôn là Max tokens: RAGFlow mặc định nó ở 512 và tooltip cảnh báo rằng giá trị sai gây ra lỗi. Sửa việc đăng ký model và nhập kích thước context đã ghi của model.

RAGFlow có thể trộn model Trung Quốc và phương Tây qua một provider không?

Có. Mỗi đăng ký gửi chuỗi Model name của nó tới cùng base url, nên deepseek-v4-pro, glm-5.2, qwen3.7-max, kimi-k2.6, và claude-sonnet-4-6 đều có thể đăng ký cạnh nhau và chọn theo từng assistant, thanh toán qua một key.

Model chat và embedding có ràng buộc riêng biệt không?

Có. Mỗi hộp thoại Add LLM đăng ký một model của một loại, và Set default models gán slot LLM và embedding mặc định độc lập. Chat model có thể đổi tự do; model embedding gắn với vector đã lập chỉ mục và bị chặn bởi một kiểm tra tương thích một khi dataset có đoạn.

Tôi có thể cấu hình sẵn endpoint trước khi khởi động đầu không?

Có, qua khối user_default_llm trong docker/service_conf.yaml.template: factory OpenAI-API-Compatible, api_key của bạn, và base_url. RAGFlow đọc nó lúc khởi động đầu; sau khi đăng nhập, cấu hình chuyển sang chỉ trang Model providers.

Vì sao model đã đăng ký của tôi không được dùng?

Đăng ký và lựa chọn là các bước riêng biệt. Đặt model làm LLM mặc định dưới Set default models, và kiểm tra cài đặt model theo từng assistant, thứ ghi đè mặc định. Nếu vẫn lỗi, hãy so sánh Model name với cách viết danh sách /v1/models.