KoboldAI Lite trên một endpoint tương thích OpenAI tùy chỉnh.
Updated 2026-07-29
KoboldAI Lite kết nối endpoint tùy chỉnh ngay từ đầu: README của chính dự án liệt kê API dạng OpenAI và dạng Claude bên cạnh các instance Kobold và AI Horde. Trỏ field URL tùy chỉnh của nó vào https://api.apisrouter.com/v1 kèm key của bạn, và mọi model trong catalog, DeepSeek, GLM, Kimi, Claude, Grok, đều chọn được trong cùng giao diện kể chuyện, dù bạn dùng bản Lite hosted tại lite.koboldai.net hay bản đi kèm KoboldCpp.
Câu trả lời nhanh: các giá trị Lite cần.
Mở panel kết nối AI (nút AI ở menu trên cùng của Lite), chuyển từ AI Horde mặc định sang nhóm endpoint tùy chỉnh, và chọn tùy chọn tương thích OpenAI. Nhãn chính xác thay đổi đôi chút giữa các bản, nhưng field thì cố định: một API URL, một key, và một model chọn sau khi kết nối. Hai chi tiết đặc thù của Lite gây rắc rối nhiều nhất khi thất bại. Thứ nhất, checkbox phiên bản: Lite có một toggle kiểu "Add Ver. Num" tự thêm /v1 vào URL, nên nhập https://api.apisrouter.com với ô đó tích và https://api.apisrouter.com/v1 với ô đó bỏ tích đều phân giải đúng, trong khi nhân đôi /v1 thì không. Thứ hai, tính bền vững: Lite từng có tiền lệ reset URL endpoint tùy chỉnh khi kết nối lại, nên hãy giữ URL sẵn sàng thay vì giả định field đó tồn tại qua mọi phiên.
API URL: https://api.apisrouter.com/v1 (or base URL + "Add Ver. Num" ticked)
API key: sk-... (from APIsRouter)
Model: deepseek-v4-flash (or any catalog id after connecting)Lite là gì, và cách nó tiếp cận một model hosted.
KoboldAI Lite là web UI không cần cài đặt của hệ sinh thái Kobold: một single-page app cho viết truyện, chế độ phiêu lưu, và chat nhân vật chạy hoàn toàn trong trình duyệt. Nó có hai dạng dùng chung cài đặt: instance hosted tại lite.koboldai.net, và bản đi kèm mà KoboldCpp phục vụ trên localhost khi bạn chạy model local. README của dự án mô tả nó có khả năng kết nối tới endpoint tùy chỉnh bao gồm API dạng OpenAI và dạng Claude, bên cạnh các instance Kobold local và remote cùng AI Horde theo mô hình crowdsourced. Vì Lite là một app trình duyệt không có server riêng, request API của bạn đi thẳng từ trình duyệt tới bất kỳ endpoint nào bạn cấu hình. Thiết kế đó là lý do con đường endpoint tùy chỉnh hoạt động được, và cũng là lý do phần CORS bên dưới tồn tại: endpoint phải trả lời được các request có nguồn gốc trình duyệt, và khi một endpoint không làm được, Lite cung cấp một toggle proxy với những đánh đổi đáng hiểu trước khi bật. Với người đến từ AI Horde: sức hút của một endpoint trả theo lượng dùng so với cluster tình nguyện là tính dự đoán được. Horde thực sự miễn phí nhưng có hàng đợi; một endpoint có nạp tiền trả lời ngay lập tức với đúng model bạn yêu cầu, và với giá tier giá trị, một buổi tối chơi tốn một phần nhỏ của cent mỗi tin nhắn.
Cài đặt, từng field một.
Nếu danh sách model vẫn trống sau khi kết nối, nguyên nhân thường gặp xếp theo thứ tự: /v1 bị nhân đôi hoặc thiếu (kiểm tra checkbox phiên bản trước), key dán kèm khoảng trắng, hoặc một extension trình duyệt chặn request. Cùng ba giá trị đó hoạt động trong một lệnh curl là cách nhanh nhất để chứng minh phía endpoint ổn và khoanh vùng vấn đề vào trình duyệt.
- Mở Lite (hosted hoặc đi kèm) và nhấn nút AI ở menu trên cùng để mở panel kết nối.
- Chuyển lựa chọn provider từ AI Horde sang nhóm endpoint tùy chỉnh, và chọn tùy chọn tương thích OpenAI (nhãn thay đổi đôi chút theo bản; một tùy chọn dạng Claude nằm cạnh nó).
- Nhập URL: https://api.apisrouter.com/v1, để ý checkbox phiên bản mô tả ở trên để /v1 chỉ xuất hiện đúng một lần.
- Dán key sk-... của bạn vào field key.
- Kết nối, rồi chọn một model từ danh sách mà Lite lấy về, hoặc gõ chính xác id catalog nếu bản của bạn yêu cầu nhập tên model thủ công.
- Gửi một tin nhắn ngắn trong một câu chuyện mới để xác nhận round trip trước khi tải một phiên dài.
Tùy chọn endpoint Claude, và khi nào nên dùng.
Nhóm endpoint tùy chỉnh của Lite cũng bao gồm một tùy chọn dạng Claude cho API theo phương ngữ Anthropic. APIsRouter cũng phục vụ phương ngữ đó, tại /v1/messages, nên id claude có thể tiếp cận qua cả hai cửa. Trong thực tế, tuyến tương thích OpenAI là mặc định đơn giản hơn ngay cả với model Claude, vì một cấu hình duy nhất khi đó phục vụ mọi họ model: claude-sonnet-4-6 cho văn xuôi cao cấp, deepseek-v4-flash cho chơi khối lượng lớn, glm-5.2 và kimi-k2.6 để xoay vòng, tất cả chỉ là thay đổi field model chứ không phải cấu hình lại. Nơi tùy chọn dạng Claude phát huy tác dụng là nếu bạn giữ preset tinh chỉnh riêng cho định dạng request của Anthropic hoặc di trú cài đặt từ một công cụ phương ngữ Anthropic khác. Về mặt chức năng, cả hai tuyến đều dẫn tới cùng model qua gateway này; chọn một tuyến và giữ nhất quán để cài đặt đã lưu của bạn vẫn di động được.
Sampler và chế độ: điều gì thực sự áp dụng qua một endpoint hosted.
Lite phơi bày toàn bộ vườn sampler cho model local trong cài đặt của nó, và phần lớn không "đi theo" được. Trên endpoint tương thích OpenAI, tài liệu của chính Lite ghi rõ chỉ temperature, top-p, và các control kiểu repetition-penalty là áp dụng được; các sampler lạ như Min-P, Top-A, hay TFS là tính năng inference local, và dù Lite có thể gắn chúng như field phụ, endpoint hosted nhìn chung bỏ qua hoặc từ chối các tham số không chuẩn. Đặt temperature quanh 0.8 đến 0.9 để văn phong đa dạng, giữ top-p gần 0.95, và giữ repetition penalty thấp; đó là toàn bộ bề mặt điều chỉnh được, và như vậy là đủ. Mọi chế độ viết của Lite đều hoạt động qua endpoint tùy chỉnh, với một lưu ý: instruct mode ánh xạ tự nhiên nhất lên các model chat hosted, vì nó tạo ra kiểu trao đổi có cấu trúc theo vai trò mà các model đó được huấn luyện cho. Kiểu viết truyện cổ điển (classic story co-writing) cũng hoạt động; kỳ vọng model hành xử giống bạn viết cùng hơn là bộ tiếp nối văn bản thô, vì đó chính là bản chất của một endpoint chat completions. Ngân sách context tuân theo cùng quy tắc như mọi frontend roleplay khác: Lite gửi lại context câu chuyện hiển thị mỗi lượt, nên hãy đặt kích thước context một cách có chủ đích (cửa sổ làm việc 16K đến 32K bao phủ các phiên dài) thay vì đẩy tối đa chỉ vì model cho phép. Hướng dẫn độ dài context liên kết bên dưới tính toán điều này qua các model.
| Cài đặt | Điểm khởi đầu | Ghi chú |
|---|---|---|
| Temperature | 0.8 to 0.9 | Đòn bẩy chính còn sống sót khi qua một endpoint hosted |
| Top P | 0.95 | Giữ nguyên trừ khi output trở nên khó hiểu |
| Repetition penalty | Low | Giá trị cao làm hỏng tên riêng trong các câu chuyện dài |
| Exotic samplers (Min-P, Top-A, TFS) | Ignore | Tính năng inference local; endpoint hosted bỏ qua hoặc từ chối |
| Context size | 16K to 32K | Gửi lại mỗi lượt; chi phí tỷ lệ theo đó |
Trả theo mức sử dụng · thấp hơn giá chính thức
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| Mô hình | Giá chính thức | Giá của chúng tôi |
|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 per M | $0.10 / $0.30 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Grok 4.5 | $2.00 / $6.00 per M | $1.60 / $4.80 per M |
CORS, toggle proxy, và giữ key của bạn an toàn.
Vì Lite gọi endpoint thẳng từ trình duyệt của bạn, một kết nối thất bại dù giá trị đúng thường là do CORS: endpoint từ chối request có nguồn gốc trình duyệt. Lite đi kèm một toggle "Use CORS Proxy" chính xác cho trường hợp này, và nó xứng đáng một lời cảnh báo trung thực: định tuyến qua bất kỳ proxy bên thứ ba nào đặt proxy đó vào giữa traffic của bạn, bao gồm cả key và nội dung câu chuyện. Hãy thử kết nối trực tiếp trước, xác nhận endpoint hoạt động qua curl nếu còn nghi ngờ, và coi toggle proxy như phương án cuối cùng chứ không phải mặc định. Chạy bản Lite đi kèm từ một KoboldCpp local là một cách né tránh sạch sẽ khác, vì cùng cài đặt endpoint tùy chỉnh cũng tồn tại ở đó. Vệ sinh key quan trọng hơn một chút với một app trình duyệt: key nằm trong cài đặt local của trình duyệt, nên tránh dán nó vào máy dùng chung hoặc công cộng, và nếu nó từng lộ, hãy thu hồi và cấp lại thay vì hy vọng. Key ở đây tạo miễn phí, nên một key riêng cho Lite giữ log sử dụng dễ đọc và giảm phạm vi ảnh hưởng nếu có sự cố. Một lưu ý về nội dung, nói thẳng: một endpoint tùy chỉnh thay đổi nơi request đi tới, không phải những gì model cho phép. Chính sách model thượng nguồn và điều khoản của bất kỳ instance Lite nào bạn dùng vẫn áp dụng; trang so sánh chính sách liên kết bên dưới bao phủ bối cảnh đó một cách khách quan, theo từng họ model.
Câu hỏi thường gặp
KoboldAI Lite có hỗ trợ endpoint tương thích OpenAI tùy chỉnh không?
Có, ngay từ đầu. README của dự án liệt kê endpoint tùy chỉnh bao gồm API dạng OpenAI và dạng Claude bên cạnh các instance Kobold và AI Horde. Cấu hình là một URL, một key, và một model, từ panel kết nối AI trong bản Lite hosted hoặc bản đi kèm KoboldCpp.
Tôi nhập URL nào cho APIsRouter trong KoboldAI Lite?
https://api.apisrouter.com/v1, với checkbox phiên bản xử lý sao cho /v1 chỉ xuất hiện đúng một lần: toggle kiểu "Add Ver. Num" của Lite tự thêm /v1 khi được tích. Đoạn phiên bản bị nhân đôi hoặc thiếu là nguyên nhân phổ biến nhất khiến danh sách model trống.
Tôi có thể dùng model Claude trong KoboldAI Lite không?
Có, theo hai cách: qua endpoint tương thích OpenAI với một id claude như claude-sonnet-4-6 trong field model, hoặc qua tùy chọn endpoint dạng Claude của Lite đối với /v1/messages. Tuyến tương thích OpenAI là mặc định đơn giản hơn vì cùng cấu hình đó khi đó phục vụ mọi họ model khác.
Vì sao cài đặt sampler của tôi có vẻ không có tác dụng gì?
Phần lớn vườn sampler của Lite dành cho inference local. Qua một endpoint tương thích OpenAI chỉ temperature, top-p, và các control kiểu repetition-penalty là áp dụng được; endpoint hosted bỏ qua hoặc từ chối các sampler lạ. Nếu output có cảm giác sai, hãy chỉnh temperature trước và kiểm tra model id sau.
Vì sao Lite không kết nối được trong khi curl hoạt động?
Gần như luôn là CORS: Lite chạy trong trình duyệt của bạn, nên endpoint phải chấp nhận request có nguồn gốc trình duyệt. Các lựa chọn theo thứ tự ưu tiên: thử lại một cấu hình trực tiếp sạch, chạy bản Lite đi kèm với một KoboldCpp local, hoặc dùng toggle CORS proxy của Lite với hiểu biết rằng khi đó một bên thứ ba sẽ nằm giữa traffic của bạn.
Cách này có tốt hơn AI Horde không?
Là một sự đánh đổi khác. Horde thực sự miễn phí, do tình nguyện viên vận hành, và có hàng đợi, với bất kỳ model nào tình nguyện viên host. Một endpoint trả theo lượng dùng trả lời ngay lập tức với đúng model bạn chọn, ở mức giá tier giá trị khiến một buổi tối chơi tốn một phần nhỏ của cent mỗi tin nhắn. Nhiều người giữ cấu hình cả hai.