KoboldAI Lite를 커스텀 OpenAI 호환 엔드포인트에서 실행하기.
Updated 2026-07-29
KoboldAI Lite는 커스텀 엔드포인트를 네이티브로 지원합니다: 프로젝트 자체 README가 Kobold 인스턴스, AI Horde와 나란히 OpenAI 형식·Claude 형식 API를 안내합니다. 커스텀 URL 필드를 여러분의 키와 함께 https://api.apisrouter.com/v1로 지정하면, DeepSeek, GLM, Kimi, Claude, Grok을 포함한 카탈로그의 모든 모델을 같은 스토리 인터페이스 안에서 선택할 수 있습니다 — lite.koboldai.net의 호스팅된 Lite든, KoboldCpp에 번들된 사본이든 상관없습니다.
빠른 답: Lite에 필요한 값.
AI 연결 패널(Lite 상단 메뉴의 AI 버튼)을 열고, 기본값인 AI Horde에서 커스텀 엔드포인트 그룹으로 전환한 다음, OpenAI 호환 옵션을 선택하세요. 정확한 레이블은 빌드마다 조금씩 달라지지만, 필드는 항상 같습니다: API URL, 키, 그리고 연결 후 선택하는 모델. 여기서 실패할 때 대부분의 문제를 일으키는 것은 Lite 특유의 두 가지 세부사항입니다. 첫째는 버전 체크박스입니다: Lite는 URL에 /v1을 자동으로 붙여주는 "Add Ver. Num" 스타일 토글을 제공하므로, 체크박스를 켠 상태로 https://api.apisrouter.com을 입력하는 것과 끈 상태로 https://api.apisrouter.com/v1을 입력하는 것 모두 정상 작동하지만, /v1을 중복시키면 작동하지 않습니다. 둘째는 지속성입니다: Lite는 재연결 시 커스텀 엔드포인트 URL을 초기화해온 이력이 있으므로, 필드가 매 세션마다 유지될 것이라 가정하지 말고 URL을 따로 보관해 두세요.
API URL: https://api.apisrouter.com/v1 (or base URL + "Add Ver. Num" ticked)
API key: sk-... (from APIsRouter)
Model: deepseek-v4-flash (or any catalog id after connecting)Lite란 무엇이며, 호스팅된 모델에 어떻게 도달하는가.
KoboldAI Lite는 Kobold 생태계의 설치 불필요 웹 UI입니다: 스토리 작성, 어드벤처 모드, 캐릭터 채팅을 위한 단일 페이지 앱으로 브라우저 안에서 완전히 동작합니다. 같은 설정을 공유하는 두 가지 형태로 제공됩니다: lite.koboldai.net의 호스팅 인스턴스, 그리고 모델을 로컬에서 실행할 때 KoboldCpp가 localhost에서 제공하는 번들 사본입니다. 프로젝트 README는 로컬·원격 Kobold 인스턴스와 크라우드소싱 방식의 AI Horde와 나란히, OpenAI 형식·Claude 형식 API를 포함한 커스텀 엔드포인트에 연결할 수 있다고 설명합니다. Lite는 자체 서버가 없는 브라우저 앱이므로, API 요청은 브라우저에서 여러분이 설정한 엔드포인트로 곧장 전달됩니다. 이 설계 때문에 커스텀 엔드포인트 경로가 애초에 작동하는 것이며, 아래에 CORS 섹션이 존재하는 이유이기도 합니다: 엔드포인트는 브라우저 출처의 요청에 응답할 수 있어야 하고, 그렇지 못한 경우 Lite는 프록시 토글을 제공하지만 켜기 전에 이해해 둘 만한 트레이드오프가 있습니다. AI Horde에서 넘어온 분들을 위한 설명: 자원봉사 클러스터 대비 종량제 엔드포인트의 매력은 예측 가능성입니다. Horde는 정말로 무료지만 대기열이 있습니다. 충전된 엔드포인트는 여러분이 요청한 바로 그 모델로 즉시 응답하며, 가성비 좋은 패밀리 요금 기준으로 저녁 한 번의 플레이 비용은 메시지당 1센트도 안 되는 수준입니다.
필드별 설정 방법.
연결 후에도 모델 목록이 비어 있다면 흔한 원인 순서는 다음과 같습니다: /v1이 중복되거나 빠짐(버전 체크박스부터 확인하세요), 공백이 섞인 키, 또는 요청을 차단하는 브라우저 확장 프로그램. 같은 세 값으로 curl 명령이 성공하는지 확인하는 것이 엔드포인트 쪽은 문제없다는 것을 증명하고 문제를 브라우저 쪽으로 좁히는 가장 빠른 방법입니다.
- Lite(호스팅 버전이든 번들 버전이든)를 열고 상단 메뉴의 AI 버튼을 클릭해 연결 패널을 엽니다.
- 프로바이더 선택을 AI Horde에서 커스텀 엔드포인트 그룹으로 전환하고, OpenAI 호환 옵션을 선택하세요(레이블은 빌드마다 조금씩 다르며, 바로 옆에 Claude 형식 옵션도 있습니다).
- URL을 입력하세요: https://api.apisrouter.com/v1. 위에서 설명한 버전 체크박스에 유의해 /v1이 정확히 한 번만 나타나도록 하세요.
- sk-...로 시작하는 키를 키 필드에 붙여넣으세요.
- 연결한 다음, Lite가 가져오는 목록에서 모델을 선택하거나, 빌드가 수동으로 모델 이름을 요구한다면 정확한 카탈로그 id를 입력하세요.
- 긴 세션을 불러오기 전에, 새 스토리에서 짧은 메시지 하나를 보내 왕복 통신을 확인하세요.
Claude 엔드포인트 옵션, 그리고 언제 사용할지.
Lite의 커스텀 엔드포인트 그룹에는 Anthropic 방언 API를 위한 Claude 형식 옵션도 포함되어 있습니다. APIsRouter도 /v1/messages에서 그 방언을 제공하므로, claude id는 어느 쪽 문을 통해서도 도달할 수 있습니다. 실제로는 Claude 모델이라도 OpenAI 호환 경로가 더 단순한 기본값입니다 — 설정 하나로 모든 패밀리를 처리할 수 있기 때문입니다: 고급 문장에는 claude-sonnet-4-6, 물량 플레이에는 deepseek-v4-flash, 로테이션에는 glm-5.2와 kimi-k2.6을 재설정이 아니라 모델 필드 변경만으로 전환할 수 있습니다. Claude 형식 옵션이 제 역할을 하는 경우는 Anthropic의 요청 형식에 맞춰 특별히 조정된 프리셋을 유지하거나, 다른 Anthropic 방언 도구에서 설정을 이전해 올 때입니다. 기능적으로는 이 게이트웨이를 통하면 두 경로 모두 같은 모델로 이어지므로, 하나를 골라 일관되게 사용하면 저장된 설정이 이식 가능한 상태로 유지됩니다.
샘플러와 모드: 호스팅된 엔드포인트에서 실제로 적용되는 것.
Lite는 설정 화면에 로컬 모델용 샘플러 전체를 노출하지만, 그 대부분은 그대로 전달되지 않습니다. OpenAI 호환 엔드포인트에서는 Lite 자체 문서에 따르면 temperature, top-p, repetition-penalty 계열 컨트롤만 적용됩니다. Min-P, Top-A, TFS 같은 특수 샘플러는 로컬 추론 전용 기능이며, Lite가 이를 추가 필드로 붙여 보낼 수는 있지만 호스팅된 엔드포인트는 대체로 비표준 파라미터를 무시하거나 거부합니다. 문장의 다양성을 위해 temperature는 0.8~0.9 정도로, top-p는 0.95 부근으로 두고, repetition penalty는 낮게 유지하세요. 조정 가능한 범위는 이것이 전부이며, 이 정도면 충분합니다. Lite의 글쓰기 모드는 모두 커스텀 엔드포인트에서 작동하며, 한 가지 안내가 있습니다: instruct 모드가 호스팅된 챗 모델에 가장 자연스럽게 대응하는데, 이 모델들이 학습된 구조화된 역할 기반 대화를 만들어내기 때문입니다. 고전적인 스토리 공동 작성도 작동합니다. 다만 모델이 단순 텍스트 이어쓰기가 아니라 대화 상대에 더 가깝게 행동한다는 점을 예상하세요 — chat completions 엔드포인트란 원래 그런 것이기 때문입니다. 컨텍스트 예산 관리는 모든 롤플레이 프론트엔드와 같은 규칙을 따릅니다: Lite는 매 턴마다 보이는 스토리 컨텍스트를 다시 전송하므로, 모델의 윈도우가 허용한다고 해서 최대치로 두지 말고 의도적으로 컨텍스트 크기를 설정하세요(16K~32K 정도의 작업 윈도우면 긴 세션도 충분합니다). 아래 링크된 컨텍스트 길이 가이드가 모델별로 이 계산을 다룹니다.
| 설정 | 시작값 | 참고 |
|---|---|---|
| Temperature | 0.8~0.9 | 호스팅된 엔드포인트까지 살아남는 주요 레버 |
| Top P | 0.95 | 출력이 앞뒤가 안 맞아지지 않는 한 그대로 둘 것 |
| Repetition penalty | 낮게 | 값이 높으면 긴 스토리에서 이름이 망가짐 |
| 특수 샘플러 (Min-P, Top-A, TFS) | 무시 | 로컬 추론 전용 기능; 호스팅된 엔드포인트는 무시하거나 거부함 |
| Context size | 16K~32K | 매 턴마다 재전송됨; 비용이 이에 비례 |
사용한 만큼 지불 · 공식 요금보다 저렴
Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.
| 모델 | 공식 요금 | 저희 요금 |
|---|---|---|
| DeepSeek V4 Flash | $0.14 / $0.28 per M | $0.10 / $0.30 per M |
| GLM-5.2 | $1.14 / $4.00 per M | $1.10 / $4.00 per M |
| Kimi K2.6 | $0.95 / $4.00 per M | $1.00 / $4.00 per M |
| Claude Sonnet 4.6 | $3.00 / $15.00 per M | $2.40 / $12.00 per M |
| Grok 4.5 | $2.00 / $6.00 per M | $1.60 / $4.80 per M |
CORS, 프록시 토글, 그리고 키를 안전하게 관리하기.
Lite는 브라우저에서 엔드포인트를 직접 호출하므로, 값이 올바른데도 연결이 실패한다면 대개 CORS 문제입니다: 엔드포인트가 브라우저 출처 요청을 거부하는 것이죠. Lite는 정확히 이런 경우를 위해 "Use CORS Proxy" 토글을 제공하지만, 솔직한 경고가 필요합니다: 어떤 서드파티 프록시를 거치든 그 프록시가 여러분의 트래픽 안에 들어오게 되며, 여기에는 키와 스토리 내용도 포함됩니다. 먼저 직접 연결을 시도하고, 의심스럽다면 curl로 엔드포인트가 작동하는지 확인한 다음, 프록시 토글은 기본값이 아니라 최후의 수단으로 취급하세요. 로컬 KoboldCpp에서 번들된 Lite를 실행하는 것도 깔끔한 우회 방법입니다 — 거기에도 같은 커스텀 엔드포인트 설정이 존재하기 때문입니다. 브라우저 앱에서는 키 관리가 조금 더 중요합니다: 키는 브라우저의 로컬 설정에 저장되므로, 공용이나 공개된 컴퓨터에 붙여넣는 것은 피하고, 만약 유출되면 요행을 바라지 말고 즉시 폐기 후 재발급하세요. 여기서는 키를 무료로 만들 수 있으므로, Lite 전용 키를 따로 두면 사용량 로그를 읽기 쉽게 유지하고 피해 범위도 작게 만들 수 있습니다. 콘텐츠 관련 한 가지를 분명히 짚자면: 커스텀 엔드포인트는 요청이 어디로 가는지만 바꿀 뿐, 모델이 무엇을 허용하는지는 바꾸지 않습니다. 업스트림 모델 정책과 여러분이 쓰는 Lite 인스턴스의 약관은 여전히 그대로 적용됩니다. 아래 링크된 정책 비교 페이지가 모델 패밀리별로 이 상황을 사실 그대로 다룹니다.
자주 묻는 질문
KoboldAI Lite는 커스텀 OpenAI 호환 엔드포인트를 지원하나요?
네, 네이티브로 지원합니다. 프로젝트 README는 Kobold 인스턴스, AI Horde와 나란히 OpenAI 형식·Claude 형식 API를 포함한 커스텀 엔드포인트를 안내합니다. 설정은 URL, 키, 모델이며, 호스팅된 Lite와 KoboldCpp 번들 Lite 어느 쪽이든 AI 연결 패널에서 이루어집니다.
KoboldAI Lite에서 APIsRouter용으로 어떤 URL을 입력하나요?
https://api.apisrouter.com/v1이며, /v1이 정확히 한 번만 나타나도록 버전 체크박스를 잘 처리하세요: Lite의 "Add Ver. Num" 스타일 토글은 체크하면 /v1을 자동으로 붙여줍니다. 버전 구간이 중복되거나 빠지는 것이 모델 목록이 비는 가장 흔한 원인입니다.
KoboldAI Lite에서 Claude 모델을 쓸 수 있나요?
네, 두 가지 방법이 있습니다: OpenAI 호환 엔드포인트에서 모델 필드에 claude-sonnet-4-6 같은 claude id를 넣거나, /v1/messages를 사용하는 Lite의 Claude 형식 엔드포인트 옵션을 이용하는 것입니다. OpenAI 호환 경로가 더 단순한 기본값입니다 — 같은 설정으로 다른 모든 패밀리도 함께 처리되기 때문입니다.
샘플러 설정이 아무 효과가 없는 것 같은 이유는?
Lite의 샘플러 대부분은 로컬 추론용입니다. OpenAI 호환 엔드포인트에서는 temperature, top-p, repetition-penalty 계열 컨트롤만 적용되며, 호스팅된 엔드포인트는 특수 샘플러를 무시하거나 거부합니다. 출력이 이상하게 느껴진다면 먼저 temperature를 조정하고, 그다음 모델 id를 확인하세요.
curl은 되는데 Lite는 연결에 실패하는 이유는?
거의 항상 CORS 때문입니다: Lite는 브라우저 안에서 실행되므로 엔드포인트가 브라우저 출처 요청을 허용해야 합니다. 대략적인 우선순위는: 깔끔한 직접 설정을 다시 시도하기, 로컬 KoboldCpp에 번들된 Lite를 실행하기, 또는 서드파티가 트래픽 안에 들어온다는 점을 감안하고 Lite의 CORS 프록시 토글을 사용하기입니다.
AI Horde보다 이게 더 나은가요?
서로 다른 트레이드오프입니다. Horde는 정말로 무료이고 자원봉사자가 운영하며 대기열이 있고, 자원봉사자가 호스팅하는 모델만 쓸 수 있습니다. 종량제 엔드포인트는 여러분이 고른 바로 그 모델로 즉시 응답하며, 가성비 좋은 패밀리 요금 기준으로 저녁 한 번의 플레이 비용이 메시지당 1센트도 안 됩니다. 많은 사람이 둘 다 설정해 두고 씁니다.