Живіть агентів Warp з власного inference-ендпоінта.

Updated 2026-07-29

Warp підтримує кастомні inference-ендпоінти саме для цього: будь-який ендпоінт, що реалізує OpenAI Chat Completions API, з явним включенням шлюзів і роутерів моделей. Спрямуйте його на https://api.apisrouter.com/v1 з одним ключем, і моделі, маршрутизовані через ендпоінт, з'являються в пікері моделей Warp, не витрачаючи кредити Warp AI.

Коротка відповідь: налаштування, URL, ключ, ID моделей.

Відкрийте Settings у Warp і знайдіть "inference endpoint", щоб перейти до конфігурації. Введіть URL ендпоінта, https://api.apisrouter.com/v1, ваш ключ APIsRouter як облікові дані і ID моделі чи моделей, які хочете через нього маршрутизувати, наприклад claude-sonnet-4-6 і gpt-5.6-sol. Після збереження ці моделі з'являються в пікері моделей Warp поряд з вбудованими опціями. Уся суть у поведінці білінгу: коли ви явно обираєте маршрутизовану через ендпоінт модель з пікера, Warp маршрутизує запит через ваш ендпоінт замість витрачання кредитів AI Warp, і вартість лягає на ваш баланс шлюзу, де ви бачите її на кожен запит. Документація Warp описує цей потік як дзеркальне відображення їхнього налаштування Bring Your Own API Key, тож він здасться знайомим, якщо ви раніше налаштовували BYOK.

Endpoint URL:  https://api.apisrouter.com/v1
Credential:    sk-YOUR-APISROUTER-KEY
Model id(s):   claude-sonnet-4-6
               gpt-5.6-sol

then: select the endpoint-routed model
      in Warp's model picker

Як Warp використовує ендпоінт.

Warp — це агентний термінал: його агенти складають команди, пояснюють збої, виконують багатоетапні завдання і редагують код з того самого вікна, де ви працюєте. Власна документація Warp прямо формулює вимогу: ендпоінт має реалізовувати OpenAI Chat Completions API на /v1/chat/completions, а їхній пост із запуском називає роутери моделей і хостингові шлюзи призначеними цілями, тож мультипостачальницький шлюз тут — повноправний учасник, а не хитрість. Варто знати два задокументовані обмеження перед початком. По-перше, ендпоінт має бути публічно доступним: localhost, 127.0.0.1 і URL-адреси приватної мережі відхиляються під час налаштування, що виключає спрямування Warp напряму на локальний сервер інференсу, але не має значення для хостингового шлюзу. По-друге, автоматичний вибір моделі Warp (Auto) завжди витрачає кредити Warp, навіть коли налаштовано кастомний ендпоінт; лише явний вибір маршрутизованої через ендпоінт моделі з пікера йде через ваш ендпоінт. Якщо ваші витрати не рухаються в консоль шлюзу, перевірте, яку модель насправді використала сесія. Доступність залежить від тарифного плану: кастомні inference-ендпоінти пропонуються на Free і прийнятних платних планах для окремих осіб та організацій з десятьма чи менше людьми, тоді як більшим організаціям потрібні рівні Business чи Enterprise від Warp. Це прямо з документації Warp і може змінитись з їхнього боку.

Вибір моделей для роботи агента термінала.

Агенти термінала оплачуються інакше, ніж чат: кожне пояснення команди, повторна спроба і резюме виводу — це запит, що несе контекст сесії. Оскільки використання, маршрутизоване через ендпоінт, потрапляє в консоль шлюзу на кожен запит і кожну модель, тиждень реального використання дає вам чесне число на кожного кандидата, що краще за здогади зі сторінки цін, включно з цією.

  • claude-sonnet-4-6 як основний щоденний вибір: надійна генерація команд, сильне використання інструментів, хороший здоровий глузд у багатоетапних завданнях.
  • gpt-5.6-sol для швидкої окресленої роботи, де затримка на хід формує відчуття від термінала.
  • claude-opus-4-7 для складних сесій: дебагінг між сервісами, довгі розслідувальні ланцюжки, зміни інфраструктури, які ви хочете обдумати наскрізь.
  • gpt-5.5 як передовий узагальнений варіант для A/B-порівняння з Claude на ваших власних робочих процесах shell.
  • deepseek-v4-pro як бюджетний вибір для рутинного використання агента з великим обсягом, де тариф важливіший за передовий полиск.

Оплата за фактом · нижче офіційних цін

Selected models are priced below official list prices. Exact input, output, cache, and per-request prices are shown for each model.

МодельОфіційна цінаНаша ціна
Claude Sonnet 4.6$3.00 / $15.00 per M$2.40 / $12.00 per M
Claude Opus 4.7$5.00 / $25.00 per M$4.00 / $20.00 per M
GPT-5.5$5.00 / $30.00 per M$4.00 / $24.00 per M
GPT-5.6 Sol$5.00 / $30.00 per M$4.00 / $24.00 per M
DeepSeek V4 Pro$0.43 / $0.87 per M$0.40 / $0.90 per M

Специфічні для Warp режими збоїв.

Як завжди, підтвердіть половину зі шлюзом двома командами curl — список моделей і один chat completion — перш ніж налагоджувати бік Warp. Якщо curl проходить, а Warp — ні, проблема у формі ендпоінта чи виборі в пікері моделей, і більше ніде.

  • Ендпоінт відхилено під час збереження: Warp навмисно відмовляє localhost і URL-адресам приватної мережі. Ендпоінт має бути публічно доступним; URL хостингового шлюзу проходить цю перевірку.
  • Витрати досі йдуть на кредити Warp: сесія на автоматичному виборі моделі (Auto), який завжди використовує кредити Warp. Явно оберіть маршрутизовану через ендпоінт модель у пікері.
  • Модель не знайдено: ID, який ви ввели в конфігурацію ендпоінта, не збігається з каталогом шлюзу. Копіюйте ID зі списку /v1/models побайтово.
  • 401 від ендпоінта: поле облікових даних тримає застарілий чи обрізаний ключ. Виконайте curl для списку моделей з тим самим ключем, щоб підтвердити поза Warp.
  • Функція взагалі не видима: перевірте ваш план. Кастомні ендпоінти доступні для окремих осіб і малих організацій на Free і прийнятних платних планах; більшим організаціям потрібні Business чи Enterprise за документацією Warp.

Хто маршрутизує Warp через шлюз.

  • Розробники, які хочуть Claude за агентами Warp на передоплаченому балансі, з безкоштовним стартом і без картки.
  • Активні користувачі агентів, чиє споживання кредитів Warp переросло їхній план, переносячи явний вибір моделі на власний ендпоінт з оплатою за використання.
  • Ті, хто «ходить по магазинах моделей», порівнюючи моделі для кодування на реальних робочих процесах термінала, де кожен кандидат — це ще один ID у конфігурації ендпоінта.
  • Команди з десяти чи менше людей, що стандартизують один ключ шлюзу, щоб агенти термінала, редактора і CI поділяли єдиний журнал використання.
  • Люди, що вже запускають інші інструменти через шлюз і хочуть тримати Warp на тому самому ключі й у тій самій консолі.

Перевірте ендпоінт і підтвердьте маршрутизацію.

Виконайте дві стандартні перевірки з точним ключем і ID, які ви налаштували в Warp. Якщо обидві пройшли — шлюз готовий, і будь-яка залишкова проблема — в налаштуваннях Warp чи виборі моделі. Тоді запустіть одне реальне завдання агента у Warp з явно обраною моделлю ендпоінта і підтвердьте, що запит з'являється в консолі APIsRouter з очікуваною моделлю і кількістю токенів. Це єдине підтвердження одразу ловить пастку режиму Auto, і відтоді консоль — ваш запис на кожен запит того, що насправді витрачає термінал.

curl -s https://api.apisrouter.com/v1/models \
  -H "Authorization: Bearer $APISROUTER_API_KEY" | head -50

curl -s https://api.apisrouter.com/v1/chat/completions \
  -H "Authorization: Bearer $APISROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"claude-sonnet-4-6",
       "messages":[{"role":"user","content":"ping"}]}'

Поширені запитання

Як налаштувати кастомний inference-ендпоінт у Warp?

Відкрийте Settings у Warp, знайдіть "inference endpoint" і введіть URL ендпоінта, ваші облікові дані і ID моделей, які через нього маршрутизувати. З APIsRouter URL — це https://api.apisrouter.com/v1, і моделі з'являються в пікері Warp після збереження.

Чи працює кастомний ендпоінт Warp зі шлюзами і роутерами моделей?

Так, явно. Документація Warp і пост із запуском називають OpenAI-сумісні шлюзи і роутери підтримуваними цілями; вимога — щоб ендпоінт реалізовував OpenAI Chat Completions API і був публічно доступним.

Чи використовують маршрутизовані через ендпоінт запити мої кредити Warp AI?

Ні. Коли ви явно обираєте маршрутизовану через ендпоінт модель, Warp маршрутизує запит через ваш ендпоінт, і його оплачує ваш провайдер, а не кредити Warp. Виняток — автоматичний вибір моделі (Auto), який завжди витрачає кредити Warp, навіть коли ендпоінт налаштовано.

Чому Warp відхиляє мій URL ендпоінта?

Warp відмовляє localhost, 127.0.0.1 та іншим URL-адресам приватної чи локальної мережі під час налаштування; ендпоінт має бути публічно доступним. URL хостингового шлюзу на кшталт https://api.apisrouter.com/v1 проходить цю перевірку.

Які плани Warp включають кастомні inference-ендпоінти?

За документацією Warp станом на середину 2026 року: Free і прийнятні платні плани для окремих користувачів та організацій з десятьма чи менше людьми; більшим організаціям потрібні Warp Business чи Enterprise. Перевірте актуальну документацію Warp, оскільки обмеження за планами можуть змінюватись з їхнього боку.

Чи можу я так запускати моделі Claude у Warp?

Так. Додайте claude-sonnet-4-6 чи claude-opus-4-7 як ID моделей у конфігурації ендпоінта і оберіть їх у пікері; шлюз обслуговує їх через OpenAI-сумісну поверхню, яку очікує Warp, на тому самому ключі, що й ID GPT і DeepSeek.