Перший рахунок від провайдера LLM зазвичай приємно дивує. Рахунок через три місяці після запуску, коли трафік виріс, а агент робить шість викликів інструментів на кожне запитання, — часто вже ні. Хороша новина: більшість AI-застосунків, які ми аудитуємо, можуть скоротити витрати на моделі на 50–80% без втрати якості, і здебільшого — кількома механічними змінами. У гайді — важелі в тому порядку, в якому ми їх застосовуємо: спершу безкоштовні виграші, наостанок компроміси з якістю, з реальними розрахунками.
Звідки насправді беруться витрати на LLM
Ви платите за токени, окремо за вхідні й вихідні. В AI-агента зазвичай переважають вхідні: кожен запит наново надсилає системний промпт, описи інструментів, знайдені документи та всю розмову. Вихідні токени дорожчі за одиницю, але їх менше.
Актуальні прайсові ціни на моделі Anthropic добре показують розкид (ціни Anthropic):
| Модель | Вхід, $ за мільйон токенів | Вихід, $ за мільйон токенів | Типове застосування |
|---|---|---|---|
| Claude Fable 5.1 | 10.00 | 50.00 | Найскладніші міркування та довготривала агентна робота |
| Claude Opus 5.5 | 4.00 | 20.00 | Складні агенти, програмування, аналітика |
| Claude Sonnet 5.5 | 2.00 | 10.00 | Повсякденні агенти, підтримка, корпоративні задачі |
| Claude Haiku 4.5 | 1.00 | 5.00 | Класифікація, вилучення даних, масова маршрутизація |
Ціни станом на вересень 2026 року; перед плануванням бюджету звіряйтеся зі сторінкою цін.
Перш ніж оптимізувати, виміряйте. Логуйте input_tokens, output_tokens і поля кешу з кожної відповіді, групуючи за функціями та маршрутами. Не можна скоротити те, чого не бачиш, а найдорожчим маршрутом рідко виявляється той, на який думає команда.
Важіль 1: Кешування промптів (найбільший безкоштовний виграш)
Більшість запитів AI-застосунку мають довгий однаковий префікс: системний промпт, описи інструментів, документи з політиками, приклади. Кешування промптів дозволяє провайдеру зберегти цей префікс і брати лише частку ціни при повторному використанні.
В API Anthropic запис у кеш коштує 1,25× базової ціни вхідних токенів для стандартного 5-хвилинного строку життя (2× для опційного годинного), а читання з кешу — приблизно 0,1×, на деяких новіших моделях ще менше (Anthropic: prompt caching). З 5-хвилинним кешем окупність настає вже на другому запиті.
Приклад. Асистент підтримки надсилає префікс на 20 000 токенів (інструкції, інструменти, витяги з політик) з кожним із 100 000 запитів на місяць на Claude Sonnet 5.5:
- Без кешування: 2 млрд вхідних токенів × $2 = $4 000 лише за префікс.
- З кешуванням і високою часткою влучань: близько 2 млрд токенів, прочитаних за $0,20 за мільйон, = $400 плюс невелика сума за записи в кеш.
Щоб кешування працювало:
- Стабільне — на початку, змінне — в кінці. Інструменти, системний промпт і документи — перед запитанням користувача. Мітка часу чи ID користувача на початку системного промпту тихо ламає кожне влучання в кеш.
- Тримайте детермінований порядок. Серіалізуйте списки інструментів і JSON у фіксованому порядку.
- Перевіряйте. Якщо
cache_read_input_tokensзалишається нулем на повторних запитах, щось у префіксі змінюється при кожному виклику.
response = client.messages.create(
model="claude-sonnet-5-5",
max_tokens=2000,
system=[{
"type": "text",
"text": STABLE_INSTRUCTIONS_AND_POLICIES, # однаковий у кожному запиті
"cache_control": {"type": "ephemeral"}, # кешувати все до цього місця
}],
messages=history + [{"role": "user", "content": question}],
)
print(response.usage.cache_read_input_tokens, response.usage.input_tokens)
Кешування природно поєднується з пошуком: стабільні знання тримайте в кешованому префіксі, а в кожному запиті надсилайте лише знайдені фрагменти — як описано в статті RAG-системи для бізнесу.
Важіль 2: Пакетна обробка для всього, що може зачекати
Не кожен запит потребує відповіді за дві секунди. Нічна генерація звітів, класифікація документів, запуски evals, збагачення даних і переклад каталогів можуть чекати хвилини чи години. Batch API обробляють такі запити асинхронно з великою знижкою — 50% у Message Batches API від Anthropic (Anthropic: batch processing).
Емпіричне правило: якщо результату не чекає людина, йому місце в batch. Evals — ідеальний кандидат; див. Як оцінювати LLM-застосунки.
Важіль 3: Гігієна вхідних токенів
- Скорочуйте описи інструментів. Двадцять інструментів із довгими описами можуть коштувати тисячі токенів на запит. Відкривайте лише інструменти, релевантні маршруту, і пишіть описи точно, а не довго.
- Повертайте компактні результати інструментів. API-виклик, що повертає запис на 200 полів, коли моделі потрібні п'ять, множить вартість кожного наступного ходу, бо результат залишається в розмові.
- Знаходьте менше, ранжуйте краще. 40 фрагментів документів «про всяк випадок» — дорого і часто знижує якість. П'ять-вісім добре відранжованих фрагментів зазвичай кращі за 40.
- Керуйте довгими розмовами. Підсумовуйте або прибирайте старі результати інструментів замість того, щоб вічно надсилати історію на 100 ходів.
Важіль 4: Гігієна вихідних токенів
На більшості моделей вихідні токени в п'ять разів дорожчі за вхідні. Просіть рівно те, що потрібно:
- Задавайте очікувану довжину відповіді в промпті («відповідай щонайбільше трьома реченнями»).
- Для відповідей, які читає код, використовуйте structured outputs замість прози, яку потім парсять.
- Не просіть модель повторювати запитання, переказувати контекст чи додавати загальні застереження.
Важіль 5: Налаштуйте effort і міркування
Сучасні моделі думають перед відповіддю, і токени міркувань тарифікуються як вихідні. Багато моделей мають параметр effort, що визначає глибину міркувань. Складним задачам — багатокроковим агентам, програмуванню, аналітиці — високий effort допомагає; класифікація, вилучення даних і простий чат часто працюють так само добре на низькому effort за частку вартості.
Налаштовуйте effort для кожного маршруту, міряйте якість на своєму eval-наборі й оцінюйте вартість виконаної задачі, а не вартість запиту. Дешевше налаштування, якому потрібні два додаткові ходи, насправді не дешевше.
Важіль 6: Обирайте і маршрутизуйте моделі свідомо
Найдорожча модель — не завжди найвигідніша, а найдешевша — не завжди найдешевша в перерахунку на результат.
- Підбирайте модель під маршрут. Масовий класифікатор може працювати на невеликій моделі, а складний агент — на сильнішій.
- Перш ніж будувати каскад, спробуйте сильну модель на нижчому effort. Новіші моделі на низькому effort часто дорівнюють старшим на високому, а одна модель — це один кеш.
- Використовуйте роутер лише тоді, коли це підтверджують дані. Невелика модель, що класифікує запити й відправляє прості на дешевшу модель, може заощадити гроші, але кожна додаткова модель — це додаткова затримка, окремий кеш і ще одна річ для оцінювання.
Кожна зміна моделі потребує прогону evals. Модель, на 30% дешевша, яка вирішує на 10% менше звернень підтримки, може коштувати дорожче з урахуванням ескалацій на людей — див. AI-агенти для підтримки: де вони працюють, а де ні.
Важіль 7: Запобіжники від неконтрольованих витрат
- Ліміти на токени та виклики інструментів на користувача і сесію.
- Максимальна кількість ітерацій агента на задачу.
- Алерти, коли денні витрати відхиляються від тренду.
- Окремі API-ключі чи робочі простори на продукт, щоб одна функція не з'їла бюджет іншої.
Порядок, у якому ми застосовуємо важелі
| Крок | Важіль | Типова економія | Ризик для якості |
|---|---|---|---|
| 1 | Виміряти токени за маршрутами | — | Немає |
| 2 | Кешування промптів | 30–80% вартості вхідних токенів | Немає |
| 3 | Batch для неінтерактивних задач | 50% на цих запитах | Немає |
| 4 | Гігієна входу й виходу | 10–40% | Низький |
| 5 | Налаштування effort за маршрутами | 10–50% | Міряти |
| 6 | Вибір і маршрутизація моделей | 20–70% | Міряти ретельно |
Щомісячний огляд витрат
Контроль витрат найкраще працює як звичка, а не разовий проєкт:
- Вивантажте використання за маршрутами й моделями за минулий місяць і порівняйте з попереднім.
- Перевірте частку влучань у кеш на кожному маршруті з довгим спільним префіксом; раптове падіння зазвичай означає, що хтось додав мітку часу чи змінив порядок інструментів.
- Подивіться на 1% найдорожчих запитів. Там ховаються зациклені агенти й завеликі документи.
- Оцінюйте вартість виконаної задачі, а не лише загальні витрати, разом із метриками якості з ваших evals.
- Перевіряйте вибір моделі й effort повторно, коли провайдери випускають нові моделі: ціни й можливості змінюються кілька разів на рік.
FAQ
Чи змінює кешування відповіді моделі? Ні. Кешовані й некешовані запити дають еквівалентні результати; відрізняються лише вартість і затримка.
Як оцінити витрати до запуску? Порахуйте токени реалістичних запитів через ендпоінт підрахунку токенів провайдера, помножте на очікуваний обсяг і додайте 30–50% на повтори, довші розмови і зростання.
Чи дешевше розгорнути open-source модель самостійно? Іноді — за дуже великого і стабільного обсягу. Перш ніж вирішувати, врахуйте вартість GPU, інженерний час і різницю в якості на власному eval-наборі.
Яка реалістична вартість однієї розмови підтримки? Від часток цента для простих відповідей на FAQ до десятків центів для багатокрокових агентів з інструментами. Міряйте свою, за маршрутами.
Джерела
- Anthropic. Pricing.
- Anthropic. Prompt caching.
- Anthropic. Batch processing.
- Anthropic. Create strong empirical evaluations.
- OWASP GenAI Security Project. LLM10: Unbounded Consumption.