Token economy: LLM-инфраструктура меньше чем за три доллара в неделюToken economy: an LLM infrastructure for under three dollars a week
Сергей ПакSergei Pak · проектирует AI-операционные системы
Моя система делает около 4 800 обращений к LLM в неделю и платит за них $2,4. Это средняя за последние тридцать дней: в отдельную неделю счёт доходил до четырёх долларов, когда система разом перемалывала архив переписки. Полгода назад было 855 вызовов и полдоллара. Объём вырос в пять с лишним раз, счёт – в четыре. Ни скидок, ни грантов; расходы растут медленнее работы, и это главный признак, что архитектура собрана верно.
Локальная модель по умолчанию
92% вызовов берёт на себя 9B-модель прямо на моём Mac. Она бесплатная, отвечает быстро, и данные с машины не уходят. Облако получает задачу только после того, как замер показал: маленькая модель тут не вывозит.
Вот как выглядит такой замер. Месяц я гонял облачную и локальную модели бок о бок на оценке качества текстов. Локальная всем подряд ставила 75 из 100 – одну и ту же цифру, с нулевым разбросом. Облачная же раскладывала тексты от 32 до 62 баллов. Миграцию я отменил, оценку качества оставил в облаке. А триаж, классификацию и выжимки давно отдал локальной: там разницы в качестве не нашлось.
Такая экономика возможна не из-за удачной конфигурации железа. Stanford HAI в AI Index 2025 замерил, что инференс уровня GPT-3.5 подешевел более чем в 280 раз с ноября 2022 по октябрь 2024, а отставание открытых моделей от закрытых на части бенчмарков за год сжалось с 8% до 1,7%. Работа, которая позавчера требовала дорогого облака, сегодня помещается в рабочий ноутбук. Экономия появляется у того, кто это заметил и перестроил маршрутизацию.
Три правила
- Один шлюз на все вызовы. Каждое обращение к LLM идёт через единственный модуль. Он считает стоимость, подбирает модель под тип задачи и кэширует промпты. Прямой вызов API из кода автоматика ловит ещё на коммите.
- Промпты, которые кэшируются. Системный промпт статичный и длиннее порога кэширования, поэтому за повторный вызов я плачу копейки – за уже виденную часть.
- Расходы лежат в базе. Кто потратил, какая модель, сколько токенов. Раз в неделю смотрю срез: что увести на локальную модель, что подорожало и почему. Строчке в дашборде провайдера я бы это не доверил.
Зачем это бизнесу
Сама по себе разница между тремя долларами в неделю и тремястами мало кого греет. Важнее другое: дешёвая инфраструктура может позволить себе думать постоянно – триажить каждое письмо, проверять каждый договор, пересчитывать цифры каждый день, а не раз в квартал перед отчётом. Как только каждый вызов стоит ощутимых денег, экономить начинают на частоте внимания – и система слепнет.
Как устроен слой целиком, от контекста до автономии, – в посте что такое AIOS. Прикинуть такую экономику на объёме вашего бизнеса можно на онлайн-консультации.
My system makes around 4,800 LLM calls a week and pays $2.40 for them. That's the average over the last thirty days; in one week the bill hit four dollars, when the system chewed through an archive of correspondence in one go. Six months ago it was 855 calls and 50 cents. Volume grew more than fivefold, the bill fourfold. No discounts, no credits; costs grow slower than the work, which is the main sign the architecture is put together right.
Local model by default
A 9B model on my Mac takes 92% of the calls. It's free, it's fast, and the data never leaves the machine. The cloud gets a task only after a measurement shows the small model can't handle it.
Here's what one of those measurements looked like. For a month I ran a cloud model and the local one side by side on text-quality scoring. The local one gave every text the same 75 out of 100, zero variance. The cloud model spread them from 32 to 62. I cancelled the migration and left quality scoring in the cloud. Triage, classification and summaries, though, went local long ago: no quality gap there.
This economy isn't down to a lucky hardware setup. Stanford HAI's AI Index 2025 measured inference at GPT-3.5 level dropping more than 280-fold between November 2022 and October 2024, while the gap between open-weight and closed models narrowed from 8% to 1.7% on some benchmarks in a single year. Work that needed expensive cloud the day before yesterday now fits on a working laptop. The savings go to whoever noticed and rebuilt their routing.
Three rules
- One gateway for every call. Every LLM request goes through a single module. It tracks the cost, picks a model for the task, and caches prompts. A direct API call from the code gets caught at commit time.
- Prompts that cache. The system prompt is static and longer than the caching threshold, so a repeat call pays pennies for the part the model has already seen.
- Costs live in a database. Who spent it, which model, how many tokens. Once a week I read the slice: what to move local, what got pricier and why. I wouldn't trust a line in a provider's dashboard with this.
Why a business should care
The gap between three dollars a week and three hundred isn't the real point. This is: cheap infrastructure can afford to think all the time – triaging every email, checking every contract, recalculating the numbers daily instead of once a quarter before the report. The moment each call costs real money, you start saving on how often the system pays attention, and it goes blind.
How the whole layer works, from context to autonomy, is in what is an AIOS. To size this economy against your own volume, book an online consultation.
Частые вопросы
- Сколько стоит LLM-инфраструктура для бизнеса?
- У меня – около $2,4 в неделю на ~4 800 вызовов, это средняя за последние 30 дней. 92% объёма берёт бесплатная локальная модель на моём Mac, платным моделям достаётся только то, что она подтверждённо не тянет.
- Когда задача уходит с локальной модели в облако?
- После замера. Обе модели гоняются бок о бок на одной задаче: качество совпало – работа остаётся на локальной. Так триаж, классификация и выжимки ушли на Mac, а оценка качества текстов осталась в облаке.
- Как держать расходы на LLM под контролем?
- Три правила: один шлюз на все вызовы, статичные промпты длиннее порога кэширования и учёт расходов в собственной базе. Раз в неделю смотрю срез: что подорожало и что пора увести на локальную модель.
FAQ
- How much does an LLM infrastructure cost a business?
- Mine runs at about $2.40 a week for ~4,800 calls, averaged over the last 30 days. A free local model on my Mac takes 92% of the volume; paid models only get what it has measurably failed at.
- When does a task move from the local model to the cloud?
- After a measurement. Both models run side by side on the same task: if the quality matches, the work stays local. That's how triage, classification and summaries moved to the Mac while text-quality scoring stayed in the cloud.
- How do you keep LLM costs under control?
- Three rules: one gateway for every call, static prompts longer than the caching threshold, and costs logged in your own database. Once a week I read the slice: what got pricier and what's ready to go local.