Как лень матушка научила меня экономить токены: автономный пайплайн написания кода за копейки
Лень — двигатель прогресса. И если вы думаете, что это просто отговорка, то вы, видимо, никогда не видели счёт от облачного провайдера после суток работы с frontier-моделью.
Я не изобретал велосипед. Я просто очень не хотел платить. И придумал схему, в которой код пишется автономно, пока я сплю, а токены тратятся только там, где это действительно критично.
---
🧩 Три этапа, которые работают, пока я вижу сны
Этап 1. Ночная смена: локальный агент
Перед сном я кидаю локальному агенту

подробное ТЗ. Не однострочный промпт, а структурированный документ с инвариантами, лимитами, контрактами и критериями готовности.
Пока я сплю, агент:
- создаёт структуру проекта,
- пишет базовый код,
- гоняет локальные тесты,
- коммитит в репозиторий.
Стоимость: 0 рублей. 0 токенов. 0 облака.
Да, локальная модель не напишет шедевр с первого раза. Она и не должна. Её задача — заполнить 80% объёма рутинного кода, который потом будет доведён до ума.
Этап 2. Утренняя смена: GitHub + средняя облачная модель
Просыпаюсь. Смотрю на пуш. Запускаю GitHub Actions, который:
1. Вытягивает свежий код.
2. Скармливает его модели среднего класса (например, Claude Sonnet или GPT-4o-mini) с промптом:
> «Вот код, написанный локальной моделью. Найди логические ошибки, дыры в контрактах, нарушения инвариантов. Исправь. Не переписывай с нуля — доводи до ума».
3. Делает PR с правками.
Почему не сразу топовая модель?
Потому что топовая модель — это как нанимать архитектора, чтобы тот расставлял стулья в офисе. Она отлично видит системные ошибки, архитектурные косяки, race conditions, проблемы с идемпотентностью. Но тратить её контекстное окно на банальный if x is None: return — это преступление против кошелька.
Средняя модель стоит в 10–50 раз дешевле и прекрасно справляется с ролью "старшего ревьюера", который ловит 90% глупостей локалки.
Этап 3. Финальная проверка: топовая модель как аудитор
Когда PR смержен и код уже выглядит прилично, я загоняю его в frontier-модель (Claude Opus, o3, Gemini Ultra — что под рукой) с одним конкретным запросом:
«Ты — архитектор с 20-летним стажем. Проверь этот код на то, что не увидели другие: граничные случаи, проблемы с конкурентностью, утечки памяти, нарушения контрактов, дыры в безопасности. Не пиши код. Только найди то, что сломается в продакшене».
Стоимость: несколько центов на весь проект.
Потому что к этому моменту код уже чистый. Frontier-модели не нужно разбираться в синтаксисе — она смотрит смысл. А смысл стоит дорого, но его мало.
💡 Почему так, а не «просто скормить всё GPT»?
Потому что токены — это не просто деньги. Это контекстное окно.
Когда вы суете frontier-модели 50 файлов сырого кода от локалки, она:
- тратит 70% контекста на то, чтобы понять, что вообще происходит,
- начинает галлюцинировать на 30-м файле,
- выдаёт "универсальные" правки, которые ломают рабочие куски,
- жрёт вам бюджет как не в себя.
А когда вы даёте ей уже причесанный, протестированный, структурированный код — она работает так, как должна: думает глубоко, а не широко.
🧮 Немного математики для тех, кто считает
Допустим, у вас проект на ~100 файлов, ~15 000 строк кода. Давайте сравним три подхода.
Если всё пишет Claude Opus, одна итерация обойдётся примерно в 5–15 долларов, займёт минут двадцать и даст высокое качество — но модель начнёт уставать к концу большого контекста.
Если всё пишет локалка, стоимость — ноль, время — около двух часов, но качество получится процентов на шестьдесят. Остальное — мусор, который потом разгребать.
А по моему пайплайну одна итерация стоит примерно 30–80 центов, занимает восемь часов (из которых семь — это сон), а качество выходит 90% и выше.
Разница в 10–20 раз при сопоставимом качестве. И это без учёта того, что локалка работает, пока вы спите — то есть фактически бесплатно использует ваше время.
---
🎯 Главный инсайт
Не все токены одинаково полезны.
Токен, потраченный на написание банального CRUD-эндпоинта в Claude Opus — это выброшенный токен.
Токен, потраченный на проверку архитектурного решения в том же Claude Opus — это инвестиция.
Разделяя задачи по "весу", вы получаете:
- дешёвый объём от локалки,
- дешёвую шлифовку от средней модели,
- дорогую, но точную проверку от топовой.
Это как производство: сырьё — дёшево, обработка — средне, контроль качества — дорого, но его мало.
---
🦥 Финальная мысль
Лень — это не порок. Это оптимизация ресурсов.
Когда вы вместо того, чтобы дёргать API каждые 5 минут, настраиваете пайплайн, который работает сам — вы не ленитесь. Вы инвестируете час настройки в сотни часов экономии.
И да, пока вы это читаете, мой локальный агент уже пишет следующий модуль. А я иду заваривать кофе.
Потому что лучшая архитектура — та, которая работает без вас.
P.S. Если вам кажется, что это overengineering — попробуйте посчитать свой счёт за API после недели активной разработки. Лень сразу перестанет казаться overengineering'ом. 🦥
Tux Linux
Поддержать автора
- номер счёта/карты
- 2204 3201 5444 9864
- получатель
- Боев Федор
Полезность
Оцените, насколько эта информация полезна лично вам, вашей семье, стране, всему обществу.
Подробнее
А
Интересность
Оцените, насколько эта информация соответствует вашим интересам, как хорошо она оформлена и понятно объяснена.
Подробнее
Комментарии 0
Войдите, чтобы оставить комментарий.
Будьте первым, кто прокомментирует эту запись.