Обучение · Агенты и вайб-кодинг
Глава 38. Токеномика
Слово выглядит модным до тошноты, а означает простую вещь: понимание того, из чего складывается твой счёт и на что ты вообще влияешь.
Из чего складывается счёт
ЧТО ТАКОЕ ТОКЕН Токен это кусок текста, на которые модель режет всё, что видит. Примерно слог или короткое слово. В русском тексте один токен это в среднем около трёх символов. Платишь ты за две вещи: за то, что отправил, и за то, что получил. Отправленное обычно в разы дешевле полученного, но его гораздо больше, потому что вся история уезжает заново каждый ход.
Статья Что это Доля в типичном счёте
Повторная отправка истории Весь разговор заново каждый ход Наибольшая
Постоянная часть контекста Правила, описания скиллов и ин- Заметная, растёт незаметно струментов
Результаты вызовов Содержимое прочитанных фай- Большая на исследовательских лов, ответы утилит задачах
Рассуждения Внутренние размышления моде- Зависит от уровня усилий ли
Собственно ответ То, что ты видишь Наименьшая
Первая строка объясняет главное: платишь ты в основном не за то, что модель написала, а за то, что она прочитала. Причём прочитала по десять раз, сука, за твои же деньги.
Кеш решает больше, чем выбор модели Самая недооценённая тема.
Поставщики кешируют начало запроса. Следующий запрос начинается точно так же, значит эта часть считается заметно дешевле.
Отсюда правило: стабильное держи в начале, изменчивое в конце.
Нарушения выглядят безобидно и стоят как чугунный мост. Текущее время в начале системного запроса. Случайный идентификатор сессии. Счётчик сообщений. Любая такая мелочь наглухо разъёбывает кеш, и каждый ход оплачивается по полной.
Токеномика
ГЛАВНОЕ ПРО КЕШ У правильно настроенного агента доля попаданий в кеш доходит до девяноста процентов. У ненастроенного она болтается около нуля. Это разница в разы на том же самом объёме работы. Проверяется за пять минут, а выигрыш больше, чем от смены модели.
Отдельная засада, о которую бьются лбом: у некоторых поставщиков запись в кеш стоит дороже обычной отправки. Значит, кеширование того, что ты используешь один раз, счёт увеличивает, а не уменьшает. Вот такое наебалово.
Убрать промежуточные шаги Второй по величине источник экономии.
Каждый вызов инструмента это дополнительный круг: отправили всё заново, получили ответ, отправили всё заново вместе с ответом. Пять вызовов вместо одного это пять полных отправок истории, и платишь ты за все пять как миленький.
Отсюда приёмы:
Отдавать сразу. Знаешь, что агенту понадобятся три файла, отдай их сразу, а не жди, пока он выклянчит по одному.
Утилиты вместо цепочек. Одна утилита, которая делает три шага и возвращает результат, дешевле трёх вызовов.
Дешёвая модель на навигацию. Хождение по файлам самой сильной моделью это самая жирная строка в счёте.
Замеренные различия между обвязками Полезное наблюдение: разные обвязки на одной и той же задаче с одной и той же моделью дают заметно разный расход.
Разница набегает из мелочей, которые по отдельности выглядят как хуйня: как часто пересобирается контекст, что попадает в системную часть, насколько агрессивно сжимается история, сколько вспомогательных вызовов делается на каждый ход.
Практический вывод: счёт кажется невъебенным, сравни две обвязки на одной задаче, прежде чем менять модель.
Токеномаксинг как антипаттерн Отдельный сюжет, о котором стоит предупредить, потому что выглядит он как достижение.
Есть соблазн оптимизировать расход как самоцель: гордиться низким счётом, жаться на каждом вызове, урезать контекст до костей.
Беда в том, что сэкономленные деньги оборачиваются твоим временем. Агент с урезанным контекстом косячит чаще, и ты просираешь часы на исправления, которые стоили бы центы.
Токеномика
ГДЕ ПРОХОДИТ ГРАНИЦА РАЗУМНОЙ ЭКОНОМИИ Экономить обязательно на том, что не влияет на результат: кеш, лишние вызовы, дублирование контекста, навигация дорогой моделью. Не экономить на том, что влияет: контекст, необходимый для понимания задачи, уровень усилий на сложной задаче, повторные прогоны для проверки. Простой признак. После экономии стал чаще переделывать, значит сэкономил не там.
Экономика строки кода Мысль, которая меняет отношение к счетам.
Строка кода перестала быть дорогой в производстве и осталась дорогой в сопровождении. Написать тысячу строк теперь стоит центы. А сопровождать их стоит ровно столько же, сколько и раньше, ни копейкой меньше.
Отсюда следствие, которое противоречит инстинкту: экономить надо не на генерации, а на количестве. Лишний код это не потраченные токены, это будущий геморрой, за который ты будешь платить годами.
Это же объясняет, почему шаг схлопывания из главы о полировке экономит больше, чем любые настройки.
Считай окупаемость до Пример, который стоит помнить.
Человек хотел подписать один документ. Через готовый онлайн-редактор это заняло бы полминуты. Он попросил агента собрать скилл для этой операции: четверть часа работы и больше пяти долларов по счётчику за один заход.
Дальнейшие подписания стали дешёвыми. Вопрос в том, сколько их будет.
РАСЧЁТ ОКУПАЕМОСТИ ЗА ДВЕ МИНУТЫ 1. Сколько раз в месяц выполняется операция? 2. Сколько минут занимает ручной проход? 3. Сколько стоит сборка автоматизации: время плюс токены? 4. Сколько будет стоить один автоматический проход? 5. Раздели стоимость сборки на экономию с одного прохода. Получишь число проходов до окупаемости. Сравни с пунктом первым.
И не забудь, что автоматизация требует сопровождения. Скилл протухает, интерфейс меняется, что-то отваливается. Это добавляется к стоимости.
Парадокс стоимости Наблюдение, которое объясняет странность отрасли.
Токеномика
Разработка подешевела, а счета выросли. Причина не в ценах, а в том, что дешевизна породила объём. Раньше ты бы хуй стал переписывать модуль ради небольшого улучшения. Теперь стал бы, потому что это стоит центы.
В результате ты делаешь в десять раз больше работы за втрое большие деньги и при этом искренне считаешь, что тебя наебали.
ГЛАВНОЕ ПРО СЧЁТ Смотри не на абсолютную сумму, а на стоимость единицы результата. Закрытая задача, закрытое требование, вышедшая функция. Абсолютная сумма растёт всегда, потому что растёт объём. Стоимость единицы результата это то, чем ты управляешь.
Что запомнить Платишь ты в основном за то, что модель прочитала, и прочитала многократно.
Кеш даёт разницу в разы. Стабильное в начало, изменчивое в конец, проверка занимает пять минут.
Убирай промежуточные вызовы: каждый это полная отправка истории.
Навигацию по файлам отдавай дешёвой модели.
Не экономь на контексте, нужном для понимания. Стал чаще переделывать, значит сэкономил не там.
Лишний код это не потраченные токены, а будущие расходы на сопровождение.
Окупаемость автоматизации считай до сборки, с учётом сопровождения.
И меряй стоимость единицы результата, а не абсолютную сумму.
← Приватность и утечки · оглавление · Подписки, лимиты и горизонт →
Спросить книгу может любой, кто вошёл в Neuraldeep Hub: агент ищет ответ по тексту и приводит цитату со ссылкой на главу.