Обучение · Агенты и вайб-кодинг
Глава 21. Роли и конвейер
Одиночные субагенты решают одну задачу. Задач много и они однотипные, значит из агентов собирают процесс: у каждого своя роль, между ролями шлюзы.
Это работает, но не так, как рисуют на схемах. Разберём и схему, и разницу с реальностью.
Схема ролей Вот конвейер, который собирали практики. Он повторяет обычный процесс разработки, только исполнители другие.
КОНВЕЙЕР РОЛЕЙ
Продукт Исследователь Разработчик Ревью и проверка Приёмка
требования факты и варианты код, тесты, коммит параллельно, обе продукт принимает
Продукт формулирует требования. Исследователь собирает факты и варианты решения. Разработчик пишет код и тесты и отправляет изменения. Дальше параллельно работают двое: один смотрит код и разницу, другой проверяет поведение. Оба дали добро, изменения сливаются. В конце продукт принимает результат.
Схема красивая. Теперь честная часть.
Что происходит на самом деле Автор этой схемы описал её состояние так: крутятся, задачи друг другу ставят, результат я не проверял.
И вопрос, который ему тут же задали, был правильный: покажи продуктовую задачу верхнего уровня, которую они разгрызают, нормально декомпозируя на технические, без лишних слоёв и переусложнения.
Ответа не последовало. Ситуация типичная: конвейер собирается за вечер, выглядит охуенно, агенты действительно обмениваются сообщениями, и никто ни разу не проверил, стал ли результат лучше, чем у одного агента с хорошей постановкой.
ГЛАВНОЕ ПРО КОНВЕЙЕРЫ РОЛЕЙ Проверять надо не то, что агенты общаются, а то, что результат стал лучше. Обмен сообщениями между агентами выглядит впечатляюще и не доказывает ни хуя. Единственная честная проверка это сравнение с базовой линией: та же задача, один агент, хорошая постановка. Конвейер не выигрывает, значит ты построил театр.
Роли и конвейер
Побочные эффекты ролей Практики, прожившие с ролевым конвейером дольше пары недель, отмечают несколько вещей.
Роли обрастают. Каждая роль постепенно обрастает своими правилами, исключениями и оговорками. Через полгода это отдельная система, которую надо тащить на горбу.
Роли грызутся. Ревьюер требует одного, разработчик приучен к другому, и оба ссылаются на свои инструкции. Разруливать приходится человеку.
Роли имитируют. Самый хуёвый эффект. Агент в роли ревьюера знает, что от него ждут замечаний, и доёбывается, даже когда всё в полном порядке. Замечания при этом формально верные и абсолютно бесполезные.
РОЛИ ИЛИ ОДИН АГЕНТ С ЭТАПАМИ За роли. Инструкция для каждой роли пишется один раз. На повторяющемся потоке задач экономит. Роли можно раздать разным моделям, и это режет расход. За одного агента с этапами. Тот же результат достигается сменой инструкции внутри одного разговора: сейчас ты исследуешь, теперь проектируешь, теперь проверяешь. Контекст не теряется, координировать нечего. Что решает. Объём. Задача влезает в один разговор, роли не нужны. Не влезает, роли это способ разбить её на разговоры.
Шлюзы Самая ценная часть конвейера не роли, а шлюзы: точки, где что-то не пропускают дальше.
Практика, описанная в разборах как переломная. В компании завели агента-ревьюера, который отписывается по каждому изменению. Без его одобрения изменения не сливаются. Иногда до согласия доходит десять итераций правок.
При этом человеческое ревью пройти проще, и если человек одобрил, можно сливать сразу.
ПОРЯДОК ШЛЮЗОВ
Изменение готово к слиянию
Сначала машинный шлюз, потом человек Сначала человек, машина как совет
человек видит уже чистое быстрее, но мусор доходит до человека
Смысл перестановки в том, что машинный проход дешёвый и терпит без конца, а человеческое внимание стоит дорого. Пусть дешёвое отсекает очевидную хуйню, а дорогое смотрит на суть.
Роли и конвейер
Формулировка автора этой схемы была короткой: и это всё меняет.
Схема менеджер плюс исполнитель Отдельная форма конвейера, которая выросла из экономии и оказалась полезной сама по себе.
Сильная модель работает только в режиме планирования: читает код, читает правила, готовит развёрнутый план. Ей прямо говорят, что она не исполнитель, а менеджер, который ставит задачи. Исполнение уходит дешёвой модели. Финальное ревью снова у сильной.
Результат по замерам: время выполнения растёт примерно втрое, расход лимитов падает кратно.
Возражения, которые надо знать:
Сначала нужно ревью самого плана, потому что слепые зоны находятся всегда.
Написать код по хорошей спецификации нетрудно, а вот довести спецификацию до состояния хорошей менеджер тебе не поможет.
И самое едкое: запустить тонну исполнителей недолго, задачи всё равно кто-то должен ставить.
КАК ПРОВЕРИТЬ, ЧТО КОНВЕЙЕР РАБОТАЕТ 1. Возьми пять типовых задач. 2. Прогони каждую двумя способами: через конвейер и через одного агента с хорошей постановкой. 3. Сравни три величины: качество результата, расход, время до готового. 4. Конвейер не выигрывает хотя бы в одной, значит он нахуй не нужен. 5. Повторяй после каждого изменения ролей. Конвейер деградирует незаметно.
Где конвейер точно оправдан Чтобы глава не звучала как сплошное отрицание, назовём случаи, где конвейер выигрывает уверенно.
Однотипный поток. Десятки похожих задач в неделю. Инструкция роли пишется один раз и окупается.
Разные модели на разных этапах. Планирование дорогое, исполнение дешёвое. Разделение по ролям это способ развести их технически.
Обязательные шлюзы. Есть требование, чтобы ни одно изменение не проходило без проверки, и роль ревьюера это способ его выполнить.
Разделение доступа. Исследователю права на запись нахуй не нужны. Разделение по ролям это заодно разделение прав.
Последний пункт часто оказывается главным аргументом, хотя вспоминают о нём в самом конце, если вообще вспоминают.
Роли и конвейер
Что запомнить Конвейер из ролей проверяется сравнением с одним агентом, а не количеством сообщений между агентами.
Роли обрастают, грызутся и имитируют работу. Это цена, а не случайность.
Ценность конвейера в шлюзах, а не в ролях.
Машинный шлюз перед человеческим экономит самое дорогое: внимание человека.
Схема менеджер плюс исполнитель замедляет втрое и кратно режет расход, но требует ревью плана.
И роли оправданы там, где есть поток однотипных задач или требование разделить права.
Модуль 6. Проверка Четыре главы про то, как отличить работающее от кажущегося работающим.
Ревью, измерения, детерминированные проверки и ответ на вопрос, сколько полировать. Это тот слой, который поставщик не даст и фреймворк не подскажет: строить придётся самому, и хуй кто поможет.
Читаешь книгу выборочно, начинай с этого модуля.
← Многоагентность и рои · оглавление · Ревью →
Спросить книгу может любой, кто вошёл в Neuraldeep Hub: агент ищет ответ по тексту и приводит цитату со ссылкой на главу.