Последние пару месяцев я довольно много работаю с AI-кодингом. Всякие мультиагентные системы я строить всё ещё не научился, но определённо увеличил насмотренность на то, как LLM-ки работают. У меня есть пара наблюдений, которые наверняка уже всем очевидны, но не были очевидны мне.

  1. Громкость разговоров про галлюцинации нейросетей снизилась. Думаю, это следствие того, что галлюцинаций стало сильно меньше. В моей практике они редко являются проблемой. Особенно когда результат проверяем (код сработал или не сработал), либо точность результата не слишком важна, чтобы докапываться до деталей (а в важном случае я могу сходить в первоисточник).

  2. Хороший harness влияет очень сильно. Скажем, Claude Science работает гораздо лучше простого Codex или OpenCode. И дело явно не только в модели, а в том, какие базовые инструкции вшиты в запрос и том, как выстроен протокол перепроверок. Harness для себя выбрать я пока не успел, нахожусь в процессе пассивного поиска.

  3. Модель тоже влияет. Мы развернули на лабораторном сервере локальную LLM (qwen-3.5) и работали с ней. Она была неплоха, но до облачных OpenAI-моделей сильно не дотягивала.

  4. Лимиты на сильных моделях бесят. Особенно бесит, когда к концу второго часа заканчивается пятичасовой лимит. Переключиться на ручное редактирование кода в эти три часа не можешь, потому что за первые два часа его написано уже столько, что трёх часов перерыва физически не хватит, чтобы в нём разобраться.

  5. В моих задачах bottleneck-ом была не скорость работы LLM, а скорость запуска скриптов. LLM за 10 минут написала скрипт и пошла его проверять. Через полчаса работы скрипта столкнулась с проблемой, потратила 20 секунд, исправила свой косяк, в следующий раз уткнулась в проблему через 40 минут. Чудовищно бесит. Контролируйте это.

  6. Ещё одна рекомендация: заставляйте эту скотину писать логи, чтобы когда она столкнётся с ошибкой, она как можно точнее знала, где ошибка случилась. Кстати, тогда она может анализировать программу уже в процессе её работы и замечать, что что-то пошло не так на ранних этапах.

  7. Пишет LLM тонну кода. Намного более многословно, чем люди. Кажется, что он даже неплохой, но перепроверять этот код в таких количествах просто невозможно.
    Лучше всего у меня работало «выделить мини-задачку, спросить у chatgpt, прочитать, руками встроить в систему». Только это давало уверенность в том, что код работает как надо.
    Как создавать надёжные и поддерживаемые системы с помощью LLM я пока не понимаю. Но, если у вас, как и у меня, много ad-hoc задачек, требующих не идеального, а какого-то решения (и его качество вы можете перепроверить глазами), вы можете получить хорошую пользу от создания инструментов на 1–2 раза.

  8. Я довольно многому научился, читая сгенерированный код. Например, я стал гораздо активнее использовать awk, который раньше как полноценный язык не признавал, потому что даже не пытался изучать его за пределами самых основ.

  9. Если не выдать среде разрешения на выполнение всех команд, вы будете проводить кучу времени, проверяя, не запрашивает ли модель разрешение на какую-нибудь мелочь. При этом в какой-то момент вы теряете способность реально проверить, что вы ей разрешаете. Она вам говорит: «Я написала скрипт big_beautiful_script.py, который решит вашу задачу. Разрешить его выполнить?»
    Вы нажимаете «да, разрешать всегда», потому что устали в 10-й раз разрешать эту команду. А потом оказывается, что этот скрипт немного поменялся и при каком-то неудачном стечении обстоятельств удаляет все ваши данные (или, например, отправляет злоумышленнику ваш файл с паролями).
    И ещё раз проговорю: вы не можете внимательно прочитать те 5000 строк кода, в которые где-то могла закрасться очень дорогая ошибка.
    Единственный вариант, который я вижу (и хочу протестировать) — запускать агента с полными правами, но в виртуалке. Не давая ему доступов, кроме необходимых. Не понимаю, почему это до сих пор не встроено прямо в codex. Его песочница — это просто стыд.

  10. Те, кто занимается агентами профессионально, говорят про важность настройки инфраструктуры, про мультиагентность, guardrails, циклы и графы итд итп etc etc… Я за два месяца плотной работы так и не дошёл до этого. Всё это бесконечное хвастовство в фейсбуках о том, как человек освоил технологию X и теперь всем нужно научиться работать с технологией X (вышедшей неделю назад), очень удручает. Перманентно чувствуешь себя ненастоящим сварщиком.
    Всё это, наверняка, очень круто, но инженерия этих настроек — отдельная большая задача, требующая внимания и времени (да, даже если ИИ-агент сам это делает за тебя, это всё равно требует внимания). И далеко не для всех инвестиция в изучение этих фишек окупится.
    Учиться новым технологиям полезно, они реально сильно расширяют горизонты. Но без фанатизма.

  11. Я всегда параллельно работал над многими задачами, но стало совсем тяжко. Пока одна задача без твоего участия работает, ты переходишь к другой, от неё к третьей. У меня на пике было 4 проекта, над которыми я работал на протяжение дня одновременно. Я не вполне согласен с тем, что моя работа сменилась от программиста к менеджеру. Но что-то от менедмента в ней есть.

  12. Я подтверждаю наблюдение, что продуктивность растёт, а удовлетворение от работы падает. Работа с LLM ощущается очень неприятно. Даже помимо того, что вы следите за подтверждениями и делаете вид, что понимаете.

Мне общение с агентом напоминает gambling. Вы пишете промпт и надеетесь, что агент сделает то, о чём вы его просите, с первого промпта (причём с реально хорошим объяснением задачи). Он делает фигню. Вы пишете новый промпт и надеетесь, что в этот раз он исправит все ошибки. Дёргаете рычажок «Мне повезёт» — и вам не везёт. Добавляете информации, «мне повезёт» — нет дружок, не в этот раз. Это предвкушение выигрыша держит тебя за экраном часами. Иногда думаешь, что проще было вручную уже сделать или вообще забросить задачу, но вложено уже столько сил, что ты надеешься отыграться и углубляешь, углубляешь своё отчаяние. Чёртова лудомания.

Е.Б. шутил, что провайдерам гораздо выгоднее продавать подписку на месяц, чем на день или неделю, потому что ты неделю работаешь с LLM, а следующую неделю тебя от неё так тошнит, что ты не можешь к ней прикасаться, но деньги всё равно платишь.

Ещё почему-то в голове живёт мысль, что раз у меня в руках волшебная палочка, то любая проблема должна решаться мгновенно. Как я писал, мы слишком подсели на скорость развития технологий.

Но тот факт, что волшебная палочка иногда искрит и вместо грозы создаёт козу, ощущается болезненно. От «у меня руки растут не из того места» до «надо вообще выбросить этот хлам». Я не хотел бы вновь встретиться с той козой.

До появления ИИ-агентов у меня постоянно было 2–3 пет-проекта, которые я никак не мог довести до ума.

ИИ полностью изменил правила игры.

Теперь у меня 15–20 незавершённых пет-проектов. (отсюда)