Блог Hard&Soft Skills · AI-Driven Development · Level 1

Мы провели курс AI-Driven Development и разобрали 421 сессию: как инженеры растут в работе с ИИ-агентами

Мы завершили второй поток курса AI-Driven Development первого уровня. Оба потока вёл Сергей Голубев, и вёл так, что за этот курс ему хочется сказать отдельное спасибо.

На втором потоке мы впервые сделали персональный отчёт о том, как участник работал с кодинг-агентом, – для каждого, кто сдал логи сессий. Участники сдавали домашние задания вместе с логами сессий, и по этим логам видно то, чего не видно по результату: как поставлена задача, был ли план, проверял ли человек сделанное, что он делал, когда агент предупреждал о риске.

Разборы по всем, кто сдал логи, показали, где разработчики растут, где проседают, какие ошибки повторяются и что люди унесли в свою работу. Если вы сами учитесь работать с агентами или учите этому команду, большую часть выводов можно проверить на своих сессиях.

Почему мы стали смотреть на процесс

Идея пришла с итоговой встречи первого потока. Один из участников сказал, что фидбэк по домашкам оценивает результат, а ему нужен разбор того, как он работал с агентом. Другой объяснил, почему сдал меньше домашек: подробное задание можно целиком отдать агенту, результат совпадёт с ожиданием, но понимания, контролируешь ли ты процесс, не появится.

Сергей подвёл итог той встречи так: код с агентом пишется быстро, а планирование до него и проверка после занимают основное время, и именно этому курс учил недостаточно. Ко второму потоку он переписал материалы и собрал разборы рабочих сессий.

Как устроен разбор

Участник сдаёт домашку вместе с логами сессий своего агента. Перед разбором из логов вырезаются секреты и персональные данные.

Дальше работают два агента. Первый вытаскивает из лога дословные цитаты, относящиеся к восьми навыкам работы с агентом. Второй ставит по каждому навыку балл от 0 до 4, причём только под цитату. Если в логе модуля на навык не было материала, балл не ставится вовсе: в отчёте стоит «мало данных». Итог читает преподаватель и отправляет участнику персональные рекомендации.

Восемь навыков, по которым шла оценка, и что за каждым стоит:

  1. Постановка задачи. Насколько ясно агенту объяснено, что нужно и как понять, что готово.
  2. Декомпозиция. Разбита ли работа на шаги, которые можно проверить по отдельности.
  3. Управление контекстом. Что агент знает о проекте и не тонет ли он в лишнем.
  4. Проверка результата. Тесты, запуск, ревью диффа вместо «агент сказал, что готово».
  5. Решения за человеком. Кто выбирает архитектуру, библиотеку, компромисс: человек или агент по умолчанию.
  6. Самокоррекция. Замечает ли человек, что идёт не туда, и как разворачивается.
  7. Калибровка доверия. Где агенту можно верить на слово, а где нужно перепроверить.
  8. Обратимость. Есть ли точка отката перед рискованным шагом.

По совокупности навыков работе присваивается уровень: пассажир, наивный, компетентный, уверенный оператор, оркестратор. Отдельно ловятся типовые ошибки и предупреждения агента о риске.

Схему замыкает обратная связь: рекомендация не заканчивается отправкой, по следующей порции логов того же участника видно, взял ли он её в работу. Так разбор превращается из оценки в цикл.

Логи сдали 15 участников из 27. За курс разобрана 421 сессия, больше 28 000 реплик человека и агента, 40 работ «участник × модуль», выдано 79 рекомендаций. В медианной работе 376 реплик диалога с агентом: типичная сдача – долгий диалог. Работали в разных инструментах – чаще всего в Claude Code, но также в Cursor, Codex CLI, OpenCode и GitHub Copilot, на моделях Claude, GPT, GLM и других. Разбор оценивает навыки независимо от инструмента.

15
участников из 27 сдали логи сессий
421
сессия с кодинг-агентом
28 351
реплика человека и агента
40
разобранных работ «участник × модуль»
79
персональных рекомендаций
98%
проверенных рекомендаций взяты в работу

Объём работы

Медианная работа – 376 реплик диалога с агентом

0200400600800464М2n=14177М3n=8461М4n=8333М5n=5273М6n=5

Медиана числа реплик человека и агента в логах одной работы, по модулям. В пятом и шестом модулях разобрано не больше пяти работ: их доли неустойчивы.

Инструменты

С чем работали участники

Агентные инструменты

Claude Code10Cursor3Codex CLI3OpenCode1GitHub Copilot1

Семейства моделей

Claude (Opus, Sonnet, Fable, Haiku)7GPT4GLM3Composer2Grok2

Сколько участников работали с каждым инструментом и семейством моделей – по логам сессий.

Что выявили разборы

Уровень работ вырос, а средний балл по навыкам – нет

Если сравнить первую половину курса со второй, картина выглядит как резкий рост: работ уровня «уверенный оператор» и выше стало 89% вместо 59%. Но средний балл по восьми навыкам между половинами курса не изменился.

Было → стало

Модули 2–3 (22 работы) и модули 4–6 (18 работ)

59%→89%
Работ на уровне «уверенный оператор» и выше
23%→6%
Работ, где пропущено предупреждение агента о риске
1 из 22→3 из 18
Работ на уровне «оркестратор»

Сравниваются разные наборы работ: состав сдавших от модуля к модулю менялся.

Это объясняет одно правило оценки. Агент иногда предупреждает о риске, который переживёт сессию: для репозитория, данных или ключей. Если человек продолжает, не отреагировав, работа не может получить высокий уровень, как бы хорошо она ни была сделана в остальном. Во втором модуле так было в трёх работах из 14, в третьем – в двух из 8, в четвёртом – в одной из 8. В пятом и шестом модулях – ни одного случая. Во второй половине курса таких работ почти не было, и уровень поднялся именно за счёт этого.

Предупреждения о риске

Доля работ, где агент предупредил о риске, а человек продолжил

0%10%20%30%40%21%М23 из 1425%М32 из 813%М41 из 80%М50 из 50%М60 из 5

Риск, который переживёт сессию: репозиторий, данные, ключи. В пятом и шестом модулях разобрано не больше пяти работ: их доли неустойчивы.

Уровень определило то, что человек делает, когда агент предупреждает о риске. Пропущенное предупреждение может сломать что-то за пределами сессии – в репозитории, данных или ключах, – и хороший запрос этого уже не исправит.

В двух половинах курса разные наборы работ: состав сдавших от модуля к модулю менялся. А в пятом и шестом модулях разобрано не больше пяти работ, поэтому их доли неустойчивы.

Сильнее всего – постановка задачи и проверка, слабее всего – откат

На последнем замере средний балл группы 3,0 из 4, где 3 соответствует уверенному оператору. Выше всего оценены проверка результата (3,4) и постановка задачи (3,3). Ниже всего – обратимость (2,7) и решения за человеком (2,9).

Профиль группы

Средний балл по восьми навыкам на последнем замере, шкала 0–4

1234ПостановказадачиДекомпозицияУправлениеконтекстомПроверка результатаРешения зачеловекомСамокоррекцияКалибровкадоверияОбратимость(откат)

У каждого участника взят его последний разбор логов, по навыку усредняются те, у кого есть оценка.

Баллов ниже 2 за курс не было ни разу, а 90% всех оценок – тройки и четвёрки. Ни одна работа не оказалась ниже уровня «компетентный», и на последнем замере 9 из 15 участников работали как уверенные операторы или оркестраторы.

Итоговый уровень

Уровень работы с агентом по модулям

0%25%50%75%100%58М2n=1444М3n=817М4n=8122М5n=541М6n=5
компетентныйуверенный оператороркестратор

Шкала: пассажир → наивный → компетентный → уверенный оператор → оркестратор. Цифры в столбцах – число работ. В пятом и шестом модулях разобрано не больше пяти работ: их доли неустойчивы.

Есть навыки, где группа застряла на «уверенно» и не дошла до максимума. В калибровке доверия 70% оценок составляют тройки и только 14% четвёрки. Участники в целом понимают, где агенту можно верить, но тонко настроить это доверие под задачу получается редко. Похоже и с откатом: здесь самая большая доля двоек, 23%. Точку возврата перед рискованным шагом делают не все и не всегда.

Карта освоения

В 90% оценок – 3 или 4 балла из 4

0%25%50%75%100%Постановка задачи55%43%Самокоррекция79%17%Проверка результата47%47%Декомпозиция55%38%Решения за человеком73%19%Управление контекстом13%38%50%Калибровка доверия16%70%14%Обратимость (откат)23%63%13%
балл 2балл 3балл 4

Все 291 оценка группы за курс по каждому навыку. Баллов ниже 2 не было; где наблюдать было не на чем, балл не ставился.

Рекомендации берут в работу почти все, но привычка перестраивается постепенно

Больше всего рекомендаций пришлось на решения за человеком (16 из 79) и на проверку результата (15). Дальше идут откат (11) и постановка задачи (10).

Точки роста

На какие навыки пришлись 79 рекомендаций

Решения за человеком16Проверка результата15Обратимость (откат)11Постановка задачи10Декомпозиция9Калибровка доверия7Управление контекстом6Самокоррекция5

До повторной проверки по следующим логам дошли 49 рекомендаций. Четыре из них нельзя было оценить: в новых логах не было подходящей ситуации. Из оставшихся 45 в работу взяты 44, это 98%. Полностью выполнены 19, то есть 42%. Ещё 25 выполнены частично.

Обратная связь

Что стало с рекомендацией при первой проверке

0%25%50%75%100%67М3n=1349М4n=13452М5n=11542М6n=12
выполненачастичноне выполненане видно в логах

По столбцам – модуль, в логах которого рекомендацию проверяли впервые. Проверок на модуль немного, доли неустойчивы.

Человек слышит рекомендацию и пробует. Но новая практика держится не с первого раза: где-то она уже есть, а где-то по старой памяти пропущена. Особенно это заметно на проверке результата: из восьми проверенных рекомендаций в работу взяты все, а полностью выполнены две. Проверять всё, что сделал агент, оказывается тяжелее, чем согласиться, что это нужно. Выборка здесь маленькая, но направление понятное.

Обратная связь по навыкам

Взяты в работу – почти везде, выполнены полностью – реже

25%50%75%100%ПостановказадачиДекомпозицияУправлениеконтекстомПроверка результатаРешения зачеловекомСамокоррекцияКалибровкадоверияОбратимость(откат)
взяты в работу: полностью или частичноиз них выполнены полностью

Проверок на один навык от 2 до 8: доли на отдельных навыках неустойчивы.

Ошибки, которые повторяются чаще всего

В логах ловились типовые ошибки, и восемь из них встретились хотя бы дважды. Чаще всего:

  • Предупреждение агента пропущено: 7 работ. Шире, чем случаи с риском для репозитория и данных: сюда входят и предупреждения попроще.
  • Сложная задача одной строкой: 6 работ. Агенту дают задачу на несколько шагов без контекста, критериев готовности и плана.
  • Всё в одной сессии: 4 работы. Разные задачи копятся в одном диалоге, контекст засоряется, агент начинает путаться.
  • Гигантский запрос: 4 работы. Обратная крайность: вся постановка, требования и ограничения в одном огромном сообщении.
  • По 3 работы – у трёх ошибок. Агент правит свои же тесты: тест падает, и агент чинит тест вместо кода, – если этого не заметить, зелёные тесты ничего не доказывают. Работа начата на незакоммиченном дереве. Правило объяснили агенту в чате и не записали в файл с правилами.

Типовые ошибки

Ошибки, найденные хотя бы в двух работах

Предупреждение агента пропущено7Сложная задача одной строкой6Всё в одной сессии4Гигантский запрос4Старт на незакоммиченном дереве3Агент правит свои же тесты3Правило в чате вместо файла3План принят без ревью2

Считается один раз на работу: 32 из 40 находок за курс.

Ещё дважды встретился план, принятый без ревью.

Что участники унесли в работу

На итоговой встрече потока участники рассказывали, что изменилось в их работе. Это самоотчёт, а не замер по логам, но он хорошо ложится на цифры выше:

Не пользовался AI-инструментами вообще
→
Понимает, какой инструмент взять под задачу и как с ним работать
Работал через чат и плагин в IDE, консоль не открывал
→
Консоль – основной режим: написал два своих MCP-сервера, ведёт несколько проектов параллельно
Начинал с плагинов в редакторе
→
Под каждую задачу – отдельный worktree, вместе с агентом брейншторм, план и документы
Относился к AI в разработке скептически и не применял его
→
На новой работе ведёт задачи по плану: шаг, проверка, следующий шаг
Не было даже подписки на агента
→
План с чек-листом и проверкой после каждого шага – на рефакторинге legacy-системы из 20 микросервисов

Ни в одном рассказе нет «научился писать запросы». В трёх из пяти – план, отдельная среда под задачу и проверка после каждого шага, в двух других – смена инструмента и самого режима работы.

Что из этого взять себе

Если вы работаете с агентом каждый день, вот что мы по итогам разбора советуем проверить в своих сессиях:

  1. Предупреждения агента о риске – стоп-сигнал. Когда агент пишет, что действие затронет репозиторий, данные или ключи, остановитесь и решите сами, прежде чем нажать «продолжить».
  2. Перед рискованным шагом делайте точку отката. Коммит, ветка или отдельный worktree. Откат – одно из двух самых слабых мест группы, а точка возврата стоит секунды.
  3. Одна задача – одна сессия. Не копите разные задачи в одном диалоге: контекст засоряется, и агент начинает путать договорённости.
  4. Сложную задачу начинайте с плана. Не одной строкой и не огромным сообщением: сначала план, потом шаги с проверкой после каждого. План агента читайте до того, как его принять.
  5. Правила проекта записывайте в файл. То, что сказано в чате, агент забудет в следующей сессии.
  6. Следите за тем, что агент делает с тестами. Если тест упал и агент поправил тест вместо кода, остановитесь.

Если вы учите команду работать с агентами, смотрите, как человек шёл к результату, а не только на результат. Для этого подходят логи сессий, и с ними работает цикл «рекомендация – проверка по следующим логам». Похожую обратную связь можно получить и без логов: парная работа, ревью плана до начала реализации, разбор одной сессии на ретро. Логи удобны тем, что их не нужно специально организовывать: они уже есть.

За два потока Сергей добавил в курс то, что участники второго потока назвали одним из самых полезных инструментов: разбор того, как человек шёл к результату. Сергей, спасибо за оба потока!

Следующий поток AI-Driven Development первого уровня

Программа и запись