Блог Hard&Soft Skills · AI-Driven Development · Level 1
Мы завершили второй поток курса AI-Driven Development первого уровня. Оба потока вёл Сергей Голубев, и вёл так, что за этот курс ему хочется сказать отдельное спасибо.
На втором потоке мы впервые сделали персональный отчёт о том, как участник работал с кодинг-агентом, – для каждого, кто сдал логи сессий. Участники сдавали домашние задания вместе с логами сессий, и по этим логам видно то, чего не видно по результату: как поставлена задача, был ли план, проверял ли человек сделанное, что он делал, когда агент предупреждал о риске.
Разборы по всем, кто сдал логи, показали, где разработчики растут, где проседают, какие ошибки повторяются и что люди унесли в свою работу. Если вы сами учитесь работать с агентами или учите этому команду, большую часть выводов можно проверить на своих сессиях.
Идея пришла с итоговой встречи первого потока. Один из участников сказал, что фидбэк по домашкам оценивает результат, а ему нужен разбор того, как он работал с агентом. Другой объяснил, почему сдал меньше домашек: подробное задание можно целиком отдать агенту, результат совпадёт с ожиданием, но понимания, контролируешь ли ты процесс, не появится.
Сергей подвёл итог той встречи так: код с агентом пишется быстро, а планирование до него и проверка после занимают основное время, и именно этому курс учил недостаточно. Ко второму потоку он переписал материалы и собрал разборы рабочих сессий.
Участник сдаёт домашку вместе с логами сессий своего агента. Перед разбором из логов вырезаются секреты и персональные данные.
Дальше работают два агента. Первый вытаскивает из лога дословные цитаты, относящиеся к восьми навыкам работы с агентом. Второй ставит по каждому навыку балл от 0 до 4, причём только под цитату. Если в логе модуля на навык не было материала, балл не ставится вовсе: в отчёте стоит «мало данных». Итог читает преподаватель и отправляет участнику персональные рекомендации.
Восемь навыков, по которым шла оценка, и что за каждым стоит:
По совокупности навыков работе присваивается уровень: пассажир, наивный, компетентный, уверенный оператор, оркестратор. Отдельно ловятся типовые ошибки и предупреждения агента о риске.
Схему замыкает обратная связь: рекомендация не заканчивается отправкой, по следующей порции логов того же участника видно, взял ли он её в работу. Так разбор превращается из оценки в цикл.
Логи сдали 15 участников из 27. За курс разобрана 421 сессия, больше 28 000 реплик человека и агента, 40 работ «участник × модуль», выдано 79 рекомендаций. В медианной работе 376 реплик диалога с агентом: типичная сдача – долгий диалог. Работали в разных инструментах – чаще всего в Claude Code, но также в Cursor, Codex CLI, OpenCode и GitHub Copilot, на моделях Claude, GPT, GLM и других. Разбор оценивает навыки независимо от инструмента.
Объём работы
Медианная работа – 376 реплик диалога с агентом
Медиана числа реплик человека и агента в логах одной работы, по модулям. В пятом и шестом модулях разобрано не больше пяти работ: их доли неустойчивы.
Инструменты
С чем работали участники
Агентные инструменты
Семейства моделей
Сколько участников работали с каждым инструментом и семейством моделей – по логам сессий.
Если сравнить первую половину курса со второй, картина выглядит как резкий рост: работ уровня «уверенный оператор» и выше стало 89% вместо 59%. Но средний балл по восьми навыкам между половинами курса не изменился.
Было → стало
Модули 2–3 (22 работы) и модули 4–6 (18 работ)
Сравниваются разные наборы работ: состав сдавших от модуля к модулю менялся.
Это объясняет одно правило оценки. Агент иногда предупреждает о риске, который переживёт сессию: для репозитория, данных или ключей. Если человек продолжает, не отреагировав, работа не может получить высокий уровень, как бы хорошо она ни была сделана в остальном. Во втором модуле так было в трёх работах из 14, в третьем – в двух из 8, в четвёртом – в одной из 8. В пятом и шестом модулях – ни одного случая. Во второй половине курса таких работ почти не было, и уровень поднялся именно за счёт этого.
Предупреждения о риске
Доля работ, где агент предупредил о риске, а человек продолжил
Риск, который переживёт сессию: репозиторий, данные, ключи. В пятом и шестом модулях разобрано не больше пяти работ: их доли неустойчивы.
Уровень определило то, что человек делает, когда агент предупреждает о риске. Пропущенное предупреждение может сломать что-то за пределами сессии – в репозитории, данных или ключах, – и хороший запрос этого уже не исправит.
В двух половинах курса разные наборы работ: состав сдавших от модуля к модулю менялся. А в пятом и шестом модулях разобрано не больше пяти работ, поэтому их доли неустойчивы.
На последнем замере средний балл группы 3,0 из 4, где 3 соответствует уверенному оператору. Выше всего оценены проверка результата (3,4) и постановка задачи (3,3). Ниже всего – обратимость (2,7) и решения за человеком (2,9).
Профиль группы
Средний балл по восьми навыкам на последнем замере, шкала 0–4
У каждого участника взят его последний разбор логов, по навыку усредняются те, у кого есть оценка.
Баллов ниже 2 за курс не было ни разу, а 90% всех оценок – тройки и четвёрки. Ни одна работа не оказалась ниже уровня «компетентный», и на последнем замере 9 из 15 участников работали как уверенные операторы или оркестраторы.
Итоговый уровень
Уровень работы с агентом по модулям
Шкала: пассажир → наивный → компетентный → уверенный оператор → оркестратор. Цифры в столбцах – число работ. В пятом и шестом модулях разобрано не больше пяти работ: их доли неустойчивы.
Есть навыки, где группа застряла на «уверенно» и не дошла до максимума. В калибровке доверия 70% оценок составляют тройки и только 14% четвёрки. Участники в целом понимают, где агенту можно верить, но тонко настроить это доверие под задачу получается редко. Похоже и с откатом: здесь самая большая доля двоек, 23%. Точку возврата перед рискованным шагом делают не все и не всегда.
Карта освоения
В 90% оценок – 3 или 4 балла из 4
Все 291 оценка группы за курс по каждому навыку. Баллов ниже 2 не было; где наблюдать было не на чем, балл не ставился.
Больше всего рекомендаций пришлось на решения за человеком (16 из 79) и на проверку результата (15). Дальше идут откат (11) и постановка задачи (10).
Точки роста
На какие навыки пришлись 79 рекомендаций
До повторной проверки по следующим логам дошли 49 рекомендаций. Четыре из них нельзя было оценить: в новых логах не было подходящей ситуации. Из оставшихся 45 в работу взяты 44, это 98%. Полностью выполнены 19, то есть 42%. Ещё 25 выполнены частично.
Обратная связь
Что стало с рекомендацией при первой проверке
По столбцам – модуль, в логах которого рекомендацию проверяли впервые. Проверок на модуль немного, доли неустойчивы.
Человек слышит рекомендацию и пробует. Но новая практика держится не с первого раза: где-то она уже есть, а где-то по старой памяти пропущена. Особенно это заметно на проверке результата: из восьми проверенных рекомендаций в работу взяты все, а полностью выполнены две. Проверять всё, что сделал агент, оказывается тяжелее, чем согласиться, что это нужно. Выборка здесь маленькая, но направление понятное.
Обратная связь по навыкам
Взяты в работу – почти везде, выполнены полностью – реже
Проверок на один навык от 2 до 8: доли на отдельных навыках неустойчивы.
В логах ловились типовые ошибки, и восемь из них встретились хотя бы дважды. Чаще всего:
Типовые ошибки
Ошибки, найденные хотя бы в двух работах
Считается один раз на работу: 32 из 40 находок за курс.
Ещё дважды встретился план, принятый без ревью.
На итоговой встрече потока участники рассказывали, что изменилось в их работе. Это самоотчёт, а не замер по логам, но он хорошо ложится на цифры выше:
Ни в одном рассказе нет «научился писать запросы». В трёх из пяти – план, отдельная среда под задачу и проверка после каждого шага, в двух других – смена инструмента и самого режима работы.
Если вы работаете с агентом каждый день, вот что мы по итогам разбора советуем проверить в своих сессиях:
Если вы учите команду работать с агентами, смотрите, как человек шёл к результату, а не только на результат. Для этого подходят логи сессий, и с ними работает цикл «рекомендация – проверка по следующим логам». Похожую обратную связь можно получить и без логов: парная работа, ревью плана до начала реализации, разбор одной сессии на ретро. Логи удобны тем, что их не нужно специально организовывать: они уже есть.
За два потока Сергей добавил в курс то, что участники второго потока назвали одним из самых полезных инструментов: разбор того, как человек шёл к результату. Сергей, спасибо за оба потока!
Следующий поток AI-Driven Development первого уровня
Программа и запись