Читайте снизу вверх
Пропущенный фундамент проявляется позже как ненадёжность, слепое доверие агенту или неспособность отладить систему. Верхние уровни не чинят нижние — они умножают то, что уже есть, включая беспорядок.
Карта развития инженера, который применяет coding-агентов, строит собственные agent systems и разворачивает внутренние платформы для продуктовой команды. Не рейтинг человека и не список модных фреймворков — последовательность проверяемых инженерных возможностей. В карте намеренно нет названий моделей, версий и цен: они устаревают быстрее, чем способности.
Про то, куда движется разработка с AI: инструменты, подходы, разборы и практика. Там же выходят обновления этой карты.
Чат канала — @aiGeeksClub.
Выберите самый высокий уровень, для которого вам подходят все диагностические абзацы и вы можете показать большую часть доказательств. Необязательно закрывать каждую технологию: важна способность решать соответствующий класс задач.
Пропущенный фундамент проявляется позже как ненадёжность, слепое доверие агенту или неспособность отладить систему. Верхние уровни не чинят нижние — они умножают то, что уже есть, включая беспорядок.
Курс и просмотр документации не повышают уровень. Нужен работающий проект, эксперимент, trace — Связанная история одного полного запуска системы., benchmark или команда пользователей, которая вернулась во второй раз.
Развивайте ближайший уровень, а не пытайтесь одновременно освоить enterprise governance и основы tool call — Запрос модели к внешней функции: имя инструмента и аргументы. Исполняет его ваш код, а не модель.ing. После пятого уровня выбирайте ветку, а не следующий номер — и учтите, что ветка может вам не понадобиться вовсе.
Ваша пропускная способность упирается в коллег: агент поднял пять PR за ночь, но их ревьюит вручную человек с первого уровня — и выигрыш исчез. Поднимать команду выгоднее, чем поднимать себя.
Рост — это не линейная гонка по фреймворкам. Сильный профиль возникает на пересечении модели, контекста, измерений, надёжности, безопасности и продуктовой платформы. Это оси инженерной компетенции человека — они намеренно не совпадают с моделями организационных способностей команды вроде DORA AI Capabilities, где предмет измерения другой. Экономика прогона не вынесена в отдельную ось сознательно: она живёт внутри остальных, потому что стоимость — это следствие решений, а не самостоятельный навык. Оси не превращаются в уровни один к одному: безопасность, например, начинается уже на первом уровне как гигиена прав и опасных команд, а отдельной специализацией становится только в ветке «Системы».
Уровни 0–5 — общее ядро, его проходят все. После него выбирают одну из специализаций той же высоты: 6S · Systems или 6P · Platform. Заливка кружка показывает глубину внутри ядра: чем темнее, тем дальше от начала. Кольца рядом с уровнями считают собранные свидетельства, но не выносят вердикт о готовности: доказательства различаются по весу и всё равно требуют инженерного разбора.
AI для вас пока живёт в браузерном чате: вы задаёте контекст и ограничения, просите варианты, а результат переносите в рабочие инструменты вручную.
Граница с первым уровнем проходит не по качеству промптов, а по месту работы. Пока ответ путешествует через буфер обмена, нет diff, истории и безопасного отката; доступ к репозиторию сразу повышает цену ошибки.
Главная ловушка — принять уверенный тон за истинность или после пары ошибок отказаться от инструмента совсем. Переходите дальше, когда формулируете критерии готовности, проверяете результат до применения и понимаете, какие данные нельзя отправлять во внешний сервис.
Вы запускаете coding-agent в репозитории, поручаете ему небольшие изменения, читаете diff, запускаете проверки и умеете отменить неудачную правку. Агент стал инструментом с доступом к диску и shell, поэтому ответственность теперь важнее беглости диалога.
Фактический доступ к файлам, окружению, секретам и сети зависит от продукта, режима и разрешений. До запуска вы должны уметь ответить, что агент способен сломать; режим без подтверждений оправдан только внутри подходящей изоляции.
Сообщение «готово» не считается проверкой. Уровень подтверждает небольшой PR с понятным diff, результатами тестов и зафиксированными разрешениями. До следующего уровня не хватает повторяемого процесса: удачный прогон всё ещё сильно зависит от вашего ручного ведения.
Вы используете спецификации, переиспользуемые запросы, skills — Переиспользуемая инструкция, которую агент подгружает под класс задачи. и команды, логически разделяя анализ, план, реализацию, тестирование и review, даже если всё выполняет один агент.
Новая сессия не обязана помнить прошлые решения. Поэтому цикл «спланировать → делегировать → оценить» заканчивается фиксацией повторяемого вывода в инструкции проекта, тесте или skill — Переиспользуемая инструкция, которую агент подгружает под класс задачи.. Так разовая удача превращается в накопительный эффект.
Ловушка — документировать всё подряд. Корневые инструкции лучше держать коротким оглавлением; ориентир около 150 строк — авторская эвристика, важнее приоритеты и отсутствие противоречий. На этом уровне область ещё знакома и невелика; следующий начинается, когда задача перестаёт помещаться в один прогон, а качество уже нельзя оценивать только по ощущению.
Агенты стали основным рабочим инструментом: вы проводите до PR исследование незнакомого репозитория, спецификацию, многомодульные изменения, миграции, тесты и review. Отличие от предыдущего уровня — масштаб и срок жизни задачи, а не само наличие skills.
Backpressure — Автоматическая обратная связь — типы, тесты, линтеры, хуки, схемы, — по которой агент замечает и чинит ошибку без человека. замыкает работу в цикл: типы, тесты, линтеры, хуки и схемы возвращают ошибку агенту раньше человека. Без этой обратной связи рост автономии лишь ускоряет производство дефектов.
Вы задаёте результат, ограничения и checkpoints вместо хрупкого сценария из шагов; исполнителя и проверяющего разделяете там, где это снижает риск. Одновременно следите за размером PR, деградацией кодовой базы и стоимостью прогона. Следующий уровень начинается, когда вы можете вскрыть harness и объяснить путь от вызова модели до результата.
Вы способны написать прозрачный agent loop — Цикл: модель выбирает действие, вызывает инструмент, получает результат и решает следующий шаг. без фреймворка: отправить сообщения модели, описать инструменты, обработать tool call — Запрос модели к внешней функции: имя инструмента и аргументы. Исполняет его ваш код, а не модель., вернуть результат и провалидировать типизированный финальный ответ. Так вы переходите от использования чужого harness — Оболочка вокруг модели: файлы, shell, tools, permissions, контекст и правила выполнения. к созданию своего.
Практический навык — видеть границу между моделью и оболочкой. Сбой возможен в API, сети, инференсе или вашем коде; timeout, retry, cancellation и step limit — Жёсткий потолок числа шагов цикла: страховка от бесконечно работающего агента. ограничивают цикл, а явная сборка контекста сохраняет нужное состояние.
Ловушки — принять использование SDK за понимание механики или остановиться на happy path собственного рантайма. Для этого уровня достаточно прозрачного локального цикла; durable execution, полноценная наблюдаемость и доказанное качество появляются дальше.
Вы перестали улучшать агентов по ощущениям: есть фиксированный набор задач, baseline — Исходный вариант, с которым сравнивается новое решение., автоматические проверки и история результатов по версиям модели, prompt, инструментов и workflow. Вопрос «стало лучше?» получает измеримый ответ.
Контекст становится управляемой переменной: вы выбираете файлы и факты, учитываете их происхождение и границы доверия, применяете retrieval и compaction. Шумный контекст может вредить не меньше недостаточного, а история и описания инструментов расходуют окно быстрее, чем кажется.
Контекст и evals объединяет дисциплина эксперимента: одна гипотеза, повторные прогоны и учёт variance — Разброс результата между прогонами на одной и той же задаче. Без него улучшение неотличимо от шума.. Evals проверяют не только контекст, но и модель, инструменты, prompt, workflow и политики. Модель-судью калибруют по человеческой выборке; сильное доказательство уровня — эксперимент, после которого изменение пришлось откатить.
6S — одна из двух специализаций после ядра. Вы проектируете stateful workflow с явным состоянием, переходами, approvals и handoff — Передача задачи от одного агента другому вместе с явно описанным входом и выходом.; multi-agent используете только там, где у ролей есть разные входы, выходы или границы контекста.
Долгий процесс переживает падение воркера, timeout и повторную доставку события. Idempotency — Безопасный повтор операции не создаёт второй побочный эффект., checkpoints, retries, leases и fault injection — Намеренная поломка системы в тесте: timeout, crash, дубль события, невалидный ответ. доказывают восстановление без двойных коммитов и потерянных approvals.
Граница исполнения ограничивает файлы, сеть и секреты через изоляцию, минимальные credentials и политики. Безопасность — не backpressure — Автоматическая обратная связь — типы, тесты, линтеры, хуки, схемы, — по которой агент замечает и чинит ошибку без человека.: она уменьшает последствия ошибки или атаки, а не учит агента исправляться. Автономные background agents появляются только после наблюдаемости, feedback loops и изоляции; иначе масштабируется ущерб, а не производительность.
6P находится на той же высоте, что и 6S. Вы превращаете личные скрипты во внутренний продукт: есть golden path — Рекомендуемый и максимально простой путь выполнения типичной задачи., onboarding, поддерживаемые шаблоны, self-service и пользователи, которые возвращаются без сопровождения. Реализовывать весь runtime лично не обязательно, но вы отвечаете за требования, владельцев и проверяемые гарантии вместе с Systems-инженерами.
Специализация имеет смысл только при наличии команды. Вы измеряете влияние на доставку — lead time, человеческое участие, качество PR, стоимость, adoption — Повторное самостоятельное использование платформы целевой аудиторией в естественном рабочем цикле. и пропущенные дефекты, — а не число вызовов модели. Multi-tenancy, compliance, data residency и маршрутизация нужны лишь тогда, когда этого требуют масштаб и риск.
Главные ловушки — платформа для одного автора, установка вместо повторного использования и tokenmaxxing — Внутренние лидерборды по расходу токенов ради разгона adoption: расход становится KPI и перестаёт означать пользу.. Специализация подтверждена, когда эксплуатация проходит естественный рабочий цикл без зависимости от автора, пользователи возвращаются самостоятельно, а для сбоев известен путь эскалации.
Ralph, skills — Переиспользуемая инструкция, которую агент подгружает под класс задачи., LangGraph, Temporal и MCP — Model Context Protocol — стандарт подключения инструментов и источников контекста к AI-приложениям. находятся на разных слоях. Сильный инженер сначала определяет класс проблемы, а потом выбирает инструмент. Слои не совпадают с уровнями один к одному: один уровень может задевать несколько слоёв, а один слой — тянуться через всю лестницу.
Модель, сообщения, tool call — Запрос модели к внешней функции: имя инструмента и аргументы. Исполняет его ваш код, а не модель.ing, structured output — Ответ по заданной схеме; приложение валидирует структуру и отдельно проверяет смысловые ограничения.s, streaming, ретраи. Фундамент, который нужно понимать без фреймворка.
Claude Platform docsClaude Code, Codex, OpenCode: среда с файлами, shell, permissions, контекстом и циклом выполнения.
Claude Code docsSDD — Spec-driven development: спецификация с критериями приёмки пишется до кода и служит контрактом для агента., переиспользуемые skills — Переиспользуемая инструкция, которую агент подгружает под класс задачи., compounding engineering — Цикл «спланировать → делегировать → оценить → зафиксировать вывод», в котором каждый прогон улучшает следующие., Ralph-подобные циклы и правила организации разработки.
Agent SkillsГотовый agent loop — Цикл: модель выбирает действие, вызывает инструмент, получает результат и решает следующий шаг., инструменты, сессии, handoff — Передача задачи от одного агента другому вместе с явно описанным входом и выходом.s, guardrail — Проверка на входе или выходе, отсекающая недопустимые запросы и действия.s и tracing — Сбор таких историй: что вызывалось, сколько длилось и где сломалось.. Например, OpenAI Agents SDK или PydanticAI.
SDK overviewЯвное состояние и переходы: LangGraph, ADK, AutoGen Core или собственный state machine.
LangGraph overviewНадёжное продолжение после сбоев: Temporal, Restate, DBOS и сходные подходы.
Temporal docsRetrieval — Поиск и выбор релевантных данных перед вызовом модели., compaction — Сжатие длинной истории с сохранением критически важной информации., provenance — Происхождение данных: откуда факт взялся, кто его создал и как он изменялся., границы данных и передача контекста между этапами.
Context engineeringДатасеты, grader — Проверяющий: детерминированный (тест, схема, lint) или модель в роли судьи.s, trace — Связанная история одного полного запуска системы.s, метрики, регрессии и эксперименты, которые доказывают улучшение. Общий словарь имён — GenAI semantic conventions — Соглашение OpenTelemetry об именах спанов и атрибутов gen_ai.* для вызова модели, вызова инструмента и запуска агента..
Demystifying evalsТипы, тесты, линтеры, хуки, схемы и границы безопасности — всё, по чему агент понимает, что ошибся, без вас.
Agent backpressureSandbox — Изолированная среда с ограниченными файлами, сетью, процессами и секретами., секреты, сеть, permissions, применение политик и защита внешних действий.
OWASP Agentic Top 10Background agent — Агент, работающий асинхронно и без вашего присутствия в сессии.s, worktree — Отдельная рабочая копия репозитория, в которой агент правит код, не мешая другим.s, диспетчеризация и разделение исполнителя с проверяющим.
Ralph loopГде физически исполняется модель и живут ваши данные: облачный API, self-hosted или локальный инференс. «Открытые веса» и «исполняется у вас» — разные вещи; за пропускную способность отвечают vLLM и SGLang, а десктопные обёртки — за удобство на ноутбуке.
Локальные моделиGolden path — Рекомендуемый и максимально простой путь выполнения типичной задачи.s, onboarding, self-service, governance и измерение пользы для команды.
BackstageA2A — Agent2Agent — открытый протокол общения агентов между собой: карточка возможностей, жизненный цикл задачи, обмен результатами. и родственные протоколы: обнаружение агентов, жизненный цикл задачи, подписанная идентичность. Дополняет MCP — Model Context Protocol — стандарт подключения инструментов и источников контекста к AI-приложениям., а не конкурирует с ним: один про вызов инструментов, другой — про общение агентов. Категория «знать, что существует», а не «строить на этом сегодня».
A2A · спецификацияПрограмма предполагает вход с третьего уровня, закрывает ядро до пятого и создаёт первый доказательный проект в направлении выбранной специализации. Она намеренно строится вокруг артефактов: кода, экспериментов, отчётов и полевой проверки. Сроков здесь нет и не будет: блоки закрываются результатом, а не календарём. Ниже — отдельный минимальный чеклист для старта.
Напишите небольшой runtime без фреймворка: инструменты, structured output — Ответ по заданной схеме; приложение валидирует структуру и отдельно проверяет смысловые ограничения., step limit — Жёсткий потолок числа шагов цикла: страховка от бесконечно работающего агента., timeout, retry, cancellation и журнал действий.
Реализуйте один сценарий через собственный loop и один осмысленно выбранный runtime или Agent SDK. При необходимости добавьте третий вариант только для проверки конкретной гипотезы. Сравните состояние, resume, тестируемость и lock-in.
Соберите 10–20 репрезентативных задач, зафиксируйте baseline, добавьте детерминированные проверки и повторите ключевые варианты несколько раз. Расширяйте набор по найденным классам ошибок, а не ради круглого числа.
Постройте context selector и на готовом benchmark сравните весь репозиторий с выбранными файлами. Исследуйте compaction, provenance и prompt injection; меняйте по одной гипотезе и учитывайте качество, стоимость, задержку и variance.
Запустите один узкий сценарий на реальной задаче. Добавьте trace, явные разрешения, лимиты времени и шагов; воспроизведите timeout, невалидный ответ и отказ инструмента. Запишите ручные вмешательства и остановите эксперимент, если риск не оправдан.
Выберите направление. Для 6S укрепите один workflow: восстановление, наблюдаемость, границу исполнения и fault injection. Для 6P проведите репрезентативный пилот узкого golden path и измерьте повторное самостоятельное использование. В обоих случаях заранее зафиксируйте baseline, критерий успеха и естественный цикл наблюдения.
Это минимальный стартовый проект, а не сокращённая копия всей программы: механика, сравнение подходов, первые доказательства и одна проверка реальностью. Не пытайтесь пройти всю лестницу сразу — набор закрывает фундаментальный цикл ядра, а выбор ветки начинается уже после него. Если застряли на пункте, спросите в чате @aiGeeksClub — обычно кто-то это уже проходил.
Отметки сохраняются только в вашем браузере.
Эти правила полезны на любом уровне — от первого coding-агента до корпоративной платформы.
Критические решения, состояние, права и восстановление должны быть понятны вам, даже если код написал агент.
Сравнивайте варианты на фиксированных задачах. Без baseline — Исходный вариант, с которым сравнивается новое решение. и variance — Разброс результата между прогонами на одной и той же задаче. Без него улучшение неотличимо от шума. улучшение — это впечатление. Расход токенов измеряется легче всего, но сам по себе говорит о стоимости и активности, а не о созданной ценности.
Проверяйте timeout, падение, дубль события, невалидный вывод и prompt injection — Инструкция внутри недоверенных данных, пытающаяся изменить поведение агента., а не только happy path.
По возможности задавайте результат, ограничения и проверяемые checkpoints. Пошаговые инструкции оставляйте там, где порядок сам является требованием безопасности или процесса.
Повторяемый или существенный вывод превращайте в правило, тест или проверку. Разовые наблюдения не должны бесконечно раздувать инструкции.
Ценность появляется, когда система помогает доставить продукт и не создаёт больше работы, чем экономит.
Здесь собрано всё, что встречается в карточках уровней и слоях экосистемы, плюс несколько источников, которые не привязаны к одному уровню. Не читайте всё подряд: берите слой, на котором стоите сейчас, и закрепляйте материал маленьким проектом.
Разбор прогрессии от tab complete до автономных агентных команд. Часть идей этой карты выросла из спора с ней.
HABR · ПЕРЕВОД ↗Оригинал того же текста: compounding engineering, harness engineering, background agents.
BASSIM ELEDATH ↗Документация harness: права, инструкции проекта, субагенты и skills.
OFFICIAL DOCS ↗Терминальный агент: режимы утверждения, sandbox, exec для CI и автоматизации.
OFFICIAL DOCS ↗Открытый терминальный агент с выбором провайдера, plan/build-режимами и LSP.
OFFICIAL DOCS ↗Базовый текст: когда достаточно workflow, а когда нужен агент. Читать первым.
ANTHROPIC ↗Практики агентного кодинга: инструкции проекта, циклы правок, проверка результата.
ANTHROPIC ↗Двенадцать принципов надёжных LLM-приложений: владение промптом, контекстом и control flow.
OPEN SOURCE ↗Три уровня строгости SDD на разборе Kiro, Spec Kit и Tessl — и где метод ломается.
MARTIN FOWLER · B. BÖCKELER ↗Самый портируемый инструментарий SDD: specify → plan → tasks → implement.
OPEN SOURCE ↗Текст, популяризовавший цикл «план → делегирование → оценка → фиксация вывода».
EVERY ↗Как оформлять переиспользуемые инструкции, которые агент подгружает под класс задачи.
ANTHROPIC ↗Опыт внутреннего реестра на сотню скиллов: ревью, версии, бандлы под роли.
BLOCK ↗Проектирование инструментов: границы, именование, экономия контекста, отказоустойчивость.
ANTHROPIC ↗Среда, инструменты и обратная связь, которые позволяют агенту работать без вашего вмешательства.
OPENAI ↗Автоматические механизмы, по которым агент замечает и чинит свою ошибку сам.
LATENT PATTERNS ↗Агенты, инструменты, handoffs, guardrails, сессии и встроенный tracing.
OFFICIAL DOCS ↗Типизированные зависимости, выходы, валидация и eval-инструменты.
OFFICIAL DOCS ↗Состояние, персистентность, прерывания, human-in-the-loop и продолжение выполнения.
OFFICIAL DOCS ↗AgentChat для прототипов и event-driven Core для распределённых систем.
OFFICIAL DOCS ↗Разбор реальной мультиагентной системы: где она выигрывает и чем за это платит.
ANTHROPIC ↗Надёжные долгоживущие workflows, ретраи, таймеры и восстановление после сбоев.
OFFICIAL DOCS ↗Что ломается на горизонте многих контекстных окон и как это чинят на уровне harness.
ANTHROPIC ↗Контекст как ограниченный ресурс: отбор, компакция, заметки, границы доверия.
ANTHROPIC ↗Единые имена спанов и атрибутов gen_ai.* для вызовов модели, инструментов и запусков агента.
OPENTELEMETRY ↗Архитектура host / client / server, инструменты, ресурсы и промпты.
OFFICIAL DOCS ↗Крупнейший пересмотр протокола: stateless-ядро, расширения, задачи, ужесточение авторизации.
MCP BLOG ↗Протокол общения агентов между собой: карточки возможностей, задачи, подписанная идентичность.
LINUX FOUNDATION ↗Задачи, прогоны, graders и оценка полных траекторий агента.
ANTHROPIC ↗Eval sets, метрики траекторий, сравнение с эталоном и запуск из CI.
OFFICIAL DOCS ↗Ключевые угрозы автономных систем и отправная точка для threat model.
OWASP ↗Отравление инструментов, подмена после одобрения, проброс токенов и что с этим делать.
OWASP ↗Почему приватные данные, недоверенный контент и внешний канал вместе — архитектурная дыра.
SIMON WILLISON ↗Аргумент за то, чтобы агент, его код и ваши секреты жили в разных доменах доверия.
VERCEL ↗Как заменить бесконечные подтверждения реальной границей исполнения.
ANTHROPIC ↗Автономный цикл, перезапускающий агента с чистым контекстом, пока задача не закрыта.
GEOFFREY HUNTLEY ↗Облачные фоновые агенты: изолированное окружение на сессию, цена и что это даёт.
RAMP ↗Экспериментальная прямая координация нескольких агентов на одной кодовой базе.
CLAUDE CODE DOCS ↗Формат, в котором фиксируют выбор так, чтобы через полгода его можно было оспорить по существу.
OPEN RESOURCE ↗Каталог, шаблоны и golden paths внутренней платформы разработки.
OFFICIAL DOCS ↗Цепочка от внедрения к деньгам и почему возврат определяется системой вокруг инструмента.
DORA ↗Лидерборды по расходу токенов: зачем их заводят и почему это плохая метрика.
DORA ↗Термины сгруппированы по шести осям карты, поэтому глоссарий работает и как второй вход в неё. Правило простое: каждое подсвеченное в тексте слово имеет здесь запись.