AGENT ENGINEER ROADMAP @ai_for_devs
Публичная карта · ядро 0–5 · ветки 6S / 6P

AI-Native Platform& Agent Systems Engineer

Карта развития инженера, который применяет coding-агентов, строит собственные agent systems и разворачивает внутренние платформы для продуктовой команды. Не рейтинг человека и не список модных фреймворков — последовательность проверяемых инженерных возможностей. В карте намеренно нет названий моделей, версий и цен: они устаревают быстрее, чем способности.

Уровень определяется доказательствами, а не самоощущением. Курс, статья и просмотр документации уровень не повышают. Повышает работающий проект, эксперимент, benchmark или команда, которая вернулась к вашему инструменту второй раз.
0 · БРАУЗЕРНЫЙ ЧАТ6S / 6P · ДВЕ СПЕЦИАЛИЗАЦИИ
TELEGRAM

@ai_for_devs

Про то, куда движется разработка с AI: инструменты, подходы, разборы и практика. Там же выходят обновления этой карты.
Чат канала — @aiGeeksClub.

Как пользоваться картой

Четыре правила чтения

Выберите самый высокий уровень, для которого вам подходят все диагностические абзацы и вы можете показать большую часть доказательств. Необязательно закрывать каждую технологию: важна способность решать соответствующий класс задач.

ШАГ 01

Читайте снизу вверх

Пропущенный фундамент проявляется позже как ненадёжность, слепое доверие агенту или неспособность отладить систему. Верхние уровни не чинят нижние — они умножают то, что уже есть, включая беспорядок.

ШАГ 02

Ищите подтверждение

Курс и просмотр документации не повышают уровень. Нужен работающий проект, эксперимент, trace — Связанная история одного полного запуска системы., benchmark или команда пользователей, которая вернулась во второй раз.

ШАГ 03

Выберите один следующий скачок

Развивайте ближайший уровень, а не пытайтесь одновременно освоить enterprise governance и основы tool call — Запрос модели к внешней функции: имя инструмента и аргументы. Исполняет его ваш код, а не модель.ing. После пятого уровня выбирайте ветку, а не следующий номер — и учтите, что ветка может вам не понадобиться вовсе.

ШАГ 04

Считайте уровень команды, а не только свой

Ваша пропускная способность упирается в коллег: агент поднял пять PR за ночь, но их ревьюит вручную человек с первого уровня — и выигрыш исчез. Поднимать команду выгоднее, чем поднимать себя.

Навигационная карта

Шесть сил агентного инженера

Рост — это не линейная гонка по фреймворкам. Сильный профиль возникает на пересечении модели, контекста, измерений, надёжности, безопасности и продуктовой платформы. Это оси инженерной компетенции человека — они намеренно не совпадают с моделями организационных способностей команды вроде DORA AI Capabilities, где предмет измерения другой. Экономика прогона не вынесена в отдельную ось сознательно: она живёт внутри остальных, потому что стоимость — это следствие решений, а не самостоятельный навык. Оси не превращаются в уровни один к одному: безопасность, например, начинается уже на первом уровне как гигиена прав и опасных команд, а отдельной специализацией становится только в ветке «Системы».

MODEL& TOOLSCONTEXTDESIGNEVALS& DATARELIABLERUNTIMESECURITYBOUNDARYPLATFORMADOPTIONENGINEERINGOWNERSHIP
Прокачивайте связи, а не отдельные модные слова. Evals — Повторяемая проверка качества на фиксированном наборе задач. без наблюдаемости не объяснят, почему результат изменился. Оркестрация без безопасности лишь ускорит опасные действия. Хороший контекст без продуктовой задачи создаст красивую, но ненужную систему.
Лестница мастерства

Шесть уровней ядра и две специализации

Уровни 0–5 — общее ядро, его проходят все. После него выбирают одну из специализаций той же высоты: 6S · Systems или 6P · Platform. Заливка кружка показывает глубину внутри ядра: чем темнее, тем дальше от начала. Кольца рядом с уровнями считают собранные свидетельства, но не выносят вердикт о готовности: доказательства различаются по весу и всё равно требуют инженерного разбора.

РАЗВИЛКА — ДВЕ СПЕЦИАЛИЗАЦИИ ОДНОЙ ВЫСОТЫ
0
ЯДРО

AI-пользователь

От чата к проверяемому результату
#
Как понять, что это ваш уровень

AI для вас пока живёт в браузерном чате: вы задаёте контекст и ограничения, просите варианты, а результат переносите в рабочие инструменты вручную.

Граница с первым уровнем проходит не по качеству промптов, а по месту работы. Пока ответ путешествует через буфер обмена, нет diff, истории и безопасного отката; доступ к репозиторию сразу повышает цену ошибки.

Главная ловушка — принять уверенный тон за истинность или после пары ошибок отказаться от инструмента совсем. Переходите дальше, когда формулируете критерии готовности, проверяете результат до применения и понимаете, какие данные нельзя отправлять во внешний сервис.

Что понимать

  • Что такое LLM — Большая языковая модель: система, которая предсказывает продолжение текста и умеет работать с инструкциями, кодом и вызовами инструментов., context window — Объём текста, который модель видит за один вызов. Всё, что не поместилось, для неё не существует. и галлюцинации
  • System и user instructions простыми словами
  • Базовая приватность: какие данные нельзя отправлять в чат
  • Файлы, URL и простые структурированные данные; Git, shell и HTTP/JSON становятся обязательными со следующего уровня
  • Как проверить факт, код и источник

Что практиковать

  • Создать первый репозиторий с README
  • Сделать небольшой скрипт или страницу с помощью AI и проверить результат вручную
  • Описать задачу через цель, ограничения и примеры
  • Собрать личный чек-лист проверки AI-ответов

Чем доказать уровень

1
ЯДРО

Оператор coding-агентов

Claude Code · Codex CLI · OpenCode
#
Как понять, что это ваш уровень

Вы запускаете coding-agent в репозитории, поручаете ему небольшие изменения, читаете diff, запускаете проверки и умеете отменить неудачную правку. Агент стал инструментом с доступом к диску и shell, поэтому ответственность теперь важнее беглости диалога.

Фактический доступ к файлам, окружению, секретам и сети зависит от продукта, режима и разрешений. До запуска вы должны уметь ответить, что агент способен сломать; режим без подтверждений оправдан только внутри подходящей изоляции.

Сообщение «готово» не считается проверкой. Уровень подтверждает небольшой PR с понятным diff, результатами тестов и зафиксированными разрешениями. До следующего уровня не хватает повторяемого процесса: удачный прогон всё ещё сильно зависит от вашего ручного ведения.

Что понимать

  • Файловые и shell-инструменты coding-agent
  • Git diff, ветки, коммиты и pull requests
  • Разрешения, опасные команды и базовая изоляция запуска (sandbox — Изолированная среда с ограниченными файлами, сетью, процессами и секретами., default deny — Правило «запрещено всё, что не разрешено явно», вместо полного доступа по умолчанию.)
  • Repository instructions: AGENTS.md — Открытый формат инструкций для агентов в корне репозитория; развивается под Agentic AI Foundation (Linux Foundation). как предсказуемая общая точка входа; tool-specific файлы оставляйте только там, где действительно нужны отдельные настройки
  • Plan mode для неоднозначных и рискованных задач; мелкие очевидные правки не обязаны проходить отдельную фазу планирования

Что практиковать

  • Сделать 5 небольших задач в реальных репозиториях
  • Настроить инструкции проекта
  • Запустить агента с урезанными правами и понять, что именно он может сломать
  • Собрать безопасный путь: задача → diff → тест → PR

Чем доказать уровень

2
ЯДРО

AI Boosted Developer

SDD — Spec-driven development: спецификация с критериями приёмки пишется до кода и служит контрактом для агента. · skill — Переиспользуемая инструкция, которую агент подгружает под класс задачи. · compounding engineering — Цикл «спланировать → делегировать → оценить → зафиксировать вывод», в котором каждый прогон улучшает следующие.
#
Как понять, что это ваш уровень

Вы используете спецификации, переиспользуемые запросы, skills — Переиспользуемая инструкция, которую агент подгружает под класс задачи. и команды, логически разделяя анализ, план, реализацию, тестирование и review, даже если всё выполняет один агент.

Новая сессия не обязана помнить прошлые решения. Поэтому цикл «спланировать → делегировать → оценить» заканчивается фиксацией повторяемого вывода в инструкции проекта, тесте или skill — Переиспользуемая инструкция, которую агент подгружает под класс задачи.. Так разовая удача превращается в накопительный эффект.

Ловушка — документировать всё подряд. Корневые инструкции лучше держать коротким оглавлением; ориентир около 150 строк — авторская эвристика, важнее приоритеты и отсутствие противоречий. На этом уровне область ещё знакома и невелика; следующий начинается, когда задача перестаёт помещаться в один прогон, а качество уже нельзя оценивать только по ощущению.

Что понимать

  • Spec-driven development — Spec-driven development: спецификация с критериями приёмки пишется до кода и служит контрактом для агента. и критерии приёмки; EARS — Easy Approach to Requirements Syntax — шаблон формулировки требований, который агент и человек читают одинаково. как нотация, которую агент и человек читают одинаково
  • Уровни строгости SDD — Авторская шкала: spec-first — спека даёт старт; spec-anchored — живёт вместе с фичей; spec-as-source — код генерируется из неё. — авторская шкала для разговора о строгости процесса: spec-first, spec-anchored, spec-as-source. Это не отраслевой стандарт, а способ не смешивать разные практики под одним названием
  • Инструменты: GitHub Spec Kit, AWS Kiro, OpenSpec, Tessl — и честная граница применимости: на мелкой правке спецификация дороже задачи, а генератор спек легко превращается в поток однообразного markdown на ревью
  • AGENTS.md — Открытый формат инструкций для агентов в корне репозитория; развивается под Agentic AI Foundation (Linux Foundation). — контекст проекта, skill — Переиспользуемая инструкция, которую агент подгружает под класс задачи. — процедура под класс задачи. Разные вещи: не дублируйте одно в другом
  • Skills — Переиспользуемая инструкция, которую агент подгружает под класс задачи. и повторяемые инструкции
  • Compounding engineering — Цикл «спланировать → делегировать → оценить → зафиксировать вывод», в котором каждый прогон улучшает следующие.: план → делегирование → оценка → фиксация вывода
  • Инструкции проекта как оглавление, а не как свалка правил
  • Definition of Done, review и CI
  • Когда простой single-agent лучше сложной оркестрации

Что практиковать

  • Собрать workflow: анализ → план → код → тест → review
  • Создать 2–4 специализированных skill — Переиспользуемая инструкция, которую агент подгружает под класс задачи. и переиспользовать их на разных типах задач
  • После каждой неудачи дописывать вывод в инструкции — и раз в месяц вычищать устаревшее
  • Положить промпты, спецификации и skills — Переиспользуемая инструкция, которую агент подгружает под класс задачи. в git и проводить их через ревью наравне с кодом
  • Удалить из процесса этап, который не окупается

Чем доказать уровень

3
ЯДРО

Agentic Software Engineer

Многомодульные фичи · экономика · командный код
#
Как понять, что это ваш уровень

Агенты стали основным рабочим инструментом: вы проводите до PR исследование незнакомого репозитория, спецификацию, многомодульные изменения, миграции, тесты и review. Отличие от предыдущего уровня — масштаб и срок жизни задачи, а не само наличие skills.

Backpressure — Автоматическая обратная связь — типы, тесты, линтеры, хуки, схемы, — по которой агент замечает и чинит ошибку без человека. замыкает работу в цикл: типы, тесты, линтеры, хуки и схемы возвращают ошибку агенту раньше человека. Без этой обратной связи рост автономии лишь ускоряет производство дефектов.

Вы задаёте результат, ограничения и checkpoints вместо хрупкого сценария из шагов; исполнителя и проверяющего разделяете там, где это снижает риск. Одновременно следите за размером PR, деградацией кодовой базы и стоимостью прогона. Следующий уровень начинается, когда вы можете вскрыть harness и объяснить путь от вызова модели до результата.

АГЕНТделает изменениеИЗМЕНЕНИЕdiff, коммит, PRПРОВЕРКИтипы · тесты · линт · хукиЧЕЛОВЕКсмотрит, что прошлоНЕ ПРОШЛО → АГЕНТ ЧИНИТ САМ, ВЫ ЭТОГО НЕ ВИДИТЕсюда переезжаетузкое место
Уровень 3 · автоматика ловит ошибку раньше человека

Что понимать

  • Разделение анализа, проектирования, реализации и review на проверяемые этапы; разные агенты для этих ролей нужны только при реальной пользе. Каждый этап передаёт следующему проверяемый upstream artifact — Артефакт предыдущего этапа, который передаётся следующему.
  • Backpressure — Автоматическая обратная связь — типы, тесты, линтеры, хуки, схемы, — по которой агент замечает и чинит ошибку без человека.: типы, тесты, линтеры и хуки как обратная связь для агента. Идея не новая — быстрые петли обратной связи, CI, TDD, poka-yoke; изменился только адресат сигнала
  • Ограничения вместо пошаговых инструкций
  • Разделение исполнителя и проверяющего; разные модели под разные задачи
  • Gate — Проверяемое условие, без которого процесс не переходит дальше., human-in-the-loop — Точка, где процесс останавливается и ждёт решения человека. и режимы one-shot / manual / autonomous
  • Экономика прогона: token budget — Ограничение расхода модели; его рассматривают вместе с бюджетом времени, шагов и денег., prompt caching — Повторное использование обработанного префикса, которое при поддержке провайдером может снизить задержку и стоимость., выбор модели
  • Энтропия кодовой базы при высокой скорости генерации
  • Ревью сгенерированного diff, который вы не писали: сигналы риска, порядок чтения и дробление изменений до ревьюируемого размера
  • Явная договорённость команды: что попадает в PR и кто отвечает за сгенерированный код после мержа

Что практиковать

  • Провести 10+ end-to-end задач в многомодульном репозитории
  • Довести автоматические проверки до состояния, когда агент чинит себя сам в большинстве случаев
  • Прогнать один и тот же PR через отдельный ревьюер-инстанс и сравнить с самооценкой исполнителя
  • Фиксировать вмешательства, сбои и стоимость каждого прогона
  • Отрефакторить область, которую агент успел «размазать»

Чем доказать уровень

4
ЯДРО

Harness Engineer

Model API · tools · structured output — Ответ по заданной схеме; приложение валидирует структуру и отдельно проверяет смысловые ограничения.
#
Как понять, что это ваш уровень

Вы способны написать прозрачный agent loop — Цикл: модель выбирает действие, вызывает инструмент, получает результат и решает следующий шаг. без фреймворка: отправить сообщения модели, описать инструменты, обработать tool call — Запрос модели к внешней функции: имя инструмента и аргументы. Исполняет его ваш код, а не модель., вернуть результат и провалидировать типизированный финальный ответ. Так вы переходите от использования чужого harness — Оболочка вокруг модели: файлы, shell, tools, permissions, контекст и правила выполнения. к созданию своего.

Практический навык — видеть границу между моделью и оболочкой. Сбой возможен в API, сети, инференсе или вашем коде; timeout, retry, cancellation и step limit — Жёсткий потолок числа шагов цикла: страховка от бесконечно работающего агента. ограничивают цикл, а явная сборка контекста сохраняет нужное состояние.

Ловушки — принять использование SDK за понимание механики или остановиться на happy path собственного рантайма. Для этого уровня достаточно прозрачного локального цикла; durable execution, полноценная наблюдаемость и доказанное качество появляются дальше.

STEP LIMIT · TIMEOUT · CANCELограничиваем цикл, наблюдаем все слоиМОДЕЛЬвыбирает действиеtool callВАШ КОДисполняет вызовSTRUCTURED OUTPUTтипизированный финалРЕЗУЛЬТАТ → СЛЕДУЮЩАЯ ИТЕРАЦИЯ
Уровень 4 · цикл, который вы написали сами

Что понимать

  • Model API, tool call — Запрос модели к внешней функции: имя инструмента и аргументы. Исполняет его ваш код, а не модель.ing и streaming
  • JSON Schema и structured output — Ответ по заданной схеме; приложение валидирует структуру и отдельно проверяет смысловые ограничения.s
  • Цикл model → tool → result → model
  • Timeout, retry, cancellation и step limit — Жёсткий потолок числа шагов цикла: страховка от бесконечно работающего агента.
  • Harness — Оболочка вокруг модели: файлы, shell, tools, permissions, контекст и правила выполнения. как отдельный объект проектирования, а не как обёртка
  • Стоимость и латентность одного шага: за что именно вы платите на каждой итерации
  • Чем MCP — Model Context Protocol — стандарт подключения инструментов и источников контекста к AI-приложениям. и описания его инструментов влияют на размер контекста, стоимость и задержку; сравнивайте конкретные реализации и учитывайте кэширование, а не приписывайте накладные расходы самому протоколу

Что практиковать

  • Написать прозрачный agent loop — Цикл: модель выбирает действие, вызывает инструмент, получает результат и решает следующий шаг. без фреймворка
  • Добавить 3 ограниченных инструмента и описать их так, чтобы модель не путалась
  • Покрыть парсер и переходы состояний тестами
  • Замерить стоимость и время прогона, найти главный источник расходов и доказать полезное улучшение относительно baseline
  • Повторить тот же сценарий на готовом Agent SDK и сравнить, что вы потеряли и что выиграли

Чем доказать уровень

5
ЯДРО

Measured Agent Engineer

Контекст как гипотеза · evals как способ принять решение
#
Как понять, что это ваш уровень

Вы перестали улучшать агентов по ощущениям: есть фиксированный набор задач, baseline — Исходный вариант, с которым сравнивается новое решение., автоматические проверки и история результатов по версиям модели, prompt, инструментов и workflow. Вопрос «стало лучше?» получает измеримый ответ.

Контекст становится управляемой переменной: вы выбираете файлы и факты, учитываете их происхождение и границы доверия, применяете retrieval и compaction. Шумный контекст может вредить не меньше недостаточного, а история и описания инструментов расходуют окно быстрее, чем кажется.

Контекст и evals объединяет дисциплина эксперимента: одна гипотеза, повторные прогоны и учёт variance — Разброс результата между прогонами на одной и той же задаче. Без него улучшение неотличимо от шума.. Evals проверяют не только контекст, но и модель, инструменты, prompt, workflow и политики. Модель-судью калибруют по человеческой выборке; сильное доказательство уровня — эксперимент, после которого изменение пришлось откатить.

Что понимать

  • Context engineering — Проектирование того, какие данные получает модель, в каком объёме и с какими границами доверия. как отдельная дисциплина: context selection, retrieval — Поиск и выбор релевантных данных перед вызовом модели. и compaction — Сжатие длинной истории с сохранением критически важной информации.
  • Provenance — Происхождение данных: откуда факт взялся, кто его создал и как он изменялся. — происхождение данных и границы доверия
  • Что съедает контекст: описания инструментов, история, тяжёлые модальности
  • Regression suite — Набор задач, который прогоняют перед каждым релизом, чтобы поймать деградацию. как инструмент миграции: смена модели или поставщика проверяется прогоном, а не спринтом
  • Dataset, baseline — Исходный вариант, с которым сравнивается новое решение. и regression suite — Набор задач, который прогоняют перед каждым релизом, чтобы поймать деградацию.
  • Детерминированные grader — Проверяющий: детерминированный (тест, схема, lint) или модель в роли судьи.s и LLM-as-a-judge — Оценка результата другой моделью по заданной рубрике. Дешевле человека, но требует собственной калибровки.
  • Почему RAG — Retrieval-Augmented Generation: нужные данные ищут заранее и кладут в контекст. Способ подать контекст, а не отдельная ступень зрелости. здесь не отдельный уровень: это один из способов подать контекст

Что практиковать

  • Начать с 10–20 репрезентативных задач своей кодовой базы и расширять набор по найденным классам ошибок; публичный leaderboard не заменяет проверку на вашей нагрузке
  • Прогнать свой benchmark на новой модели и принять решение по данным, а не по ощущению от релиза
  • Если рассматриваете multi-agent, сравнить его с более простым single-agent на одном наборе и учесть стоимость координации
  • Сохранять trajectory — Полная последовательность действий агента: сообщения, tools, ошибки и результаты. каждого прогона, а не только финальный ответ
  • Провести слепое парное сравнение и ablation — Эксперимент, где один компонент удаляют, чтобы проверить его реальную пользу.
  • Прогнать каждый вариант несколько раз и посчитать variance — Разброс результата между прогонами на одной и той же задаче. Без него улучшение неотличимо от шума.
  • Замерить, что даёт больше: лучший retrieval — Поиск и выбор релевантных данных перед вызовом модели. или более узкий контекст

Чем доказать уровень

6S
СПЕЦИАЛИЗАЦИЯ · 6S

Agent Systems Engineer

Оркестрация · надёжность · граница исполнения · автономность
#
Как понять, что это ваша специализация

6S — одна из двух специализаций после ядра. Вы проектируете stateful workflow с явным состоянием, переходами, approvals и handoff — Передача задачи от одного агента другому вместе с явно описанным входом и выходом.; multi-agent используете только там, где у ролей есть разные входы, выходы или границы контекста.

Долгий процесс переживает падение воркера, timeout и повторную доставку события. Idempotency — Безопасный повтор операции не создаёт второй побочный эффект., checkpoints, retries, leases и fault injection — Намеренная поломка системы в тесте: timeout, crash, дубль события, невалидный ответ. доказывают восстановление без двойных коммитов и потерянных approvals.

Граница исполнения ограничивает файлы, сеть и секреты через изоляцию, минимальные credentials и политики. Безопасность — не backpressure — Автоматическая обратная связь — типы, тесты, линтеры, хуки, схемы, — по которой агент замечает и чинит ошибку без человека.: она уменьшает последствия ошибки или атаки, а не учит агента исправляться. Автономные background agents появляются только после наблюдаемости, feedback loops и изоляции; иначе масштабируется ущерб, а не производительность.

ОДНОРАЗОВОЕ ОКРУЖЕНИЕАГЕНТшаги и решенияWORKTREEсвоя копия кодаМИНИМАЛЬНЫЕ ПРАВАсвои креды, свой identity, свой аудитDEFAULT DENYПРОД · СЕТЬ · СЕКРЕТЫнарушение политикизавершает запускполитика ограничивает радиус поражения
Ветка 6S · граница исполнения, а не бесконечные подтверждения

Что понимать

  • State machines, графы и event-driven оркестрация
  • Manager, router, handoff — Передача задачи от одного агента другому вместе с явно описанным входом и выходом., fan-out, evaluator loop
  • Границы гарантий популярных agent frameworks
  • Durable execution — Исполнение, сохраняющее прогресс и продолжающееся после сбоя.: Temporal, Restate, DBOS или аналогичные идеи
  • Очереди, lease — Временная аренда задачи одним воркером, чтобы её не взял второй.s, backoff и dead-letter queue — Отстойник для событий, которые не удалось обработать после всех попыток.; восстановление побочных эффектов
  • Tracing — Сбор таких историй: что вызывалось, сколько длилось и где сломалось., метрики, логи и replay
  • GenAI semantic conventions — Соглашение OpenTelemetry об именах спанов и атрибутов gen_ai.* для вызова модели, вызова инструмента и запуска агента.: единый словарь имён вместо того, чтобы каждый фреймворк называл одно и то же по-своему. При внедрении фиксируйте версию и следите за отдельным репозиторием GenAI conventions: схема продолжает меняться
  • Threat modeling, sandbox — Изолированная среда с ограниченными файлами, сетью, процессами и секретами., RBAC — Разграничение доступа по ролям: кто и что имеет право делать., одноразовые секреты, prompt injection — Инструкция внутри недоверенных данных, пытающаяся изменить поведение агента.
  • MCP-сервер как поверхность атаки: отравленные описания инструментов, подмена поведения после одобрения, сквозной проброс токенов, доверие к чужому серверу
  • Идентичность агента — Отдельный или делегированный субъект: от чьего имени действует агент, с какими правами и как это попадает в аудит.: короткоживущие креды, делегированные полномочия и пер-агентный аудит вместо общего сервисного пользователя на всех
  • Опциональная специализация · inference infrastructure: локальный и self-hosted инференс, когда данные не должны покидать периметр. «Открытые веса» и «исполняется у вас» — разные вещи, а за пропускную способность отвечают vLLM или SGLang, а не десктопная обёртка
  • Ralph-подобные циклы: Ralph loop — Автономный цикл, который перезапускает агента с чистым контекстом, пока задача не закрыта. и его родня — перезапуск с чистым контекстом как способ не тащить мусор предыдущей итерации
  • Background agent — Агент, работающий асинхронно и без вашего присутствия в сессии.s, worktree — Отдельная рабочая копия репозитория, в которой агент правит код, не мешая другим.s и роль orchestrator — Агент или процесс, который раздаёт задачи другим агентам и собирает результат.а
  • Опциональная специализация · supply chain: лицензии на сгенерированный код и происхождение зависимостей

Что практиковать

  • Реализовать один workflow в двух осмысленно выбранных стеках и написать ADR — Architecture Decision Record: короткая запись вариантов, решения и причин выбора. с осознанным выбором
  • Убивать воркер посередине шага и повторять события
  • Построить дашборд запуска и runbook
  • Создать строгий execution profile и провести red-team набор атак
  • Запустить автономный цикл на реальной задаче и записать, где пришлось вмешаться
  • Если приватность или экономика этого требуют, собрать контур с локальной моделью и сравнить его с облачным по качеству и стоимости

Чем доказать специализацию

6P
СПЕЦИАЛИЗАЦИЯ · 6P

Agent Platform Lead

Внутренний продукт · внедрение · масштаб организации
#
Как понять, что это ваша специализация

6P находится на той же высоте, что и 6S. Вы превращаете личные скрипты во внутренний продукт: есть golden path — Рекомендуемый и максимально простой путь выполнения типичной задачи., onboarding, поддерживаемые шаблоны, self-service и пользователи, которые возвращаются без сопровождения. Реализовывать весь runtime лично не обязательно, но вы отвечаете за требования, владельцев и проверяемые гарантии вместе с Systems-инженерами.

Специализация имеет смысл только при наличии команды. Вы измеряете влияние на доставку — lead time, человеческое участие, качество PR, стоимость, adoption — Повторное самостоятельное использование платформы целевой аудиторией в естественном рабочем цикле. и пропущенные дефекты, — а не число вызовов модели. Multi-tenancy, compliance, data residency и маршрутизация нужны лишь тогда, когда этого требуют масштаб и риск.

Главные ловушки — платформа для одного автора, установка вместо повторного использования и tokenmaxxing — Внутренние лидерборды по расходу токенов ради разгона adoption: расход становится KPI и перестаёт означать пользу.. Специализация подтверждена, когда эксплуатация проходит естественный рабочий цикл без зависимости от автора, пользователи возвращаются самостоятельно, а для сбоев известен путь эскалации.

Что понимать

  • Платформа как продукт и developer experience
  • Golden path — Рекомендуемый и максимально простой путь выполнения типичной задачи.s, self-service и governance
  • Мультиплеер-эффект: пропускная способность команды как общий потолок
  • Метрики adoption — Повторное самостоятельное использование платформы целевой аудиторией в естественном рабочем цикле., SLO — Целевой уровень сервиса, заданный метрикой и временным окном. и модель поддержки
  • Build vs buy — Решение, что строить самим, а что взять готовым, принятое по данным, а не по вкусу. и vendor lock-in
  • Общий реестр skills — Переиспользуемая инструкция, которую агент подгружает под класс задачи.: версии, ревью и владельцы
  • Multi-tenant изоляция, маршрутизация моделей и управление стоимостью
  • Golden path для ревью агентских изменений: общий чеклист, автоматика до человека, договорённость о размере PR
  • Compliance, data residency и реакция на инциденты. Сроки регуляторных обязательств двигаются — сверяйтесь с первоисточником, а не с прошлогодним постом

Что практиковать

  • Запустить пилот на репрезентативной части целевой аудитории — например, на 3–10 разработчиках — начав с себя и team lead
  • Создать onboarding и каталог workflow
  • Собирать продуктовые и надёжностные метрики
  • Вынести общие skills — Переиспользуемая инструкция, которую агент подгружает под класс задачи. в реестр с ревью и историей версий
  • Стандартизировать evals — Повторяемая проверка качества на фиксированном наборе задач. и доказательства между командами

Чем доказать специализацию

Карта экосистемы

Не учите инструменты одной плоской кучей

Ralph, skills — Переиспользуемая инструкция, которую агент подгружает под класс задачи., LangGraph, Temporal и MCP — Model Context Protocol — стандарт подключения инструментов и источников контекста к AI-приложениям. находятся на разных слоях. Сильный инженер сначала определяет класс проблемы, а потом выбирает инструмент. Слои не совпадают с уровнями один к одному: один уровень может задевать несколько слоёв, а один слой — тянуться через всю лестницу.

01

Model API

Модель, сообщения, tool call — Запрос модели к внешней функции: имя инструмента и аргументы. Исполняет его ваш код, а не модель.ing, structured output — Ответ по заданной схеме; приложение валидирует структуру и отдельно проверяет смысловые ограничения.s, streaming, ретраи. Фундамент, который нужно понимать без фреймворка.

Claude Platform docs
02

Coding-agent harness — Оболочка вокруг модели: файлы, shell, tools, permissions, контекст и правила выполнения.

Claude Code, Codex, OpenCode: среда с файлами, shell, permissions, контекстом и циклом выполнения.

Claude Code docs
03

Skills & methodology

SDD — Spec-driven development: спецификация с критериями приёмки пишется до кода и служит контрактом для агента., переиспользуемые skills — Переиспользуемая инструкция, которую агент подгружает под класс задачи., compounding engineering — Цикл «спланировать → делегировать → оценить → зафиксировать вывод», в котором каждый прогон улучшает следующие., Ralph-подобные циклы и правила организации разработки.

Agent Skills
04

Agent SDK

Готовый agent loop — Цикл: модель выбирает действие, вызывает инструмент, получает результат и решает следующий шаг., инструменты, сессии, handoff — Передача задачи от одного агента другому вместе с явно описанным входом и выходом.s, guardrail — Проверка на входе или выходе, отсекающая недопустимые запросы и действия.s и tracing — Сбор таких историй: что вызывалось, сколько длилось и где сломалось.. Например, OpenAI Agents SDK или PydanticAI.

SDK overview
05

Workflow runtime

Явное состояние и переходы: LangGraph, ADK, AutoGen Core или собственный state machine.

LangGraph overview
06

Durable execution — Исполнение, сохраняющее прогресс и продолжающееся после сбоя.

Надёжное продолжение после сбоев: Temporal, Restate, DBOS и сходные подходы.

Temporal docs
07

Context & memory

Retrieval — Поиск и выбор релевантных данных перед вызовом модели., compaction — Сжатие длинной истории с сохранением критически важной информации., provenance — Происхождение данных: откуда факт взялся, кто его создал и как он изменялся., границы данных и передача контекста между этапами.

Context engineering
08

Evals — Повторяемая проверка качества на фиксированном наборе задач. & observability

Датасеты, grader — Проверяющий: детерминированный (тест, схема, lint) или модель в роли судьи.s, trace — Связанная история одного полного запуска системы.s, метрики, регрессии и эксперименты, которые доказывают улучшение. Общий словарь имён — GenAI semantic conventions — Соглашение OpenTelemetry об именах спанов и атрибутов gen_ai.* для вызова модели, вызова инструмента и запуска агента..

Demystifying evals
09

Backpressure — Автоматическая обратная связь — типы, тесты, линтеры, хуки, схемы, — по которой агент замечает и чинит ошибку без человека. & feedback loops

Типы, тесты, линтеры, хуки, схемы и границы безопасности — всё, по чему агент понимает, что ошибся, без вас.

Agent backpressure
10

Security boundary

Sandbox — Изолированная среда с ограниченными файлами, сетью, процессами и секретами., секреты, сеть, permissions, применение политик и защита внешних действий.

OWASP Agentic Top 10
11

Автономность и оркестрация

Background agent — Агент, работающий асинхронно и без вашего присутствия в сессии.s, worktree — Отдельная рабочая копия репозитория, в которой агент правит код, не мешая другим.s, диспетчеризация и разделение исполнителя с проверяющим.

Ralph loop
12

Инференс и приватность

Где физически исполняется модель и живут ваши данные: облачный API, self-hosted или локальный инференс. «Открытые веса» и «исполняется у вас» — разные вещи; за пропускную способность отвечают vLLM и SGLang, а десктопные обёртки — за удобство на ноутбуке.

Локальные модели
13

Internal platform

Golden path — Рекомендуемый и максимально простой путь выполнения типичной задачи.s, onboarding, self-service, governance и измерение пользы для команды.

Backstage
14

Межагентное взаимодействие

A2A — Agent2Agent — открытый протокол общения агентов между собой: карточка возможностей, жизненный цикл задачи, обмен результатами. и родственные протоколы: обнаружение агентов, жизненный цикл задачи, подписанная идентичность. Дополняет MCP — Model Context Protocol — стандарт подключения инструментов и источников контекста к AI-приложениям., а не конкурирует с ним: один про вызов инструментов, другой — про общение агентов. Категория «знать, что существует», а не «строить на этом сегодня».

A2A · спецификация
Практический путь

Шесть блоков системного роста

Программа предполагает вход с третьего уровня, закрывает ядро до пятого и создаёт первый доказательный проект в направлении выбранной специализации. Она намеренно строится вокруг артефактов: кода, экспериментов, отчётов и полевой проверки. Сроков здесь нет и не будет: блоки закрываются результатом, а не календарём. Ниже — отдельный минимальный чеклист для старта.

1
MODEL API

Собственный agent loop — Цикл: модель выбирает действие, вызывает инструмент, получает результат и решает следующий шаг.

Напишите небольшой runtime без фреймворка: инструменты, structured output — Ответ по заданной схеме; приложение валидирует структуру и отдельно проверяет смысловые ограничения., step limit — Жёсткий потолок числа шагов цикла: страховка от бесконечно работающего агента., timeout, retry, cancellation и журнал действий.

РЕЗУЛЬТАТПрозрачный agent loop — Цикл: модель выбирает действие, вызывает инструмент, получает результат и решает следующий шаг., который вы способны объяснить построчно.
2
FRAMEWORKS

Сравнение подходов

Реализуйте один сценарий через собственный loop и один осмысленно выбранный runtime или Agent SDK. При необходимости добавьте третий вариант только для проверки конкретной гипотезы. Сравните состояние, resume, тестируемость и lock-in.

РЕЗУЛЬТАТСравнительный отчёт и ADR — Architecture Decision Record: короткая запись вариантов, решения и причин выбора..
3
EVAL FOUNDATIONS

Минимальный benchmark

Соберите 10–20 репрезентативных задач, зафиксируйте baseline, добавьте детерминированные проверки и повторите ключевые варианты несколько раз. Расширяйте набор по найденным классам ошибок, а не ради круглого числа.

РЕЗУЛЬТАТМинимальная regression suite, на которой можно проверять следующие гипотезы.
4
CONTEXT EXPERIMENT

Контекст и память

Постройте context selector и на готовом benchmark сравните весь репозиторий с выбранными файлами. Исследуйте compaction, provenance и prompt injection; меняйте по одной гипотезе и учитывайте качество, стоимость, задержку и variance.

РЕЗУЛЬТАТИзмеримый эксперимент по качеству контекста и решение, принятое по данным.
5
REALITY GATE

Реальный прогон под ограничениями

Запустите один узкий сценарий на реальной задаче. Добавьте trace, явные разрешения, лимиты времени и шагов; воспроизведите timeout, невалидный ответ и отказ инструмента. Запишите ручные вмешательства и остановите эксперимент, если риск не оправдан.

РЕЗУЛЬТАТИзмеренный реальный прогон с известными границами, отказами и стоимостью человеческого участия.
6
SPECIALIZATION

Первый доказательный проект

Выберите направление. Для 6S укрепите один workflow: восстановление, наблюдаемость, границу исполнения и fault injection. Для 6P проведите репрезентативный пилот узкого golden path и измерьте повторное самостоятельное использование. В обоих случаях заранее зафиксируйте baseline, критерий успеха и естественный цикл наблюдения.

РЕЗУЛЬТАТПроверяемый артефакт в сторону 6S или 6P и список пробелов до полноценной специализации.
Практический запуск

Стартовый чеклист

Это минимальный стартовый проект, а не сокращённая копия всей программы: механика, сравнение подходов, первые доказательства и одна проверка реальностью. Не пытайтесь пройти всю лестницу сразу — набор закрывает фундаментальный цикл ядра, а выбор ветки начинается уже после него. Если застряли на пункте, спросите в чате @aiGeeksClub — обычно кто-то это уже проходил.

ЛИЧНЫЙ ПРОГРЕСС0 / 12

Отметки сохраняются только в вашем браузере.

0%
01 · MECHANICS

Понять механику

02 · COMPARISON

Сравнить подходы

03 · EVIDENCE

Добавить доказательства

04 · REALITY

Проверить реальностью

Инженерные принципы

Что отличает развитие от коллекционирования фреймворков

Эти правила полезны на любом уровне — от первого coding-агента до корпоративной платформы.

01 · Own it

Критические решения, состояние, права и восстановление должны быть понятны вам, даже если код написал агент.

02 · Measure it

Сравнивайте варианты на фиксированных задачах. Без baseline — Исходный вариант, с которым сравнивается новое решение. и variance — Разброс результата между прогонами на одной и той же задаче. Без него улучшение неотличимо от шума. улучшение — это впечатление. Расход токенов измеряется легче всего, но сам по себе говорит о стоимости и активности, а не о созданной ценности.

03 · Break it

Проверяйте timeout, падение, дубль события, невалидный вывод и prompt injection — Инструкция внутри недоверенных данных, пытающаяся изменить поведение агента., а не только happy path.

04 · Constrain it

По возможности задавайте результат, ограничения и проверяемые checkpoints. Пошаговые инструкции оставляйте там, где порядок сам является требованием безопасности или процесса.

05 · Close the loop

Повторяемый или существенный вывод превращайте в правило, тест или проверку. Разовые наблюдения не должны бесконечно раздувать инструкции.

06 · Ship it

Ценность появляется, когда система помогает доставить продукт и не создаёт больше работы, чем экономит.

Библиотека первоисточников

Что читать и пробовать

Здесь собрано всё, что встречается в карточках уровней и слоях экосистемы, плюс несколько источников, которые не привязаны к одному уровню. Не читайте всё подряд: берите слой, на котором стоите сейчас, и закрепляйте материал маленьким проектом.

ОРИЕНТИР

8 уровней агентной инженерии

Разбор прогрессии от tab complete до автономных агентных команд. Часть идей этой карты выросла из спора с ней.

HABR · ПЕРЕВОД ↗
ОРИЕНТИР

Levels of agentic engineering

Оригинал того же текста: compounding engineering, harness engineering, background agents.

BASSIM ELEDATH ↗
CODING AGENT

Claude Code

Документация harness: права, инструкции проекта, субагенты и skills.

OFFICIAL DOCS ↗
CODING AGENT

OpenAI Codex CLI

Терминальный агент: режимы утверждения, sandbox, exec для CI и автоматизации.

OFFICIAL DOCS ↗
CODING AGENT

OpenCode

Открытый терминальный агент с выбором провайдера, plan/build-режимами и LSP.

OFFICIAL DOCS ↗
МЕТОДОЛОГИЯ

Building effective agents

Базовый текст: когда достаточно workflow, а когда нужен агент. Читать первым.

ANTHROPIC ↗
МЕТОДОЛОГИЯ

Claude Code: best practices

Практики агентного кодинга: инструкции проекта, циклы правок, проверка результата.

ANTHROPIC ↗
МЕТОДОЛОГИЯ

12-factor agents

Двенадцать принципов надёжных LLM-приложений: владение промптом, контекстом и control flow.

OPEN SOURCE ↗
SDD

Understanding Spec-Driven-Development

Три уровня строгости SDD на разборе Kiro, Spec Kit и Tessl — и где метод ломается.

MARTIN FOWLER · B. BÖCKELER ↗
SDD

GitHub Spec Kit

Самый портируемый инструментарий SDD: specify → plan → tasks → implement.

OPEN SOURCE ↗
COMPOUNDING

My AI had already fixed the code

Текст, популяризовавший цикл «план → делегирование → оценка → фиксация вывода».

EVERY ↗
SKILLS

Agent Skills

Как оформлять переиспользуемые инструкции, которые агент подгружает под класс задачи.

ANTHROPIC ↗
SKILLS

3 принципа дизайна skills

Опыт внутреннего реестра на сотню скиллов: ревью, версии, бандлы под роли.

BLOCK ↗
TOOLS

Writing effective tools for agents

Проектирование инструментов: границы, именование, экономия контекста, отказоустойчивость.

ANTHROPIC ↗
HARNESS

Harness engineering

Среда, инструменты и обратная связь, которые позволяют агенту работать без вашего вмешательства.

OPENAI ↗
FEEDBACK

Agent backpressure

Автоматические механизмы, по которым агент замечает и чинит свою ошибку сам.

LATENT PATTERNS ↗
AGENT SDK

OpenAI Agents SDK

Агенты, инструменты, handoffs, guardrails, сессии и встроенный tracing.

OFFICIAL DOCS ↗
TYPED AGENTS

PydanticAI

Типизированные зависимости, выходы, валидация и eval-инструменты.

OFFICIAL DOCS ↗
WORKFLOW RUNTIME

LangGraph

Состояние, персистентность, прерывания, human-in-the-loop и продолжение выполнения.

OFFICIAL DOCS ↗
MULTI-AGENT

Microsoft AutoGen

AgentChat для прототипов и event-driven Core для распределённых систем.

OFFICIAL DOCS ↗
MULTI-AGENT

Multi-agent research system

Разбор реальной мультиагентной системы: где она выигрывает и чем за это платит.

ANTHROPIC ↗
DURABLE EXECUTION

Temporal

Надёжные долгоживущие workflows, ретраи, таймеры и восстановление после сбоев.

OFFICIAL DOCS ↗
LONG-RUNNING

Harnesses for long-running agents

Что ломается на горизонте многих контекстных окон и как это чинят на уровне harness.

ANTHROPIC ↗
CONTEXT

Effective context engineering

Контекст как ограниченный ресурс: отбор, компакция, заметки, границы доверия.

ANTHROPIC ↗
OBSERVABILITY

GenAI semantic conventions

Единые имена спанов и атрибутов gen_ai.* для вызовов модели, инструментов и запусков агента.

OPENTELEMETRY ↗
PROTOCOL

Model Context Protocol

Архитектура host / client / server, инструменты, ресурсы и промпты.

OFFICIAL DOCS ↗
PROTOCOL

MCP · ревизия 2026-07-28

Крупнейший пересмотр протокола: stateless-ядро, расширения, задачи, ужесточение авторизации.

MCP BLOG ↗
PROTOCOL

Agent2Agent (A2A)

Протокол общения агентов между собой: карточки возможностей, задачи, подписанная идентичность.

LINUX FOUNDATION ↗
EVAL DESIGN

Demystifying agent evals

Задачи, прогоны, graders и оценка полных траекторий агента.

ANTHROPIC ↗
EVALUATION

Google ADK · evaluate

Eval sets, метрики траекторий, сравнение с эталоном и запуск из CI.

OFFICIAL DOCS ↗
SECURITY

OWASP Agentic Top 10

Ключевые угрозы автономных систем и отправная точка для threat model.

OWASP ↗
SECURITY

MCP Security Cheat Sheet

Отравление инструментов, подмена после одобрения, проброс токенов и что с этим делать.

OWASP ↗
SECURITY

The lethal trifecta

Почему приватные данные, недоверенный контент и внешний канал вместе — архитектурная дыра.

SIMON WILLISON ↗
SECURITY

Границы безопасности в агентных архитектурах

Аргумент за то, чтобы агент, его код и ваши секреты жили в разных доменах доверия.

VERCEL ↗
SANDBOXING

Beyond permission prompts

Как заменить бесконечные подтверждения реальной границей исполнения.

ANTHROPIC ↗
АВТОНОМНОСТЬ

Ralph loop

Автономный цикл, перезапускающий агента с чистым контекстом, пока задача не закрыта.

GEOFFREY HUNTLEY ↗
АВТОНОМНОСТЬ

Why we built our background agent

Облачные фоновые агенты: изолированное окружение на сессию, цена и что это даёт.

RAMP ↗
ГОРИЗОНТ

Agent Teams

Экспериментальная прямая координация нескольких агентов на одной кодовой базе.

CLAUDE CODE DOCS ↗
DECISIONS

Architecture Decision Records

Формат, в котором фиксируют выбор так, чтобы через полгода его можно было оспорить по существу.

OPEN RESOURCE ↗
PLATFORM

Backstage

Каталог, шаблоны и golden paths внутренней платформы разработки.

OFFICIAL DOCS ↗
ROI

ROI of AI-assisted Software Development

Цепочка от внедрения к деньгам и почему возврат определяется системой вокруг инструмента.

DORA ↗
ЛОВУШКА

Finding balance in the era of tokenmaxxing

Лидерборды по расходу токенов: зачем их заводят и почему это плохая метрика.

DORA ↗
Глоссарий

Термины простыми словами

Термины сгруппированы по шести осям карты, поэтому глоссарий работает и как второй вход в неё. Правило простое: каждое подсвеченное в тексте слово имеет здесь запись.

MODEL & TOOLS
LLM
Большая языковая модель: система, которая предсказывает продолжение текста и умеет работать с инструкциями, кодом и вызовами инструментов.
Tool call
Запрос модели к внешней функции: имя инструмента и аргументы. Исполняет его ваш код, а не модель.
Agent loop
Цикл: модель выбирает действие, вызывает инструмент, получает результат и решает следующий шаг.
Harness
Оболочка вокруг модели: файлы, shell, tools, permissions, контекст и правила выполнения.
Structured output
Ответ по заданной схеме; приложение валидирует структуру и отдельно проверяет смысловые ограничения.
Step limit
Жёсткий потолок числа шагов цикла: страховка от бесконечно работающего агента.
MCP
Model Context Protocol — стандарт подключения инструментов и источников контекста к AI-приложениям. Спека версионируется датой и заметно меняется: сверяйтесь с актуальной ревизией, а не с постом полугодовой давности.
A2A
Agent2Agent — открытый протокол общения агентов между собой: карточка возможностей, жизненный цикл задачи, обмен результатами.
Prompt caching
Повторное использование обработанного префикса, которое при поддержке провайдером может снизить задержку и стоимость.
Token budget
Ограничение расхода модели; его рассматривают вместе с бюджетом времени, шагов и денег.
Feedback loop
Замкнутый цикл, в котором агент видит результат своего действия и может его исправить сам.
Backpressure
Автоматическая обратная связь — типы, тесты, линтеры, хуки, схемы, — по которой агент замечает и чинит ошибку без человека.
CONTEXT DESIGN
Context window
Объём текста, который модель видит за один вызов. Всё, что не поместилось, для неё не существует.
Context engineering
Проектирование того, какие данные получает модель, в каком объёме и с какими границами доверия.
Retrieval
Поиск и выбор релевантных данных перед вызовом модели.
RAG
Retrieval-Augmented Generation: нужные данные ищут заранее и кладут в контекст. Способ подать контекст, а не отдельная ступень зрелости.
Compaction
Сжатие длинной истории с сохранением критически важной информации.
Provenance
Происхождение данных: откуда факт взялся, кто его создал и как он изменялся.
Upstream artifact
Артефакт предыдущего этапа, который передаётся следующему.
EVALS & DATA
Eval
Повторяемая проверка качества на фиксированном наборе задач.
Baseline
Исходный вариант, с которым сравнивается новое решение.
Ablation
Эксперимент, где один компонент удаляют, чтобы проверить его реальную пользу.
Grader
Проверяющий: детерминированный (тест, схема, lint) или модель в роли судьи.
LLM-as-a-judge
Оценка результата другой моделью по заданной рубрике. Дешевле человека, но требует собственной калибровки.
Trajectory
Полная последовательность действий агента: сообщения, tools, ошибки и результаты.
Variance
Разброс результата между прогонами на одной и той же задаче. Без него улучшение неотличимо от шума.
Regression suite
Набор задач, который прогоняют перед каждым релизом, чтобы поймать деградацию.
RELIABLE RUNTIME
Gate
Проверяемое условие, без которого процесс не переходит дальше.
Human-in-the-loop
Точка, где процесс останавливается и ждёт решения человека.
Handoff
Передача задачи от одного агента другому вместе с явно описанным входом и выходом.
Trace
Связанная история одного полного запуска системы.
Tracing
Сбор таких историй: что вызывалось, сколько длилось и где сломалось.
Idempotency
Безопасный повтор операции не создаёт второй побочный эффект.
Durable execution
Исполнение, сохраняющее прогресс и продолжающееся после сбоя.
Lease
Временная аренда задачи одним воркером, чтобы её не взял второй.
Dead-letter queue
Отстойник для событий, которые не удалось обработать после всех попыток.
Fault injection
Намеренная поломка системы в тесте: timeout, crash, дубль события, невалидный ответ.
Ralph loop
Автономный цикл, который перезапускает агента с чистым контекстом, пока задача не закрыта.
GenAI semantic conventions
Соглашение OpenTelemetry об именах спанов и атрибутов gen_ai.* для вызова модели, вызова инструмента и запуска агента.
Background agent
Агент, работающий асинхронно и без вашего присутствия в сессии.
Orchestrator
Агент или процесс, который раздаёт задачи другим агентам и собирает результат.
Worktree
Отдельная рабочая копия репозитория, в которой агент правит код, не мешая другим.
SECURITY BOUNDARY
Идентичность агента
Отдельный или делегированный субъект: от чьего имени действует агент, с какими правами и как это попадает в аудит.
Prompt injection
Инструкция внутри недоверенных данных, пытающаяся изменить поведение агента.
Lethal trifecta
Опасное сочетание: доступ к приватным данным, недоверенный контент и возможность отправить данные наружу.
Sandbox
Изолированная среда с ограниченными файлами, сетью, процессами и секретами.
Default deny
Правило «запрещено всё, что не разрешено явно», вместо полного доступа по умолчанию.
Fail-closed
Нарушение политики блокирует опасное действие или останавливает процесс, а не разрешается по умолчанию.
RBAC
Разграничение доступа по ролям: кто и что имеет право делать.
Guardrail
Проверка на входе или выходе, отсекающая недопустимые запросы и действия.
PLATFORM ADOPTION
SDD (spec-driven development)
Spec-driven development: спецификация с критериями приёмки пишется до кода и служит контрактом для агента.
Уровни строгости SDD
Авторская шкала: spec-first — спека даёт старт; spec-anchored — живёт вместе с фичей; spec-as-source — код генерируется из неё.
EARS
Easy Approach to Requirements Syntax — шаблон формулировки требований, который агент и человек читают одинаково.
AGENTS.md
Открытый формат инструкций для агентов в корне репозитория; развивается под Agentic AI Foundation (Linux Foundation).
Skill
Переиспользуемая инструкция, которую агент подгружает под класс задачи.
Compounding engineering
Цикл «спланировать → делегировать → оценить → зафиксировать вывод», в котором каждый прогон улучшает следующие.
ADR
Architecture Decision Record: короткая запись вариантов, решения и причин выбора.
Golden path
Рекомендуемый и максимально простой путь выполнения типичной задачи.
Adoption
Повторное самостоятельное использование платформы целевой аудиторией в естественном рабочем цикле.
Tokenmaxxing
Внутренние лидерборды по расходу токенов ради разгона adoption: расход становится KPI и перестаёт означать пользу.
SLO
Целевой уровень сервиса, заданный метрикой и временным окном.
Build vs buy
Решение, что строить самим, а что взять готовым, принятое по данным, а не по вкусу.