Последний день августа подвёл месяц к естественному финалу: после взрывного роста agent capabilities индустрия начала составлять их инвентаризацию. AWS открыла организационный registry для agents, tools и skills. GitHub свела месячные изменения VS Code в карту новых runtime surfaces и одновременно напомнила, что выбранная модель может исчезнуть из платформы уже завтра.

Каталог, lifecycle, внешний review и структурное описание workflow — скучные слова рядом с «автономным агентом». Но именно из них складывается система, которая переживает смену модели, команды и очередного красивого demo.

Agent control plane

AWS открыла registry для agents, tools и skills

AWS Agent Registry стала generally available в пяти регионах. Единый governed catalog хранит agents, tools, skills и custom resources, поддерживает keyword и semantic search, публикацию через MCP server, cross-account access и автоматическое обнаружение AgentCore Gateways и агентов в организации.

Официальные источники подтверждают доступность, но не сообщают precision поиска, latency, adoption и реальную экономию от переиспользования. Пять регионов — состояние на 31 августа, а не бессрочное свойство сервиса.

Два соседних релиза показывают, зачем registry вообще нужен. Amazon Quick умеет находить зарегистрированные agents и MCP servers, а reference pattern соединяет MCP server в AgentCore Runtime с несколькими chat agents и workflows без отдельного connector для каждого. Каталог, runtime и client начинают работать как один operating layer.

Это ещё не универсальная переносимость: auth, network boundary и tool schema никуда не исчезают. Registry решает discovery и governance, но не должен маскировать несовместимость найденной capability.

Источники: Agent Registry GA, интеграция с Quick, MCP reference pattern.

Developer tooling

VS Code за месяц превратился в диспетчер нескольких агентов

GitHub собрала релизы VS Code 1.132–1.135: параллельные agent sessions, /btw, Agent Host, plugins и связанные изменения Copilot workflow. Страница — месячный roundup, поэтому 31 августа датируется сама сводка, а не каждая перечисленная функция.

Общей метрики качества или adoption нет. Но системная линия читается хорошо. Редактор больше не обслуживает одного помощника в боковой панели: он управляет несколькими сессиями, фоновым host и подключаемыми пакетами поведения.

В таком IDE главный UX-вопрос меняется. Нужно не только удобно задать prompt, но и понять, какой агент владеет веткой, что делает в фоне, откуда получил skill и какой результат ждёт review. Session management становится частью correctness.

Источник: августовский roundup Copilot в VS Code.


GitHub предупредила: выбранные модели исчезнут из Copilot на следующий день

GitHub опубликовала уведомление о прекращении поддержки части моделей Copilot с 1 сентября. На 31 августа replay-safe только само предупреждение: deprecation ещё не вступила в силу. Конкретный список и инструкции принадлежат changelog и не должны пересказываться по памяти.

Это небольшой релиз с большим operational смыслом. Saved prompt, router policy или organizational default способны сломаться без единого изменения в репозитории — просто потому, что платформа завершила lifecycle upstream-модели.

Model abstraction обязана включать lifecycle. Нужны inventory зависимостей, замена до deadline, regression eval и понятный fallback. Иначе «автоматический выбор лучшей модели» работает лишь до первого решения поставщика убрать её из меню.

Источник: уведомление GitHub.

Safety governance

Anthropic обещала вынести проверку alignment-security наружу

Anthropic вернулась к инцидентам, которые публично описывала 30 июля и 4 августа, и объявила изменения процессов, включая план внешнего review со стороны METR.

Важно не переписать время: сами инциденты не произошли 31 августа. Новостью дня является организационный ответ. И он пока остаётся обещанием — завершённого независимого анализа и измеримого результата новых controls нет.

Тем не менее внешний review меняет структуру доверия. Внутренний postmortem проверяет команда, чьи процессы дали сбой. Независимая сторона может увидеть другие допущения и потребовать evidence, которое компания не сочла нужным. Ценность появится не от имени METR, а от опубликованных границ доступа, методологии и реакции Anthropic на выводы.

Источник: обновление Anthropic.

Инфраструктура

Сто мегаватт в NEOM — начало стройки, а не готовый AI-кластер

HUMAIN и DataVolt объявили первый этап AI data center campus в NEOM. Внутри проекта на 360 MW началось строительство очереди на 100 MW.

Источник не называет число ускорителей, их производителя, PUE, дату полной готовности и гарантированный customer demand. Поэтому электрическую мощность нельзя переводить в AI throughput, а строительный старт — в доступный compute.

Сигнал всё равно заметен: Саудовская Аравия собирает рядом энергию, капитал и data-center construction, пытаясь создать региональный слой AI-инфраструктуры. Но между «есть площадка и соглашение» и «клиент может запустить workload» лежит вся трудная часть проекта.

Источник: HUMAIN и DataVolt в NEOM.

Evaluation

WorkflowBench проверяет не текст ответа, а структуру исполняемого процесса

WorkflowBench предлагает генерировать из естественно-языковых требований DAG с business rules. Dataset содержит 635 синтетических правил; отдельно оцениваются структура, точные условия, корректность JSON и LLM-judge validity.

Авторы заявляют около 89% judge validity, 90% exact-condition accuracy, 99–100% валидного JSON и примерно вдвое меньше prompt tokens против baseline. Все числа self-reported и зависят от synthetic generator, evaluator и выбранных моделей. Реальный workflow добавит permissions, partial failures и human approvals, которых в headline нет.

Правильно выбран объект оценки. Workflow может выглядеть убедительно в prose и быть неверным как граф: перепутать ветку, условие или порядок side effects. Проверка структуры и правил ближе к production, чем оценка красоты объяснения.

Источник: WorkflowBench.

Главный технологический сдвиг выпуска

Тридцать первого августа capability стала объектом учёта.

Registry отвечает, какие агенты и tools существуют. IDE показывает, где живут их сессии. Model lifecycle напоминает, что исполнитель временный. External review проверяет процесс владельца платформы. Workflow benchmark отделяет исполняемую структуру от убедительного текста.

Месяц начинался вопросом «что ещё умеет модель», а заканчивается более зрелым: «можем ли мы найти, проверить, заменить и безопасно удалить то, что ей это позволяет?» Именно такой control plane переживёт следующий модельный цикл.

Что обсудить с технической командой

  1. Есть ли у нас полный registry агентов, tools, skills, владельцев и cross-account permissions?
  2. Показывает ли IDE принадлежность worktree, фонового процесса и результата конкретной agent session?
  3. Какие workflows сломаются при deprecation основной модели и когда последний раз проверялся fallback?
  4. Что делает внешний safety review независимым: доступ к данным, методология или право публиковать несогласованный вывод?
  5. Проверяем ли мы generated workflow как граф условий и side effects, а не только как текст?