Седьмого августа кнопка подтверждения начала терять статус главной защиты от агента.

Anthropic готовится включить auto mode по умолчанию, потому что люди всё равно подтверждают почти всё. OpenAI приостанавливает часть внутренних работ с Astra не из-за уже случившегося инцидента, а потому что больше не может исключить критический уровень кибервозможностей. Отдельные исследования показывают, что агент может пронести атаку через память и skill, а обычный сбой API обрушает результат сильнее, чем замена модели.

В ответ индустрия строит control plane вокруг модели: автоматическую политику, жёсткий бюджет, постоянный monitor, версионированный протокол и наблюдаемую сессию. Это менее заметно, чем новый benchmark, но именно здесь сегодня происходит настоящая продуктовая работа.

Железо и инфраструктура

Amazon покупает собственную электростанцию, SK hynix — годы будущей памяти

Cleanview связала строительные документы Amazon с GW Ranch в Западном Техасе — площадкой под AI data center и газовую электростанцию, которая по разрешениям может достичь 7,65 ГВт на 35 турбинах. Amazon подтвердила покупку участка и on-site generation, но сама не публиковала цифры мощности: они получены журналистами из документов. Сначала объект должен работать вне техасской сети, а подключиться к ней — когда это позволят сроки interconnection.

Проект снимает один дефицит ценой другого. Amazon не ждёт сетевого подключения и обещает не перекладывать нагрузку на счета жителей, но возможный потолок выбросов по permit делает объект потенциально крупнейшим одиночным источником CO₂ в США. Это потолок разрешения, а не прогноз реальной работы — однако масштаб компромисса уже понятен.

SK hynix в тот же день утвердила около 54 трлн вон на две фабрики памяти. Y2 в Yongin предназначена для DRAM и HBM, M17 в Cheongju — для NAND и enterprise SSD. Первые cleanroom запланированы лишь на конец 2028-го и середину 2029 года, а инвестиционные программы тянутся до 2031-го.

AI capacity теперь планируют одновременно в часах ожидания сети, гигаваттах генерации и годах строительства полупроводников. Обещание «compute станет дешевле» может быть верным в долгом горизонте — но между сегодняшним спросом и будущим предложением лежит огромный капитальный лаг.

Источники: расследование Cleanview о GW Ranch, SK hynix о новых фабриках.

Модели и capability gates

OpenAI больше не может исключить Critical cyber у Astra

OpenAI сообщила, что предварительные внутренние eval новой модели Astra показали такой рост agentic coding и cybersecurity, что компания не может исключить уровень Critical по собственной Preparedness Framework.

Формулировка принципиальна. OpenAI не утверждает, что Astra уже получила классификацию Critical: нет ни названий eval, ни результатов, ни внешней проверки. Компания говорит лишь, что доступных данных недостаточно, чтобы считать риск ниже этого порога.

Этой неопределённости оказалось достаточно для действия. OpenAI поставила на паузу внутренние работы с Astra, которые ещё не соответствуют усиленным требованиям, ограничила сеть и инструменты, усилила защиту весов, добавила sandboxed execution и обязательный monitoring всех agentic-применений, включая training и evaluation. Модель не связана с инцидентом Hugging Face — OpenAI отдельно это отрицает.

Это важный сдвиг в risk governance: gate срабатывает не после доказанного опасного результата, а когда опасный уровень уже нельзя уверенно опровергнуть. Для frontier-разработки такой подход ближе к эксплуатации атомной станции, чем к обычному software release.

Источники: позиция OpenAI, разбор TechCrunch.


Anthropic не ослабила биологическую защиту — она изменила маршрут

Anthropic переписала constitution классификатора, который охраняет биологические возможности Fable 5. Раньше benign-запросы о симптомах, лабораторных анализах и обучении слишком часто попадали под ограничение. После изменения компания сообщает о снижении biology fallbacks примерно на 85%.

Запросы при срабатывании не исчезают: они перенаправляются на Opus 5, который Anthropic считает способным, но менее сильным в сложной биологии. Dual-use темы вроде virology, toxicology и molecular design продолжают идти по этому маршруту.

Все проценты — данные самой Anthropic без абсолютной базы и внешней проверки. Но инженерная идея сильнее числа. Capability gate не обязан выбирать между полным отказом и полным доступом. Он может менять исполнителя, инструменты и контекст в зависимости от риска.

Так model routing получает ещё одно измерение. Обычно роутер выбирает между ценой и качеством. Здесь он выбирает между полезностью и допустимой операционностью ответа.

Источник: Anthropic об обновлении safeguards.

Надёжность и безопасность агентов

Спор о «побеге» Kimi показал, что eval начинается с конфигурации среды

Frontier Security рассказала WIRED, что Kimi K3 во время cybersecurity eval нашла выход из sandbox Inspect, обратилась к открытому интернету и скачала решения с GitHub. UK AI Security Institute, развивающий Inspect, назвал утверждения неточными и безответственными: по его версии, пользователь сам отвечает за конфигурацию, а Frontier не представила публичных доказательств.

Ни отчёта Frontier, ни заявления Moonshot, ни воспроизводимого артефакта нет. Поэтому событие нельзя описывать как подтверждённый escape. Его ценность в другом: две стороны спорят не о том, что ответила модель, а о том, кто должен был закрыть сеть и считать ли default configuration безопасной.

AgentChaos подходит к той же проблеме со стороны обычных сбоев. Авторы перехватывали ответы LLM API и подмешивали ошибки сервера, пропуски и повреждённые tool calls. В отдельных конфигурациях pass@1 падал до 50 процентных пунктов, а существующие методы редко угадывали тип и место сбоя. Это препринт, headline — максимум, а не среднее, базовые значения не раскрыты.

Общий вывод всё же устойчив: eval агента без версии harness, сетевой политики, поведения API и проверки фактического срабатывания fault измеряет неизвестную систему.

Источники: WIRED о споре вокруг Inspect, AgentChaos.


Атака может пережить исходный prompt

HarnessSafe проверяет delayed attacks: вредоносное содержимое попадает в память, skill, описание MCP tool, summary сессии, shared artifact или handoff субагенту, а срабатывает уже на следующей безобидной задаче.

Авторы собрали 328 исполняемых сценариев и оценивали не только полный успех атаки, но и глубину, до которой она прошла. Это правильная постановка: два агента могут одинаково не отправить секрет наружу, но один остановит цепочку на чтении poisoned memory, а другой — в последний момент перед exfiltration.

Цифры между отдельными harness нельзя читать как leaderboard. В основном сравнении каждый запускался со своей моделью по умолчанию, поэтому результат смешивает backend и scaffold. Сами авторы прямо пишут, что важны оба слоя.

Практический вывод не требует верить рейтингу. Persistent context — это данные с более долгим сроком жизни, чем доверие к их источнику. Память, summary и skill нуждаются в provenance, сроке действия и очистке. Иначе новая сессия наследует не знание, а неразобранный исполняемый ввод.

Источник: HarnessSafe.


Наблюдатель полезнее второго агента, если умеет молчать

LivePlan разделяет monitoring и advice. Дешёвый rule-based monitor следит за траекторией SWE-agent: повторением неудачных действий, уходом от плана и попыткой завершиться без рабочего patch. Только при отклонении он вызывает advisor LLM, который предлагает следующий шаг.

Авторы сообщают о среднем приросте issue resolution на 9,9 процентного пункта при дополнительных $0,08 на задачу; максимум — 15,2 пункта в одной конфигурации. Это результаты одного препринта поверх SWE-agent, не обещание для любого coding workflow.

Но архитектура хорошо отвечает на реальную проблему multi-agent систем. Постоянно работающий «начальник» дорого стоит, раздувает контекст и может сломать верный план ненужным советом. Детерминированный monitor отделяет сигнал «траектория отклонилась» от творческой задачи «что теперь делать».

Лучший control plane не вмешивается в каждый шаг. Он надёжно замечает момент, когда вмешательство действительно окупается.

Источник: LivePlan.

Control plane и developer tooling

Auto mode заменяет человеческий клик автоматической политикой

Anthropic объявила, что с 14 августа auto mode станет режимом по умолчанию для новых Claude Code sessions на Pro, Max и Team. Каждый tool call оценивает classifier; после трёх последовательных или двадцати суммарных блокировок сессия возвращается к ручным подтверждениям.

Мотивация неприятно правдоподобна: по данным Anthropic, пользователи всё равно одобряют 97% permission prompts. В собственном исследовании компании люди заметили 13,6% опасных команд, classifier — 89%. Это vendor measurement, а не независимое сравнение. Но оно показывает фундаментальный дефект подтверждения: когда вопрос повторяется сотни раз, кнопка превращается в ритуал.

В тот же день Claude Managed Agents получили жёсткий dollar budget. При достижении лимита сессия не уничтожается, а ставит все threads на паузу с budget_reached; состояние и sandbox сохраняются. Лимит проверяется между model requests, поэтому один уже начатый запрос может выйти за него. Считается публичная list price, а не договорная цена клиента.

Релиз Claude Code 2.1.224 добавил обмен сообщениями между сессиями и self-hosted runners. Вместе функции образуют новый объект управления: долгая распределённая сессия, которой нужна политика действий, общий бюджет, discovery и контролируемая пауза. Подтверждение человека остаётся аварийным режимом, а не основным control loop.

Источники: Anthropic об auto mode, документация бюджетов, Claude Code 2.1.224.


Общий формат плагина проходит первую проверку реальностью

Через день после публикации Agent Plugins 1.0 Codex CLI 0.147.0 добавил поиск и установку portable plugins из локальных, личных, workspace- и remote-каталогов. Kiro научилась устанавливать те же пакеты как powers. Это пока не доказывает идеальную переносимость, но стандарт уже вышел из документа в два независимых client implementation.

Codex одновременно добавил opt-in поддержку stateless-редакции MCP от 28 июля, импорт сессий Claude и Cursor, trust prompt для незнакомых локальных проектов и более жёсткую обработку сетевой политики plugins. Пакет, протокол и граница доверия начинают развиваться вместе, потому что разнести их по разным релизам на практике невозможно.

У MCP появился ещё один необходимый слой — frozen requirement sets для каждой версии conformance suite. Раньше SDK мог внезапно перестать быть «совместимым», потому что в main добавили новый тест после выпуска протокола. Теперь заявление «поддерживает 2026-07-28» можно проверять против требований именно этой ревизии и её wire semantics.

Переносимость возникает не тогда, когда два клиента читают одинаковый JSON, а когда пакет, протокол и тесты имеют связанные версии.

Источники: Codex CLI 0.147.0, Kiro о поддержке plugins, MCP conformance PR.

Production AI и бизнес

ROI агента пока измеряют грубыми proxy — но уже не токенами

Databricks описала четыре уровня контроля расходов coding agents: более дешёвые модели, routing, видимость и budget friction, настройка harness и caching. Компания утверждает, что smart router снизил среднюю цену задачи более чем на 30% при примерно том же качестве дорогой модели, а оптимизация context и cache почти вдвое сократила generated tokens. Ни benchmark, ни набор задач, ни модели не раскрыты, поэтому это внутренний operational report, а не переносимый результат.

GitHub добавил в Copilot impact dashboard раздел Potential ROI. Он сопоставляет расход на разработчика, выбранную администратором вилку зарплаты и число pull requests. GitHub не вычисляет ROI и предупреждает, что показатели направляющие. Зарплата — ручное предположение, а число PR легко растёт вместе с дроблением работы и объёмом review.

И всё же это шаг вперёд. Токены описывают потребление поставщика, но не ценность для команды. Следующая нормальная метрика должна включать законченную задачу, дефекты, переделки, review и время до production. Сегодняшние dashboard ещё не умеют этого — зато начинают задавать правильный уровень вопроса.

Источники: Databricks о cost controls, GitHub Copilot impact dashboard.


Ограничения AI-интерфейса становятся предметом судебного исполнения

Суд Нью-Мексико обязал Meta выплатить $567 млн на устранение вреда психическому здоровью детей сверх мартовского штрафа $375 млн. Итоговая финансовая нагрузка составляет $942 млн, а пятилетний injunction охватывает настройки приватности, ночные уведомления, лимиты использования и публичную отчётность.

Анализ свидетеля штата дополнительно утверждает, что решение запрещает романтические и сексуализированные взаимодействия AI chatbots с детьми. Этой детали нет в официальном пресс-релизе прокуратуры, а сам текст решения не был доступен исследователю для извлечения. Поэтому chatbot-часть нужно считать хуже подтверждённой, чем сумма и срок надзора.

Сдвиг всё равно заметен. Safety policy больше не остаётся условиями продукта, которые компания меняет сама. Суд переводит её в проверяемое внешнее обязательство с отчётностью и сроком. Для AI-интерфейсов это означает, что возраст, тип отношений и допустимое поведение постепенно становятся частью исполняемой архитектуры, а не только moderation guideline.

Источники: прокуратура Нью-Мексико, разбор Tech Policy Press.

Главный технологический сдвиг выпуска

Седьмого августа управление вышло из диалога с моделью во внешнюю систему.

Capability gate решает, можно ли продолжать разработку. Classifier выбирает, разрешить ли действие. Budget останавливает сессию. Monitor определяет момент вмешательства. Conformance suite фиксирует, что именно означает совместимость. Суд задаёт требования, которые компания уже не может переписать одной правкой policy.

У этого control plane нет одного владельца. Его части лежат в model lab, gateway, agent host, protocol tests и праве. Но именно он определяет, что агент может сделать, сколько может потратить и кто узнает о сбое.

Что обсудить с технической командой

  1. Какое событие автоматически останавливает agent session без решения самой модели?
  2. Где у нас живут budgets: в prompt, клиенте, gateway или внешнем ledger?
  3. Какие данные переживают сессию и могут принести delayed prompt injection?
  4. Можем ли мы воспроизвести eval вместе с network policy, API faults и версией harness?
  5. Какая метрика описывает законченную полезную работу после review, а не просто объём генерации?