Двадцать пятого августа AI-стек продолжил срастаться по вертикали. OpenAI впервые показала числа собственного inference-чипа. Figure строит собственный рынок данных о физическом мире. Google упаковывает модель, отраслевые навыки и permissions в юридический продукт, а Copilot — MCP, plugins и skills в единый distribution layer.
На поверхности это восемь разных новостей. Под ней — одна борьба за границы системы. Кто контролирует кремний, данные, sandbox, доступ к документам и способ подключения инструментов, тот всё меньше зависит от качества одного model call и всё больше определяет поведение продукта целиком.
Инфраструктура
OpenAI впервые показала измерения собственного inference-чипа
OpenAI опубликовала первые результаты Jalapeño. На GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T компания заявляет в 1,5–1,9 раза больше работы на ватт при пиковой пропускной способности и в 1,7–3,6 раза меньшую end-to-end latency, чем у выбранных коммерческих систем.
Это vendor benchmark. Публичный запуск через InferenceX не делает измерение независимым: итог сильно зависит от конфигурации конкурентов, software stack, batching и целевого workload. Диапазон нельзя превращать в обещание, что любое приложение OpenAI внезапно ускорилось в три с половиной раза.
Первый содержательный результат здесь не рекорд, а появление замкнутого контура
модель → компилятор → serving → silicon. Лаборатория теперь может менять
архитектуру модели под свойства собственного чипа и наоборот, не ожидая общего
roadmap GPU-вендора. Цена такой свободы — необходимость доказать, что система
выигрывает не только на специально выбранных внутренних нагрузках.
Источник: первые результаты Jalapeño.
Sandbox становится распределённым примитивом Ray
Google Cloud и Anyscale показали экспериментальную библиотеку, которая создаёт изолированные OCI-среды внутри Ray-кластеров на GKE через gVisor. Целевые сценарии — RL rollouts, выполнение сгенерированного кода и параллельные tool interactions.
Раньше sandbox для агента часто выглядел отдельным внешним сервисом: запрос уходит из runtime, где-то поднимается контейнер, результат возвращается назад. Здесь изоляция становится объектом самого distributed scheduler. Ray может раскладывать тысячи сред рядом с задачами, данными и accelerator resources.
Заявления о sub-second startup и небольшом overhead принадлежат поставщикам; полного benchmark setup публикация не даёт. API экспериментальный и ещё не является стабильным контрактом Ray. Но архитектурный переход уже понятен: если агенты массово исполняют недоверенный код, sandbox нужно планировать так же естественно, как CPU, память и GPU.
Источник: gVisor sandboxes for Ray.
Модели и данные
Granite 4.2 училась не только отвечать, но и действовать в среде
IBM открыла семейство Granite 4.2 для reasoning, tool use, coding и speech, с вариантами под локальное и enterprise-развёртывание. Модели доступны через Hugging Face, GitHub, Ollama, watsonx и другие каналы.
У семейства нет одной независимой таблицы, которая позволяла бы честно объявить его победителем среди моделей разного размера и назначения. Поэтому размеры, лицензии и benchmark нужно проверять по отдельным model cards, а не собирать в общий headline.
Более важная деталь — часть моделей обучали на agentic sandbox-задачах. Tool use перестаёт быть форматом ответа, добавленным на instruction tuning, и становится поведением, которое модель практиковала внутри среды. Это не гарантирует production-надежность, но делает способ обучения ближе к реальной единице работы агента: не «выдай правильный JSON», а «добейся результата несколькими действиями».
Источник: IBM о Granite 4.2.
Figure покупает длинный хвост физического мира прямо у людей
Figure открыла Index — приложение и платную программу сбора видео физических действий. Компания сообщает о 16 млн загруженных роликов, 264 тысячах скачиваний, 44 тысячах weekly active users в 108 странах и $15 млн выплат авторам. На данные и compute в следующие 12 месяцев обещан бюджет свыше $1 млрд.
Все числа self-reported. Они не показывают разнообразие действий, качество разметки и то, насколько видео реально улучшает роботов. И слово «открыла» здесь нельзя спутать с open dataset: собранные данные остаются эксклюзивными для Figure.
Стратегия всё равно примечательна. Интернет дал языковым моделям дешёвый корпус человеческих текстов, но не содержит нужного количества видео о том, как люди берут незнакомый предмет, чинят конкретный механизм или действуют в редкой обстановке. Figure пытается создать недостающий слой не лабораторной съёмкой, а рынком: пользователь находит длинный хвост, компания назначает ему цену.
Источник: Figure Index.
Вертикальные агенты
Юридический агент начинается с ethical walls, а не с юридического prompt
Google представила Gemini Enterprise for Legal. Продукт объединяет domain skills, MCP-коннекторы, acting agents и управляемый control plane. Ключевая деталь — наследование matter permissions, document-level ACL и ethical walls, плюс трассируемые цитаты.
В анонсе есть клиенты и партнёры, но нет независимых измерений точности, экономии времени или цены ошибки. Формулировка production-ready остаётся утверждением Google.
Тем не менее продукт правильно определяет, что делает агента отраслевым. Юридический язык можно вложить в модель, но принадлежность документа к делу, конфликт интересов и право конкретного сотрудника видеть материал живут в организационной системе. Vertical agent — это не LLM, которая знает термины, а workflow, который понимает и не нарушает реальные границы доступа.
Источник: Gemini Enterprise for Legal.
Инструменты разработки
Visual Studio признала reasoning budget и worktree обычными настройками IDE
Августовское обновление Visual Studio 2026 добавило выбор Low, Medium или High reasoning для поддерживаемых моделей, отображение usage, распространение организационных custom agents и создание Git worktrees из интерфейса.
Microsoft не приводит измерений продуктивности, поэтому наличие переключателя не доказывает, что разработка стала быстрее. Но набор функций хорошо показывает новую норму. Reasoning больше не считается бездонным внутренним свойством модели: это видимый бюджет, который разработчик выбирает под задачу. Worktree тоже выходит из продвинутого Git-workflow в основной интерфейс, потому что несколько агентов должны работать параллельно и изолированно.
IDE постепенно управляет не только файлами и компилятором, но вычислительным усилием агента и топологией его рабочих копий.
Источник: Visual Studio August update.
Copilot собирает расширения в отдельную витрину
В Copilot App раздел Customize стал общедоступным и объединил поиск и управление MCP-серверами, plugins, skills и canvases. Это пока каталог и UI, а не новый стандарт упаковки. Присутствие элемента в витрине также не означает, что ему автоматически выданы permissions или что он одинаково работает во всех клиентах.
Но у agent ecosystem появляется знакомая структура: базовая модель, runtime и отдельный distribution layer для способностей. Пользователь выбирает уже не только модель, но набор инструкций, инструментов и источников контекста, которые собирают конкретного исполнителя.
Главный риск такого слоя — смешать discoverability с доверием. Чем легче подключить MCP или plugin, тем важнее отдельно показать происхождение, запрашиваемые права и границу данных. Магазин способностей без permission model быстро превращается в supply-chain проблему.
Источник: GitHub Copilot Customize GA.
WebMCP проверяет, может ли сама страница стать инструментом агента
OpenAI вместе с Chrome, Cloudflare, Shopify, Vercel, Render и Netlify запустила десятидневный WebMCP Challenge. Участникам предложено строить open-source проекты вокруг экспериментального интерфейса, который отдаёт агенту структурированные tools прямо на живой странице и внутри авторизованной пользовательской сессии. Призовой фонд — $35 тысяч.
Hackathon не делает WebMCP стандартом и не даёт production guarantee. Он лишь фиксирует, что интерфейс открыт для публичных экспериментов и интересен сразу нескольким платформенным компаниям.
Содержательная ставка сильнее события. Сегодня агент часто «видит» сайт через скриншот и нажимает координаты, хотя само приложение знает семантику действий. Browser-native tools могут убрать хрупкий слой визуальной имитации. Но вместе с DOM агент получает авторизованную сессию человека, поэтому контракт инструмента обязан включать подтверждение, происхождение данных и узкие полномочия — иначе структурный API просто сделает опасное действие надёжнее.
Источник: объявление WebMCP Challenge.
Главный технологический сдвиг выпуска
Двадцать пятого августа конкурентным продуктом стала не модель, а граница вокруг неё.
Свой чип сокращает зависимость от чужого hardware roadmap. Собственный рынок данных закрывает дефицит физических наблюдений. Distributed sandbox делает массовое действие приемлемым. Отраслевой control plane наследует реальные права, а витрина расширений определяет, какие способности вообще попадут в runtime.
Так AI-компании двигаются к вертикальной интеграции не из эстетики. Каждый внешний слой — источник задержки, риска и чужих правил. Но каждый присоединённый слой становится новой обязанностью: его нужно измерять, защищать и доказывать уже не на собственном пресс-релизе, а в чужом production.
Что обсудить с технической командой
- Какой слой нашего AI-продукта является настоящим bottleneck: модель, данные, sandbox, permissions или distribution инструментов?
- Какие vendor benchmarks зависят от конфигурации, которую пользователь не сможет воспроизвести?
- Планируется ли изоляция как ресурс distributed runtime или остаётся внешним сервисом с собственной очередью и отказами?
- Наследует ли отраслевой агент существующие ACL и ethical walls либо создаёт параллельную систему доступа?
- Разделены ли в каталоге расширений обнаружение, доверие и фактическая выдача полномочий?