Третьего августа модель окончательно перестала быть продуктом сама по себе.
Qwen учит агента работать с компьютером по одним пикселям. OpenAI делит живой разговор и глубокое рассуждение между разными системами. Stripe прячет тысячу skills за одним простым интерфейсом. GitHub превращает комментарий в событие для фонового coding agent. Microsoft собирает cyber-workflow из нескольких моделей.
Даже «открытая модель» MiniMax оказывается не файлом весов, а гибридным pipeline, часть которого всё равно живёт в облаке.
Побеждает не тот, у кого один раз получился лучший ответ. Побеждает тот, кто умеет дать модели наблюдение, память, инструменты, политику и среду исполнения — и заменить любой из этих компонентов, не развалив весь продукт.
Интерфейс к миру
Qwen-CUA отказалась от DOM и стала смотреть на компьютер как человек
Qwen-CUA видит только screenshots и действует клавиатурой и мышью. Никакого DOM, accessibility tree или специального API приложения. Это намеренное ограничение: один и тот же агент может работать там, где есть человеческий интерфейс, даже если разработчик программы не подготовил для него отдельную интеграцию.
Цена универсальности — длинная визуальная история. Scaffold хранит до двадцати активных снимков, а более старые сворачивает фиксированными блоками, чтобы не разрушать reusable prompt prefix. Для обучения команда подняла rollout fleet почти на 100 000 vCPU и собрала около 40 000 задач с проверяемым результатом.
Авторы сообщают 86,2 на OSWorld-Verified для 397B-A17B MoE и 87,6 для версии свыше триллиона параметров. Но эти цифры не означают, что агент надёжно работает «почти везде». На OSWorld 2.0 результаты заметно ниже, а RedTeamCUA показывает, что prompt injection остаётся реальной частью интерфейса, пусть attack success и снизился относительно Qwen3.7.
Главный шаг — не ещё один desktop benchmark. Outcome в компьютерной задаче становится проверяемым без привилегированного machine-readable канала наблюдения. Теперь bottleneck смещается в качество trajectory, безопасность экрана и контроль side effects.
Что нужно понимать: computer use, visual history, verifiable reward,
OSWorld, prompt injection.
Источник: paper Qwen-CUA.
GPT-Live вынесла «думать» за пределы живого разговора
Голосовой интерфейс не может ждать так же, как текстовый. Секунда тишины после клика терпима; секунда тишины посреди фразы ощущается как поломка собеседника.
Поэтому OpenAI развела систему на два контура. Аудио движется по маленькому dedicated fast path, а tool use, business logic и делегирование frontier-модели живут за асинхронной RPC-границей. Медленный поиск задержит собственный результат, но не остановит media stream.
Media frontend и inference logic переписали с Python asyncio на Go. Внутренняя метрика OpenAI выразительна без абсолютных миллисекунд: p95 новой системы стал равен прежнему p50. Stateful conversation при этом может пережить миграцию между model instances. Новый instance прогревается рядом со старым, получает контекст и принимает поток после готовности; таким же способом скрывается дорогая compaction и перестройка KV-cache.
Получается полезная продуктовая модель: один AI поддерживает ритм разговора, другой выполняет медленную интеллектуальную работу. Пользователь слышит одного собеседника, хотя внутри работает распределённая система с разными latency budget.
Что нужно понимать: full duplex, media fast path, async delegation,
stateful inference, warm handoff.
Источник: инженерная ретроспектива OpenAI.
Агент как корпоративная система
Stripe Kai уместила тысячу skills не в prompt, а в файловую среду
По кейсу LangChain, один инженер собрал первую версию внутреннего агента Kai за неделю. Скорость впечатляет, но интереснее то, что произошло после запуска.
Kai использует S3-backed virtual filesystem, sandboxed Python и summarization. Инструкции и знания раскладываются по skills и подгружаются постепенно, вместо того чтобы навсегда занимать общий prompt. Stripe сообщает, что Kai еженедельно используют 83% сотрудников, а число сессий превысило 60 000.
Успех создал следующий предел. В системе уже больше 1 000 skills и 500 MCP tools. Ни одна модель не может стабильно выбирать из такого каталога, если показывать ей всё сразу. Команда строит гибридный selector: classifier или retrieval сначала сократит пространство, а LLM примет окончательное решение.
Это важная коррекция идеи «умная модель сама разберётся». После определённого масштаба routing становится отдельной системой со своими eval, ошибками доступа и стоимостью. Простой интерфейс пользователя оплачивается сложностью control plane, который он не видит.
Что нужно понимать: virtual filesystem, progressive disclosure, skills,
tool routing, selector.
Источник: кейс Stripe и LangChain.
Комментарий в GitHub стал входом в фоновую автоматизацию
Copilot automations теперь могут запускаться при появлении issue- или pull-request comment. Команда задаёт текст-триггер, а облачный агент, например, исследует stack trace, обновляет документацию или создаёт follow-up issue.
Одновременно GitHub добавила выбор reasoning level для cloud agent и разрешила enterprise-настройки специализировать по командам. Эти три изменения складываются в один продукт: событие запускается внутри рабочего потока, вычислительный бюджет задаётся рядом с моделью, а доступность контролируется организацией.
Но комментарий — внешняя поверхность. Если достаточно совпадения строки, нужно точно понимать, кто способен его создать, какие repository permissions получит агент и может ли неавторизованный участник вызвать дорогую или опасную работу. Event-driven agent требует тех же правил, что webhook и CI job, а не только хорошего system prompt.
Что нужно понимать: event trigger, cloud agent, reasoning budget,
managed policy, repository permissions.
Источники: автоматизации по комментариям, reasoning level, настройки команд.
Microsoft собрала киберзащиту из разных моделей и ролей
Project Perception вошёл в public preview с первым сценарием vulnerability management. Microsoft описывает не одного универсального security agent, а систему red-, blue- и green-team agents с общим context, harness, моделями и actuators.
Специализированная MAI-Cyber-1-Flash работает внутри multi-model MDASH. Microsoft сообщает 96% any-crash score на CyberGym и почти 50% экономии относительно текущей production-конфигурации. Это числа производителя на одном сценарии, а не универсальная оценка cyber capability.
Тем не менее выбор архитектуры показателен. Frontier-модель не обязана делать всё. Быстрая специализированная модель может искать уязвимости, другая — проверять находку, третья — оценивать исправление. Общую ценность создаёт цикл, который передаёт контекст и не позволяет одной роли бесконтрольно объявить себя победителем.
Что нужно понимать: multi-model system, red team, blue team,
green team, CyberGym.
Источник: анонс Microsoft.
Открытость и капитал
MiniMax открыла веса H3, но не весь путь до лучшего результата
MiniMax выпустила два checkpoint H3-Base — для first/last-frame и reference generation. 33B dense omni-transformer принимает текст, изображения, видео и аудио и генерирует видео с native stereo sound. В полном workflow заявлены ролики до пятнадцати секунд и до 2K.
Слово «полном» здесь принципиально. Context-IR, который разбирает сложный мультимодальный запрос, остаётся hosted preprocessing service. Regenerate-2K, который повторно прогоняет результат для высокого разрешения, тоже доступен через API. Sparse-attention implementation обещан позже. Локально открыт H3-Base, а не вся система, показанная в лучших примерах.
Это не делает релиз бесполезным. Разработчик получает реальные веса для fine-tuning и локального inference. Но продуктовая граница проходит ровно там, где заканчивается открытый checkpoint и начинается managed workflow. «Open weights» нужно раскладывать на отдельные права и компоненты, иначе один ярлык скрывает половину архитектуры.
Что нужно понимать: open weights, community license, Context-IR,
in-context regeneration, hosted component.
Источники: описание открытого релиза, модель на Hugging Face.
Инвесторы одновременно покупают вычисления и автоматизированную атаку
OLIX привлекла $312 млн при оценке $3,3 млрд на специализированную инфраструктуру для inference. Идея компании — разбить производство токена между подходящими compute и memory компонентами, связать их быстрым interconnect, но сохранить программируемость под меняющиеся архитектуры моделей.
В тот же день Horizon3 привлекла $250 млн при оценке выше $2 млрд на развитие NodeZero — автоматизированного offensive-security продукта. Деньги идут на две стороны одного рынка: дешевле производить интеллектуальную работу и чаще проверять системы атакой.
Оба раунда пока доказывают спрос инвесторов, а не техническое превосходство. У OLIX первые racks впереди. У Horizon3 компания сама описывает эффективность продукта. Но направление капитала показывает, где рынок ждёт дефицит: не в ещё одном chat UI, а в физическом throughput и непрерывной проверке расширяющейся поверхности действий.
Что нужно понимать: inference architecture, memory bottleneck,
automated pentest, continuous validation.
Источники: раунд OLIX, раунд Horizon3.
Palantir продаёт AI как право не отдавать контроль над операциями
Palantir сообщила о квартальной выручке $1,935 млрд — на 93% выше прошлого года. U.S. commercial revenue достигла $764 млн и выросла на 149%. За квартал компания закрыла 220 сделок минимум на $1 млн и подняла прогноз годовой выручки до $8,150–8,158 млрд.
Нельзя автоматически приписать весь рост одной AIP или одному классу моделей. Но язык компании хорошо совпадает с остальными новостями дня. Клиенту продают не доступ к «самому умному AI», а контроль над собственными данными, решениями и операциями. Модель находится внутри этого контура и может меняться; operational layer остаётся.
Именно такой продукт легче защищать бюджетом. API модели можно заменить за квартал. Система, которая знает процессы компании, разрешения, данные и критерии завершения, становится инфраструктурой.
Что нужно понимать: AIP, operational layer, data sovereignty,
enterprise contract.
Источник: результаты Palantir.
Главный технологический сдвиг выпуска
Третьего августа универсальность переехала из модели в систему.
Модель может смотреть на экран, говорить без пауз, искать уязвимости или генерировать видео. Но законченный продукт появляется только после того, как кто-то дал ей память, распределил роли, выбрал инструменты, ограничил события, провёл контекст через несколько компонентов и сохранил контроль над данными.
Поэтому новый конкурентный слой — orchestration без иллюзии, что orchestration является тонкой обвязкой. Это место, где живут latency, безопасность, стоимость, проверяемость и пользовательский опыт одновременно.
Что обсудить с технической командой
- Какие возможности действительно принадлежат модели, а какие создаёт наш harness, memory, selector и execution environment?
- Есть ли у каждого event trigger собственная authorization policy и бюджет?
- Как агент сокращает каталог tools до релевантного и как мы измеряем ошибку routing?
- Можем ли мы заменить модель в multi-model workflow без переписывания всего процесса и потери eval history?
- Что в нашем «открытом» стеке можно запустить независимо, а что требует hosted-компонента поставщика?