Третьего августа модель окончательно перестала быть продуктом сама по себе.

Qwen учит агента работать с компьютером по одним пикселям. OpenAI делит живой разговор и глубокое рассуждение между разными системами. Stripe прячет тысячу skills за одним простым интерфейсом. GitHub превращает комментарий в событие для фонового coding agent. Microsoft собирает cyber-workflow из нескольких моделей.

Даже «открытая модель» MiniMax оказывается не файлом весов, а гибридным pipeline, часть которого всё равно живёт в облаке.

Побеждает не тот, у кого один раз получился лучший ответ. Побеждает тот, кто умеет дать модели наблюдение, память, инструменты, политику и среду исполнения — и заменить любой из этих компонентов, не развалив весь продукт.

Интерфейс к миру

Qwen-CUA отказалась от DOM и стала смотреть на компьютер как человек

Qwen-CUA видит только screenshots и действует клавиатурой и мышью. Никакого DOM, accessibility tree или специального API приложения. Это намеренное ограничение: один и тот же агент может работать там, где есть человеческий интерфейс, даже если разработчик программы не подготовил для него отдельную интеграцию.

Цена универсальности — длинная визуальная история. Scaffold хранит до двадцати активных снимков, а более старые сворачивает фиксированными блоками, чтобы не разрушать reusable prompt prefix. Для обучения команда подняла rollout fleet почти на 100 000 vCPU и собрала около 40 000 задач с проверяемым результатом.

Авторы сообщают 86,2 на OSWorld-Verified для 397B-A17B MoE и 87,6 для версии свыше триллиона параметров. Но эти цифры не означают, что агент надёжно работает «почти везде». На OSWorld 2.0 результаты заметно ниже, а RedTeamCUA показывает, что prompt injection остаётся реальной частью интерфейса, пусть attack success и снизился относительно Qwen3.7.

Главный шаг — не ещё один desktop benchmark. Outcome в компьютерной задаче становится проверяемым без привилегированного machine-readable канала наблюдения. Теперь bottleneck смещается в качество trajectory, безопасность экрана и контроль side effects.

Что нужно понимать: computer use, visual history, verifiable reward, OSWorld, prompt injection.

Источник: paper Qwen-CUA.

GPT-Live вынесла «думать» за пределы живого разговора

Голосовой интерфейс не может ждать так же, как текстовый. Секунда тишины после клика терпима; секунда тишины посреди фразы ощущается как поломка собеседника.

Поэтому OpenAI развела систему на два контура. Аудио движется по маленькому dedicated fast path, а tool use, business logic и делегирование frontier-модели живут за асинхронной RPC-границей. Медленный поиск задержит собственный результат, но не остановит media stream.

Media frontend и inference logic переписали с Python asyncio на Go. Внутренняя метрика OpenAI выразительна без абсолютных миллисекунд: p95 новой системы стал равен прежнему p50. Stateful conversation при этом может пережить миграцию между model instances. Новый instance прогревается рядом со старым, получает контекст и принимает поток после готовности; таким же способом скрывается дорогая compaction и перестройка KV-cache.

Получается полезная продуктовая модель: один AI поддерживает ритм разговора, другой выполняет медленную интеллектуальную работу. Пользователь слышит одного собеседника, хотя внутри работает распределённая система с разными latency budget.

Что нужно понимать: full duplex, media fast path, async delegation, stateful inference, warm handoff.

Источник: инженерная ретроспектива OpenAI.

Агент как корпоративная система

Stripe Kai уместила тысячу skills не в prompt, а в файловую среду

По кейсу LangChain, один инженер собрал первую версию внутреннего агента Kai за неделю. Скорость впечатляет, но интереснее то, что произошло после запуска.

Kai использует S3-backed virtual filesystem, sandboxed Python и summarization. Инструкции и знания раскладываются по skills и подгружаются постепенно, вместо того чтобы навсегда занимать общий prompt. Stripe сообщает, что Kai еженедельно используют 83% сотрудников, а число сессий превысило 60 000.

Успех создал следующий предел. В системе уже больше 1 000 skills и 500 MCP tools. Ни одна модель не может стабильно выбирать из такого каталога, если показывать ей всё сразу. Команда строит гибридный selector: classifier или retrieval сначала сократит пространство, а LLM примет окончательное решение.

Это важная коррекция идеи «умная модель сама разберётся». После определённого масштаба routing становится отдельной системой со своими eval, ошибками доступа и стоимостью. Простой интерфейс пользователя оплачивается сложностью control plane, который он не видит.

Что нужно понимать: virtual filesystem, progressive disclosure, skills, tool routing, selector.

Источник: кейс Stripe и LangChain.

Комментарий в GitHub стал входом в фоновую автоматизацию

Copilot automations теперь могут запускаться при появлении issue- или pull-request comment. Команда задаёт текст-триггер, а облачный агент, например, исследует stack trace, обновляет документацию или создаёт follow-up issue.

Одновременно GitHub добавила выбор reasoning level для cloud agent и разрешила enterprise-настройки специализировать по командам. Эти три изменения складываются в один продукт: событие запускается внутри рабочего потока, вычислительный бюджет задаётся рядом с моделью, а доступность контролируется организацией.

Но комментарий — внешняя поверхность. Если достаточно совпадения строки, нужно точно понимать, кто способен его создать, какие repository permissions получит агент и может ли неавторизованный участник вызвать дорогую или опасную работу. Event-driven agent требует тех же правил, что webhook и CI job, а не только хорошего system prompt.

Что нужно понимать: event trigger, cloud agent, reasoning budget, managed policy, repository permissions.

Источники: автоматизации по комментариям, reasoning level, настройки команд.

Microsoft собрала киберзащиту из разных моделей и ролей

Project Perception вошёл в public preview с первым сценарием vulnerability management. Microsoft описывает не одного универсального security agent, а систему red-, blue- и green-team agents с общим context, harness, моделями и actuators.

Специализированная MAI-Cyber-1-Flash работает внутри multi-model MDASH. Microsoft сообщает 96% any-crash score на CyberGym и почти 50% экономии относительно текущей production-конфигурации. Это числа производителя на одном сценарии, а не универсальная оценка cyber capability.

Тем не менее выбор архитектуры показателен. Frontier-модель не обязана делать всё. Быстрая специализированная модель может искать уязвимости, другая — проверять находку, третья — оценивать исправление. Общую ценность создаёт цикл, который передаёт контекст и не позволяет одной роли бесконтрольно объявить себя победителем.

Что нужно понимать: multi-model system, red team, blue team, green team, CyberGym.

Источник: анонс Microsoft.

Открытость и капитал

MiniMax открыла веса H3, но не весь путь до лучшего результата

MiniMax выпустила два checkpoint H3-Base — для first/last-frame и reference generation. 33B dense omni-transformer принимает текст, изображения, видео и аудио и генерирует видео с native stereo sound. В полном workflow заявлены ролики до пятнадцати секунд и до 2K.

Слово «полном» здесь принципиально. Context-IR, который разбирает сложный мультимодальный запрос, остаётся hosted preprocessing service. Regenerate-2K, который повторно прогоняет результат для высокого разрешения, тоже доступен через API. Sparse-attention implementation обещан позже. Локально открыт H3-Base, а не вся система, показанная в лучших примерах.

Это не делает релиз бесполезным. Разработчик получает реальные веса для fine-tuning и локального inference. Но продуктовая граница проходит ровно там, где заканчивается открытый checkpoint и начинается managed workflow. «Open weights» нужно раскладывать на отдельные права и компоненты, иначе один ярлык скрывает половину архитектуры.

Что нужно понимать: open weights, community license, Context-IR, in-context regeneration, hosted component.

Источники: описание открытого релиза, модель на Hugging Face.

Инвесторы одновременно покупают вычисления и автоматизированную атаку

OLIX привлекла $312 млн при оценке $3,3 млрд на специализированную инфраструктуру для inference. Идея компании — разбить производство токена между подходящими compute и memory компонентами, связать их быстрым interconnect, но сохранить программируемость под меняющиеся архитектуры моделей.

В тот же день Horizon3 привлекла $250 млн при оценке выше $2 млрд на развитие NodeZero — автоматизированного offensive-security продукта. Деньги идут на две стороны одного рынка: дешевле производить интеллектуальную работу и чаще проверять системы атакой.

Оба раунда пока доказывают спрос инвесторов, а не техническое превосходство. У OLIX первые racks впереди. У Horizon3 компания сама описывает эффективность продукта. Но направление капитала показывает, где рынок ждёт дефицит: не в ещё одном chat UI, а в физическом throughput и непрерывной проверке расширяющейся поверхности действий.

Что нужно понимать: inference architecture, memory bottleneck, automated pentest, continuous validation.

Источники: раунд OLIX, раунд Horizon3.

Palantir продаёт AI как право не отдавать контроль над операциями

Palantir сообщила о квартальной выручке $1,935 млрд — на 93% выше прошлого года. U.S. commercial revenue достигла $764 млн и выросла на 149%. За квартал компания закрыла 220 сделок минимум на $1 млн и подняла прогноз годовой выручки до $8,150–8,158 млрд.

Нельзя автоматически приписать весь рост одной AIP или одному классу моделей. Но язык компании хорошо совпадает с остальными новостями дня. Клиенту продают не доступ к «самому умному AI», а контроль над собственными данными, решениями и операциями. Модель находится внутри этого контура и может меняться; operational layer остаётся.

Именно такой продукт легче защищать бюджетом. API модели можно заменить за квартал. Система, которая знает процессы компании, разрешения, данные и критерии завершения, становится инфраструктурой.

Что нужно понимать: AIP, operational layer, data sovereignty, enterprise contract.

Источник: результаты Palantir.

Главный технологический сдвиг выпуска

Третьего августа универсальность переехала из модели в систему.

Модель может смотреть на экран, говорить без пауз, искать уязвимости или генерировать видео. Но законченный продукт появляется только после того, как кто-то дал ей память, распределил роли, выбрал инструменты, ограничил события, провёл контекст через несколько компонентов и сохранил контроль над данными.

Поэтому новый конкурентный слой — orchestration без иллюзии, что orchestration является тонкой обвязкой. Это место, где живут latency, безопасность, стоимость, проверяемость и пользовательский опыт одновременно.

Что обсудить с технической командой

  1. Какие возможности действительно принадлежат модели, а какие создаёт наш harness, memory, selector и execution environment?
  2. Есть ли у каждого event trigger собственная authorization policy и бюджет?
  3. Как агент сокращает каталог tools до релевантного и как мы измеряем ошибку routing?
  4. Можем ли мы заменить модель в multi-model workflow без переписывания всего процесса и потери eval history?
  5. Что в нашем «открытом» стеке можно запустить независимо, а что требует hosted-компонента поставщика?