Двадцатого августа агент перестал помещаться в один model call даже на уровне продуктовых релизов. Anthropic разложила платформу на действие, версионируемую процедуру и долговечный файл. LangSmith добавила для агента отдельную preview- среду на каждый pull request. Google встроила coding harness в общий enterprise контур identity, расходов и наблюдаемости.

Параллельно специализация пошла в обе стороны. Маленькая draft-модель ускоряет большую, time-series foundation model входит в банковский workflow, а научный агент связывает литературу с симуляцией материалов. Универсальность теперь создаётся не одной универсальной моделью, а композицией узких слоёв.

Agent platforms

Claude Platform собрала действие, процедуру и артефакт в один production surface

Anthropic перевела computer use, Skills API и Files API в GA и добавила browser use, который использует структуру страницы вместе со screenshot. Computer use может выполнить несколько действий за model turn. Skills API хранит версионируемые пакеты инструкций, scripts и templates; Files API — повторно используемые входные и выходные артефакты, до 1 ТБ на организацию.

Вендор приводит клиентский кейс с сокращением workflow с 32 до 13 минут, примерно 30-процентным снижением стоимости и стопроцентным completion. Это один выбранный компанией пример без количества задач; переносить проценты на другие сценарии нельзя. HIPAA eligibility также не делает compliant любое приложение автоматически.

Надёжнее сам продуктовый разрез. Tool отвечает за действие, skill — за воспроизводимую процедуру, file — за долговечное состояние между вызовами. Агент становится системой именно тогда, когда эти три слоя перестают прятаться в одном огромном prompt.

Источник: Claude Platform GA.


Google переносит Antigravity под корпоративную identity

Antigravity стала доступна части подписчиков Gemini Enterprise вместе с административными ограничениями, pooled usage, наблюдаемостью и spend controls. Extensions несут тот же harness в VS Code, а в preview — в Visual Studio, JetBrains и Zed. Desktop app и CLI используют корпоративную identity через WIF или ADC и региональные endpoints.

«Available today» относится только к перечисленным лицензиям, а несколько IDE- интеграций ещё не вышли из preview. Google не публикует benchmark качества coding agent.

Событие важно не моделью. В персональном инструменте credentials, бюджет и состояние обычно принадлежат разработчику. Enterprise harness должен подчиниться организации: кто вошёл, в каком регионе исполняется работа, сколько она стоит и какие действия увидит аудит. Antigravity становится корпоративным продуктом ровно на этой границе.

Источник: Antigravity for enterprise.

Проверка изменений

Pull request агента получает исполняемую preview-среду

LangSmith Preview Builds автоматически поднимает isolated production-like environment из ветки GitHub. Reviewer может проверить prompts, tools, traces и failure paths до merge; новые commits создают отдельные revisions. Idle TTL и предел одновременных previews ограничивают расход.

Public Beta доступна только в LangSmith Cloud с GitHub integration. Secrets копируются из parent при создании, поэтому LangChain прямо рекомендует отдельные preview credentials, особенно для внешних contributors.

Для agent code обычного diff недостаточно. Изменение одной инструкции может перестроить всю траекторию, а новый tool — открыть действие, которого в тексте prompt вообще не видно. Preview превращает review из чтения конфигурации в наблюдение поведения. Это дороже статической проверки, но ближе к тому, что после merge получит пользователь.

Источник: LangSmith Preview Builds.


monday.com отказалась от россыпи AI-функций в пользу общей рабочей среды

В кейсе Anthropic и monday.com описан переход от отдельных summarization и categorization features к agent-first платформе. Агенты работают внутри общих boards, context, workflows и permissions. Компании сообщают о 5 млн agent interactions за два месяца и более чем 250 тысячах клиентов monday.com.

Это совместный маркетинговый материал без retention, task success и business- outcome baseline. Interaction count показывает активность, но не полезность.

И всё же причина перестройки узнаваема. «AI dust» добавляет кнопку к каждому экрану, но не знает, как работа проходит между экранами. Агент становится полезным, когда входит в тот же workflow и permission model, что человек, и может продолжить незавершённое состояние вместо генерации ещё одного текста.

Источник: кейс monday.com.

Модели и inference

Маленькая draft-модель ускоряет большую, не меняя её ответ

Liquid AI выпустила DSpark checkpoints для LFM2.5-1.2B-Instruct, 2.6B и 8B-A1B. Они используются в speculative decoding: дешёвая модель предлагает несколько следующих токенов, target проверяет их пачкой. Если предположение принято, выход остаётся выходом target-модели, но требует меньше последовательных шагов.

Liquid заявляет до 3,18× throughput на GPU и до 2,87× на устройстве. Максимумы зависят от пары draft/target, hardware, длины и acceptance rate; speculation также занимает дополнительную память и может не окупиться на коротких или плохо предсказуемых ответах.

Это полезный пример системной оптимизации. Модель ускоряют не меньшим качеством и не новым kernel, а разделением труда между двумя предсказателями. Значимый benchmark здесь должен всегда называть весь контур, а не только красивый максимальный множитель.

Источник: LFM2.5-DSpark.


FalconTST 2.0 идёт в банки не как LLM, а как прогнозная модель

Ant International представила Falcon Time-Series Transformer 2.0 для cash-flow, liquidity exposure и FX management. Среди интеграторов названы Barclays, Citi, Deutsche Bank и Standard Chartered. Компания заявляет более 93% forecast accuracy и SOTA по MASE.

«Accuracy» без горизонта, dataset и определения ошибки мало что объясняет, а процент нельзя сравнивать с MASE как с той же метрикой. Заявленная ранее 60-процентная экономия FX costs в открытом первоисточнике этого дня не подтверждается и в выпуск не входит.

Сильный сигнал — сам тип production-задачи. В управлении ликвидностью нужен не красивый общий reasoning, а устойчивый количественный forecast, встроенный в существующее решение банка. Специализированная foundation model конкурирует с универсальной не широтой, а совпадением со способом проверки результата.

Источник: FalconTST 2.0.

Научные агенты

MAESTRO соединяет поиск литературы с постепенно дорожающей симуляцией

MAESTRO строит computational discovery pipeline для metal-organic frameworks: ищет литературу, связывает papers с crystal structures, собирает пригодную для вычислений базу и пропускает кандидатов через несколько уровней simulation. Перспективные материалы для separation во влажном flue gas нашлись в исходных работах, посвящённых другим задачам.

Это domain-specific preprint. Abstract не даёт общего success rate, стоимости и сравнения с экспертной командой; «end-to-end» заканчивается вычислением, а не автономным wet lab.

Архитектура интересна способом расходовать доказательство. Дешёвый retrieval расширяет воронку, structure matching делает записи сопоставимыми, дорогая симуляция применяется только к прошедшим фильтр. Научный агент здесь ценен не тем, что заменяет учёного одним ответом, а тем, что удерживает provenance между разными представлениями и уровнями стоимости.

Источник: MAESTRO.

Оркестрация рынка

Callosum хочет маршрутизировать одновременно по моделям и типам чипов

Callosum привлекла $100 млн seed на orchestration layer, который выбирает не только модель, но и accelerator type. Среди инвесторов — DCVC и британский Sovereign AI fund.

Источник принадлежит инвестору; публичной демонстрации продукта и performance нет. Размер раунда не доказывает работоспособность router.

Но поставленная задача становится неизбежной. Когда один workload может идти на GPU, wafer-scale system, custom ASIC или локальное устройство, backend нельзя считать однородным. Scheduler должен знать capability, цену, доступность, residency и свойства hardware. Model routing и cluster scheduling сходятся в один рынок исполнения.

Источник: DCVC о Callosum.

Главный технологический сдвиг выпуска

Двадцатого августа универсальность переехала из модели в композицию.

Action, skill и artifact стали отдельными production layers. Preview проверяет их совместное поведение. Identity и budget охватывают один harness во многих IDE. Draft-модель ускоряет target, специализированная модель входит в банковский контур, а научный агент связывает несколько типов доказательства.

В такой системе заменить модель сравнительно легко. Гораздо сложнее сохранить процедуру, состояние, права, наблюдаемость и критерий успеха. Именно они и становятся настоящим продуктом.

Что обсудить с технической командой

  1. Разделены ли у нашего агента versioned procedure, tool capability и durable artifact либо всё спрятано в одном prompt?
  2. Можно ли проверить изменение поведения в изолированной preview-среде до merge, включая failure paths и реальные tools?
  3. Какие secrets копируются в preview и чем ограничены действия внешнего contributor?
  4. Где специализированная модель даст более проверяемый результат, чем универсальная LLM?
  5. Учитывает ли routing одновременно свойства модели, hardware, цену и residency?