Двадцать четвёртого августа agent stack начал измеряться как производственная система. NVIDIA вынесла token generation на специализированный ускоритель. Liquid опубликовала benchmark, где единицей сравнения стала точная комбинация модели, quantization, runtime и устройства. Toyota считает не красоту demo, а время от идеи до production-агента.
Даже капитал теперь привязан ко всему стеку сразу: Alibaba направляет размещение акций на модели, облако и связанные технологии. Граница конкуренции проходит не между весами, а между организациями, способными собрать и эксплуатировать весь контур.
Inference и hardware
Groq 3 LPX отделяет быстрый decode от тяжёлого prefill
NVIDIA объявила Groq 3 LPX в full production рядом с Vera Rubin NVL72. Context-heavy prefill остаётся на универсальной rack platform, а latency- sensitive generation передаётся специализированному LPU. Компания ссылается на Artificial Analysis: 3 400 output tokens/s для Gemma 4 31B при контексте 100 тысяч токенов и четырёхкратная responsiveness относительно ближайшей альтернативы.
Full production относится к hardware. Доступ через первого cloud adopter Nebius ещё сформулирован как план. Benchmark выбран и цитируется самим поставщиком, поэтому model, context и basis нельзя отрывать от цифры; «4×» не является скоростью любого агента.
Содержательный сдвиг — disaggregated inference. Prefill и decode имеют разные bottlenecks, и одна архитектура не обязана одинаково хорошо выполнять оба. Serving всё чаще собирает конвейер из специализированных машин.
Источник: NVIDIA о Groq 3 LPX.
Pipette сравнивает не «модель на телефоне», а воспроизводимый deployment
Liquid AI открыла под Apache 2.0 client, management и scoring components Pipette, measurement protocol и raw configuration records. Первый dataset содержит пять performance metrics для более тысячи комбинаций model, quantization, runtime, device и context, свыше 30 моделей и длины от 256 до 8 192. Первые устройства — M5 Max, iPhone 17 Pro и Galaxy S26 Ultra.
Runs используют warm-up и пять измерений с readiness gates по thermal и load. Artificial Analysis проверила методику, но Liquid остаётся одновременно автором benchmark и поставщиком моделей; community submissions ещё beta.
Правильна единица сравнения. Один и тот же checkpoint на другом runtime или quantization — уже другой продукт по памяти и скорости. Pipette не сворачивает quality, latency и memory в магический score, а сохраняет конфигурацию, которую можно попытаться повторить.
Источник: Pipette.
Капитал и production
Alibaba направляет размещение на full-stack AI, но это ещё не capex
Alibaba оценила 710 млн новых акций по HK$112,70, ожидая привлечь около HK$80 млрд gross. Компания заявила, что 100% net proceeds пойдут на foundation models, cloud infrastructure и related technologies. Closing планировался на 26 августа при выполнении условий.
Это размещение и объявленное назначение средств, не уже построенная инфраструктура и не гарантированный return. Всю сумму нельзя называть compute spend, а переводить её в доллары без курса дня — лишняя точность.
Новость показывает масштаб full-stack ставки. Модель, облако и технология её эксплуатации больше не разделены в инвестиционном narrative. Капитал нужен не для одного большого training run, а для постоянного обновления всей вертикали.
Источник: документ Alibaba.
Toyota утверждает, что стандартизация сократила выпуск агента с месяцев до дней
В кейсе LangChain Toyota North America описывает команду примерно из 35 человек и более 50 production agents. Reusable skills, стандартизованный стек Deep Agents/LangGraph/LangSmith и observability, по словам клиента, сократили создание одного агента с шести месяцев и шести инженеров до четырёх дней и одного. GearPal якобы уменьшил диагностику линии с 5–6 часов до 2–3 минут.
Это vendor-selected story без независимого audit, распределения результатов и counterfactual. Будущие «семи-восьмизначные savings» являются прогнозом, а не достигнутой экономией.
Надёжный сигнал — портфель. После десятков агентов стоимость создаёт не ещё один prompt, а общие deployment recipes, permissions, traces и повторно используемые skills. Переход от проекта к платформе и даёт шанс сократить следующий цикл.
Источник: production agents Toyota.
Developer tooling и governance
Copilot harness стал отдельным GA-продуктом внутри JetBrains
GitHub перевела новый Copilot harness в GA в JetBrains plugin. Встроенный JetBrains MCP server остаётся public preview; также появились review- интеграции, multi-root customization discovery и улучшения debug logs, model controls, session resume и длинных tool outputs.
GA относится только к harness, не к MCP server. Changelog не приводит performance baseline и не доказывает рост качества.
Разделение статусов важно архитектурно. Agent runtime и IDE-native tool boundary версионируются независимо: стабильный исполнитель может обращаться к ещё экспериментальному набору действий. Product surface должен показывать это пользователю, иначе слово GA создаёт ложное доверие ко всей цепочке.
Источник: Copilot harness for JetBrains.
Главным ограничителем inference руководители называют governance, а не compute
В разборе State of AI Infrastructure report Google сообщает, что 79% опрошенных technology leaders считают security, governance и operational complexity крупнейшими проблемами масштабирования inference. Предлагаемый ответ — общий control plane для identities, policies, observability и workload placement.
Открытая страница не раскрывает sample size и sampling frame, поэтому 79% нельзя считать долей всего рынка. Это perception респондентов и интерпретация вендора, не измеренная частота incidents. URL также оказался доступен нестабильно при повторной проверке.
Но bottleneck правдоподобно смещается. Купить capacity легче, чем согласовать, кто имеет к ней доступ, где могут обрабатываться данные и как расследовать действие агента через несколько систем. Несвязанные stacks умножают именно этот операционный долг.
Источник: Google State of AI Infrastructure.
Evaluation и knowledge
Forecasting agents требуют live evaluation без знаний из будущего
Survey разделяет standalone LLM workflows, tool- и retrieval-augmented agents и гибриды со statistical models. Он охватывает finance, weather, health, energy и operations и собирает negative evidence: чувствительность к малым изменениям, ablations без улучшения от LLM и gains, которые могут происходить из temporal contamination.
Это обзор, не новая forecasting model и не pooled meta-analysis. Неудача LLM в части ablations не доказывает бесполезность всех подходов.
Практические требования хороши: live evaluation, calibration при distribution shift и совместная публикация accuracy и cost. Особенно важно время. Модель, которая видела последующий исход в pretraining или retrieval, не прогнозирует прошлое — она вспоминает будущее.
Источник: survey forecasting agents.
OaK строит ontology под путь решения, а не под красоту графа
Ontology-as-a-Kernel извлекает concepts и relations из требований и training data, строит knowledge graph, генерирует functions для graph reasoning и меняет ontology по feedback judge. Авторы тестируют подход на TravelPlanner, CRMArenaPro и ToolQA и сообщают лучшее evidence grounding и multi-step reliability.
В abstract нет абсолютных scores и стоимости construction; judge-driven refinement наследует bias evaluator. Preprint не доказывает превосходство над хорошим retrieval на любой задаче.
Интересен критерий. Knowledge graph оценивается не по общему впечатлению о полноте, а по тому, помогает ли он пройти конкретный decision path и показать evidence. Структура знаний становится исполняемым ядром задачи, а не ещё одним бесконечным context dump.
Источник: Ontology-as-a-Kernel.
Главный технологический сдвиг выпуска
Двадцать четвёртого августа AI-система стала измеряться целиком.
Отдельные устройства обслуживают разные фазы inference. Benchmark фиксирует artifact, runtime и device. Enterprise считает время от идеи до production, а не скорость первого demo. Governance охватывает identity, policy и placement. Forecast проверяется только без доступа к будущему.
Лучший model score всё ещё важен, но больше не описывает продукт. Продукт — это воспроизводимая и управляемая машина, которая доставляет проверенный результат в реальных ограничениях.
Что обсудить с технической командой
- Какие фазы workload стоит исполнять на разном hardware вместо универсальной платформы?
- Фиксирует ли benchmark точные model artifact, quantization, runtime, device и thermal state?
- Какие общие слои действительно сокращают цикл выпуска пятидесятого агента, а не только первого?
- Показывает ли product surface независимые maturity statuses runtime и его tools?
- Может ли historical forecasting eval доказать отсутствие temporal contamination?