Двенадцатого августа модели разошлись к противоположным краям масштаба. xAI продаёт 500-тысячный context с ценовым обрывом после 200 тысяч. Qwen открывает веса MoE на 2,4 трлн параметров. Liquid и Cohere, наоборот, помещают vision и работу с документами в 2–3 млрд параметров для edge.

Посередине формируется distribution layer: GitHub распространяет skills и MCP как единый plugin, а инфраструктурные компании показывают, сколько мощности, сетей и будущих контрактов требуется всей этой системе. Масштаб модели больше нельзя обсуждать без масштаба машины и цены её реального использования.

Модели

Grok 4.6 продаёт большой context по ступенчатой цене

Grok 4.6 вышла в API, Grok Build и Cursor с context window 500 тысяч токенов. До 200K вход стоит $2 за миллион токенов, cached input — $0,50, output — $6; выше порога цены удваиваются. xAI заявляет 69,9 на CursorBench и 65,9 на DeepSWE.

500K — максимальная длина, а не гарантия эффективного recall. Benchmarks смешивают собственные и опубликованные конкурентами результаты и не дают независимого cost-normalized сравнения.

Price cliff делает архитектурную цену контекста видимой. Приложение, которое без разбора накапливает history и tool outputs, может одним сообщением перейти в другой тариф. Long context не отменяет retrieval и memory policy — он делает их финансовые ошибки дороже.

Источники: Grok 4.6, документация модели.


Открытые 2,4 трлн параметров всё равно требуют огромной serving-системы

Qwen опубликовала веса Qwen3.8-2.4T-A95B — MoE с 2,4 трлн общих, 95 млрд активных параметров и 92 слоями. Репозиторий датирует открытие весов 12 августа, хотя отдельный cloud endpoint существовал раньше.

Parameter count не равен памяти или compute на запрос: нужны precision, sharding, KV-cache и runtime. Vendor benchmarks не являются независимыми.

Активные 95B заметно уменьшают стоимость относительно dense 2.4T, но не делают модель локальной в бытовом смысле. Open weights дают право владеть checkpoint, а не бесплатную машину для него. На этом масштабе свобода от API-поставщика означает зависимость от собственного distributed serving.

Источники: model card Qwen, репозиторий.


Edge vision расходится на UI и документы

LFM2.5-VL-3B сочетает примерно 3,1B language backbone и SigLIP2 NaFlex encoder. Liquid ориентирует её на screenshots, UI localization, OCR, grounding и tool use. В собственных ablations ToolSandbox вырос с 26,4 до 59,5, BFCL — с 20,5 до 32,5, RefCOCO — с 57,1 до 87,9.

North Micro Vision от Cohere использует 400M native-resolution encoder и 2B language model, сохраняет aspect ratio документов и поддерживает 11 языков. Curriculum прошёл десятки миллионов examples вплоть до A4 resolution; модель вышла под Apache 2.0.

Оба набора цифр принадлежат авторам. У Liquid нет hardware latency для слова edge, а её лицензия не Apache/MIT. У Cohere vLLM support ещё обещан, а часть конкурентов сильнее на STEM и hallucination. Сигнал дня — специализация даже в малых VLM: UI-agent и document parser требуют разных resolution, grounding и runtime trade-offs.

Источники: LFM2.5-VL-3B, North Micro Vision.

Distribution layer

Agent Plugins 1.0 превратил skills и MCP в переносимый пакет

GitHub включила Agent Plugins 1.0 в VS Code, Copilot CLI, SDK и Copilot App. Пакет объединяет Agent Skills и конфигурации MCP servers; для Business и Enterprise предусмотрена managed policy. Спецификация появилась 6 августа, а 12-го началась GA-дистрибуция по продуктам.

Версия 1.0 не говорит о количестве совместимых vendors. «Portable» не означает одинаковых permissions и UX во всех harness, а сохранение старых plugins может оставлять прежние небезопасные соглашения.

Тем не менее agent capability получает узнаваемую единицу поставки. Процедура и инструменты приезжают вместе, а организация может управлять их наличием. Теперь к переносимости нужно добавить provenance, versioning и отдельное согласие на права каждого MCP server.

Источник: Agent Plugins 1.0 GA.

Cybersecurity

Четырёхдневная кампания показала near-autonomous agent operation, но не «полностью автономную атаку»

Dream Security описала recovered workspace размером 160 MB и 1 395 файлов, связанный с кампанией 1–4 июля на Hermes и OpenClaw. До восьми subagents параллельно исследовали пути и меняли тактику против 21 системы; исследователи сообщают о 85 аккаунтах и более 2 500 personnel records.

Все operational numbers идут из отчёта Dream и contemporaneous coverage. Первичный URL отчёта не найден, модель неизвестна, а связь с Китаем основана на косвенных признаках. Государственное подтверждение Тайваня появилось только 13-го и не используется для усиления этого дня.

Оператор задавал цели и инфраструктуру, поэтому «полностью автономная» сильнее доказательств. Надёжнее говорить о near-autonomous execution: человек определяет кампанию, а агенты масштабируют разведку и адаптацию внутри неё.

Источник: современный репортаж исследования.

Экономика инфраструктуры

Nebius растёт быстрее, чем успевает вводить заявленную мощность

Nebius сообщила квартальную выручку около $582 млн, рост 454% год к году и положительную adjusted EBITDA AI cloud. Investor deck показывает более $8 млрд cash, около $2,3 млрд operating cash flow и повышение contracted power guidance с более чем 3 до более чем 4 GW.

Revenue относится ко всей группе, adjusted metrics не равны GAAP, а 4 GW — контрактный pipeline, не работающая capacity. Четыре крупные сделки со средним TCV свыше $1 млрд распределены на будущие годы.

Спрос уже измеряется контрактами и деньгами, но физическое исполнение отстаёт от headline. Энергия становится обещанием будущей поставки compute, которое ещё нужно профинансировать и построить.

Источники: результаты Nebius, SEC presentation.


Cerebras почти учетверила cloud revenue и накопила $25,4 млрд обязательств

Cerebras сообщила GAAP cloud revenue $126 млн, рост 281%, и total revenue $180,1 млн, рост 74%. Remaining performance obligations достигли $25,4 млрд, а live и contracted power должны превысить 600 MW к концу 2027 года.

Core cloud revenue — non-GAAP, RPO — будущие обязательства, не cash. 600 MW смешивает live и contracted capacity; manufacturing expansion не раскрывает исходную базу.

Как и у Nebius, главный вопрос не в наличии спроса, а в conversion backlog в работающий сервис. На специализированном hardware concentration и execution risk особенно велики: контракт нельзя обслужить чужим взаимозаменяемым парком, если собственная машина не введена вовремя.

Источники: релиз Cerebras, 10-Q.


Cisco выделила networking в отдельную строку AI capex

Cisco закончила финансовый год с $9,3 млрд AI infrastructure orders от hyperscalers, из них $4 млрд пришлись на четвёртый квартал. Компания говорит, что признала около $4 млрд соответствующей выручки в FY2026 и ожидает $7,5 млрд в FY2027.

Orders, recognized revenue и guidance — три разные величины. Cisco не раскрывает концентрацию клиентов и состав продуктов, поэтому всю сумму нельзя приписать Ethernet fabrics или одному поколению silicon.

Полезен сам масштаб сети как самостоятельного продукта AI boom. GPU не образуют кластер без fabric, и hyperscaler orders начинают делать эту скрытую часть капитальных затрат видимой в отчётности.

Источник: FY2026 Cisco.

Главный технологический сдвиг выпуска

Двенадцатого августа слово «модель» перестало обозначать сопоставимые продукты.

Одна продаёт 500K context через API, другая открывает 2.4T weights для distributed serving, третья помещает vision на edge. Plugin связывает модель с skills и tools. Ниже cloud providers продают ещё не построенную мощность, а networking становится миллиардной строкой.

Сравнивать такие системы одним benchmark бессмысленно. Нужна полная единица deployment: capability, context, цена, runtime, hardware, data boundary и готовность инфраструктуры сегодня, а не в будущем контракте.

Что обсудить с технической командой

  1. Где long context пересекает ценовой порог и какие данные можно не отправлять повторно?
  2. Что именно даёт open weight, если serving остаётся распределённой инфраструктурой?
  3. Совпадает ли лицензия маленькой edge-модели с требованиями продукта?
  4. Выдаются ли permissions MCP server отдельно от установки plugin package?
  5. Какие power и networking цифры являются live capacity, а какие только contracted guidance?