Тринадцатого августа рынок одновременно удешевлял model call и усложнял систему вокруг него. Google временно режет цену Flash вдвое. DeepSeek выпускает V4-Pro с тремя уровнями reasoning. OpenAI продаёт отдельный сверхбыстрый serving path, а в собственном руководстве просит отделять deterministic orchestration от решения модели.

Главная новость не в том, что появилось больше режимов. Поставщики наконец признают: latency, reasoning effort, coordination и цена — независимые ручки, и ни одна модель не выставит их правильно для продукта сама.

Модели и serving

Gemini 3.7 Flash начинает конкурировать временной ценой

Gemini 3.7 Flash вышла в Gemini API и продуктах Google. До конца 2026 года introductory price составляет $0,75 за миллион input tokens и $3,75 за output — примерно половину launch pricing Gemini 3.6 Flash. Google заявляет улучшения reasoning, coding, multilingual и tool use при Flash latency profile.

Цена временная и не включает полный blended cost с caching, batch и длинным context. Benchmarks принадлежат Google, независимого blind evaluation в день релиза нет.

Сильный факт — агрессивная ставка на high-volume agent steps. Дешёвая быстрая модель ценна не как слабая замена frontier, а как исполнитель большей части траектории. Но продукту придётся заранее решить, когда promotional economics закончится и какая модель сохранит бюджет после 2026 года.

Источник: Gemini 3.7 Flash.


DeepSeek V4-Pro вышла сегодня, а новая цена начнёт действовать только 16-го

V4-Pro стала GA в приложении, web и API. DeepSeek добавила reasoning levels low, high и max и совместимость с OpenAI Responses API. Одновременно компания опубликовала peak/off-peak schedule, но явно назначила его вступление на 16 августа в 16:00 UTC.

Тариф зависит от cache hit и времени суток, поэтому его нельзя свести к одному проценту подорожания. Vendor benchmarks не независимы.

Хронологическая граница важнее кажется. 13-го доступны модель и интерфейс, но не новая фактическая цена. Для agent scheduler announced future rate уже является входом планирования, однако ретроспективная стоимость запусков до 16-го обязана считаться по старым условиям.

Источник: DeepSeek V4-Pro GA.


Ultrafast меняет не цену токена, а число возможных шагов в минуту

OpenAI открыла ограниченный preview GPT-5.6 Sol на Cerebras. Компания заявляет до 14× скорости Standard tier и до 750 output tokens/s для select customers.

Оба числа — максимумы без раскрытых prompt length, concurrency, time-to-first- token и стоимости. Limited preview не равен публичному API, а OpenAI и Cerebras заинтересованы в результате.

Низкая latency особенно ценна в цикле reason → tool → observe → retry. Ускорение одного decode сокращает не только ожидание ответа, но число минут на полную траекторию. Реальный benchmark должен измерять завершённую задачу: быстрый текст не поможет, если tool или verification остаются bottleneck.

Источник: Ultrafast preview.

Agent architecture

DeepSeek Harness делает session log append-only

DeepSeek открыла MIT-licensed Harness в developer preview. Runtime строится вокруг Cordis и принципа «everything is a plugin»: модели, tools, memory и UI заменяются пакетами. History хранится append-only, а presets standard, code, minimal и creator задают четыре профиля.

Явного timestamp на landing page нет; дата восстановлена по первой публикации репозитория. Performance benchmark отсутствует, preview API нестабилен.

Append-only здесь важнее plugin slogan. Перезапись единственного mutable transcript удобна, пока не нужно доказать порядок действий или восстановиться после сбоя. Журнал событий сохраняет историю, из которой можно построить новое представление, не меняя прошлое задним числом.

Источники: DeepSeek Harness, репозиторий.


OpenAI формализует agent engineering как разделение вероятностного и детерминированного

Builder's Guide to GPT-5.6 рекомендует отделять orchestration от model judgment, давать tools узкие contracts и проверяемые outputs, строить длинные задачи через context и checkpoints, а eval — по trajectory, latency и cost.

Это руководство поставщика под собственную модель, не независимый стандарт и не новый benchmark. Универсального процента улучшения нет.

Тем важнее, что vendor перестаёт описывать production как «напишите лучший prompt». Модель выбирает там, где нужна интерпретация. Обычный код фиксирует порядок, полномочия и acceptance. Checkpoint делает длинную задачу восстанавливаемой, а trajectory eval проверяет путь, по которому получен ответ.

Источник: Builder's Guide.


Сорок пять security-агентов нашли больше, но потратили вчетверо больше токенов

Anthropic проверила swarm из 45 агентов на 15 open-source проектах. Координируемая система нашла 266 уязвимостей при 27 млн токенов; независимые агенты — 21 при 6,5 млн. Авторы отмечают diminishing returns без shared evidence и явного разделения ролей.

Бюджеты отличаются более чем в четыре раза, поэтому 266 против 21 не изолирует эффект coordination. Findings не равны критическим CVE, а model и harness принадлежат Anthropic.

Эксперимент показывает сразу пользу и цену swarm. Параллельность расширяет поиск, но только общая доказательная база мешает десяткам агентов повторять одну работу. Сравнивать нужно findings после validation на единицу compute, а не один впечатляющий total.

Источник: multi-agent systems Anthropic.

Рынок

Databricks привлекла $5 млрд на AI-платформу стоимостью $190 млрд

Databricks закрыла раунд $5 млрд при post-money valuation $190 млрд. Компания сообщает revenue run-rate свыше $7 млрд и рост более 80% год к году; средства идут на AI products, acquisitions и liquidity сотрудников.

Run-rate — экстраполяция текущего темпа, не признанная годовая выручка. Valuation не равна proceeds и ничего не доказывает об unit economics. Официальный URL не индексировался, поэтому использованы копия заявления и TechCrunch.

Сумма показывает, что data и agent platform финансируются как единый enterprise layer. Но огромный капитал не отвечает, какая доля роста устойчива и сколько стоит обслуживать вычислительную нагрузку клиентов.

Источники: копия заявления, TechCrunch.


OpenAI назначила руководителя, отвечающего за превращение adoption в выручку

Бывший президент HashiCorp Дали Райич стал chief revenue officer OpenAI и объединил enterprise sales, partnerships и commercialization. Компания заявляет более 1 млрд weekly users и свыше 2 млн business customers — примерно вдвое больше год к году.

Weekly users и businesses — разные единицы; не раскрыты paid criteria, seats и revenue. Appointment не является доказательством роста продукта.

Организационный сигнал всё же ясен. После model launch cadence отдельной функцией становится дистрибуция: договоры, закупка, партнёрства и превращение массового использования в повторяемый enterprise business.

Источник: назначение Дали Райича.

Главный технологический сдвиг выпуска

Тринадцатого августа модель получила несколько независимых режимов эксплуатации.

Flash оптимизируется под массовый дешёвый шаг. Pro даёт уровни reasoning и time-based pricing. Ultrafast покупает минимальную latency. Harness сохраняет историю, guide отделяет decision от orchestration, swarm меняет compute на ширину поиска.

Нет одного лучшего режима. Production architecture должна выбирать его под конкретный участок траектории и сохранять доказательство того, что более дорогой или сложный путь действительно улучшил итог.

Что обсудить с технической командой

  1. Что произойдёт с unit economics после окончания introductory pricing?
  2. Версионируются ли тарифы вместе с историческими расчётами agent runs?
  3. Измеряем ли low-latency tier по завершённой trajectory, а не token speed?
  4. Какая часть workflow обязана быть append-only для восстановления и аудита?
  5. Сравнивается ли multi-agent search по проверенным findings на единицу compute?