К содержанию
Выпуски

Новости · · 11 мин

ИИ и разработка — 16 сентября 2026

Период: 15 сентября — утро 16 сентября.

Главная линия дня: экономика AI всё сильнее определяется не размером модели, а эффективностью всей системы — электричество → специализированная модель → context engineering → permissions → tools → production workflow.

1. Железо и инфраструктура

NVIDIA меняет главный KPI AI-дата-центра: с FLOPS на «полезные agent tokens на мегаватт»

Что произошло. На AI Infra Summit NVIDIA показала DSX — систему, которая динамически перераспределяет power budget между GPU/rack workloads и может снижать нагрузку дата-центра по сигналу энергосети. Компания прямо предлагает измерять AI factories через validated agentic tokens per megawatt.

Что показали данные. Lambda запустила 19 узлов в power budget, обычно рассчитанном на 16: token throughput вырос примерно с 4 до 5 млн токенов/с, то есть на 24%, performance/W — на 23%. NVIDIA отдельно сообщает на SemiAnalysis AgentX до 30× throughput/MW и до 45× меньшую стоимость млн токенов у Vera Rubin NVL72 против GB300 NVL72 на DeepSeek V4 Pro. Последние цифры — vendor-reported результат на внешнем benchmark, а не независимая лабораторная проверка.

AgentX интересен сам по себе: он воспроизводит реальные coding-agent trajectories с ростом context, tool delays и subagents. NVIDIA оценивает типичную такую сессию примерно в 15× больший token volume, чем простой chat request.

Почему важно. Agent economics начинает влиять обратно на hardware: длинные trajectories заставляют оптимизировать не пиковую производительность GPU, а количество законченной AI-работы на фиксированный энергетический бюджет.

Что нужно уже понимать: tokens/MW, power capping, agent trajectory, GPU utilization, demand response.

Что это меняет. Для крупных inference workloads стоит требовать от инфраструктурных поставщиков benchmarks на вашем полном agent workflow, а не только tokens/sec на одиночном запросе.

Дата: 15 сентября.

Первоисточник: NVIDIA — AI Infra Summit


2. Модели

Gemini 3.8 Live: voice-agent теперь может разговаривать, думать и вызывать tools одновременно

Что произошло. Google выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Модели поддерживают background reasoning и asynchronous function calling: агент может продолжать голосовой разговор, пока API/tool выполняется в фоне. Есть visual context и 97+ языков.

Что показали данные. Extended Thinking получил 82,6 на Artificial Analysis Speech-to-Speech Quality Index, 68,6% task completion на τ-Voice, 35,1% на Sierra τ-Voice-banking и 97,7% на Big Bench Audio. Artificial Analysis — независимый leaderboard, остальные результаты публикует Google.

API-price базовой Live-модели: около $0,005/мин входящего и $0,018/мин исходящего audio.

Почему важно. Voice перестаёт быть просто speech-to-text → LLM → text-to-speech. Теперь это полноценный agent interface:

разговор продолжается → reasoning идёт параллельно → tools работают → результат возвращается в разговор.

Что нужно уже понимать: native speech-to-speech, async tool calling, voice agent, τ-bench, full-duplex.

Что это меняет. Для support/sales agents уже имеет смысл тестировать voice как основной интерфейс. Метрика — не естественность речи сама по себе, а task completion, latency, interruptions и стоимость завершённого разговора.

Дата: 15 сентября.

Первоисточник: Google — Gemini 3.8 Live


Salesforce Koa: enterprise начинает дообучать open model под конкретную систему действий

Что произошло. Salesforce и NVIDIA представили Koa — CRM reasoning model на базе open-weight Nemotron 3 Super. Salesforce сама контролирует веса, post-training и inference; training corpus построен на synthetic CRM scenarios более чем из 14 отраслей, без customer data. Использованы SFT и GRPO.

Что показали данные. На собственном Salesforce CRM Benchmark — задачи вроде обновления opportunity, routing case и scheduling follow-up — компания заявляет сопоставимое или лучшее качество относительно ведущих моделей при 3× меньшем числе ошибок. Это vendor benchmark; подробностей достаточно для сигнала, но не для вывода, что Koa в целом сильнее frontier-моделей.

Почему важно. Возникает практичная архитектура:

сильная open base model → domain post-training → tools конкретного SaaS → generic frontier model как fallback.

То есть enterprise может не обучать foundation model с нуля, но получить специализированную reasoning capability и одновременно контролировать inference boundary.

Что нужно уже понимать: open weights, post-training, SFT, GRPO, domain model.

Что это меняет. Если 70–80% agent workload принадлежит узкому домену, стоит benchmark'ить специализированную модель против постоянного использования frontier API.

Дата: 15 сентября.

Первоисточник: Salesforce — Koa


3. Архитектура и эксплуатация агентных систем

В Испании зарегистрирована первая утечка данных, предположительно выполненная AI-agent практически автономно

Что произошло. Испанская AEPD получила первую нотификацию о breach, где сторонний AI-agent, по данным пострадавшей организации, последовательно выполнил несколько стадий атаки: вошёл в систему, самостоятельно искал новые уязвимости, изменил персональные данные и получил доступ к счетам.

Важно: расследование ещё продолжается. AEPD отдельно подчёркивает, что это не означает компрометацию LLM или инфраструктуры её provider. Пока это один зарегистрированный случай, а не доказанная статистическая тенденция.

Что показали данные. Количественных security metrics нет. Значимость — в observed real-world chain с ограниченным human intervention.

Почему важно. Автономность не создаёт принципиально новую уязвимость, но резко уменьшает время между:

получили доступ → нашли следующую слабость → использовали её → двинулись дальше.

Следовательно, human incident response может просто не успевать за machine-speed attack loop.

Что нужно уже понимать: least privilege, credential scope, lateral movement, agentic cyberattack, automatic containment.

Что это меняет. Security architecture должна рассчитывать, что credential, API key или session token будет эксплуатироваться автоматически и сразу. Scope, rate limits и автоматический kill/containment становятся важнее ручного мониторинга.

Дата: 15 сентября.

Первоисточник: AEPD — первая agent-linked breach notification

Дополнительный источник: Reuters.


Исследование «enforcement gap»: хороший auditor бесполезен, если он не способен остановить агента

Это важный paper от 14 сентября, пропущенный в прошлом окне.

Что произошло. Автор исследовал Reflexion-style agents и выделил проблему enforcement gap: система способна определить, что следующий шаг опасен, но executor всё равно его выполняет, потому что audit-output не связан с control path.

Что показали данные. Добавление одного conditional enforcement check менее чем в 20 строк кода снизило attack success более чем в 4 раза в экспериментах на frontier models, пяти agent frameworks и дополнительном benchmark. Это preprint, отправленный на ICLR 2027, пока без peer review.

Почему важно. LLM-as-a-Judge или safety-agent сам по себе ничего не гарантирует:

detect ≠ prevent.

Это не объяснение испанского инцидента выше, но оба события указывают на один системный вопрос: где именно находится hard execution gate.

Что нужно уже понимать: runtime enforcement, LLM-as-a-Judge, policy gate, Reflexion, fail-closed.

Что это меняет. Если verifier решил deny, это должно технически блокировать tool call — независимо от дальнейшего reasoning основного агента.

Дата: 14 сентября.

Исследование: arXiv 2609.15293


4. Production AI, SaaS и бизнес

Docusign: маленькие специализированные модели + правильный context дали −90% стоимости и 8× throughput

Это один из наиболее полезных production case studies недели.

Что произошло. Docusign отказалась от использования больших general-purpose models для каждого этапа document processing и перешла к небольшим fine-tuned моделям для конкретных задач плюс context engineering. Более крупные foundation models используются как teacher: генерируют training data, после проверки ею дообучают маленькие модели.

Что показали данные. На production workload более 1 млн agreements в день:

  • AI processing cost снизился на 90%;
  • throughput вырос до ;
  • accuracy осталась в пределах 2 процентных пунктов от крупных моделей.

Для одной задачи вместо полного 100-страничного договора модели может передаваться около 4 000 релевантных токенов. Это production case study Docusign/Microsoft, а не независимый benchmark.

Почему важно. Это очень сильный контрпример идее «для production нужен максимально сильный model».

На масштабе выигрывает система:

выбрать правильный context → выбрать минимальную достаточную модель → проверить → мониторить.

Что нужно уже понимать: context engineering, fine-tuning, teacher/student, task-specific model, cost per task.

Что это меняет. Перед следующим апгрейдом frontier-модели стоит проверить, сколько нерелевантных tokens система отправляет ей и какие задачи можно передать дешёвым specialist models.

Дата: 15 сентября.

Источник: Microsoft/Docusign production case study


Salesforce делает CRM headless: AI-agent больше не обязан работать внутри интерфейса SaaS

Что произошло. Новый AIforce открывает Salesforce data, workflows, business logic, permissions и actions внешним AI interfaces через MCP, APIs, plugins и skills. Например, Claude получает готовый Salesforce MCP server и 37 sales skills. Все действия по-прежнему проходят через permissions Salesforce.

Почему важно. Это потенциально важный сдвиг в SaaS:

пользователь приходит в приложение

сменяется на:

agent приходит к приложению как к системе данных и действий.

UI становится лишь одним из каналов использования продукта.

Что показали данные. Это product release, не performance benchmark. Salesforce сообщает, что Agentforce Coworker активировали 100 тыс. пользователей за первые 35 дней; это usage metric самой компании.

Что нужно уже понимать: headless SaaS, MCP, system of record, permission propagation, Agent Skills.

Что это меняет. Для SaaS-фаунера становится стратегическим вопрос: сможет ли ваш продукт быть полезен, если пользователь вообще перестанет открывать ваш UI и будет работать через Claude, ChatGPT или корпоративного агента?

Дата: 15 сентября.

Первоисточник: Salesforce — AIforce


TotalEnergies вкладывает более €100 млн в собственные frontier-модели вместе с Mistral

Что произошло. TotalEnergies и Mistral запустили трёхлетнюю программу стоимостью свыше €100 млн для моделей и agentic systems в геологоразведке и reservoir engineering. Цель — объединить proprietary subsurface data, отраслевую экспертизу и специализированные AI-models.

Что показали данные. Пока никаких benchmark или production ROI нет — это investment commitment.

Почему важно. Это ранний сигнал другой модели enterprise AI: компании с действительно уникальными данными могут не ограничиваться RAG поверх общего API, а инвестировать в собственный domain model layer.

Что нужно уже понимать: domain foundation model, proprietary data, AI for Science, agentic workflow.

Что это меняет. Для большинства компаний — пока наблюдать. Собственный model layer оправдан, только если уникальность данных и объём повторяемого workload действительно компенсируют огромную стоимость разработки.

Дата: 15 сентября.

Первоисточник: TotalEnergies — Mistral partnership


5. GitHub / open-source сигналы

ToolReplay: появляется отдельный слой forensic tooling для agent trajectories

Новый Matthew0822/ToolReplay за первые дни набрал около 170 stars и 18 forks. Это не доказательство технической ценности, но категория проекта показательна.

CLI анализирует записанные tool-call transcripts и ищет:

  • одинаковые вызовы с разными результатами;
  • лишние повторные вызовы;
  • выход агента за разрешённый tool scope;
  • изменение уже записанной trajectory через SHA-256 hash chain.

Результаты детерминированы и могут использоваться как CI gate. Автор отдельно уточняет важное ограничение: hash chain защищает от незаметного изменения уже sealed transcript, но не является цифровой подписью — файл можно изменить и заново запечатать.

Почему важно. После стадии observability dashboard open source начинает двигаться к более серьёзному AgentOps:

record → replay → detect divergence → check authority → gate deployment.

Что нужно уже понимать: trajectory replay, tool-call trace, hash chain, scope, CI gate.

Что это меняет. Пока не production recommendation. Но собственные agents уже стоит логировать так, чтобы tool calls можно было воспроизвести и проверить постфактум, а не хранить только финальный ответ.

Дата сигнала: 15 сентября.

Источник: GitHub — ToolReplay

Главный технологический сдвиг выпуска

Сегодня особенно хорошо видно, как оптимизация перемещается со слоя модели на всю систему. NVIDIA оптимизирует agent tokens на мегаватт; Salesforce и Docusign показывают специализированные models и context; research и реальный cyber incident показывают необходимость hard enforcement; open source начинает строить replay и audit infrastructure.

Главный практический вывод: конкурентоспособная AI-система всё чаще выигрывает не потому, что использует самый сильный LLM, а потому что тратит дорогой интеллект только там, где он нужен, а остальное делает специализированным, проверяемым и жёстко контролируемым software.

Что обсудить с технической командой

  1. Какие наши agent tasks действительно требуют frontier-модели, а какие можно отдать specialist model или deterministic tool?
  2. Сколько денег мы теряем на нерелевантном context до того, как начинаем оптимизировать цену модели?
  3. Может ли security/verifier реально заблокировать tool call, или он только пишет предупреждение в trace?
  4. Способен ли наш SaaS работать как governed headless backend для внешних агентов?
  5. Можем ли мы воспроизвести полную trajectory production-agent после инцидента — включая tools, permissions, responses и state?