К содержанию
Выпуски

Новости · · 6 мин

ИИ и разработка — 2 сентября 2026

Период: 1 сентября — утро 2 сентября.

Frontier-модели

Anthropic выпустила Claude Fable 5.1 и Mythos 5.1

Это одна и та же базовая модель с разными safeguard-режимами: Fable 5.1 доступна широко, Mythos 5.1 — только через trusted-access программы для чувствительных задач в cybersecurity и life sciences. Anthropic заявляет заметный рост в long-horizon coding, science и computer-use. На Terminal-Bench 4.0 Fable 5.1 получила 55,8%, Mythos 5.1 — 60,9%; на CursorBench 3.2 — 73,4%. Это прежде всего vendor-evals.

Fable 5.1 должна быть примерно на 25% дешевле Fable 5 в типичных workload и до ~45% дешевле в особенно agentic-сценариях благодаря снижению стоимости cache reads. Модель уже появилась в GitHub Copilot и Amazon Bedrock.

Почему важно: Anthropic явно оптимизирует frontier-модель не только по абсолютному качеству, но по стоимости многочасовых agent runs.

Дата: 1 сентября. Первоисточник: Anthropic — Fable 5.1 / Mythos 5.1.

OpenAI официально признала Astra моделью уровня Critical по кибервозможностям

Ранее OpenAI лишь допускала такой исход. Теперь компания считает, что Astra достигла Critical cybersecurity capability threshold: с подходящими инструментами модель способна автономно искать неизвестные уязвимости и строить exploit chains против хорошо защищённых систем. На внутреннем тестировании Astra обнаружила два zero-day и использовала их в одной цепочке; отдельно построила browser sandbox escape и local privilege-escalation chain до root.

Большой frontier RL-run, остановленный после инцидента с Hugging Face, был возобновлён 28 августа после усиления isolation, network controls и monitoring. Релиз Astra ожидается скоро, но продвинутые cyber-возможности сначала получат только ограниченные тестеры и пользователи Daybreak.

Почему важно: впервые крупная лаборатория официально относит будущую production-модель к категории автономного поиска и эксплуатации zero-day.

Дата: 1 сентября. Первоисточник: OpenAI — Path to Astra.

DeepSeek открыла веса V4-Flash-Vision-Exp

Модель появилась через API ещё 21 августа, но теперь DeepSeek опубликовала полные 305B-веса под MIT. Это первая мультимодальная модель семейства V4; доступны Transformers, vLLM, SGLang и минимальная reference implementation.

По данным DeepSeek, DeepSWE вырос с 54,4% у V4-Flash до 59,3%, Toolathlon — с 70,3% до 75,9%; на multimodal Agents' Last Exam модель показывает 27,3%. Показатели производителя пока следует воспринимать как vendor benchmarks.

Почему важно: vision-capable coding/agent model такого масштаба теперь можно полностью self-host и fine-tune без коммерческих лицензионных ограничений.

Дата публикации весов: 31 августа — 1 сентября. Первоисточник: DeepSeek / Hugging Face.

Agent engineering

Google сделала анализ видео агентным

В Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite появился agentic video understanding. Вместо обработки видео с фиксированным FPS модель сама решает, какие временные участки пересмотреть, с какой частотой кадров и через какой канал — кадры, звук или transcript.

Google заявляет до −88% токенов, −66% стоимости и +7% accuracy относительно статического анализа. Возможны поиск секундного момента внутри многочасового ролика, anomaly detection и подсчёт быстрых действий.

Почему важно: полезный общий паттерн для multimodal agents — не помещать весь медиаобъект в context, а дать модели инструменты для активного выборочного исследования.

Дата: 1 сентября. Первоисточник: Google DeepMind.

Agent payments получили показательный production-кейс на 20 млн транзакций

AWS раскрыла архитектуру t54/x402-secure поверх AgentCore Payments. Система уже обработала более 20 млн agent-initiated micropayments по $0,001–0,01 без ручного подтверждения каждой операции.

Главный инженерный паттерн: модель не определяет собственные финансовые права. Перед каждым платежом выполняется детерминированный trust gate, credentials скрыты от агента, budget ограничен session scope, а агент не может увеличить лимит или создать новую платёжную сессию самостоятельно.

Почему важно: хороший production-пример принципа LLM decides what to do, deterministic infrastructure decides what it is allowed to do.

Дата публикации: 1 сентября. Первоисточник: AWS.

Enterprise / безопасность

Anthropic представила Enterprise Frontier Safeguards

EFS пытается совместить сильные модели с требованиями Zero Data Retention. Логи и prompts могут оставаться в cloud-account самого клиента под его encryption keys, а автоматический safety-monitor анализирует rolling window активности без обязательного human review со стороны Anthropic.

Архитектура должна работать одинаково через AWS, Azure и Google Cloud. Развёртывание начнётся поэтапно этой осенью.

Почему важно: safety monitoring frontier-agents начинает проектироваться как customer-controlled enterprise infrastructure, а не как обязательная передача чувствительных данных model provider.

Дата: 1 сентября. Первоисточник: Anthropic EFS.

Palo Alto Networks купила AI-платформу Console

Console позволяет формулировать operational goals на естественном языке и строить agent workflows для анализа, triage и автоматического remediation. Palo Alto собирается встроить технологию прежде всего в Cortex. Стоимость покупки не раскрыта.

Почему важно: крупные security-платформы быстро переходят от «AI анализирует alerts» к software-as-an-agent, который самостоятельно выполняет corrective actions.

Дата: 1 сентября. Первоисточник: Palo Alto Networks.

AI-инфраструктура

США начинают фильтровать «призрачный» спрос дата-центров на электричество

Reuters обнаружил более 700 ГВт заявок на подключение крупных потребителей только в части США — более чем в десять раз выше текущего оценочного энергопотребления американских дата-центров. В Техасе число заявок выросло примерно с 48 ГВт в 2023 году до 474 ГВт.

Регуляторы начали требовать финансовые гарантии и upfront payments; Техас временно остановил новые подключения, чтобы отделить реальные проекты от спекулятивных или дублирующихся запросов.

Почему важно: следующим ограничителем AI-capex становится не просто доступность энергии, а способность сетей понять, какие из заявленных сотен гигаватт вообще будут построены.

Дата публикации: 1 сентября. Источник: Reuters.

GitHub Trending

Текущий динамический снимок GitHub:

  • THU-MAIC/OpenMAIC — ~3 128 stars за сутки. Уже разбирался ранее; рост после v1.0 остаётся очень высоким.
  • jingyaogong/minimind — ~1 005 stars/сутки. Полный учебный стек для самостоятельного обучения компактной LLM от pretraining до SFT/RL; проект не новый, но снова резко набирает внимание.
  • firecrawl/pdf-inspector — ~541 stars/сутки. Rust-библиотека сначала за 10–50 мс определяет, нужен ли странице OCR, и отправляет на него только необходимые страницы. Firecrawl утверждает, что около 54% PDF можно обрабатывать без OCR.
  • browser-use/video-use — ~472 stars/сутки. Skill для Claude Code/Codex/Hermes и других shell-agents. Видео превращается в компактный transcript с timestamps, а визуальные filmstrip-срезы запрашиваются только по необходимости; есть subagents для анимации и self-review финального монтажа.
  • Gitlawb/openclaude — ~31 тыс. stars всего. Vendor-neutral coding-agent CLI с OpenAI-compatible API, Gemini, Codex, Ollama и другими backends, background sessions, MCP, subagents и per-agent model routing. Сегодня присутствует в Trending, хотя суточный прирост заметно ниже лидеров.

scientific-agent-skills снова быстро растёт (~912 stars/сутки), но уже разбирался в прошлых выпусках и повторно не включён.

Главный сигнал суток: frontier-модели становятся достаточно автономными и опасными, чтобы deployment всё сильнее зависел от внешнего control plane — customer-owned monitoring, deterministic permissions, sandbox и финансовых limits. Одновременно agentic-подход распространяется на video, security и даже платежи.