4. Developer tooling и программирование
Android Bench 2.0: короткие coding benchmarks насыщаются, а long-horizon engineering остаётся нерешённым
Что произошло. Google выпустила Android Bench 2.0 с 30 long-horizon задачами: создание приложений, migrations, новые platform features и cross-platform app conversions. Задачи меняют от сотен до тысяч строк и десятки/сотни файлов; каждый task запускается пять раз в чистом containerized environment. Проверка сочетает deterministic tests, database/system checks и multimodal UI judge.
Почему это важно. Android Bench 1.0 уже достиг примерно 90% pass rate у frontier models, но типичная задача меняла медианно лишь 32 строки в 1–2 файлах. Версия 2.0 ближе к реальному engineering: нужно удерживать intent часами, проходить API migrations, integration details, UI и regression constraints.
Что показали данные. GPT-6 Astra + Codex: 28,0% perfect pass rate, 82,2% average completion, 7,9 часа aggregate latency и $375,7 за полный benchmark run. Claude Fable 5.1 + Claude Code: 22,7%, 82,4%, 22,2 часа и $492,6. GPT-5.6 Sol + Codex: 19,3%, 74,3%, 8,6 часа и $235,8. Ни одна конфигурация не прошла целиком ни один full app conversion, хотя отдельные runs достигали около 0,90–0,99 completion. Google отдельно предупреждает, что cost/latency нельзя напрямую трактовать как efficiency: failing runs часто заканчиваются раньше.
Что нужно уже понимать: long-horizon coding; pass rate vs completion rate; regression oracle; agent harness; contamination resistance.
Что это может изменить для продукта или engineering-команды. Для выбора coding agent нужен собственный benchmark на многочасовых задачах. Сравнивайте perfect completion, human interventions, regressions, latency и cost, а не только SWE-bench.
Дата: 17 сентября 2026.
Первоисточник: https://developer.android.google.cn/bench
Методология: https://developer.android.google.cn/bench/methodology/2
Claude Projects превращает одну coding-сессию в coordinator + parallel workers
Что произошло. Anthropic переработала Projects и открыла beta в Claude Code. Пользователь задаёт цель, coordinator scopes работу, создаёт параллельные threads, делегирует задачи, следит за progress, reviews outputs и собирает результат. Каждый thread — отдельная cloud Claude Code session со своей копией/веткой repository; threads используют shared project memory и могут запускать subagents.
Почему это важно. Multi-agent orchestration становится product primitive, а не самописным research framework. Это делает параллельную разработку доступнее, но создаёт новые failure modes: duplicate work, shared-state errors, merge conflicts и непрозрачный рост token spend.
Что показали данные. Controlled productivity benchmark Anthropic для новой архитектуры пока не опубликовала. Компания прямо указывает, что usage может расти быстро и позволяет отдельно задавать model/effort для coordinator и workers. Поэтому это capability release, а не доказанный прирост productivity.
Что нужно уже понимать: coordinator/worker; parallel branches; shared memory; subagent; merge conflict.
Что это может изменить для продукта или engineering-команды. Стоит провести внутренний эксперимент на действительно параллелимых задачах. Единица сравнения — completed accepted work per dollar/hour с учётом review и merge overhead.
Дата: 17 сентября 2026.
Первоисточник: https://claude.com/blog/projects-redesigned
Google обновила Antigravity Agent: managed harness становится стабильнее как API primitive
Что произошло. Google выпустила antigravity-preview-09-2026, заменяющий майскую версию managed agent. Один API call поднимает Linux sandbox, agent loop может выполнять Bash/Python/Node, редактировать и искать файлы, пользоваться web search и сохранять state между interactions. В новой версии file editing перешёл с full rewrites на line-range replacements, появились отдельные file/code search tools.
Почему это важно. Agent harness всё чаще поставляется самим model/cloud provider как managed runtime. Это снижает стоимость создания собственного sandbox/orchestrator, но увеличивает vendor lock-in на уровне tool schema, state и execution environment.
Что показали данные. Google указывает типичный расход 100K–3M tokens на interaction; сложные workflows могут доходить до 3–5M. Оценочные costs для типовых задач — примерно $0,25–$3,25, до около $5 для сложных workflows; 50–70% input tokens обычно cached. Environment compute в preview не тарифицируется. Это vendor estimates, не независимый benchmark.
Что нужно уже понимать: managed agent; sandbox; tool schema; token budget; stateful interaction.
Что это может изменить для продукта или engineering-команды. Для нового agent product имеет смысл сравнить managed runtime с собственным harness по TCO, observability, portability, security controls и пределам кастомизации. Особенно важно учитывать migration cost при изменении built-in tool schema.
Дата: 17 сентября 2026.
Первоисточники: https://ai.google.dev/gemini-api/docs/changelog ; https://ai.google.dev/gemini-api/docs/antigravity-agent
Plugin4Shell показывает, что agent plugins/skills — полноценная software supply chain
Что произошло. Air Security раскрыла Plugin4Shell — класс обхода SHA-pinning при установке/автообновлении plugins в coding agents. По описанию исследователей, клиент мог выполнить checkout указанного commit, но не удостовериться, что итоговый working tree действительно соответствует ожидаемому объекту; при контроле upstream repository это позволяло подменить code при auto-update.
Почему это важно. Skill/plugin часто воспринимается как «инструкция для модели», но на практике может включать scripts, hooks и tools с filesystem/network/credential authority coding agent. Поэтому plugin marketplace нужно защищать как package manager/CI supply chain.
Что показали данные. Air Security сообщает PoC для Claude Code, Codex, Copilot и Gemini CLI. Claude Code исправил класс проблемы в 2.1.179, Codex — в 0.146.0. Для Copilot есть существенное уточнение: GitHub сообщил The Register, что hosted GitHub marketplaces не подвержены конкретному сценарию, потому что GitHub не позволяет создать branch/tag, выглядящий как SHA; следовательно, корректно говорить о классе supply-chain риска, а не об универсальной эксплуатации всех установок.
Что нужно уже понимать: software supply chain; commit pinning; auto-update; plugin marketplace; least privilege.
Что это может изменить для продукта или engineering-команды. Allowlist sources, проверка resolved object/commit, controlled updates и sandbox должны применяться к agent plugins примерно так же, как к CI Actions и package dependencies.
Дата публичного раскрытия: 17 сентября 2026.
Первоисточник: https://www.air.security/blog-posts/plugin4shell
Дополнительный источник: https://www.theregister.com/security/2026/09/17/ai-coding-agents-0-click-rce-flaw-could-hand-attackers-keys-to-the-kingdom/5297335