Двадцать девятого августа, в тихую субботу, вышел необычно цельный набор исследований. Все они по-разному показывают одну и ту же ошибку: мы слишком часто считаем финальный ответ достаточным описанием работы агента.

Машины на кольцевой дороге входят в stop-and-go wave из-за накопленной динамики. API-агент достигает правильного состояния, но не умеет корректно доставить результат. Handoff сохраняет факты и теряет границы доступа. Event stream теряет завершение, хотя durable log уже записал полный tool result.

У системы есть история, и именно в ней живут её главные отказы.

Динамика агентов

Двадцать два LLM-водителя создали пробку без аварии и центрального координатора

Исследователи поставили 22 LLM-агента регуляторами целевой скорости в симуляции кольцевой дороги длиной 230 метров. Решение принималось каждые полсекунды, а обычный IDM оставался collision-avoidance clamp.

В 39 600 решениях по трём seeds агенты воспроизводили stop-and-go waves. Расхождение выбранных скоростей держалось около 8% даже при шестикратном изменении temperature. При большей плотности транспорта критическая доля LLM-управляемых машин, нужная для перехода к нестабильности, снижалась примерно до 0,23.

Это preprint и симуляция, не эксперимент с автономными автомобилями. Результат зависит от prompt, модели, traffic model и safety clamp. Но он хорошо показывает системный эффект: небольшое локальное рассогласование не обязано быть опасным само по себе. Оно становится проблемой через обратную связь и накопление в общей среде. Agent safety нельзя оценивать только независимой точностью каждого следующего действия.

Источник: traffic simulation preprint.

Evaluation

API-агент может сделать работу и всё равно провалить задачу

APIFlow-Bench проверяет длинные зависимые REST workflows и раскладывает успех на семь инженерных способностей. Synthetic API worlds проходят self-test без LLM и oracle solvability check; grading следит за canary по реальному call path и сверяет typed answer card.

У 19 моделей в одном scaffold success снизился с 93% на отдельных subtasks до 74% на чистых цепочках из 20 шагов и до 61% с добавлением 8% испытаний, которые не прошла ни одна модель. Best-of-five улучшал результат на 7 пунктов, а all-five reliability расходилась уже на 44. Самая показательная цифра: 77% неудачных чистых запусков достигли правильного final state, но ошиблись в delivery.

Все результаты принадлежат авторам preprint и требуют воспроизведения. Однако benchmark ловит важную границу. «Сделал изменения» и «вернул проверяемый результат тому, кто его ждёт» — разные способности. В production вторая часто является частью задачи, а не косметикой вокруг неё.

Источник: APIFlow-Bench.


AgentLogs переносит исследование с benchmark-задач на реальные траектории

AgentLogs собирает публичные запуски GitHub Copilot cloud agent. Авторы просканировали 1 812 362 популярных public repositories и нашли agent activity в 35 810. Dataset включает 307 416 задач, 549 239 сессий и более 64,2 млн log entries: prompts, intermediate reasoning, tool calls, Git-операции и token usage.

Это гораздо ближе к реальной разработке, чем набор финальных patches. Но public footprint не представляет private enterprise usage, а наличие reasoning и logs зависит от интерфейсов и privacy filtering GitHub. Перед анализом нужны dataset card, лицензии и отдельная проверка на чувствительные данные.

Сильная сторона набора — возможность изучать процесс: где агент тратит токены, как человек формулирует задачу, какие tool sequences ведут к отказу и что происходит после review. Масштаб важен лишь потому, что сохраняет промежуточные причины, а не только успешный commit.

Источник: AgentLogs.

Память и границы доступа

Короткий handoff сохраняет факты лучше, чем правила обращения с ними

Авторы исследовали multi-agent handoff, где исходное взаимодействие сжимается в summary для следующего агента. Operational facts переживали компрессию почти полностью, а boundary markers — хуже: в свободном тексте survival был около 0,80, при лимите 25 слов падал примерно до 0,57.

Расплывчатая формулировка границ приводила к leakage в 73% GPT- и 50% DeepSeek-сценариев. Явные constraints снижали утечки ниже 15% у всех трёх моделей, а gold-derived audience allowlist почти устранял проблему. Human validation judge дала κ=0,74.

Testbed искусственный, работа не доказывает те же проценты в production. Но механизм правдоподобен: summary оптимизируется на «что произошло», а permission звучит как второстепенная оговорка и исчезает первой. Authorization metadata нужно переносить как отдельное structured state, а не надеяться, что краткий пересказ сохранит её между агентами.

Источник: исследование handoff-компрессии.

Production failure

Полный tool result записан, но потребитель навсегда ждёт отсутствующий конец

В prime-agent 0.8.1 описан bug: daemon и RPC client получают начало выполнения и полный tool result размером около 219 KiB, но не terminal event. Durable JSONL уже содержит результат, а streaming consumer не видит границу завершения и висит до timeout.

Автор патча локализовал проблему в snapshot/backpressure filters и сообщает о 268 прошедших тестах. Но upstream не принял изменение: pull request закрыт contribution gate, а maintainers не подтвердили исправление. Это один тщательно описанный случай, не статистика распространённости.

Урок шире конкретного проекта. Durable state и event stream — две разные реальности. Если consumer доверяет только событию, записанный результат не спасает workflow; если восстановление читает только state, оно может повторить уже выполненное действие. Terminal boundary обязана быть восстанавливаемой, а не существовать лишь как эфемерный frame.

Источник: bug report prime-agent.

Governance науки

Для LLM-assisted доказательства предлагают публиковать не только результат

Пятистраничная argument paper призывает раскрывать prompts и точную software setup математических исследований с LLM, по возможности публиковать machine- verifiable formalization и отдельно требовать понятного человеку интуитивного объяснения.

Это позиция одного автора, не стандарт журнала и не решение математического сообщества. Поддержка и влияние не измерены.

Предложение всё равно попадает в нерв дня. Финальное доказательство может быть формально правильным, но воспроизводимость зависит от скрытого prompt, версии модели и цепочки попыток. Formalization проверяет итог, disclosure объясняет процесс, а человеческое изложение возвращает смысл. Ни один слой не заменяет два других.

Источник: argument paper о disclosure.

Главный технологический сдвиг выпуска

Двадцать девятого августа главным объектом стала не генерация, а сохранённая история действия.

Динамика среды превращает маленькие ошибки в волну. Правильный state не гарантирует правильной доставки. Summary теряет authorization раньше факта. Event stream расходится с durable log. Финальный proof скрывает путь, которым его получила модель.

Поэтому надёжный агент обязан оставлять не больше текста, а правильные границы: что было сделано, кем и с каким правом, какое состояние изменилось, какое событие завершило шаг и как результат можно проверить независимо.

Что обсудить с технической командой

  1. Какие небольшие локальные ошибки накапливаются через feedback loop общей среды?
  2. Считаем ли мы доставку и подтверждение результата частью task success?
  3. Переносится ли authorization между агентами как structured metadata?
  4. Может ли workflow восстановить terminal state при расхождении event stream и durable log без повторного side effect?
  5. Какие prompts, версии и траектории нужны, чтобы результат AI-assisted работы действительно воспроизводился?