Двадцать девятого августа, в тихую субботу, вышел необычно цельный набор исследований. Все они по-разному показывают одну и ту же ошибку: мы слишком часто считаем финальный ответ достаточным описанием работы агента.
Машины на кольцевой дороге входят в stop-and-go wave из-за накопленной динамики. API-агент достигает правильного состояния, но не умеет корректно доставить результат. Handoff сохраняет факты и теряет границы доступа. Event stream теряет завершение, хотя durable log уже записал полный tool result.
У системы есть история, и именно в ней живут её главные отказы.
Динамика агентов
Двадцать два LLM-водителя создали пробку без аварии и центрального координатора
Исследователи поставили 22 LLM-агента регуляторами целевой скорости в симуляции кольцевой дороги длиной 230 метров. Решение принималось каждые полсекунды, а обычный IDM оставался collision-avoidance clamp.
В 39 600 решениях по трём seeds агенты воспроизводили stop-and-go waves. Расхождение выбранных скоростей держалось около 8% даже при шестикратном изменении temperature. При большей плотности транспорта критическая доля LLM-управляемых машин, нужная для перехода к нестабильности, снижалась примерно до 0,23.
Это preprint и симуляция, не эксперимент с автономными автомобилями. Результат зависит от prompt, модели, traffic model и safety clamp. Но он хорошо показывает системный эффект: небольшое локальное рассогласование не обязано быть опасным само по себе. Оно становится проблемой через обратную связь и накопление в общей среде. Agent safety нельзя оценивать только независимой точностью каждого следующего действия.
Источник: traffic simulation preprint.
Evaluation
API-агент может сделать работу и всё равно провалить задачу
APIFlow-Bench проверяет длинные зависимые REST workflows и раскладывает успех на семь инженерных способностей. Synthetic API worlds проходят self-test без LLM и oracle solvability check; grading следит за canary по реальному call path и сверяет typed answer card.
У 19 моделей в одном scaffold success снизился с 93% на отдельных subtasks до 74% на чистых цепочках из 20 шагов и до 61% с добавлением 8% испытаний, которые не прошла ни одна модель. Best-of-five улучшал результат на 7 пунктов, а all-five reliability расходилась уже на 44. Самая показательная цифра: 77% неудачных чистых запусков достигли правильного final state, но ошиблись в delivery.
Все результаты принадлежат авторам preprint и требуют воспроизведения. Однако benchmark ловит важную границу. «Сделал изменения» и «вернул проверяемый результат тому, кто его ждёт» — разные способности. В production вторая часто является частью задачи, а не косметикой вокруг неё.
Источник: APIFlow-Bench.
AgentLogs переносит исследование с benchmark-задач на реальные траектории
AgentLogs собирает публичные запуски GitHub Copilot cloud agent. Авторы просканировали 1 812 362 популярных public repositories и нашли agent activity в 35 810. Dataset включает 307 416 задач, 549 239 сессий и более 64,2 млн log entries: prompts, intermediate reasoning, tool calls, Git-операции и token usage.
Это гораздо ближе к реальной разработке, чем набор финальных patches. Но public footprint не представляет private enterprise usage, а наличие reasoning и logs зависит от интерфейсов и privacy filtering GitHub. Перед анализом нужны dataset card, лицензии и отдельная проверка на чувствительные данные.
Сильная сторона набора — возможность изучать процесс: где агент тратит токены, как человек формулирует задачу, какие tool sequences ведут к отказу и что происходит после review. Масштаб важен лишь потому, что сохраняет промежуточные причины, а не только успешный commit.
Источник: AgentLogs.
Память и границы доступа
Короткий handoff сохраняет факты лучше, чем правила обращения с ними
Авторы исследовали multi-agent handoff, где исходное взаимодействие сжимается в summary для следующего агента. Operational facts переживали компрессию почти полностью, а boundary markers — хуже: в свободном тексте survival был около 0,80, при лимите 25 слов падал примерно до 0,57.
Расплывчатая формулировка границ приводила к leakage в 73% GPT- и 50% DeepSeek-сценариев. Явные constraints снижали утечки ниже 15% у всех трёх моделей, а gold-derived audience allowlist почти устранял проблему. Human validation judge дала κ=0,74.
Testbed искусственный, работа не доказывает те же проценты в production. Но механизм правдоподобен: summary оптимизируется на «что произошло», а permission звучит как второстепенная оговорка и исчезает первой. Authorization metadata нужно переносить как отдельное structured state, а не надеяться, что краткий пересказ сохранит её между агентами.
Источник: исследование handoff-компрессии.
Production failure
Полный tool result записан, но потребитель навсегда ждёт отсутствующий конец
В prime-agent 0.8.1 описан bug: daemon и RPC client получают начало выполнения и полный tool result размером около 219 KiB, но не terminal event. Durable JSONL уже содержит результат, а streaming consumer не видит границу завершения и висит до timeout.
Автор патча локализовал проблему в snapshot/backpressure filters и сообщает о 268 прошедших тестах. Но upstream не принял изменение: pull request закрыт contribution gate, а maintainers не подтвердили исправление. Это один тщательно описанный случай, не статистика распространённости.
Урок шире конкретного проекта. Durable state и event stream — две разные реальности. Если consumer доверяет только событию, записанный результат не спасает workflow; если восстановление читает только state, оно может повторить уже выполненное действие. Terminal boundary обязана быть восстанавливаемой, а не существовать лишь как эфемерный frame.
Источник: bug report prime-agent.
Governance науки
Для LLM-assisted доказательства предлагают публиковать не только результат
Пятистраничная argument paper призывает раскрывать prompts и точную software setup математических исследований с LLM, по возможности публиковать machine- verifiable formalization и отдельно требовать понятного человеку интуитивного объяснения.
Это позиция одного автора, не стандарт журнала и не решение математического сообщества. Поддержка и влияние не измерены.
Предложение всё равно попадает в нерв дня. Финальное доказательство может быть формально правильным, но воспроизводимость зависит от скрытого prompt, версии модели и цепочки попыток. Formalization проверяет итог, disclosure объясняет процесс, а человеческое изложение возвращает смысл. Ни один слой не заменяет два других.
Источник: argument paper о disclosure.
Главный технологический сдвиг выпуска
Двадцать девятого августа главным объектом стала не генерация, а сохранённая история действия.
Динамика среды превращает маленькие ошибки в волну. Правильный state не гарантирует правильной доставки. Summary теряет authorization раньше факта. Event stream расходится с durable log. Финальный proof скрывает путь, которым его получила модель.
Поэтому надёжный агент обязан оставлять не больше текста, а правильные границы: что было сделано, кем и с каким правом, какое состояние изменилось, какое событие завершило шаг и как результат можно проверить независимо.
Что обсудить с технической командой
- Какие небольшие локальные ошибки накапливаются через feedback loop общей среды?
- Считаем ли мы доставку и подтверждение результата частью task success?
- Переносится ли authorization между агентами как structured metadata?
- Может ли workflow восстановить terminal state при расхождении event stream и durable log без повторного side effect?
- Какие prompts, версии и траектории нужны, чтобы результат AI-assisted работы действительно воспроизводился?