Шестнадцатого августа длинная agent trajectory стала главным объектом инженерии. Prime Intellect дала агентам до восьми дней научного поиска. HyMem разделила план и подробные execution traces. Bounded Agents провела delegated authority через отдельную цепочку, а code review заставил reviewer и critic обязательно не соглашаться.
Даже экономика теперь меняется внутри дня: новые тарифы DeepSeek вступили в силу ровно в 16:00 UTC. Для долгого агента версия модели, reasoning, цена и полномочия должны быть частью одного сохранённого контракта запуска.
Agent runtimes
Hermes собрала три дня быстрых изменений в стабильный тег
Hermes Agent 0.20.2 объединила, по подсчёту maintainer, около 397 pull requests, 967 commits и 1 279 файлов между тегами 13 и 16 августа. Rollup охватывает несколько agent gateways, MCP health, persisted model routes, prompt caching, Windows probes, Telegram topics и hardening cron, auth и installers.
Counts включают generated и mechanical changes и не равны числу возможностей. Полные curated notes отложены до 0.21.0, поэтому release нельзя раскладывать на более точные claims, чем дал maintainer.
Значим сам stable checkpoint. Быстро меняющийся runtime нужен downstream Docker images, hosted deployments и fresh installs в воспроизводимой версии. Без тега «последнее состояние main» не является поставляемым продуктом и не позволяет связать failure с конкретной сборкой.
Источник: Hermes Agent 0.20.2.
Pricing
Тариф DeepSeek изменился в середине суток
Peak/off-peak schedule V4-Pro, объявленный 13 августа, начал действовать 16-го в 16:00 UTC. Таблица различает cache hit и miss, input и output, время суток; сама модель также имеет low, high и max reasoning.
Без конкретного token mix и локального окна нельзя свести тариф к одной цене или проценту изменения. Официальный schedule не равен измеренному customer bill.
Для retrospective точный timestamp принципиален: запуск утром и вечером одного дня мог стоить по разным правилам. Agent ledger должен хранить не только model name, но pricing version, cache behavior и effort каждого вызова. Иначе историческую стоимость невозможно восстановить честно.
Источник: DeepSeek pricing schedule.
Автономное исследование
Восемь дней работы не гарантировали агенту новых научных идей
Prime Intellect провела 153 autonomous research runs на 18 frontier-моделях. Каждый агент получал isolated 8×H200 environment и до восьми дней, чтобы уменьшить training steps 124M GPT до target loss. Лучший Claude Fable 5 достиг 2 726 steps — 81,7% пути от baseline 3 290 к заявленному human record 2 600.
Это доля закрытого разрыва между выбранными точками, не «процент человеческого интеллекта». Дата привязана к contemporaneous announcement, compute budgets огромны, а human record не подтверждён независимо.
Авторы отмечают высокую variance и мало действительно новых идей. Long horizon даёт время перебрать больше вариантов, но не создаёт автоматически хороший research taste. Нужны replicates, журнал гипотез и разделение найденного улучшения от случайного удачного run.
Источник: Measuring Autonomous Research.
Memory architecture
HyMem не даёт подробному исполнению затопить высокоуровневый план
HyMem хранит план отдельно от execution traces. Сложный analysis уходит в изолированный module и возвращает в persistent context структурированное summary. С DeepSeek-V4 авторы заявляют Pass@1 66,7% на GAIA и 61,3% на BrowseComp-plus — на 6,1 и 4,7 пункта выше сильнейшего baseline.
Это два benchmark и один backbone. Стоимость summaries и риск потери evidence не включены в headline; независимой репликации нет.
Разделение полезно не как ещё одна compression. План отвечает, куда идёт задача, trace — что именно произошло. Если смешать их в один растущий context, поздняя деталь вытесняет цель. Summary должна оставлять ссылку на исходный trace, чтобы экономия не уничтожала возможность проверки.
Источник: HyMem.
Делегированные полномочия
Authority сужается при каждом handoff между user, agent и subagent
Agentic Principal Chain хранит scope и budget передачи полномочия вне модели и проверяет новое действие в контексте предыдущих. На 3 154 instances compromised-model test снизил exfiltration AgentDojo с 75–100% до нуля и заблокировал 544 data-stealing cases. Intent binding уменьшил destruction с 38,6% до 4,0%, manipulation — с 90,5% до 12,1%; p99 проверки составил 0,24 мс.
Attack call вставлялся ground-truth после первого легитимного вызова, поэтому эксперимент изолирует authorization, а не discovery. Utility снизилась на 8,6 и 13,9 пункта в двух settings. Неизвестная опасная композиция останется разрешённой, если restriction set её не описывает.
Результат показывает цену реального blast-radius control. Полномочие не копируется subagent целиком; оно становится уже, а проверка остаётся stateful и serialized. Без этой цепочки делегирование незаметно превращается в escalation.
Источник: Bounded Agents.
Review
Три агента оказались полезны только после обязательного несогласия
Adversarial Review использует coding agent, reviewer и critic. Critic обязан проверить review через structured disagreement до исправлений. На LiveCodeBench три агента дали лучший pass rate среди методов и обошли five-agent baseline. На SWE-PRBench наивная схема показала false consensus; одна prompt iteration с явным disagreement дала лучший F1.
Abstract не раскрывает абсолютные scores, а prompt правили после обнаружения проблемы, возможно под benchmark. Это не production code review study.
Но механизм хорошо согласуется с collaboration tax: дополнительные агенты не полезны сами по себе. Если все стремятся быстро согласиться, число голосов лишь усиливает одну ошибку. Роль critic должна требовать независимой повторной проверки, а не стилистического одобрения reviewer.
Источник: Adversarial Review.
GUI agents
Одна успешная демонстрация удвоила strict success — на тех же целях
UI-Mate-27B объединяет grounded data engine, SFT, online RL и GUI demonstrations. OSWorkerBench содержит 100 длинных office tasks в 41 приложении. Авторы заявляют 77,0% на OSWorld-Verified, 66,2% на WindowsAgentArena и 41,0% strict success на собственном benchmark.
На 33 self-demo tasks одна успешная strong-agent trajectory подняла strict success с 17,2% до 35,4%. Но это демонстрации тех же targets; отдельные variant tasks используют related human recordings. Новый benchmark и модель принадлежат одной команде.
Demonstration сильна потому, что показывает не только цель, но path в конкретном UI. Однако тот же путь легко переоценивает переносимость. Eval обязан разделять instruction-only, same-target demo и related-task demo.
Источники: UI-Mate paper, проект.
Serving efficiency
Маленький full-context helper спасает большую модель после агрессивного eviction
KV-Rescue чередует reasoning основной модели с full-context helper и останавливает дегенеративные candidates по entropy и compressibility. На пяти math benchmarks с Qwen2.5-Math 7B и 72B при cache budget B=64 метод вернул в среднем 87% потерянной accuracy; early stopping уменьшил генерацию base model на 43%.
87% считается от gap между evicted и full-KV, не является absolute accuracy. Сокращение токенов большой модели не равно снижению total cost: helper тоже использует compute и context. Проверен только math/Qwen setup.
Интересна complementary error. Маленькая модель с полной памятью может исправить большую, если та потеряла нужный контекст. Размер backbone и доступность evidence — независимые ресурсы; больше параметров не компенсирует удалённый факт.
Источник: KV-Rescue.
Главный технологический сдвиг выпуска
Шестнадцатого августа длинная задача получила собственный execution contract.
Тег фиксирует runtime. Pricing timestamp — стоимость. Plan отделён от trace. Authority сужается через delegation. Reviewer обязан спорить. Demo маркируется по степени близости, а helper возвращает утраченное evidence.
Агент может работать восемь дней только если система способна восстановить, на какой версии, с какими правами, по какой цене и на основании каких данных был сделан каждый шаг.
Что обсудить с технической командой
- Можно ли связать любой failure с точным runtime tag и конфигурацией?
- Хранится ли pricing version каждого model call для ретроспективной экономики?
- Возвращает ли summary ссылку на полный execution trace и evidence?
- Сужается ли authority при каждом subagent handoff?
- Требует ли независимый reviewer доказательного несогласия, а не простого второго голоса?