Тридцатого августа воскресный поток состоял почти целиком из papers, зато они собрались в хорошую карту зрелого агента. Skill получает жизненный цикл. Memory разделяется на несколько представлений и обязана открыть evidence до ответа. Video workflow хранит задачи и артефакты в общем workspace. Judge оценивается как измерительный прибор, а поставщик модели — как сторона, чью честность иногда нужно проверять.
Главный объект дня — не интеллект, а доверие к длинной системе: от того, как она нашла процедуру, до того, какая модель на самом деле выполнила tool call и не подменил ли host один бит в control plane.
Архитектура агентов
Skill становится программным активом с собственным жизненным циклом
Position paper предлагает считать agentic skills переносимым procedural knowledge, а не папкой prompt-файлов. Авторы выделяют девять стадий: discovery, authoring, storage, retrieval, composition, execution и repair, adaptation, evaluation и security governance. Рядом появляются registries, marketplaces и runtime verification.
Это таксономия, не benchmark и не принятый стандарт. Paper не доказывает, что существующие платформы совместимы или что именно девять стадий оптимальны.
Но язык полезен. Если skill влияет на действия агента, ему нужны происхождение, версия, тесты, зависимости, права и отзыв — всё то, что давно требуется коду. Marketplace без этих стадий распространяет не «знание», а непроверяемое поведение. Skill начинает жить как supply-chain artifact.
Источник: systems lifecycle agentic skills.
Память выигрывает не объёмом, а разными представлениями одной истории
Agent Zero Memory соединяет episodic timeline, entity-event graph и citation- locked documentary memory. Retrieval включает intent gate, выбор источника и три параллельных search loop; ответ разрешён только по фактически открытым evidence pointers.
Авторы заявляют 95,60% на LongMemEval и 93,60% на LoCoMo — на 0,73 и 1,10 пункта выше сильнейших сравнений. На восьми backbone-моделях accuracy отличалась на 3,4 пункта при примерно тридцатикратной разнице стоимости; близкое к лучшему качество якобы достигалось до двадцати раз дешевле.
Все цифры self-reported. Нужны проверка splits, равенства baselines, latency и реализации citation lock. Сильная идея не зависит от рекорда: timeline отвечает «когда», graph — «с чем связано», documentary layer — «где доказательство». Одна бесконечная summary плохо выполняет все три роли.
Источник: Agent Zero Memory.
Video-агенты координируются через workspace, а не через пересказ друг друга
FRAMEWORKERS превращает производство видео в динамический Task Stack. Director меняет порядок задач и выбирает sub-agent, Assistant связывает задачу с assets в общем Workspace, вызывает исполнителя и сохраняет результат. Новые исполнители подключаются descriptors; routing дополнительно обучают через SFT и GRPO.
Авторы заявляют преимущество по routing, восстановлению после failures, обобщению на неизвестных sub-agents и итоговому качеству видео. На abstract-page нет числовой базы, judges и стоимости pipeline, поэтому сравнение остаётся заявлением.
Надёжный сигнал — shared workspace. Если каждый агент передаёт следующему текстовый пересказ, теряются версия asset, связь с задачей и промежуточный результат. Когда состояние хранится отдельно, сообщения координируют работу, но не становятся единственным носителем реальности.
Источник: FRAMEWORKERS.
Обучение
World model и policy используют общий вход, но записывают разные выходы
Авторы последовательно обучали next-state world model и reward-maximizing policy, затем анализировали изменения параметров. По их данным, world-model updates имеют низкий ранг, делят input-feature subspace с policy updates, но пишут информацию в почти ортогональные output directions. Sequential training лучше переживало projection interventions и давало более разнообразное исследование states и actions.
Статья принята на EMNLP 2026, но abstract не раскрывает размеры моделей, абсолютные метрики и confidence intervals. Это направление, не готовый рецепт.
Интуиция всё равно интересна: понимание динамики среды и выбор выгодного действия могут опираться на одни признаки, не смешивая целевые представления. Агенту полезно учиться предсказывать последствие до того, как policy научится эксплуатировать reward.
Источник: world-model and policy updates.
Evaluation
LLM-judge меняет строгость вместе с версией модели
Pre-registered audit измерил severity, halo, reliability, cross-version shifts и differential functioning двенадцати LLM judges на 2 377 эссе в двух языках. Разброс строгости на ENEM достиг 219 пунктов из 1 000; на ASAP — 15–33% шкалы, тогда как обученные люди различались примерно на 1%. Correlation с людьми была 0,47–0,56, а все пять смен версий дали значимый shift — до 133 пунктов.
Две preregistered гипотезы дали null. Self-consistency улучшала повторяемость, но не делала оценку человеческой по точности. Это один образовательный сценарий, не все LLM-as-judge задачи.
Практический вывод прямой: score без версии judge не является стабильной метрикой. Model upgrade способен создать «улучшение» или «падение» продукта, не меняя сам продукт. Judge нужно калибровать и версионировать как измерительный инструмент, а не считать невидимым арбитром.
Источник: pre-registered audit LLM judges.
Provenance и безопасность
Подмену API-модели предлагают искать по распределению tool calls
AgentProv строит fingerprint по распределению структурированных действий и применяет MMD permutation test. Это обходит ситуацию, когда API скрывает текст при tool invocation, а provider-injected prompt ломает text-channel audit.
На 630 парах checkpoints авторы обнаружили все выбранные подмены; false-positive rate при injected prompts составил 7% против 67% и 53% у двух baselines. Paper принят на EMNLP, но benchmark создан авторами, а 100% на известных substitutions не защищает от адаптивного provider. Quantization и wrappers тоже могут менять action distribution без злонамеренной подмены.
Сильный сдвиг — provenance проверяется на том канале, который важен агенту. Если модель выбирает tools иначе, текстовое сходство мало утешает: изменилось поведение системы.
Источник: AgentProv.
Один бит в CPU control plane может испортить GPU inference
JITterFlip атакует не веса, а CPU-resident branch code, который выбирает скомпилированные artifacts и запускает GPU kernels. В лабораторных workloads авторы получили gibberish с ростом perplexity от 15,45× до 2,48 млн × и sponge attacks с замедлением от 2,03× до 181,90×. В end-to-end Rowhammer demonstration один bit flip дал до 7,23 млн × по perplexity либо 124,97× задержки при сохранённом ответе.
Эксплуатация зависит от физического окружения, memory layout и конкретного tenant; работа не доказывает массовой cloud-атаки. Но она исправляет threat model: целостность весов и GPU kernels недостаточна. Маленький host-side branch может выбрать неправильный путь огромной вычислительной системы. CPU control plane тоже является частью доверенной базы inference.
Источник: JITterFlip.
Главный технологический сдвиг выпуска
Тридцатого августа доверие разложилось по всему жизненному циклу агента.
Skill требует provenance и governance. Memory обязана показать evidence. Workspace хранит состояние между исполнителями. Judge меняет строгость и должен иметь версию. API-модель оставляет поведенческий fingerprint, а CPU-ветка определяет целостность GPU-результата.
Ни один финальный ответ не доказывает, что вся эта цепочка была правильной. Production-система должна уметь назвать версию каждого слоя и восстановить путь от процедуры и памяти до действия и измерения.
Что обсудить с технической командой
- Есть ли у skills происхождение, версия, тесты, permissions и процедура отзыва?
- Разделяет ли память timeline, связи и цитируемое доказательство?
- Хранят ли агенты общее состояние в workspace или передают реальность только текстовыми summaries?
- Версионируется ли judge вместе с результатами, которые он оценил?
- Какие CPU-компоненты входят в trusted computing base нашего GPU inference?