Двадцать второго августа papers сложились в день инженерной честности. Красивый результат снова и снова разваливается, если спросить, где проходила проверка. Быстрый kernel бесполезен без интеграции в настоящий inference. Сгенерированный сайт не обучает агента, если половина задач в нём невыполнима. Playable game не гарантирует, что следующая правка не сломает старое поведение.
Даже «безопасный» post-training способен сделать персональные данные легче извлекаемыми, а невинный skill — сжечь token budget. Надёжность оказывается не свойством одного компонента, а качеством стыков между ними.
Инфраструктура
Power cap нужно распределять по фазам inference, а не душить весь GPU одинаково
PowerSlider различает prefill, reasoning и answer decode. Compute-bound prefill теряет throughput почти вместе с частотой, а memory-bound decode в экспериментах авторов держался до 0,57 nominal frequency. Online solver пересчитывал allocation за 7,7 мс.
При снижении power cap на 30% система показала 78,3% goodput против 47,6% у лучшего из пяти baselines; replay аварийного дня CAISO дал 92% среднего goodput. Это preprint и авторская среда на SGLang, а не production deployment энергосети. Результат зависит от SLO, hardware и смеси workload.
Сильная идея проще цифр: LLM-serving не является одной однородной нагрузкой. Когда энергии не хватает, одинаковый throttling тратит производительность там, где она особенно чувствительна, и почти не использует запас там, где bottleneck уже в памяти. Power scheduling становится частью inference scheduler.
Источник: PowerSlider.
Coding agents
Machine-checkable контракт сильнее помогает слабой модели
Эксперимент сравнил пять информационно эквивалентных форматов архитектуры: prose, Mermaid с ADR, OpenAPI, C4/Structurizr и TypeScript contracts. Шесть моделей трёх семейств прошли 90 multi-turn trials.
У сильных моделей spread качества между форматами составил 0,17–0,92 пункта, у слабых — 0,83–2,42. TypeScript contracts подняли route coverage самой слабой модели с 33% до 100%, а self-validation по спектру снизилась со 100% до нуля.
Это preprint одного автора и небольшой task set. Спецификация не заменяет сильную модель. Но она убирает часть работы, которую модель делает особенно ненадёжно: интерпретацию неоднозначной прозы. Проверяемый контракт не добавляет reasoning capability — он сокращает пространство, где она нужна.
Источник: эксперимент с форматами спецификаций.
Игровой benchmark проверяет не screenshot, а накопление изменений
GameXpert-Bench разделён на генерацию, ремонт и развитие игр: 97 generation tasks по 11 жанрам, 100 repair tasks из 50 проверенных levels с 19–27 внедрёнными bugs и 17 цепочек оптимизации по шесть ходов. Оценка использует живое взаимодействие, детерминированные behavioral tests и regressions.
Авторы обнаружили, что agents лучше создают playable foundation и выполняют явное требование, чем сами находят defects, проверяют runtime и сохраняют поведение через серию правок. Это preprint; injected bugs и выбранные игры не покрывают хаос настоящего продукта.
Методическая часть важнее рейтинга. Один удачный запуск игры не говорит, что агент умеет сопровождать её. Software engineering начинается там, где следующая правка обязана сохранить не упомянутые заново свойства предыдущей версии.
Источник: GameXpert-Bench.
Оптимизация и training worlds
Агент оптимизирует kernel только после проверки в реальном inference path
LLM4LLM начинает с target inference script, выделяет phase-aware задачи, ищет patch и принимает его после in-model validation. На десяти workloads авторы заявляют geometric-mean end-to-end latency speedup 3,91× на A100 и 6,98× на H100; работа принята на EMNLP 2026.
Цифры авторские, а workload и harness определяют baseline. Acceptance на конференцию не является независимым воспроизведением и не превращает максимум в универсальное ускорение serving.
Главная ценность — место gate. Изолированный kernel может быть быстрее и при этом неверно работать на shape, dtype или memory path реальной модели. Оптимизация становится полезной только после включения в target script и проверки выхода всей системы.
Источник: LLM4LLM.
Качество synthetic world оказалось отдельным bottleneck обучения агента
Авторы генерируют websites как scaffold страниц, links, database records, state-change markers и task constraints, затем проверяют structural, semantic, consistency и feasibility defects. На 500 environments доля выполнимых задач выросла с 48,6% до 94,8%. State меняется только через validated transitions, а reward компилируется из проверяемых predicates.
94,8% — выполнимость среды, не success rate агента. Domains синтетические, verifier авторский, а transfer на WebArena, WebShop и MiniWoB++ требует проверки полного evaluation.
Сломанный training world учит не тому поведению, которое записано в задаче. Если цель невозможно достичь, policy либо получает шумный reward, либо учится эксплуатировать дефект симуляции. Генерация большого числа environments ничего не даёт без oracle, который сначала докажет, что мир согласован и задача имеет решение.
Источник: verified synthetic web environments.
Privacy и moderation
Доброкачественный RLVR сделал уже запомненные персональные данные доступнее
Исследователи сначала нашли латентно memorized PII, затем fine-tuned модели на обычных factual data без PII и повторили targeted и free-recall probes. У DeepSeek-V3.1 verbatim recall@k вырос с 0,155 до 0,370 — в 2,4 раза. Эффект наблюдался на трёх моделях от 8B до 671B и был абсолютным максимумом у крупнейшей, хотя reasoning и refusal rates сохранились.
Нужно использовать именно v1 от 22 августа. Это extraction setup preprint, а не доказанная утечка данных production-сервиса.
Неприятный вывод узок и важен: post-training не обязан содержать секрет, чтобы изменить доступ к уже запомненному секрету. Privacy evaluation нужно повторять после каждого этапа обучения, даже если новые данные выглядят безопасными.
Источник: RLVR и memorized PII.
Пятьдесят три модели не дали одного лучшего moderator для всех рисков
EMNLP-paper сравнила 53 модели на 11 datasets в prompt-only и prompt-response режимах. Риски объединены в четыре категории. Frontier general-purpose model, сильная в одном классе, могла уступать небольшой специализированной в другом; conversational safety оставалась слабой у всех семейств.
Benchmark не воспроизводит traffic mix, языки, latency и cost конкретного продукта. «Most comprehensive» остаётся характеристикой авторов.
Load-bearing вывод — moderation нельзя купить одним leaderboard winner. Фильтр для пользовательского prompt, проверки ответа и долгой беседы решает разные задачи. Нужны scenario-specific evals и несколько слоёв защиты, а не одна модель с максимальным средним score.
Источник: benchmark moderation-моделей.
Supply chain агентов
Skill может не красть секреты, а просто раздувать работу в десять раз
SkillBloat ищет условия token amplification, затем переписывает полный skill document с помощью LLM. На real-world skill benchmark средний лучший amplification в нескольких coding-agent configurations составил от 5,4184× до 10,1455×.
Это preprint двух авторов; benchmark и pricing model требуют независимой репликации. Работа не доказывает, что атака уже происходила в production marketplaces.
Threat model тем не менее реален. Skill — доверенный instruction channel. Он может не менять финальный ответ и не обращаться к секретам, а заставить агента повторять проверки, читать лишние файлы и бесконечно уточнять контекст. Review расширения должен проверять bounded work и cost так же, как permissions и опасные действия.
Источник: SkillBloat.
Главный технологический сдвиг выпуска
Двадцать второго августа надёжность поселилась на стыках.
Power scheduler различает фазы. Контракт уменьшает неоднозначность для модели. Kernel принимается только в полном inference path. Training world сначала проверяется на выполнимость. Privacy пересматривается после post-training, а skill — на скрытую стоимость.
Компонент может быть правильным в изоляции и сломать систему в композиции. Поэтому зрелый gate всегда проверяет тот путь, по которому реальный пользователь получит результат.
Что обсудить с технической командой
- Какие ресурсы мы ограничиваем одним общим knob, хотя разные фазы чувствительны к нему по-разному?
- Можно ли заменить неоднозначную prose-спецификацию machine-checkable контрактом до запуска coding agent?
- Проверяется ли оптимизированный компонент внутри полного production path?
- Доказываем ли мы выполнимость generated training tasks до расчёта reward?
- Входит ли token amplification в threat model skills и marketplaces?