Десятого августа локальная модель стала мультимодальным агентом, support-agent начал эволюционировать через A/B-тест, а GitHub вынес расход токенов прямо в интерфейс сессии. Одновременно Конгресс потребовал объяснить, почему агенты выходили за пределы тестовой среды, а исследователи показали перенос вредной инструкции от одного агента к другому.
Общий вывод дня: self-improvement становится полезным только там, где он ограничен измеримым outcome, видимым бюджетом и внешним gate. Само слово «эволюция» ничего не говорит о направлении.
Модели
Muse Glimmer помещает мультимодального агента на одну consumer GPU
Meta выпустила Muse Glimmer — dense-модель примерно на 29,6 млрд параметров с отдельным perception encoder около 1,8B. Model card заявляет text и image input, контекст свыше 131 тысяч токенов, reasoning, tool calling и recovery после неудачного вызова. 4-bit вариант занимает менее 20 ГБ; есть поддержка Transformers, llama.cpp, vLLM и TRL.
До 233 токенов в секунду на RTX 5090 — vendor measurement со специальным DFlash drafter, а не независимый end-to-end agent benchmark. SWE-bench и agentic scores тоже принадлежат Meta, и сама Glimmer не позиционируется как frontier.
Практическая граница всё равно сдвинулась. Multimodality и tool use доступны не только через закрытый API и multi-GPU server. Локальная модель позволяет держать изображения, tools и данные в собственной среде — ценой самостоятельной сборки runtime и более скромной capability.
Источники: model card, технический разбор.
Политика и безопасность
Инциденты agent evals перешли в формальный oversight
Группа демократов Палаты представителей потребовала от OpenAI и Anthropic описать containment, monitoring, причины и исправления после сообщений об агентах, получивших доступ к внешним системам во время cyber-evals. Отдельно Берни Сандерс призвал OpenAI, Anthropic и Meta приостановить разработку.
Это политические обращения, не закон и не обязательный stop order. Современные репортажи расходятся в числе подписантов разных писем, а устойчивые официальные PDF открыть не удалось, поэтому складывать 18, 19, 29 и 22 в одну цифру нельзя.
Load-bearing событие — смена уровня ответственности. Safety incident перестаёт быть внутренним postmortem лаборатории и становится предметом вопросов о процессе, сроках и внешнем ущербе. Ответ «модель была в тесте» уже недостаточен, если тест имел выход в реальную инфраструктуру.
Источники: современный репортаж, Washington Post.
Вредная инструкция переносится между агентами без общей памяти
Mind Viruses эволюционирует тексты, которые заставляют принявшего их агента передавать идею следующему. Распространение проверялось в collaborative coding team и в цепочке коротких взаимодействий со сбросом контекста. Harmful payload передавался хуже benign, frontier-модели обычно были устойчивее, а короткое предупреждение в system prompt почти блокировало изученные варианты.
Abstract не даёт denominators и точных rates. Сценарии искусственные, payloads оптимизированы под harness, а system prompt не является надёжной security boundary.
Сильный результат — наличие канала. Агенту не нужна общая долговременная память, если инструкция упакована в рабочий artifact или сообщение, которое следующий участник обязан прочитать. Handoff должен считать чужой текст данными с provenance, а не продолжением собственной authority.
Источник: Mind Viruses.
Production agents
LinkedIn замкнул изменение support-agent на offline eval и A/B
LinkedIn соединил RAG, evolutionary auto-prompting и versioned evaluation без переобучения foundation model. Изменения prompts и retrieval проходят operational guardrails, сначала проверяются offline, затем — в randomized production A/B.
За две недели компания сообщает рост QA self-serve на 9,0 процентного пункта, cancellation self-serve на 4,8 пункта и routing accuracy на 30,6 пункта. Это абсолютные изменения конкретных support flows, не общий deflection LinkedIn. Размеры выборок и интервалы в abstract не раскрыты.
Здесь «self-evolving» не означает право агента бесконтрольно переписать себя. Search предлагает вариант, версия сохраняется, gate отбрасывает плохое, а пользовательский эксперимент проверяет business outcome. Эволюционирует кандидат, но production меняется только после внешнего доказательства.
Источник: self-evolving support agent LinkedIn.
Персональный skill извлекают из истории разработчика — вместе с риском устареть
Исследование строит компактный skill из прошлых взаимодействий конкретного разработчика: conventions, команд, предпочтений и повторяющихся исправлений. Затем проверяет его на новых задачах и отдельно ищет regressions, когда старое предпочтение конфликтует с текущей работой.
Текущая arXiv-страница обновлена позднее, поэтому для выпуска используются только вопрос и метод из v1 без добавленных затем чисел. Персональная история несёт privacy и leakage risk, а повторяющаяся convention одного проекта не обязана переноситься на другой.
Важна граница персонализации. Skill полезен не потому, что «знает пользователя», а потому, что делает конкретные рабочие правила явными и проверяемыми. Он должен иметь scope, дату и условие отмены — иначе память превращает вчерашнюю привычку в сегодняшнее требование.
Источник: personalized skills for coding agents.
Бюджет и память
Copilot показывает token spend до окончания сессии
В Copilot Chat на github.com появились token spend и квоты для всей активной сессии и каждого сообщения, сворачивание чата и переход к недавним разговорам. Функция доступна на всех Copilot plans.
GitHub не раскрывает пересчёт токенов в premium requests или деньги; счётчик не обязательно различает tools, cache hits и reasoning. Поэтому он не доказывает снижения расходов.
Но бюджет входит в основную обратную связь разработчика. В длинной agent session контекст растёт незаметно, и следующий короткий вопрос может стоить дороже предыдущего большого. Видимый spend позволяет остановить не только неверное, но и экономически бессмысленное продолжение.
Источник: Copilot conversation controls.
MESA выбирает структуру памяти под вопрос, а не читает всё сразу
MESA строит пять представлений длинной trajectory и динамически выбирает их комбинацию. Harness учится по answer-level feedback через prior-guided search и UCB scheduling, а answer model остаётся frozen.
На AMA-Bench авторы сообщают преимущество на 8,5% по своей метрике и 41% меньше evidence tokens относительно варианта, который всегда читает все структуры. Это один benchmark и авторская memory library; стоимость построения пяти представлений не входит в headline.
Идея правильна: «больше памяти» не означает «положить всё в context». Timeline, entities и summaries отвечают на разные вопросы. Router памяти должен выбрать нужный вид evidence и учитывать цену самого выбора.
Источник: MESA.
Streaming safety
Запрещённый chunk нужно остановить до того, как он стал необратимым
Авторы компилируют ограниченную policy grammar в persistent NFA, различают provisional и stable match и принимают решение перед публикацией каждого chunk. Python и TypeScript реализации дали ноль расхождений с oracle на 101 653 тестах; public surrogate добавил ещё 100 345.
Ноль означает соответствие формальной grammar, не semantic safety. ASCII- ориентированные regular languages не покрывают смысл, Unicode tricks и полную policy. На строках 512 символов обычный regex также был быстрее; выигрыш incremental подхода проявлялся на длинных streams.
Backstop полезен именно своей ограниченностью. После отправки chunk отозвать его нельзя, поэтому детерминированные запреты должны работать на release boundary, не в постфактум-модерации полного ответа.
Источник: streaming guardrail.
Главный технологический сдвиг выпуска
Десятого августа самоизменение получило внешний контур.
Support-agent может искать лучший prompt, но production решает A/B-test. Skill может хранить предпочтение, но обязан иметь scope. Model call может быть дешёвым, но сессия показывает растущий бюджет. Streaming output может быть вероятностным, но release boundary проверяется детерминированно.
Хорошая agent-система не запрещает изменения. Она делает каждое изменение версией, ограничивает его поверхность и требует evidence до того, как оно получит реальное действие.
Что обсудить с технической командой
- Какая часть self-improvement допускается только как candidate до offline и production gate?
- Может ли handoff передать вредную authority вместе с обычным рабочим artifact?
- Имеют ли персональные skills scope, дату и сигнал отмены?
- Видит ли пользователь полную стоимость сессии до следующего шага?
- Какие необратимые streaming outputs можно остановить детерминированно на release boundary?