3. GitHub / open-source сигналы
Reverify: вместо «LLM проверяет LLM» — deterministic tools проверяют каждое утверждение агента
Один из наиболее интересных новых небольших проектов сегодняшнего GitHub-сигнала — 2akouwu/reverify.
Идея почти предельно простая:
LLM формирует гипотезу → deterministic tool проверяет её → только после этого она становится фактом.
Проект начинался с reverse engineering бинарников, где hallucination особенно опасны, но архитектура обобщается и на обычный код. Reverify работает как CLI и MCP server, хранит отдельно подтверждённые и опровергнутые факты и умеет переносить это состояние между свежими agent sessions.
Что показали данные. Автор протестировал систему на 71 реальном Windows binary. Ответ модели «по памяти» оказался неправильным в 97% случаев; verifier не принял ни одного из 71 неправильного утверждения. В отдельном classifier-style наборе проект заявляет 0 false VERIFIED среди 475 заведомо ложных claims и отсутствие пропущенных known-true claims. Benchmark, результаты и CI воспроизводимы из репозитория. Это benchmark автора проекта, а не независимая академическая оценка.
На 5 сентября сторонний daily snapshot фиксировал около 866 stars у репозитория; существенно интереснее, что проект уже имеет 71 commit, benchmark suite, CI и replication instructions.
Почему это важно. Архитектурный паттерн гораздо шире reverse engineering:
модель отвечает
↓
объективная система проверяет
↓
verified state сохраняется
↓
следующий агент получает facts, а не summary предыдущего агента.
Это напрямую связано сразу с двумя проблемами последних выпусков: ошибочностью LLM-as-a-Judge и деградацией состояния при compaction/context reset.
Что нужно уже понимать: deterministic verification, MCP, ground truth, context compaction, persistent state.
Что это может изменить. Для production coding agents полезно буквально пройтись по workflow и спросить: какие утверждения агента можно превратить из текста в проверяемый объект? Compiler, tests, types, schemas, database constraints, API introspection и security scanners должны иметь приоритет над self-confidence модели.
Дата сигнала: 5 сентября.
Первоисточник: GitHub — reverify
Skills продолжают расти быстрее полноценных agent frameworks
Вчера мы уже отмечали mattpocock/skills, поэтому не повторяю описание проекта. Но динамика сама стала новым сигналом: сторонний snapshot за 5 сентября насчитал уже примерно +2,7 тыс. stars за сутки, против примерно +1,6 тыс. в предыдущем наблюдении. Официальный anthropics/skills также получил около +500, а model-agnostic OpenCode — около +300.
Точные intraday значения stars здесь основаны на стороннем snapshot и должны рассматриваться как приблизительные.
Почему это важно. Похоже, open-source рынок всё активнее оптимизирует не сам agent runtime, а engineering behavior поверх runtime:
как уточнять requirement → как планировать → как тестировать → как review'ить → как не писать лишний код.
То есть конкурентным слоем становятся переносимые engineering practices, а не только prompts и модели.
Что нужно уже понимать: Agent Skills, agent harness, TDD, workflow, model-agnostic tooling.
Что это может изменить. Если команда тестирует coding agents, имеет смысл benchmark'ить не только модели, но и одну модель с разными наборами engineering skills/process rules.
Дата: 5 сентября.
Источники: GitHub repositories + historical snapshot.