Что ещё привезли на конференцию авторы постерных докладов, рассказываем в новом обзоре!
Multi-Agent Teams Hold Experts Back
Забавная статья: авторы утверждают, что мультиагентная команда может портить результаты одного эксперта. Агенты скорее ищут компромисс, а не лучший ответ, и не слушаются эксперта, даже если обозначить его в промпте. Люди тоже склонны к такому поведению, но не так сильно, как LLM.
AgentSuite: Toward More Reliable Agent Evaluation with a Component-Based Benchmark Auditing Pipeline
Пайплайн для очистки и правки агентских бенчей. Сделали хорошую таксономию ошибок, подобрали judge'eй для поиска и исправления. Хорошо согласовано с людьми, находило много ошибок в первых версиях τ-бенча. Подходит для проверки запуска агентских бенчей и фильтрации траекторий.
FormulaCode: Evaluating Agentic Optimization on Large Codebases
Намайнили 900 задач на оптимизацию скорости из 245K пул-реквестов в 70+ научных Python-репозиториях. Фильтровали эвристиками, LLM, а потом и людьми.
Для каждой задачи сделали снэпшот репозитория, экспертный патч и кучу нагрузочных ворклоадов. Модель должна ускорять код, не сломав корректность (по юниттестам). Условно, ей задают какие из 50+ метрик можно замерять или ускорять, а она должна решить, что оптимизирует.
Скор — Δ% против человеческого патча, то есть, многокритерийные градации вместо бинарного вердикта. Даже топовым моделям тяжеловато его проходить.
Scaling Long-Horizon LLM Agent via Context-Folding
Ресёрчеры из ByteDance и Стэнфорда решают проблему контекста в задачах deepsearch.
Предлагают сделать что-то вроде селф-субагента, который называют Context Folding. Модели для этого дают два тула: Branch и return. Модель может уйти в ветку, дёргать тулы, потом вернуться из бранча и сбросить сделанный там контекст. Это позволяет неявно хендлить модели миллионы токенов и не переполняться. Все бенчи растут, +8 на BrowseCompPlus. При этом решение имплементируется гораздо легче, чем субагенты.
Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning
Авторы снижают затраты на инференс ризонящих моделей за счёт периодической суммаризации рассуждений. Модель генерирует кусок ризонинга в обычном режиме, пишет к нему короткое саммари с выводами, затем исходный ризонинг выкидывается, и дальше модель ризонит, опираясь только на саммари.
Замерялись на математических бенчах, так как в таких задачах ризонинг хорошо разбивается на отдельные логические блоки.
Для сбора SFT-датасета брали OpenR1-Math-220k и переписывали рассуждения DeepSeek так, чтобы они были разбиты на блоки с саммари.
Репортят ускорение в 3–4 раза относительно аналогичной модели с unfold-ризонингом без просадки pass@1.
Передали фото и впечатления
#YaICML2026
Душный NLP