Как агенты и люди работают с документами, в которых нужно найти ответ на вопрос? Выясняют на ICML 2026

Продолжаем делиться работами с конференции. А о том, что мы сами привезли на ICML, читайте в канале ML Underhood.

Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections

Авторы задали людям и агентам 2250 вопросов, ответы на которые спрятаны внутри 800 разных PDF и документов. В ходе нового теста MADQA записывали не только финальный ответ, но и весь путь поиска.

В результате:

• Лучшие агенты уже догнали людей по точности (около 82%), но берут грубой силой, а не умом.

• Человек находит ответ с первой попытки в 50% случаев, лучший агент (Gemini 3 Pro) — только в 12%.

• Агенты не умеют останавливаться: если задача не по зубам, крутятся по кругу и жгут ресурсы.

• Увеличение объёма вычислений не спасает. Один агент потратил 270 млн токенов и 850 долларов, но проиграл более дешёвому и аккуратному.

• Около 20% вопросов не осилил никто: ни люди, ни агенты.

Новизна работы в том, что в обычных тестах оценивают только корректность ответа. Здесь впервые измеряли, насколько эффективно система к нему пришла, считая каждый шаг поиска.

RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments

В этой работе предлагают обучаться на верифицируемых средах, сложность которых растёт динамически.

Авторы собрали RLVE-Gym из 400 verifiable-задачек. Когда модель начинает хорошо справляться с текущими задачами, уровень их сложности растёт. Получается своего рода curriculum, который не только ускоряет сходимость, но и бустит общее качество.

Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy

Ресёрчеры из Университета Альберты неожиданно выдают базу в position-статье: оказывается, что если геймить среду, то агент будет плохо работать в онлайне 🤷‍♂️

Нашёл для вас эти статьи Андрей Соколов

#YaICML2026

Душный NLP