Продолжаем делиться работами с конференции. А о том, что мы сами привезли на ICML, читайте в канале ML Underhood.
Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections
Авторы задали людям и агентам 2250 вопросов, ответы на которые спрятаны внутри 800 разных PDF и документов. В ходе нового теста MADQA записывали не только финальный ответ, но и весь путь поиска.
В результате:
• Лучшие агенты уже догнали людей по точности (около 82%), но берут грубой силой, а не умом.
• Человек находит ответ с первой попытки в 50% случаев, лучший агент (Gemini 3 Pro) — только в 12%.
• Агенты не умеют останавливаться: если задача не по зубам, крутятся по кругу и жгут ресурсы.
• Увеличение объёма вычислений не спасает. Один агент потратил 270 млн токенов и 850 долларов, но проиграл более дешёвому и аккуратному.
• Около 20% вопросов не осилил никто: ни люди, ни агенты.
Новизна работы в том, что в обычных тестах оценивают только корректность ответа. Здесь впервые измеряли, насколько эффективно система к нему пришла, считая каждый шаг поиска.
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
В этой работе предлагают обучаться на верифицируемых средах, сложность которых растёт динамически.
Авторы собрали RLVE-Gym из 400 verifiable-задачек. Когда модель начинает хорошо справляться с текущими задачами, уровень их сложности растёт. Получается своего рода curriculum, который не только ускоряет сходимость, но и бустит общее качество.
Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy
Ресёрчеры из Университета Альберты неожиданно выдают базу в position-статье: оказывается, что если геймить среду, то агент будет плохо работать в онлайне 🤷♂️
Нашёл для вас эти статьи
#YaICML2026
Душный NLP