На вчерашних welcome remarks отметили, что в этом году ICML вновь побила собственные масштабы: организаторы получили 24,7 тысяч сабмитов от более чем 76 тысяч авторов, а в рецензировании участвовали почти 18 тысяч экспертов. В основной программе — 6 докладов, 168 устных выступлений и почти 5900 постеров.
По тематике ожидаемо лидируют LLM — им посвящены 18% всех принятых работ. Следом идут computer vision с 7,9% и генеративные модели с 5,3%.
Наш коллега Алексей Зотов посетил несколько очных докладов и две постерные сессии — и поделился впечатлениями.
Понравилась организация постерной сессии: статьи сгруппированы по тематикам, поэтому рядом с интересной работой часто оказываются ещё 3-4 релевантных.
Из минусов — в этот раз слушателей так много, что иногда приходится стоять в очереди, чтобы задать вопрос или хотя бы рассмотреть постер популярной работы. Также стоит отметить высокий средний уровень статей — получилось почерпнуть действительно много интересных идей уже в первый день.
Для себя в основном искал темы, связанные с RLHF/RLVR для алайнмента LLM. В работе Why Tree-Style Branching Matters показали, как эффективнее обучать ризонинг-модели на RLHF-сигнал, где вариативность ответа может добавлять шум в оценку качества рассуждений. А на очном докладе Don't Force the Fit: Bounded Log-Likelihood Loss for Enhanced Reasoning in Large Language Models предложили простой и эффективный метод улучшения SFT на ризонинг-цепочках — его нам предстоит аккуратно проверить, так как результаты, показанные в презентации, пока выглядят чересчур оптимистично.
Много внимания уделено проблемам нестабильности RL-обучения. Работы Rethinking the Trust Region in LLM Reinforcement Learning и Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs предлагают несколько алгоритмических изменений, направленных на повышение стабильности.
А в статье Spurious Rewards: Rethinking Training Signals in RLVR показывают, что несовершенства современных RL-алгоритмов не только вызывают проблемы со стабильностью обучения, но и могут приводить к парадоксальным результатам.
#YaICML2026
ML Underhood