Но обо всём по порядку. Читайте TL;DR от наших коллег и листайте фото с постерами!
Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
Классная статья про стабилизацию RLVR. Авторы предлагают метрику, которая лучше всех предыдущих детектит потенциальный взрыв — effective sample size. По сути, это нормированная сумма important weight между движками актора и роллаута. Мы в Яндексе тоже её используем — работает!
Дальше авторы рассматривают два пути решения. Первый — простой (мы тоже его пробуем). Если метрика начинает стрелять, надо понижать лёрнинг рейт адаптивно.
Второй путь — умный потокенный решейпинг — чинит все проблемы сразу. RL учится 1000 степов и не разваливается, даже на специально усложнённом сетапе со staleness 12. Имплементировать, судя по описанию, должно быть легко.
TVCACHE: A Tool-Value Cache for Post-Training LLM Agents
В этой работе кэшируют последовательные цепочки туллколов в агентских роллаутах. Получается приличный кэшхит в десятки процентов. Применяют хаки типа прогрева кэша перед роллаутом. Кэш шарят по всему по времени обучения, поэтому кэшхит к концу может расти.
Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning
Говорят, что научились заставлять GRPO растить reward, не удлиняясь относительно инита. В GRPO вместо reward'а на R делают R • s, где s — нормализующий коэффициент, функция от относительной длины ответов в группе.
Spurious Rewards: Rethinking Training Signals in RLVR
Обучают GRPO на шумные сигналы, доходя до обучения на случайный шум. Обнаружили парадокс: в некоторых моделях Qwen обучение даже на такой «сигнал» даёт профит. Объясняют тем, что виноват клиппинг в GRPO — он чаще срабатывает на маловероятных траекториях, вероятности высоковероятных, наоборот, растут. Проверяют это, отключив клиппинг: действительно, модель перестает учиться на «испорченные» сигналы.
Revisiting Efficiency–Accuracy Scaling in Mixture-of-Experts Architectures
NVIDIA оптимизируют MoE. Обычно инференс таких архитектур упирается в пропускную способность памяти: либо перекачиваем туда-обратно экспертов на каждом токене, либо при большом батче упираемся в all-to-all.
Авторы сделали архитектуру LatentMoE — временно проецируют представления токенов в низкоразмерное латентное пространство перед маршрутизацией. Весь тяжелый сетевой трафик all-to-all и чтение экспертов из памяти происходят в сжатом формате. А на выходе из MoE-слоя данные возвращаются к исходному размеру.
Экономию при зеродифф-костах реинвестируют в увеличение числа экспертов и количество активируемых. Качество растёт — говорят, что уже используют это в Nemotron.
Why Tree-Style Branching Matters for Thought Advantage Estimation in GRPO
В GRPO при обучении ризонинг-модели на reward-сигнал генерации итогового ответа могут отличаться друг от друга, получая разную награду. В работе показывают, что часть бюджета выгодно потратить на генерации нескольких ответов при фиксированном CoT, чтобы разделить награду конкретного ответа от ожидаемой награды для цепочки (T4A4 > T16A1). На практике при правильном использовании это также экономит компьют, так как ризонинг цепочки обычно занимают бóльшую часть генерации.
Поделились впечатлениями
#YaICML2026
Душный NLP