Конференция за конференцией — мы на SIGIR 2026!

В эти дни в Мельбурне проходит конференция по исследованиям и разработке информационного поиска. И мы уже там, чтобы посмотреть (и вам показать) интересное, а также представить собственную работу — Gated Bidirectional Linear Attention for Generative Retrieval.

В рекомендательных системах generative retrieval обычно строится по схеме «энкодер–декодер». Энкодер обрабатывает историю взаимодействий пользователя, после чего авторегрессионный декодер генерирует рекомендуемые объекты. В крупных стриминговых сервисах активные пользователи со временем накапливают очень длинные истории. По мере их роста энкодер становится одним из основных узких мест с точки зрения задержки, поскольку вычислительная сложность внимания с softmax квадратично зависит от длины последовательности.

В статье предлагают Gated Bidirectional Linear Attention (GBLA) — слой двунаправленного аттеншена с линейной вычислительной сложностью, который расширяет линейное внимание тремя компонентами: локальным каузальным смешиванием с помощью Conv1D, гейтингом ключей на уровне последовательности для мягкого забывания и выходным слоем gated RMSNorm.

На крупномасштабном датасете «Яндекс Музыки» гибридный энкодер, в котором блоки self-attention (SA) и GBLA чередуются в соотношении 1:2 — один блок SA, за которым следуют два блока GBLA, — достигает качества двунаправленного self-attention.

Бонусом держите фото с места событий и фотографию крутого зубастого участника конференции.

#YaSIGIR26

ML Underhood
865 просмотров · 21 реакций Открыть в Telegram · Открыть пост на сайте
Scalable Keyword Spotting via Modular Network Expansion

Сегодня рассказываем о статье от команды технологий голосового ввода Яндекса. Работу приняли на конференцию Interspeech 2026, которая пройдёт с 27 сентября по 1 октября в Сиднее.

Авторы предложили новый способ обновлять набор голосовых команд в умных устройствах без забывания уже известных. Наш коллега Виктор Хаймоненко рассказал о методе подробнее.

Чтобы расширить набор команд, поддерживаемых устройством с голосовым управлением, нужно дообучить модель распознавания речи. Но есть проблема: часто такие модели забывают команды, которые уже знали, или начинают хуже понимать их. Это называют catastrophic forgetting.

Есть методы непрерывного обучения, например EWC (elastic weight consolidation), которые уменьшают эффект, но не устраняют его полностью. В работе предложили другой подход — модульное расширение модели. Он хорошо решает проблему и при этом требует меньше вычислительной мощности, чем те же LoRA и адаптеры.

Предлагается не менять всю работающую нейросеть, а просто добавлять к ней компактный модуль, отвечающий за распознавание новых команд. Эта ветка использует промежуточные признаки, которые извлекает основная модель, но имеет собственный классификатор для новых команд. При этом параметры базовой модели остаются неизменными, поэтому результаты её работы для старых команд не страдают.

Новый метод требует небольшого увеличения размера нейросети. Общее количество дополнительных параметров — не больше 10% от числа параметров изначальной модели.

Эффективность проверили на открытом датасете Google Speech Commands. В экспериментах модель должна была выучить новые пары команд и при этом продолжить поддерживать старые. Метод снизил среднюю долю пропущенных новых команд (FRR) с 6,46% до 4,37% по сравнению с отдельной моделью аналогичного размера и превзошёл методы адаптеров и LoRA.

Для сравнения, при обычном полном дообучении всей модели она хорошо усваивала новые команды, но гораздо хуже распознавала старые: средняя доля пропущенных известных команд выросла с 2,71% до 69,08%.

Об особенностях процесса обучения и том, как обходили ограничения, рассказали на Хабре.

ML Underhood
1 052 просмотров · 41 реакций Открыть в Telegram · Открыть пост на сайте
Рассказываем о новой unified-модели в Alice AI

С недавних пор в Алисе AI и Шедевруме появилась обновлённая модель — Alice AI ART 2.0. Пользователи уже сейчас могут протестировать два базовых сценария её работы: Text-to-Image и Image-to-Image.

Для Яндекса этот релиз — первый шаг к тому, чтобы получить unified-модель с едиными метриками и стеком, которая одинаково хорошо умеет и в T2I, и в I2I. Команда генеративных моделей в компьютерном зрении рассказала на Хабре об экспериментах на этом пути, которые сработали и не сработали. Делимся основным.

С чего начали

Стартовали, имея две сущности. С одной стороны, картиночный генератор Alice AI ART 1.0 — свёрточная модель с текстовым энкодером на базе LLM. С другой — редактирование с отдельной базовой моделью и пайплайном инференса. Это разделение было дорогим и приносило много сложностей. Каждое обновление приходилось дважды переносить, данные готовились по-разному, метрики T2I и I2I было тяжело сравнивать между собой, стадии обучения были рассогласованы.

Что хотели от релиза

Цели было две: свести две модели в одну и при этом поднять качество каждой. В T2I целились на рост релевантности и отрисовки текста на картинке. В I2I старались поднять общее качество, но с акцентом на важных для наших пользователях задачах: любые изменения с участием людей и стилизация. Критически важно было, чтобы объединённая модель не уступала по качеству раздельным, а лучше — превосходила их.

Главный герой этого обновления — unified-претрейн

Он включает данные обоих типов: «текст → картинка» и «картинка + инструкция → картинка». Была гипотеза, что общий визуальный и текстовый контекст перетекает между задачами и улучшает качество. Например, концепты (объекты, предметы, действия, стили), выученные на T2I, становятся доступны в I2I без дополнительного сбора данных. И это действительно подтвердилось.

Мы также унифицировали архитектуру, перейдя на single-stream MMDiT с VLM в качестве текстово-картиночного энкодера, и увеличили размер генератора по сравнению с Alice AI ART 1.0. Важным оказалось использовать:

🔴Joint attention — текстовые и визуальные токены идут через общий аттеншн, а не двумя раздельными ветками.
🔴U-RoPE — позиционное кодирование, дружелюбное к разным разрешениям и к конкатенации картинка + текст (что особенно важно для I2I).

Результаты

Alice AI ART 2.0 стала намного более качественной в обеих задачах и по нашим замерам заметно отстаёт только от Gemini 3.1 Flash.

Но главный показатель — это реакция пользователей. Скачивание результатов генерации и редактирования выросло на 37 %, а запросов на генерацию с персонажем стало больше на 23 %.

В обзоре мы пробежались по верхам. В основном посте — подробно об аналитике и замерах, динамике обучений. Есть также таблицы с результатами и рассказ о том что у нас не сработало.

ML Underhood
1 852 просмотров · 34 реакций Открыть в Telegram · Открыть пост на сайте
По следам воркшопов и постерных сессий

Вчера мы анонсировали активности с участием наших исследователей на ICML 2026. Теперь делимся фото и впечатлениями спикеров о том, как это было.

Дмитрий Еремеев, Yandex Research:

Для меня это первая конференция — всё было в новинку, проходило очень насыщенно. Одну из наших статей, GraphPFN, мы представляли в формате постера на основной конференции, а ещё я выступал с докладом по ней на воркшопе по Graph Foundation Models. На постерах многие хвалили работу, часто задавали содержательные вопросы. В итоге GraphPFN ещё и получил best paper award на воркшопе!

К сожалению, не смог нормально посмотреть другие постеры и пообщаться с авторами, так как большинство релевантных нам работ были во время постерных сессий, когда мы сами представляли свои работы. Тем не менее, судя по представленным статьям, таким как PluRel или RDB-PFN, область движется именно в том направлении, которое мы считаем перспективным и важным и в котором активно развиваемся сами. Это не может не радовать!


Карина Романова, старший разработчик:

Я участвовала в воркшопе по Mechanistic Interpretability. К нашей статье был большой интерес со стороны исследователей из известных зарубежных университетов. Многие хвалили идею и говорили, что исследование будет полезно для их проектов.

Сам воркшоп был очень сильным. Нашли много хороших работ. Например, о том, как обучили VLA-агента в среде и выявили случаи, когда модель начинает «сходить с ума» (MultiSTEVE-1s). Или о том, что активации модели содержат больше информации для определения важных шагов рассуждения, чем сами токены (Reasoning Models Know What’s Important, and Encode It in Their Activations).

Было приятно поделиться опытом наших исследований с коллегами на международной площадке и перенять их опыт.


#YaICML2026

ML Underhood
10 891 просмотров · 26 реакций Открыть в Telegram · Открыть пост на сайте
Получили Best Paper Award на воркшопе ICML 2026!

Статья GraphPFN: A Prior-Data Fitted Graph Foundation Model получила статус лучшей работы на воркшопе Graph Foundation Models: A New Era for Graph Machine Learning 💫

Машинное обучение на графах сейчас проходит примерно тот же путь, который несколько лет назад проделали NLP и CV — от узкоспециализированных моделей к foundation models. Именно вокруг этого строилась программа воркшопа.

Людмила Прохоренкова из Yandex Research приняла участие в панельной дискуссии вместе с известными исследователями в этой области из RWTH Aachen, Georgia Tech и ASU.

Мы представили графовую foundation model, развивающую подход Prior-Data Fitted Networks (PFN). Она предобучается на миллионах специально сгенерированных синтетических графов, а затем может эффективно решать задачи на реальных данных как в режиме in-context learning, так и после дообучения. На широком наборе реальных графовых датасетов GraphPFN обходит все остальные протестированные модели.


Поздравляем графовую команду!

#YaICML2026

ML Underhood
3 802 просмотров · 119 реакций Открыть в Telegram · Открыть пост на сайте
Сегодня завершился ещё один день постерных сессий на ICML 2026

А завтра — встречаемся на воркшопах. Ниже — расписание со временем по Сеулу и местами проведения.

Graph Foundation Models: A New Era for Graph Machine Learning

Oral-презентация
10:00–10:40 (KST)
Room 308

GraphPFN: A Prior-Data Fitted Graph Foundation Model
Спикер: Дмитрий Еремеев, Yandex Research

Постерная сессия
12:10–14:00 (KST)
Room 308

GraphPFN: A Prior-Data Fitted Graph Foundation Model

Turning Tabular Foundation Models into Graph Foundation Models

A Fair Evaluation of Graph Foundation Models for Node Property Prediction

Команда исследователей Yandex Research: Дмитрий Еремеев, Олег Платонов, Глеб Баженов, Артём Бабенко и Людмила Прохоренкова


Workshop on Mechanistic Interpretability

Weight-Space Geometry of Offline Reasoning Training
11:00–12:00 (KST)
Hall C, Poster board 216

Среди авторов — Карина Романова и Владимир Платонов с коллегами из Keenable.ai


Workshop on Weight-Space Symmetries: from Foundations to Practical Applications

Analyzing Stream Collapse in Hyper-Connections
15:30–17:00 (KST)
Room 403

Среди авторов — Екатерина Алимаскина, Yandex Research, и коллеги из BRAInLab


4th Structured Probabilistic Inference & Generative Modeling

ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE
08:00–17:00 (KST)
Hall D1

Среди авторов — Кирилл Струминский, Yandex Research, и коллеги из НИУ ВШЭ

Registers Matter for Pixel-Space Diffusion Transformers
08:00–17:00 (KST)
Hall D1

Команда исследователей Yandex Research: Никита Стародубцев, Илья Судаков, Илья Дробышевский, Артём Бабенко и Дмитрий Баранчук


Foundations of Deep Generative Models: Understanding Memorization, Generalization, and Reasoning

Registers Matter for Pixel-Space Diffusion Transformers
08:00–17:00 (KST)
Room 318

Команда исследователей Yandex Research: Никита Стародубцев, Илья Судаков, Илья Дробышевский, Артём Бабенко и Дмитрий Баранчук


Если вы тоже на ICML, приходите послушать выступления, посмотреть постеры и обсудить работы с авторами!

#YaICML2026

ML Underhood
8 126 просмотров · 29 реакций Открыть в Telegram · Открыть пост на сайте
Первые рекорды ICML 2026 в Сеуле

На вчерашних welcome remarks отметили, что в этом году ICML вновь побила собственные масштабы: организаторы получили 24,7 тысяч сабмитов от более чем 76 тысяч авторов, а в рецензировании участвовали почти 18 тысяч экспертов. В основной программе — 6 докладов, 168 устных выступлений и почти 5900 постеров.

По тематике ожидаемо лидируют LLM — им посвящены 18% всех принятых работ. Следом идут computer vision с 7,9% и генеративные модели с 5,3%.

Наш коллега Алексей Зотов посетил несколько очных докладов и две постерные сессии — и поделился впечатлениями.

Понравилась организация постерной сессии: статьи сгруппированы по тематикам, поэтому рядом с интересной работой часто оказываются ещё 3-4 релевантных.

Из минусов — в этот раз слушателей так много, что иногда приходится стоять в очереди, чтобы задать вопрос или хотя бы рассмотреть постер популярной работы. Также стоит отметить высокий средний уровень статей — получилось почерпнуть действительно много интересных идей уже в первый день.

Для себя в основном искал темы, связанные с RLHF/RLVR для алайнмента LLM. В работе Why Tree-Style Branching Matters показали, как эффективнее обучать ризонинг-модели на RLHF-сигнал, где вариативность ответа может добавлять шум в оценку качества рассуждений. А на очном докладе Don't Force the Fit: Bounded Log-Likelihood Loss for Enhanced Reasoning in Large Language Models предложили простой и эффективный метод улучшения SFT на ризонинг-цепочках — его нам предстоит аккуратно проверить, так как результаты, показанные в презентации, пока выглядят чересчур оптимистично.

Много внимания уделено проблемам нестабильности RL-обучения. Работы Rethinking the Trust Region in LLM Reinforcement Learning и Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs предлагают несколько алгоритмических изменений, направленных на повышение стабильности.

А в статье Spurious Rewards: Rethinking Training Signals in RLVR показывают, что несовершенства современных RL-алгоритмов не только вызывают проблемы со стабильностью обучения, но и могут приводить к парадоксальным результатам.


#YaICML2026

ML Underhood
1 405 просмотров · 24 реакций Открыть в Telegram · Открыть пост на сайте
Обзор погодных моделей на ICML 2026

Разбираем несколько работ, связанных с прогнозированием погоды. Не все одинаково убедительны, но тем интереснее.

EMFormer: Efficient Multi-Scale Transformer for Accumulative Context Weather Forecasting

Очередная посредственная глобальная модель погоды. Цель исследования: улучшить RMSE глобальной детерминистской модели на пятые и десятые сутки. Для этого авторы с нуля обучают свою архитектуру, затем проводят хитрый файнтюн (делают KV-кэш на каждом роллаут-шаге и конкатенируют с KV на следующем). Сравниваются со старыми моделями — RMSE становится ниже, но само по себе это мало что значит. Осадки сделать не получилось, тестов на физичность тоже нет. Зачем нужна эта работа, когда есть ансамбли, — не ответили. Для 2026 года статья выглядит откровенно слабо: от самой постановки задачи до реализации.

The Perception-Physics Paradox: Probing Scientific Alignment with TC-Bench

Любопытная работа с предсказуемым исходом. Условно, фото урагана со спутника выступает своего рода прокси для давления. Вопрос: могут ли латенты этих фото выступать в качестве осмысленных прокси? В этом и был эксперимент, и ответ — не могут. Методологически сделали хорошо, в чём-то даже математически элегантно, но будто бы не очень понятно, зачем. Было любопытно послушать размышления автора о фундаментальных причинах неудачи.

StarEmbed: Benchmarking Time Series Foundation Models on Astronomical Observations of Variable Stars

Не совсем о погоде, но полезно. Взяли временные ряды из астрономии и пробенчмаркали time series foundation models (TSFM) на этих незнакомых неидеальных данных. Проверили и в zero-shot, и в подтюненных сетапах. Как полагается, в сравнение добавляют и общепризнанный классический подход. Любопытно, что год назад команда Нейрометеума делала ровно то же самое с теми же моделями, но для прогноза приземной температуры в собственной формулировке. Результаты у нас вышли одинаковые — модели справляются на удивление хорошо, но побить классику не выходит. Наш алгоритм лежит на полке до лучших времён, но главный take away на будущее: файнтюн помогает, но несильно, а также стоит уделить внимание токенизации. В общем, было обоюдно приятно, что кто-то ещё пытается применить TSFM для научных задач.

Собрал интересное Павел Анисимов

#YaICML2026

ML Underhood
1 553 просмотров · 37 реакций Открыть в Telegram · Открыть пост на сайте
Мы уже на ICML 2026! 🇰🇷

Аннён, друзья! Инженеры и исследователи Яндекса шлют привет из Сеула, где сегодня стартует ICML 2026. Ниже собрали расписание наших постеров — со временем (по Сеулу) и местом проведения. Если вы тоже на ICML, приходите пообщаться, обсудить статьи и задать вопросы авторам.

7 июля (вторник)
GraphPFN: A Prior-Data Fitted Graph Foundation Model
10:30–12:15 (KST)
Hall A, Poster #2411

One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining
10:30–12:15 (KST)
Hall A, Poster #3610

Unveiling the Role of Data Uncertainty in Tabular Deep Learning
14:00–15:45 (KST)
Hall A, Poster #2802


8 июля (среда)
SoftSign: Smooth Sign in Your Optimizer for Better Parameter Heterogeneity Handling
14:30–16:15 (KST)
Hall A, Poster #3708


9 июля (четверг)
Inverse Entropic Optimal Transport Solves Semi-supervised Learning via Data Likelihood Maximization
10:30–12:15 (KST)
Hall A, Poster #2603

On Efficient Scaling of GNNs via IO-Aware Layers Implementations (Spotlight)
17:00–18:45 (KST)
Hall A, Poster #2205

Relevance-Based Embeddings: Lightweight Candidate Retrieval via Heavy-Ranker Calls
17:00–18:45 (KST)
Hall A, Poster #4007


Подробнее о работах основного трека рассказали тут и отдельно — о Spotlight-статье.

#YaICML2026

ML Underhood
3 303 просмотров · 38 реакций Открыть в Telegram · Открыть пост на сайте
ICML стартует уже в понедельник!

Мы уже рассказывали о Spotlight-работе, которую наши исследователи представят на конференции в Сеуле. Сегодня расскажем о других, не менее крутых статьях.

GraphPFN: A Prior-Data Fitted Graph Foundation Model

Исследователи из Yandex Research Дмитрий Еремеев, Олег Платонов, Глеб Баженов, Артём Бабенко, Людмила Прохоренкова создали графовую foundation model, развивающую подход Prior-Data Fitted Networks (PFN). Она предварительно обучается на миллионах специально сгенерированных синтетических графов, а затем может эффективно решать задачи на реальных данных как в режиме in-context learning, так и после дообучения. На широком наборе реальных графовых датасетов GraphPFN обходит все остальные протестированные модели.

Unveiling the Role of Data Uncertainty in Tabular Deep Learning

Авторы из Yandex Research Николай Карташев, Иван Рубачёв и Артём Бабенко, исследуют, почему современные методы глубокого обучения показывают высокое качество в задачах на табличных данных. Многие успешные идеи последних лет — эмбеддинги числовых признаков, retrieval-augmented-архитектуры и продвинутое ансамблирование (TabM) — неявно повышают способность моделей работать с высокой неопределённостью в данных. Статья предлагает новый взгляд на недавний прогресс в DL на табличных данных, помогает понять, какие механизмы могут стоять за успехами современных табличных моделей, и задаёт направление для разработки новых методов.

Relevance-Based Embeddings: Lightweight Candidate Retrieval via Heavy-Ranker Calls

Исследователи Яндекса — Кирилл Шевкунов и Людмила Прохоренкова — рассматривают задачу поиска наиболее релевантных объектов для заданного запроса.
Авторы предлагают способ строить эмбеддинги запросов и объектов с использованием информации от самой модели ранжирования. Подход учитывает релевантность запроса набору опорных объектов. Это позволяет получать более информативные представления и эффективнее находить кандидатов для дальнейшего ранжирования.

One-Step Gradient Delay Is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining

Среди авторов статьи — исследователи Яндекса Филипп Змушко, Егор Петров, Нурсултан Абдуллаев и Михаил Хрущев. Работа выполнена в сотрудничестве с BRAIn Lab и MBZUAI.

В статье исследуется асинхронный pipeline parallelism для обучения больших языковых моделей. Такой подход позволяет повысить загрузку GPU, избавляясь от простоев видеокарт в пайплайне, однако долгое время считалось, что задержка градиентов ухудшает качество обучения. Авторы показывают, что проблема зависит не столько от факта самой задержки, сколько от типа используемого параллелизма, а также оптимизатора. В частности, Muon сохраняет значительную устойчивость в асинхронном режиме, а предложенная техника, основанная на Error-Feedback, дополнительно сокращает разрыв между синхронным и асинхронным обучением, позволяя обучать модели на масштабе 10B MoE без потери качества.

SoftSign: Smooth Sign in Your Optimizer for Better Parameter Heterogeneity Handling

Дмитрий Феоктистов из Yandex Research совместно с коллегами из BRAIn Lab предлагают новый подход к оптимизации нейронных сетей, основанный на сглаженной версии sign-обновлений. Он позволяет учитывать различия в поведении отдельных параметров модели и адаптировать величину обновлений во время обучения под них. На основе этой идеи разработали оптимизаторы SoftSignum и SoftMuon. Они стабильно превосходят классические sign-based-методы и AdamW на широком наборе задач.

О работах, которые представим на воркшопах, расскажем отдельно. И даже покажем, как это выглядело вживую.

#YaICML2026

ML Underhood
2 183 просмотров · 37 реакций Открыть в Telegram · Открыть пост на сайте
Ускорили перевод видео в Яндекс Браузере — задистиллировали диффузионный декодер TTS

Делимся свежей хабростатьёй о том, как ускорили синтез речи при переводе видео в Яндекс Браузере. Зачем это понадобилось, где были подводные камни и что в итоге уехало в прод — рассказал ML-инженер команды TTS в Яндексе Цырен-Доржо Цыбиков.

С чего стартовали

Внутри TTS — каскад из трёх частей:
🔴языковая модель предсказывает аудиотокены по тексту;
🔴диффузионный декодер восстанавливает мел-спектрограмму из латентов;
🔴вокодер превращает её в звуковую волну.

После того как оптимизировали языковую модель (она долго была самой тяжёлой), узким местом стал декодер латентов: его forward pass запускается на каждом шаге семплинга, а шагов — десятки. Его и взялись ускорять.

Что сделали с аттеншном

Прогнали инференс через torch.profiler и увидели, что время съедают рукописный QKVAttention и пересчёт RelativePositionBias на каждой итерации. Дальше — по нарастающей:
🔴перевели self-attention на SDPA (memory-efficient) и закешировали bias → 2,5× на уровне QKVAttention и почти вдвое меньше GPU-памяти, всё без переобучения;
🔴проверили гипотезу RoPE + FlashAttention — и честно её похоронили: на наших размерах тензоров она не обогнала кешированный baseline. Зато получили полезный отрицательный результат;
🔴как более сильную архитектуру посмотрели DiT (на него уже перешли F5-TTS, CosyVoice3): качество выше, латенси сопоставимое.

Главный буст — дистилляция флоуматчинга

Самое интересное — поверх флоуматчинг-декодера навесили две дистилляции:
🔴CFG-distill: вместо двух forward pass'ов на шаг (conditional + unconditional) student воспроизводит guided-предсказание за один проход;
🔴progressive distillation: student учится за один шаг делать то, что teacher делает за два, и число шагов итеративно уменьшается вдвое.

Вместе это срезало число шагов семплинга с ~20 до 3 при паритете качества по SBS (наивное снижение шагов так не умеет — звук заметно проседает). Бонус progressive distillation — почти не пришлось трогать прод-код инференса, поменяли число шагов в конфиге.

Итог

Эти ускорения вместе дали примерно 1,5× ускорения всего TTS-пайплайна целиком. На практике это позволило на четверть сократить использование GPU в TTS-компоненте.

Подробности, замеры и блок с выводами — на Хабре.

ML Underhood
5 935 просмотров · 66 реакций Открыть в Telegram · Открыть пост на сайте
Везём восемь статей на основной трек ICML!

В этом году наши исследователи представят на ICML восемь работ в основной программе и ещё восемь — на воркшопах.

На ICML 2026 было подано 23 918 работ — вдвое больше, чем в 2025 году. Из них приняли 6 352 статьи (26,6%), а статус Spotlight получили только 536 работ — 2,2% от всех поданных заявок. Это статьи, которые получили самые высокие оценки программного комитета.


Начинаем серию постов о принятых работах со Spotlight-статьи On Efficient Scaling of GNNs via IO-Aware Layers Implementations, посвящённой эффективному масштабированию графовых нейросетей.

Что исследовали

Авторы — Дарья Фомина из команды ML-инфраструктуры, Вячеслав Ждановский из команды разработки инференса, Фёдор Великонивцев из Yandex Research и студенты ШАД — исследуют, как ускорить обучение и инференс Graph Neural Networks на GPU. Несмотря на популярность таких моделей, их производительность часто ограничивается не вычислениями, а неэффективной работой с памятью на GPU и большим объёмом передачи данных.

Что получилось

Исследователи разработали набор GPU-ядер для наиболее популярных семейств графовых нейросетей — от графовых свёрток и агрегирующих операторов до современных архитектур, таких как Graph Transformers и GATv2. Эксперименты на крупных графах показывают заметное ускорение работы и снижение потребления памяти по сравнению с существующими решениями.

Кроме того, авторы изучили влияние переупорядочивания вершин графа в памяти GPU и показали, что его эффективность зависит как от структуры графа, так и от особенностей доступа к данным.

Статья уже выложена на Arxiv, а код — на GitHub.

#YaICML2026

ML Underhood
6 146 просмотров · 61 реакций Открыть в Telegram · Открыть пост на сайте
Как устроена голосовая активация в Яндекс Дропс

Недавно Яндекс запустил свои первые ИИ-наушники — Яндекс Дропс. В числе прочего они умеют распознавать обращение «Алиса», а отвечает за эту способность компонент, который мы внутри называем «споттером» (чуть подробнее писали о споттерах тут). И если с голосовой активацией в колонках всё плюс-минус понятно, то перенести её в наушники — это челлендж.

О том, что было сложного в этом процессе и как в итоге выкрутились, рассказал на Хабре Григорий Афанасенко из команды голосовых технологий. А мы пересказываем самое интересное.

Для начала следовало выбрать чип, который позволил бы споттеру работать непрерывно и постоянно искать обращение в окружающем шуме. Большинству CPU такое не под силу — поэтому взяли чип с NPU (Neural Processing Unit). Решение казалось практически беспроигрышным — но ещё подкинуло сложностей в процессе.

Даже с NPU надо было придумать, как оптимизировать потребление энергии. Решили сделать два этапа — и тем самым уменьшили нагрузку в пять раз:

1. Лёгкая модель VAD (Voice Activity Detector) отделяет голос от фонового шума.

2. Когда VAD услышал голос, включается споттер и разбирается, «Алиса» это или нет.

Также была проблема с тем, что модели из умных колонок в наушники никак бы не влезли. Надо было ужать модель под NPU, сохранив качество распознавания. Провели ряд оптимизаций (разбили подсчёт зависимостей на два шага с помощью Depthwise‑separable convolution, добавили дистилляцию знаний и квантование в 8 бит) — и уместили модель в 200 КБ.

А теперь возвращаемся к той самой проблеме в NPU. Выяснилось, что SDK производителя чипа накладывает жёсткие ограничения на архитектуру: размер ядра свёртки — до 15 фреймов для обычных свёрток и до 11 фреймов для depthwise.

Пришлось сделать сеть глубже, чтобы набрать нужный контекст, а вместо Hardswish выбрать ReLU, которая хорошо ведёт себя после квантования. Но тут получили затухание градиента, из-за которого нижние слои почти не обучались. Помог переход на residual‑архитектуру.

А ещё, после долгих экспериментов с SDK, разобрались, как использовать для наших моделей стриминг, — и увеличили модель в два раза.

Качество споттера оценивали по числу ложных срабатываний в час и доле пропущенных верных активаций. Лучший баланс, разумеется, в тихой комнате. На улице качество чуть ухудшается, а в транспорте система почти не срабатывает ложно, но цена за это — высокий уровень пропусков. Ещё один сложный сценарий — разговор на фоне: доля пропусков небольшая, а вот число ложных активаций возрастает ощутимо.

Подробнее о том, как собирали данные для обучения и почему решили отказаться от модели для быстрых команд, рассказали в хабростатье. Там же — о дальнейших планах по развитию технологии.

ML Underhood
2 371 просмотров · 48 реакций Открыть в Telegram · Открыть пост на сайте
Какие ML-тренды принесла прошедшая ICLR 2026

О собаках на постерах и моде на микростенды мы уже писали. Но на конференции были замечены и другие (более серьёзные) тренды, о которых рассказали на Хабре Мария Никифорова, старший разработчик службы качества претрейна YandexGPT, и Дарья Шатько, руководитель ML в Yandex Crowd. Делимся главным.

Агентские системы — везде и всюду

2026-й стал для ICLR годом автономных агентов. Фокус исследований сместился с отдельных моделей на проектирование долгоживущих агентских систем, которые могут планировать на несколько шагов вперёд, выстраивать сложные цепочки зависимых вызовов инструментов, накапливать память и опыт, поддерживать мультиагентность и даже эволюционировать без дообучения базовой модели.

Новые подходы к развитию памяти агентских систем

Простое расширение контекстного окна до миллионов токенов не решило проблему памяти агентских систем. Большая история диалога зашумляет контекст, увеличивает вычислительную сложность и ведёт к деградации качества ответов. На ICLR оформился тренд: агенту нужна управляемая, структурированная память, способная к компрессии и абстрагированию опыта. На конференции было много подходов на эту тему, и среди них можно выделить два особенно интересных. Первый — переход от сырых трейсов к семантическим графам знаний. Второй — многоуровневая компрессия памяти и предсказание пользовательского интента.

Speculative Execution в агентах

Чем автономнее становятся агенты, тем сильнее растёт latency. Если нужно последовательно вызвать несколько инструментов, дождаться ответов, сделать выводы и спланировать следующий шаг, инференс растягивается на десятки секунд. Исследователи предложили перенести фундаментальный принцип спекулятивного выполнения (Speculative Execution) из многопоточных CPU и спекулятивного декодирования LLM на уровень агентской оркестрации.

Интерактивные среды — новый стандарт оценки агентов

Обычные бенчмарки с вопросом и правильным ответом всё хуже отражают реальные способности агентских систем. Агент может ошибиться не только в финальном ответе — он также может выбрать не тот инструмент, плохо спланировать шаги, зациклиться, неправильно понять состояние среды или сломаться из-за изменений интерфейса.

На смену привычным тестам с фиксированным инпутом и golden-ответом пришли динамические платформы, которые изолируют агента в интерактивном окружении и замеряют его живучесть на долгих задачах. В основном исследователи фокусировались на трёх вещах: поведении агента на длинных горизонтах, стратегии сбора информации и устойчивости к изменениям UI и среды.

RL учит поведению, а не ответам

RL для агентских систем перестает быть способом дообучить модель на правильный финальный ответ. Теперь систему учат правильно вести себя в процессе: исследовать среду, пользоваться памятью, выбирать инструменты, общаться с пользователем и не делать лишних действий.

Текстовая диффузия выходит в прод

Ещё недавно Diffusion LLMs воспринимались как необычная альтернатива авторегрессионным LLM, но к ICLR 2026 она уже оформилась в заметное направление. Теперь изучают не то, работает ли это вообще, а более практичные вещи: как масштабировать DLM, при каких режимах обучения они ведут себя лучше авторегрессионных моделей, и в каких задачах не-авторегрессионная параллельная генерация действительно даёт преимущество.

Продолжаем экономить компьют

По мере роста моделей и датасетов эксперименты становятся всё дороже. Исследователи чаще оптимизируют сам процесс разработки: какую смесь данных брать, какие гиперпараметры переносить на большой масштаб, как понять, какие примеры реально повлияли на поведение модели.

На ICLR особенно выделялись два направления: 1) data selection — поиск максимально полезных данных в рамках ограниченных экспериментов, 2) ускорение инференса моделей.

В наш пост уместился только верхенеуровневый рассказ о заметных тенденциях, а в полной статье вы найдёте ещё и структурированную подборку работ по каждой теме.

#YaICLR26

ML Underhood
2 348 просмотров · 29 реакций Открыть в Telegram · Открыть пост на сайте
ICRA — день второй, насыщенный

Вена продолжает удерживать статус столицы робототехники — по крайней мере, на время проведения конференции. Вот что интересного увидели, услышали и узнали на мероприятии.

• В задаче генерации сцены предлагают EP-Diffuser. Модель похожа на MotionDiffuser, но использует полиномы в качестве входов и выходов диффузера (в отличии от MotionDiffuser, где вход — сырые вектора, а выход — PCA компоненты).
• Много статей об автоматической парковке: есть end-to-end-решения и подходы с декомпозицией задачи на предсказание интентов агентов и дальнейшую генерацию траектории, согласованной с интентами агентов.
• Несколько работ посвящены предсказанию опасных траекторий. Например, манёвров перестроения с подрезанием автономного автомобиля для последующей проверки в симуляции.
• Одни авторы собрали целый мини-город в масштабе 1:15 для тестирования планера.

Бонусом — пачка весёлых роботов: они играют в казике, гоняют мячик и машут крыльями.

Ну и напоминаем, что если хотите почитать больше разборов с ICRA, подписывайтесь на наш канал @DriverNotFound. Там в ближайшее время будет прямо много ИКРЫ. Простите, пожалуйста.

Интересное увидели Егор Волков и Максим Спорышев

#YaICRA26

ML Underhood
2 135 просмотров · 21 реакций Открыть в Telegram · Открыть пост на сайте
Как прошёл первый день ICRA 2026 в Австрии

Не успели инженеры Яндекса стряхнуть бразильскую пыль с сапог после ICLR, как в Вене стартовала ICRA 2026 — одна из главных мировых конференций по робототехнике и автономным системам. Наши коллеги уже на месте, а это их впечатления от первого дня.

Максим Спорышев, руководитель службы поведения и предсказания движения в Автономном транспорте Яндекса:

Один из основных воркшопов в первый день был целиком посвящён теме reinforcement learning в робототехнике. Рассказывали о разных вариантах претрейна на демонстрационных данных (IL, Offline RL), как делать ризонинг в embodied-моделях, sim2real/real2sim, world modelling. Основные кейноуты, постеры и выставки начинаются во второй день, чего мы очень ждём!


Егор Волков, разработчик группы претрейна модели планирования движения в Автономном транспорте Яндекса:

На воркшопе по автономным автомобилям, организованном Мюнхенским университетом, рассказали о новых симуляторах для обучения World Engine и AlpaSim, а также поделились планами выложить в опенсорс весь пайплайн автономного автомобиля.

Другой интересный воркшоп первого дня — о предсказании траекторий пешеходов. Обсудили ключевую сложность задачи: движение пешехода зависит от взаимодействия с машинами и того, что он считает безопасным. К сожалению, прорывных решений проблемы пока не предложили.

В целом, поражает количество компаний и стартапов, которые специализируются на роборуках, манипуляторах и прочем. Масштаб интереса к этой области огромен.


Впереди ещё несколько дней конференции. Технические разборы и подборки интересных работ будем публиковать в @DriverNotFound.

#YaICRA26

ML Underhood
2 044 просмотров · 49 реакций Открыть в Telegram · Открыть пост на сайте
Как мы научили модель понимать структуру архивных записей

В Поиске по архивам появилась новая модель, которая не только распознаёт текст, но и извлекает связи между людьми — например, определяет, кто в документе отец, мать, жених, невеста, свидетель и прочее. Это умение очень важно, чтобы действительно помогать пользователям находить родственников.

Дарья Виноградова, руководитель команды универсального применения компьютерного зрения в Яндексе, и Анна Сидорова, главный разработчик распознавания архивов, рассказали на Хабре, почему универсальные VLM-модели не подошли для этой задачи и как удалось перейти от распознавания текста к извлечению структуры и смысла из документов.

Как было раньше

Прошлая версия системы представляла собой классический OCR-пайплайн. Детектор находил на скане строки, OCR-модель распознавала их по отдельности, а другая модель собирала в текстовые блоки.

Поиск работал в основном по текстовым совпадениям. Из-за этого вместе с нужными данными в выдачу попадали имена священников, номера записей, служебные пометки и другие нерелевантные части документа. Со временем проблемы стали чаще возникать на уровне структуры документа — из-за разбиения текста на строки и последующей склейки.

Как модель научили понимать структуру документов

В новой версии OCR остаётся отдельным этапом, но сам пайплайн строится уже вокруг структуры документа.

По сути, перед нами стояла KIE-задача (Key Information Extraction) — нужно было по изображению документа извлекать ключевую информацию о людях и их ролях. Но довольно быстро стало понятно, что работать со страницей целиком не получится. Типичный архивный скан имеет размер больше 2500 пикселей по стороне, содержит сразу несколько записей, а суммарно в них может упоминаться до 35 человек. Такой объём информации слишком большой и для модели, и для обучения. Поэтому мы решили сначала находить на странице отдельные записи — о рождении, браке или смерти — а уже потом извлекать информацию о людях из каждой выделенной области.


Для этого используют дообученную VLM‑модель Alice AI. Она получает изображение записи вместе с текстом от OCR и извлекает из документа структуру и связи между людьми. Ключевая метрика — доля людей, которых затем можно корректно найти по ФИО в сервисе. По ней модель достигает качества 90,5% на всех типах архивных записей.

Как усовершенствовали OCR

Параллельно команда перешла от строкового OCR к блочному. Так удалось убрать целый этап сборки строк в блоки, сократить количество моделей в пайплайне и уменьшить объём дополнительного процессинга при обработке сканов.

Однако переход к блочной архитектуре сильно усложнил требования к детектору. Если раньше ошибка означала, что какие-то строки просто плохо склеятся, то теперь модель рисковала целиком потерять нужный фрагмент документа.

При этом сами блоки оказались очень разными по размеру: модель могла получить как маленький кусок с одним словом, так и огромный фрагмент на много строк. Из-за этого команде пришлось отдельно дорабатывать энкодер и оптимизировать токенизацию — иначе обработка больших блоков становилась слишком дорогой по вычислениям.

После перехода на новый OCR-пайплайн recall распознавания вырос до 93,2% на основной выборке и до 88,1% — на сложной.

Детали реализации и сложные кейсы распознавания вы найдёте в полной версии статьи.

ML Underhood
3 844 просмотров · 46 реакций Открыть в Telegram · Открыть пост на сайте
Немного о погоде в Рио

Вернее, не в Рио, а на прошедшей ICLR. И не то чтобы о погоде — о статьях, связанных с её прогнозированием. Руководитель группы ML в Яндекс Погоде Пётр Вытовтов поделился мыслями о трендах и занятными публикациями на тему. Слово Петру.

Первое, что я заметил, ещё до приезда в Рио, что в этом году на ICLR было заметно больше погодных работ, чем раньше. С одной стороны, это хорошо, что область погодного ML развивается. С другой — конкуренция растёт, и надо постоянно больше и качественнее работать, чтобы успевать за отраслью и сохранять лидирующие позиции. Основная масса работ была по двум направлениям: foundation-погодные модели и наукаст.


А теперь к самим статьям.

Task-Adaptive Parameter-Efficient Fine-Tuning for Weather Foundation Models

Есть такое направление, как тюнинг fountation-погодных моделей под различные downstream-задачи. Это связано с тем, что для финальной решаемой задачи не всегда необходимо моделировать с хорошим качеством всю атмосферу, но при этом всё-таки хочется учитывать эту информацию. Поэтому можно подтюнить модель под необходимый параметр и немного принебречь качеством остальных.

Здесь авторы предлагают не тюнить модель целиком, а использовать, так называемый, обучаемый soft prompt, чтобы говорить модели, какую именно задачу она должна сейчас решать. Утверждается, что модель хорошо учится с ним работать. Авторы проверяли работу своего подхода поверх модели Aurora от Microsoft и получили хорошие результаты для задач super-resolution, прогноза осадков и постпроцессинга ансамблевых прогнозов.

Идейно подход выглядит интересно, но пока он проверялся только на грубом разрешении сетки, и не совсем понятно как этот подход себя покажет на продовых моделях.

Extreme Weather Nowcasting via Local Precipitation Pattern Prediction

Если рассматривать наукаст, как задачу перемещения существующих осадков, то она — по большей части — уже решена. Но есть две открытых проблемы в этой области: возникновение новых осадков и прогноз экстремальных значений. Здесь авторы концентрируются на второй подзадаче.

Они делают предположение, что одна из причин плохого восстановления сильных осадков — структура декодера, и предлагают его модификацию. При этом в работе сравнивают разные варианты того, как можно делать апсемплинг картинки в процессе декодирования. Интересно, что авторы — одни из немногих, у которых Фурье-лосс для задачи наукаста заработал лучше стандартно используемых MSE и MAE.

Авторы проверялись на стандартных датасетах SEVIR и MeteoNet, а также на их собственном KMA, который должен быть публично доступен. Не во всех сетапах удалось получить SotA, но картинки выглядят заметно чётче по сравнению с аналогами.


#YaICLR26

ML Underhood
2 570 просмотров · 20 реакций Открыть в Telegram · Открыть пост на сайте
Ещё несколько мыслей про ICLR 2026

Конференция, которая закончилась в Рио, оставила после себя много впечатлений и любопытных мыслей. Ими сегодня поделится с нашим каналом СТО поисковых сервисов и ИИ Яндекса Алексей Гусаков.

RL сейчас становится одним из самых дорогих и плохо предсказуемых этапов после претрейна — особенно, если много генерировать длинные reasoning/tool-calling-траектории. Допустим, мы используем GRPO: берём батч запросов, и для каждого сэмплируем G траекторий/ответов. Для них считаем reward, а advantage определяется относительно остальных ответов на тот же запрос.

Если запрос слишком лёгкий или слишком сложный, все G ответов могут получить одинаковый reward — например, все правильные или все неправильные. Тогда такой пример даёт мало полезного RL-сигнала. Помимо этого, цепочки генерировать дорого, а длинные — очень дорого. Несколько классов идей о борьбе с этим:

1. Curriculum — идея не новая. Давайте растить сложность запросов в процессе улучшения модели. Есть много вариантов, как это делать. Один из них — использовать трансформерное предсказание сложности и бандитов. Думаю, конкретная реализация не так важна, главное, что при смешивании множества RL-сред в одном обучении единой модели нужно иметь хорошие мониторинги доли успехов по каждой задаче и бороться, если возникает проблема.

2. Генерировать роллауты не каждый раз с нуля, а начинать с префиксов предыдущих. Тогда можно получить больше бит информации на единицу компьюта и получить дерево траекторий. Для внутренних вершин дерева можно подсчитывать статистику успехов и использовать для process reward.

3. В случае, если основной тул в цепочках — это web search, то можно отдельно оценивать, насколько очередное добавление в инфоконтекст полезно: нельзя ли было дать ответ без него и продвинуло ли оно к правильному ответу (observation reward).

Комбинация второго и третьего подходов заставила меня вспомнить AlphaZero, где модель предсказывает распределение по возможным ходам P и оценку позиции Value. Затем Tree Search строит дерево и получает более информативную статистику по ходам, после чего модель учится приближать результаты этого Tree Search.

В LLM-случае «ход» — это не дискретный шахматный ход, а кусок reasoning плюс очередной tool call, плюс observation, и пространство ходов не только больше, но и гораздо менее структурированное. Напрямую не используешь, но точно интересно подумать над экспериментами, где после генерации скольки-то роллаутов из позиции переранжируем их по process и observation reward.

4. Scaling recipes плюс scaling laws для RL. Тема неплохо изучена для претрейна. В Meta* считают, что у них работает для RL. Scaling там устроен по-другому — имеет форму сигмоиды и можно экстраполировать качество с малых запусков на более крупные. Если правда работает, точно надо использовать — особенно, когда смешиваем несколько RL-сред для понимания, сколько нужно тратить компьюта на оптимизацию каждой.


И немного о том, как всё (или почти всё) успеть на конференции.

Чтобы повысить продуктивность, к каждому дню нужно готовиться минимум по паре часов, составляя с LLM-ассистентом план того, что хочешь посетить. Помогают промпты в стиле «Завтра утренняя постер-сессия на ICLR, интересны такие-то темы, в основном топовые лабы, раньше были интересны такие-то работы. Что посмотреть?» Дальше фильтруешь, просишь отсортировать постеры, часть просишь удалить, а где-то предлагаешь добавить. Затратно, но зато не просто бродишь, читая бесконечные названия статей.


#YaICLR26

ML Underhood
__
Компания Meta признана экстремистской; её деятельность в России запрещена.
2 178 просмотров · 33 реакций Открыть в Telegram · Открыть пост на сайте
ICLR 2026: подборка трендов от CTO Яндекс Поиска

Екатерина Серажим рассказала об агентских системах и связанных с ними подходах к обучению и оптимизации моделей.

Отношение к агентским системам стало более «взрослым»: не как к набору эвристик вокруг модели, а как к полноценной инженерной системе, где каждый компонент заслуживает внимания и постепенно становится отдельным объектом оптимизации.

1. Написание промптов превращается в ML-задачу

Понравилась линия работ вроде GEPA и ACE. Главная мысль: промпт — это уже не «текст, который хорошо написал человек», а оптимизируемый компонент системы.

В GEPA промпт улучшают эволюционным алгоритмом, но мутации придумывает не случайность, а LLM-рефлектор: он смотрит на траектории текущего кандидата (рассуждения, вызовы инструментов, ответы), формулирует на естественном языке, что пошло не так, и на основе этой критики предлагает правку c красивым названием — natural language reflection. Кандидаты держатся на Pareto-фронте по разным задачам, чтобы отбор не схлопывал разнообразие в один «усреднённо хороший» промпт.

На фото — «было-стало»: стартовый промпт и тот, до которого дошла система.

ACE расширяет эту идею: оптимизировать можно не только промпт, но и рабочий контекст агента — инструкции, память, накопленные стратегии. Мне понравилась формулировка context as an evolving playbook: контекст не переписывается целиком (что ведёт к потере деталей), а обновляется инкрементально: новые наблюдения добавляются, старые — уточняются или удаляются.

2. Оптимальный выбор примеров для обучения

Хорошая мысль — обучать модель на примерах из «зоны её ближайшего развития». Слишком простые примеры не развивают — модель и так хорошо умеет их решать. Слишком сложные — тоже плохо: модель не может извлечь из них стабильный сигнал. Самые ценные — те, где модель уже почти может, но ещё ошибается.

Ниже — несколько докладов примерно на эту тему.

В работе Prompt Curriculum Learning авторы показывают, что задачи промежуточной сложности — где модель имеет около 50% вероятности успеха — оказываются наиболее эффективными. Предлагают PCL — алгоритм, в котором обученная value-модель за один forward pass предсказывает вероятность, что текущая политика справится с промптом, и отбирает в батч примеры с вероятностью ~0,5. Value-модель обучается параллельно с политикой, поэтому понятие «средней сложности» сдвигается вместе с ростом модели.

Похожая, но с другим механизмом — работа Actor-Curator. Идея в том, чтобы обучить модель-«куратора», которая отбирает не просто сложные или лёгкие примеры, а те, что должны дать максимальный прирост качества текущей модели.

Ещё одна интересная работа — Cram Less to Fit More — о том, что у модели есть ограниченная «память» на факты. Если пытаться запихнуть в обучение слишком много фактической информации, она начинает запоминать хуже. Авторы показывают, что иногда лучше не добавлять всё подряд, а аккуратно отбирать данные — тогда модель удерживает больше полезного.

В целом это рифмуется с DATA-FM invited talk Baharan Mirzasoleiman — о том, что для SFT/RL нужно не просто «больше данных», а данные правильной сложности и разнообразия.

3. Для tool-calling-агентов можно оценивать не только финальный ответ

Если агент ответил правильно, это ещё не значит, что он хорошо пользовался инструментами. Может быть, поиск вообще был не нужен. Или поиск был нужен, но запрос был плохой. Идея в том, чтобы оценивать тулколы независимо: был ли вызов инструмента нужен, был ли он полезен, улучшил ли вероятность правильного ответа. В Tool-call Reward Model предлагают делать реворд на уровне каждого вызова инструмента.

4. О выборе рецепта обучения

Percy Liang красочно рассказал о Marin — опенсорсном проекте, где с нуля обучили 32B-модель. В докладе много интересного о факапах, практические рецепты обучения, scaling laws, и то, как их вывели. Автор постулирует открытость — не только весов, но и всего процесса обучения модели. Команда Marin открыла даже свою очередь тикетов.


#YaICLR26

ML Underhood
4 553 просмотров · 63 реакций Открыть в Telegram · Открыть пост на сайте
Свежая партия интересностей с ICLR

Конференция закончилась, а ты ещё нет обзоры докладов ещё нет.

AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs

Для максимальной эффективности инференса может быть полезно выбирать точность прогоняемой модели на лету. Простые фрагменты промпта или генерации можно прогонять через более квантизованную модель, а при переходе к сложным — вызывать модель в точности повыше. Однако хранить много версий модели в разных битностях накладно по памяти, а хотелось бы занимать места не больше, чем самая высокая битность.

В работе AnyPrecisionLLM предложили способ получать модели разной точности. Но используемое представление весов требовало довольно дорогостоящих операций транспонирования и считывания значений из таблицы.

В AnyBCQ, в свою очередь, предлагают использовать бинарную кодировку весов модели, когда каждый параметр квантизуется поразрядно в -1 или 1. На инференсе достаточно собрать требуемое число разрядов и сложить. Благодаря этому операция деквантизации становится довольно дешёвой. В итоге получают качество не хуже хорошей квантизации в фиксированную битность и при этом имеют достаточно быстрый инференс.

Compute-Optimal Quantization-Aware Training

Команда из Apple провела исследование того, как правильно распределять бюджет между обучением в полной точности и quantization-aware training, чтобы при фиксированном бюджете обучения выжать наилучшее качество.

Обыкновенно доля, выделяемая на QAT, зафиксирована вручную (например, 10%), но авторы замечают, что целесообразно её подстраивать под битность и продолжительность обучения:

• больше модель — меньше QAT;
• меньше битность — больше QAT;
• дольше учим — больше QAT.

Учат модели в разных битностях: от 1 до 6, вплоть до 2,3 миллиарда параметров и 1,4 триллиона токенов. Оптимальная стратегия позволяет сэкономить вычисления в два раза при 1-битном обучении.

MrRoPE: Mixed-radix Rotary Position Embedding

Новый — по утверждениям авторов — SotA-метод интерполяции ротари без дообучения для улучшения качества длинного контекста.
Формально, авторы интерпретируют вектора θ, соответствующие позициям m, как числа, заданные в rotix-смешанной системе отсчёта, и вводят кумулятивные коэффициенты для неё. Фактически заменяют линейную функцию изменения скейл-фактора YaRN на экспоненциальную со специфичными коэффициентами и немного меняют правила подбора диапазона частот для Qwen2.5 (для Llama3.1 оставляют как в YaRN).

Авторы решили замеряться только на длинных бенчмарках, где доминируют над обычным YaRN в большинстве случаев — и на Qwen, и на Llama.

Из минусов: фактически тестировали базовый YaRN против своего метода, в котором перебирали достаточное количество гиперпараметров. Это делает сравнение не до конца честным — особенно с учётом того, что для обеих моделей были разные оптимальные параметры.

Интересное увидели
Денис Кузнеделев и Борис Груздьев

#YaICLR26

ML Underhood
1 931 просмотров · 16 реакций Открыть в Telegram · Открыть пост на сайте
Постеры — хорошо, а что там на оралах?

А там — не менее интересно. Несём несколько обзоров, сделанных по горячим следам выступлений.

Is it Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort

Работа о скрытом взломе награды у ризонинг-моделей. Идея: модель может получать высокий reward не потому, что честно решает задачу, а потому что эксплуатирует «лазейку».

Авторы рассматривают два типа loophole:
1) лазейка в контексте — утёк нужный сигнал или ответ;
2) лазейка в проверке награды — сам verifier / reward можно обмануть.

Признак такого поведения — когда модель проходит задачу только при наличии лазейки, а без неё разваливается.

Для детекции предлагают TRACE: обрезают цепочку рассуждений на разных процентах, форсят ранний ответ и смотрят, как рано модель может получать высокий reward. Если reward высокий уже при раннем обрыве, значит ответ, скорее всего, найден через shortcut, а остальная цепочка рассуждений декоративная.

По результатам TRACE — лучше обычного мониторинга по цепочке рассуждений и лучше ловит такие случаи в задачах по математике и коду.

Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments

Meta* обновила популярный бенч Gaia. Новая версия Gaia2 оценивает агентов в динамической и асинхронной среде, а не в статичных задачах вида «запрос -> ответ». Теперь задача — это полноценный сценарий с течением времени, событиями и изменяемым состоянием (приложения, уведомления, ответы пользователей), где агент должен планировать, ждать и адаптироваться.

Оценка тоже другая: вместо финального ответа смотрят на последовательность действий агента. Учитываются только действия, которые меняют состояние, и они сравниваются с эталонным графом действий (oracle DAG). Проверяется правильность шагов, порядок, тайминг и полнота выполнения. Это позволяет измерять не текст, а реальное поведение агента в длинных сценариях с инструментами и событиями.

How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining

Авторы рассуждают о проблеме curriculum learning для LLM: если модель видит более качественные данные ближе к концу обучения, стандартный learning rate decay может почти «обнулить» пользу от этих данных. То есть лучшие данные приходят поздно, но именно в этот момент learning rate уже слишком мал. В итоге модель получает более чистый сигнал, но почти не способна существенно обновиться.

Как решение предлагают Curriculum Model Averaging (CMA): сохранить более высокий learning rate на поздней стадии, а шум и нестабильность компенсировать усреднением последних чекпоинтов. Такой подход позволяет продолжать извлекать пользу из качественных данных и одновременно снижать variance финальной модели. Как результат, одна только curriculum-стратегия не помогает, один только model averaging тоже не помогает. Но их комбинация даёт прирост.

Послушали и записали Даниил Беликов и Ярослав Ведерников

#YaICLR26

ML Underhood
__
Компания Meta признана экстремистской; её деятельность в России запрещена.
1 823 просмотров · 34 реакций Открыть в Telegram · Открыть пост на сайте
Разное прикольное с ICLR

Продолжаем делиться фотографиями с конференции. В этот раз предлагаем:

— оценить технику цзяньчжи;
— поразглядывать постер, которому место в комиксе «Лечебница Аркхем»;
собаку;
— запрыгнуть на хайптрейн в ожидании cool stuff, который running late;
— посмотреть на статью, которой нужен не большой постер, а только внимательный слушатель;
— поискать автограф Яндекса на стене Microsoft;
— полюбоваться на постер Yandex Research.

#YaICLR26

ML Underhood
1 565 просмотров · 23 реакций Открыть в Telegram · Открыть пост на сайте
От забавных постеров к серьёзным разборам

Но тоже постеров. Тех, которые привлекли внимание инженеров Яндекса на ICLR 2026.

FreeKV: Boosting KV Cache Retrieval for Efficient LLM inference

Авторы работают над развитием класса методов KV selection — он помогает ускорить self-attention на длинных контекстах через подгрузку в кернел не всех токенов, а только важных (выбор может быть обучаемым или по эвристике).

В целом, KV selection может быть скомбинирован с offload кэша в RAM / SSD / NetStorage. Но общее больное место всех таких методов — эффективная работа с подгрузками больших объёмов данных и выбор важных токенов.

В статье предлагают делать такие подгрузки спекулятивно (между итерациями декодинга догружаем только изменения, грузим основное асинхронно), так как заметили, что соседние важные токены в декодинге отличаются слабо. Кроме того, в случае сильного изменения предлагается делать перевыбор с помощью набора эвристик. Итоговый подход отлично себя показал на бенчмарках скорости поверх сильного бейзлайна ShadowKV.

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

Авторы предлагают способ обмена KV-кэшами между разными моделями, чтобы LLM-ки могли коммуницировать друг с другом не на уровне конечных токенов, а на уровне более богатых внутренних представлений. Есть две модели: Sharer и Receiver. Первая отдаёт представления, а вторая получает и генерирует ответ. В практически интересном сценарии — Sharer — большая сильная модель, а Receiver — поменьше и послабее.

Обучают небольшую нейросеть, которая отображает KV-кэш из исходной модели в целевую. Кроме того, есть обучаемый gate, смешивающий представления двух моделей. Receiver-модель обучается воспроизводить ответ более мощного Sharer.

В итоге удаётся зачастую не только не уступить Sharer в качестве, но иногда и превзойти. Авторы показывают, что Cache-to-Cache работает лучше, чем просто подача текстовой информации от Sharer.

LLM Pretraining with Continuous Concepts

Стандартный претрейнинг учит модель только одному — предсказывать следующий токен. Все высокоуровневые абстракции модель должна «выкопать» сама из cross-entropy-лосса. CoCoMix предлагает дать LLM прямой сигнал о концептах, которые должны быть активны. Идея такая:

1 этап — извлечение концептов. Авторы берут предобученую LLM (GPT-2) и обученный на её хидденах TopK SAE. Прогоняют корпус через teacher (взятая LLM), на выбранном слое получают разреженные SAE-активации. Дальше — фильтрация по attribution score (градиент CE × активации): оставляют только те концепты, которые реально влияют на предсказание следующего токена.

2 этап — непосредственно обучение. Модель условно режется на h и f. На выходе h параллельно происходит:

— линейная голова предсказывает распределение SAE-концептов → CE-лосс на метках, которые получили на первом этапе;
— предсказанный вектор сжимается в один continuous concept и интерливится с hidden states: [z₁, c₁, z₂, c₂, …], идёт в f;
— общий лосс получается равен — СЕ_tokens + \lambda * CE_concepts

В итоге достигают того же качества по PPL, что и модели, обученные просто на задачу NTP, но за меньшее — на 21,5% — количество токенов. По бенчмаркам (HellaSwag / PIQA / SIQA / ARC-e / WinoGrande / LAMBADA / WikiText) получается стабильно лучше, чем аналогичная модель, но обученная на NTP задачу.
Для извлечения концептов можно использовать модель меньшего размера, чем ту, которую хотим претрейнить, качество при этом не страдает.

В таком сетапе получается, что на каждый токен последовательности добавляется вектор-концепт, что увеличивает длину контекста в два раза. Авторы проверяли свой метод на контексте в 1024 токена, поэтому с проблемой нехватки контекста не столкнулись.

Интересное увидели Роман Горб, Денис Кузнеделев и Дмитрий Масный

#YaICLR26

ML Underhood
3 085 просмотров · 28 реакций Открыть в Telegram · Открыть пост на сайте
Ну какая конфа без забавных постеров и слайдов?

Нынешняя ICLR тоже без них не обходится. Вот они, слева направо:

1. Большой постер.
2. Постер поменбше.
3. Совсем маленький постер.
4. Продам гараж ICLR Edition.
5. Продам гараж ICLR Edition 2.

#YaICLR26

ML Underhood
1 618 просмотров · 36 реакций Открыть в Telegram · Открыть пост на сайте
Инженеры и исследователи Яндекса — уже на открытии ICLR 2026 в Рио

В Бразилии стартовала она — 14-я конференция International Conference on Learning Representations. В этом году на ICLR приняли больше 5 тысяч статей (из почти 19 тысяч заявленных), что в полтора-два раза больше, чем в предыдущие годы.

В первый день конференции удача была на нашей стороне: ребятам удалось попасть в окно между очередями на получение бейджей — и на всё ушло не больше пяти минут. Так что они уже успели посетить первые постеры и послушать доклады.

Напоминаем, что представим и свои исследования: привезли шесть статей от Yandex Research на основную программу и ещё одну — на воркшоп ICBINB. Ждём фоторепортажей с постеров!

#YaICLR26

ML Underhood
1 715 просмотров · 38 реакций Открыть в Telegram · Открыть пост на сайте
ICLR 2026 стартует уже завтра 🇧🇷

Olá, amigos! Кто-то из наших инженеров уже любуется красотами Бразилии и считает диких обезьян, а кто-то ещё в многочасовом перелёте с кучей пересадок. Но всё это того стоит — впереди ICLR 2026.

Совсем скоро начнём вещать из Рио во всех наших каналах, а пока несём первые фото и впечатления.

Иван Ершов, руководитель команды LLM-агентов Алисы:
Рио — яркий, красочный, зелёный, громкий. Я впервые перелетел Атлантику, соответственно впервые в Латинской Америке. Природа, постройки, люди сильно отличаются от того, что я привык видеть в Европе.

Поражает количество зелени, разнообразие деревьев, птиц, животных. На первой же прогулке с коллегами было ощущение, что улица — «бесплатный зоопарк»: обезьяны, маракуйя, папайя. При всём обилии зелени город выглядит аккуратным и убранным.

Люди в основном говорят на португальском — даже в аэропорту пришлось объясняться жестами. Мне пока больше помогает знание итальянского, чем английского.


Данил Кашин, руководитель команды претрейна VLM:
Пережив 14-часовой перелёт, добрались до Рио. Погода замечательная, красивые виды. Сейчас боремся с джетлагом и изучаем расписание оралов и постеров, чтобы собрать всё самое интересное и поделиться этим в каналах!


Вилиана Девбунова, разработчик службы технологий голосового ввода:
Очень заметен контраст: едешь по городу и в какой-то момент оказываешься рядом с горами, плотно усыпанными простыми домами — так называемыми фавелами. По застройке Копакабана похожа на Анталью.

Фан-факт: я уже проехала по Рио больше 60 км и не увидела ни одного спортивного мотоцикла — в основном все ездят на нейкедах с узкими кастомными рулями.


#YaICLR26

ML Underhood
1 748 просмотров · 49 реакций Открыть в Telegram · Открыть пост на сайте
Muon — мощный оптимизатор для обучения табличных DL-моделей

К такому выводу пришла tabular DL-команда Yandex Research, сравнив 15 оптимизаторов на 17 табличных датасетах для обучения современных моделей на основе архитектуры MLP. Сперва все оптимизаторы сравнивались для стандартных MLP, а затем лучшие варианты протестировали и на более продвинутых моделях вроде TabM.

В качестве референсного бейзлайна выступал широко распространённый оптимизатор AdamW. Сравнивали и вариации последнего: NAdamW, Cautious AdamW, AdEMAMix и другие. Кроме того, тестированию подверглись SOAP и Muon.

Самые высокие результаты показали Muon и AdamW с экспоненциальным скользящим средним (EMA) — эти методы обошли базовый AdamW более чем в половине датасетов. Добавление EMA к Muon может бустить качество на некоторых задачах, но в целом ванильный Muon более надежный.

Что в итоге? Muon показывает отличные результаты и рекомендуется к использованию как для базовых, так и для продвинутых моделей, а AdamW с EMA может быть неплохой альтернативой для более простых архитектур. Использование обоих оптимизаторов несколько замедляет обучение по сравнению с обычным AdamW, но всё зависит от модели. Вероятно, замедление будет допустимым во многих реальных приложениях.

ML Underhood
2 044 просмотров · 42 реакций Открыть в Telegram · Открыть пост на сайте
Хотите лучше разбираться, как развивается машинное обучение сегодня? Собрали каналы от инженеров Яндекса — с фокусом на практику, исследования и реальные задачи.

👩‍💻 ML Underhood — чем живёт ML в Яндексе.

🧠 Душный NLP — детальные NLP-разборы.

🔍 CV Time — всё вокруг компьютерного зрения.

🔮 Рекомендательная — обзоры новых рекомендательных технологий.

🎙 Speech Info — голосовые технологии: ASR, TTS и аудио.

🚗 404 Driver Not Found — ML в автономном транспорте.

Подписывайтесь на каналы, которые вам ближе, чтобы понимать не только «что происходит», но и «как это работает».
2 462 просмотров · 27 реакций Открыть в Telegram · Открыть пост на сайте
Долгое бодрствование агентов — как мы построили платформу Agent Transport System для Алисы AI

Агент «Исследовать», о котором мы писали ранее, должен быть устойчивым к непредвиденным ситуациям. Собственно, исследование — процесс комплексный, требующий проанализировать несколько источников, вызвать разные инструменты и запустить модели. Если где-то что-то упадёт, то всё придется начинать сначала. Чтобы этого не происходило, в Яндексе использовали платформу Agent Transport System (ATS). О ней на Хабре рассказал Алексей Логинов, ведущий разработчик в команде, которая отвечает за инфраструктуру Алисы AI. Кратко выделим главное.

Сперва агентский режим ассистента реализовали на OpenAI Agents SDK. Это работало, но стейты выполнения хранились локально, а при любых сбоях приходилось начинать всё заново. Нужно было найти такое решение, которое позволяло бы продолжать работу именно из состояния до падения. Кроме того, хорошо бы иметь под капотом распределённое выполнение, чтобы агенты и тулы взаимодействовали друг с другом, находясь на разных хостах.

Для построения отказоустойчивых систем хорошо подходит фреймворк Temporal. Он оперирует двумя типами сущностей: workflow (объект с состоянием, который описывает последовательность шагов) и activity (функции, которые вызываются из workflow). Фреймворк фиксирурет решения, принятые workflow, и результаты завершённых activity. В случае падения Temporal восстанавливает выполнение, не вызывая уже сделанные activity.

Однако Temporal не умеет в стриминг, а агенту было бы хорошо выдавать ответы пользователю по мере их получения. К тому же агенты, написанные на Temporal, привязываются к Temporal SDK, что может быть не слишком удобно в случае «переезда» в будущем.

Поэтому Temporal взяли как основу для надёжности, а уже на фреймворке построили центральный сервер платформы — ATS, чьи протоколы и реализуют агенты. ATS также берёт на себя, например, оркестрацию и транспортировку данных и событий между агентами, тулами и моделями на разных хостах. В итоге схема работы выглядит так:

1. Клиент отправляет запрос в ATS.
2. ATS делает запрос в Temporal на запуск workflow. Temporal запускает workflow.
3. Workflow делает запрос в Temporal на запуск activity корневого агента. Temporal запускает activity корневого агента.
4. Activity корневого агента поднимает двунаправленный gRPC-стрим к сервису агента.
5. Если агенту нужно вызвать модель / инструмент / дочернего агента — он просит ATS, ATS сообщает workflow о необходимости запустить activity (signal/update).
6. Workflow запускает соответствующую activity.
7. Activity поднимает двунаправленный gRPC-стрим к сервису.
8. Все activity одного workflow общаются между собой через in-memory-очереди от дочернего activity к родительскому — так чанки данных передаются в реальном времени.
9. Корневой агент пишет свои чанки во внешний стриминговый сервис — пользователь видит ответ по мере выполнения.
10. Завершённые activity возвращают результаты workflow — Temporal сохраняет их.

В случае сбоя ATS начинает взаимодействовать с агентом заново. Когда агент просит вызвать инструмент, модель или дочернего агента, ATS проверяет, есть ли в хранилище какой-то результат работы по этому запросу с прошлого раза. Если да, то агент получает результат и шаг за шагом «перематывается вперёд» до состояния, в котором он был до сбоя, без повторных вызовов тяжёлых LLM и инструментов.

А подробнее о том, как всё устроено, читайте на Хабре.

ML Underhood
2 719 просмотров · 34 реакций Открыть в Telegram · Открыть пост на сайте