ICML стартует уже в понедельник!
Мы уже рассказывали о Spotlight-работе, которую наши исследователи представят на конференции в Сеуле. Сегодня расскажем о других, не менее крутых статьях.
GraphPFN: A Prior-Data Fitted Graph Foundation Model
Исследователи из Yandex Research Дмитрий Еремеев, Олег Платонов, Глеб Баженов, Артём Бабенко, Людмила Прохоренкова создали графовую foundation model, развивающую подход Prior-Data Fitted Networks (PFN). Она предварительно обучается на миллионах специально сгенерированных синтетических графов, а затем может эффективно решать задачи на реальных данных как в режиме in-context learning, так и после дообучения. На широком наборе реальных графовых датасетов GraphPFN обходит все остальные протестированные модели.
Unveiling the Role of Data Uncertainty in Tabular Deep Learning
Авторы из Yandex Research Николай Карташев, Иван Рубачёв и Артём Бабенко, исследуют, почему современные методы глубокого обучения показывают высокое качество в задачах на табличных данных. Многие успешные идеи последних лет — эмбеддинги числовых признаков, retrieval-augmented-архитектуры и продвинутое ансамблирование (TabM) — неявно повышают способность моделей работать с высокой неопределённостью в данных. Статья предлагает новый взгляд на недавний прогресс в DL на табличных данных, помогает понять, какие механизмы могут стоять за успехами современных табличных моделей, и задаёт направление для разработки новых методов.
Relevance-Based Embeddings: Lightweight Candidate Retrieval via Heavy-Ranker Calls
Исследователи Яндекса — Кирилл Шевкунов и Людмила Прохоренкова — рассматривают задачу поиска наиболее релевантных объектов для заданного запроса.
Авторы предлагают способ строить эмбеддинги запросов и объектов с использованием информации от самой модели ранжирования. Подход учитывает релевантность запроса набору опорных объектов. Это позволяет получать более информативные представления и эффективнее находить кандидатов для дальнейшего ранжирования.
One-Step Gradient Delay Is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining
Среди авторов статьи — исследователи Яндекса Филипп Змушко, Егор Петров, Нурсултан Абдуллаев и Михаил Хрущев. Работа выполнена в сотрудничестве с BRAIn Lab и MBZUAI.
В статье исследуется асинхронный pipeline parallelism для обучения больших языковых моделей. Такой подход позволяет повысить загрузку GPU, избавляясь от простоев видеокарт в пайплайне, однако долгое время считалось, что задержка градиентов ухудшает качество обучения. Авторы показывают, что проблема зависит не столько от факта самой задержки, сколько от типа используемого параллелизма, а также оптимизатора. В частности, Muon сохраняет значительную устойчивость в асинхронном режиме, а предложенная техника, основанная на Error-Feedback, дополнительно сокращает разрыв между синхронным и асинхронным обучением, позволяя обучать модели на масштабе 10B MoE без потери качества.
SoftSign: Smooth Sign in Your Optimizer for Better Parameter Heterogeneity Handling
Дмитрий Феоктистов из Yandex Research совместно с коллегами из BRAIn Lab предлагают новый подход к оптимизации нейронных сетей, основанный на сглаженной версии sign-обновлений. Он позволяет учитывать различия в поведении отдельных параметров модели и адаптировать величину обновлений во время обучения под них. На основе этой идеи разработали оптимизаторы SoftSignum и SoftMuon. Они стабильно превосходят классические sign-based-методы и AdamW на широком наборе задач.
О работах, которые представим на воркшопах, расскажем отдельно. И даже покажем, как это выглядело вживую.
#YaICML2026
ML Underhood
2026-07-03 13:18 UTC
2 183 просмотров · 37 реакций
Открыть в Telegram · К списку постов · Ссылка на этот пост