Вчера на ECCV послушали кейноут Яна Лекуна — делимся основными тезисами.Лекун начал с контраста между успехами AI в программировании и математике и его способностью действовать в физическом мире. Среди проблем — работа с высокоразмерными непрерывными данными (сырым видео, аудио и сигналами с датчиков), зависимость агентов от большого числа демонстраций и слабая адаптация к новым задачам.
🔴Интеллект — это способность решать новые задачи с минимальным обучением. Лекун отделяет её от накопления знаний и освоения фиксированного набора навыков. Термин AGI он критикует: человеческий интеллект тоже специализирован, а ключевое свойство — быстрая адаптация к незнакомым ситуациям.
🔴Моделировать мир через предсказание следующего кадра — по мнению Лекуна, неверный путь. Будущее на уровне пикселей неоднозначно, а такая детализация часто не нужна для выбора действий. Вместо этого он предлагает обучать абстрактные представления и предсказывать изменения в их пространстве.
На этом принципе построена JEPA (Joint Embedding Predictive Architecture), предложенная Лекуном в 2022 году: энкодер кодирует целевые данные, а предиктор по контексту предсказывает их представление. В модели мира предсказание также учитывает действие. Ошибка считается между представлениями, что позволяет игнорировать несущественные и непредсказуемые детали исходного сигнала.
🔴Модель мира позволяет планировать действия. Предсказывая последствия разных действий, система может искать последовательность, которая приводит к цели. Поэтому основным механизмом выбора действий Лекун предлагает сделать model-predictive control. RL при этом отводится роль корректировки модели мира или критика, когда фактический результат расходится с прогнозом.
🔴Для сложного планирования нужна иерархия моделей мира. В показанной архитектуре на каждом уровне работают своё представление состояния и своя модель динамики. Верхние уровни предсказывают более абстрактные изменения на длинных временных масштабах и задают подцели нижним. Нижние — планируют более конкретные действия на коротком горизонте. Иерархия здесь относится и к задачам, и к самим моделям, которые обеспечивают планирование.
В финале Лекун обратился к исследователям, чья цель — AI человеческого уровня, и рекомендовал им сменить исследовательский фокус: с генеративных архитектур на joint-embedding, с вероятностных моделей на energy-based models, с контрастивного обучения на методы с регуляризацией, с RL-я на управление на основе прогнозирующих моделей. По его мнению, именно в этих направлениях стоит искать путь к таким системам. В этом же контексте прозвучал призыв сместить внимание с LLM на обучение представлений и моделей мира.
А после — селфи со слушателями, как всегда. Заметки с той стороны объектива принесли ❣ Александр Шишеня, Ангелина Гнедина, Виктор Юрченко, Роман Исаченко и Полина Комиссарова.#YaECCV2026
ML Underhood