Исследователи из Амстердамского университета добились впечатляющих результатов в оптимизации рекомендательных систем. Используя открытый датасет Yambda, предоставленный Яндексом в 2025 году, ученые смогли ускорить обучение моделей почти в 60 раз. Об этом сообщила пресс-служба российской компании.
Yambda — один из крупнейших в мире публичных наборов данных, содержащий почти 5 миллиардов обезличенных событий из «Яндекс Музыки». Он был открыт для исследователей в мае 2025 года и сразу привлек внимание специалистов по машинному обучению. Датасет позволяет тестировать алгоритмы рекомендаций на реальных данных огромного масштаба.
Ученые из Амстердама работали над улучшением модели Seater, которая организует товары и контент в иерархический каталог (подобие дерева папок). Это упрощает и ускоряет выдачу рекомендаций. Однако подготовка такого каталога занимала до 20% всего времени обучения. Исследователи предложили два новых метода подготовки данных: сверхбыстрый и быстрый с последующей доработкой.
На датасете Yambda быстрый метод сократил время подготовки данных с 82 минут до 83 секунд, сохранив при этом качество рекомендаций. Комбинированный подход (быстрый плюс доработка) ускорил процесс в 15 раз и даже повысил точность рекомендаций. В итоге улучшенная модель Seater обошла популярные системы SASRec, BERT4Rec и GRU4Rec на 13–17%.
Авторы исследования подчеркивают, что Yambda позволил доказать практическую применимость генеративных рекомендательных систем на больших каталогах. Весь код улучшенной модели выложен в открытый доступ, что позволит внедрять разработку в реальные продукты. Это важный шаг в развитии рекомендательных технологий, а российский датасет сыграл ключевую роль в международном исследовании.