Российские данные разогнали голландский ИИ: как Яндекс помог ускорить рекомендации в 60 раз
Рекомендательные системы сегодня — это невидимая рука, которая тащит нас за шкирку от видео к видео, от трека к треку, от товара к товару. Они стали настолько привычной частью цифровой жизни, что мы перестали замечать их работу. Но за кулисами этого шоу всегда идет жестокая битва: как подобрать идеальный контент миллионам пользователей за доли секунды, не потратив на обучение модели вечность? Ответ на этот вопрос нашли исследователи из Амстердамского университета, и, что иронично, ключом к их триумфу стал российский датасет Yambda от Яндекса.
История началась в мае 2025 года, когда Яндекс открыл для мирового научного сообщества почти 5 миллиардов обезличенных событий из своей музыкальной платформы. Это не просто «коробка с цифрами», а гигантский слепок реального поведения живых людей — их вкусы, прыжки между треками, повторы и пропуски. Такого масштабного и честного набора данных публично не выкладывал никто. И он моментально превратился в полигон для самых смелых экспериментов. Голландские ученые, вооружившись этим массивом, взялись за апгрейд модели Seater — системы, которая организует товары и контент в иерархический каталог, похожий на гигантское дерево папок. Это позволяет выдавать рекомендации молниеносно, но подготовка этого самого «дерева» пожирала до 20% всего времени обучения.
Проблема классических подходов была в том, что эта предварительная сортировка данных работала медленно и ресурсозатратно. Амстердамские математики предложили два элегантных решения. Первый метод, «сверхбыстрый», сократил время подготовки данных с 82 минут до 83 секунд — почти в 60 раз! При этом качество рекомендаций не пострадало. Второй подход, комбинированный (быстрый плюс доработка), ускорил процесс в 15 раз и даже улучшил точность алгоритма, позволив ему обойти таких тяжеловесов, как SASRec, BERT4Rec и GRU4Rec, на 13–17%. Это как если бы вы нашли способ собирать сложный пазл в 60 раз быстрее, и при этом картинка стала четче.
Почему это прорыв, а не просто галочка в отчете? Потому что рекомендательные системы сейчас упираются в математическую стену. Генеративные модели, которые пытаются предсказывать следующее действие пользователя, требуют невероятных вычислительных мощностей. Без хорошей организации данных они захлебываются в шуме. Ускорение в 60 раз означает, что мы можем внедрять более сложные и точные алгоритмы в реальные продукты без необходимости строить новые дата-центры. Яндекс, предоставив Yambda, фактически подарил мировому сообществу ключ к следующему поколению ИИ-рекомендаций.
Но самое приятное в этой истории — открытость. Исследователи выложили весь код улучшенной модели в публичный доступ. Это значит, что любой стартап или гигант вроде Netflix или Spotify может взять наработки и интегрировать их в свои системы уже завтра. Не часто увидишь, чтобы российские данные становились основой для международного технологического прорыва, а потом возвращались к нам в виде решений с открытым исходным кодом. Это ли не пример того, как наука должна работать в идеальном мире — без границ и политических барьеров, а лишь на основе интереса к большим данным и стремления сделать алгоритмы умнее. Теперь остается только дождаться, когда ускоренные голландцами алгоритмы появятся в наших плеерах и лентах, чтобы удивить нас треком, о котором мы и не подозревали, но который идеально ляжет на настроение.
Читайте также:



