Набор данных LAION-DISCO-12M состоит из 12 млн ссылок на общедоступные треки YouTube с метаданными. Он собран для поддержки фундаментальных исследований в области машинного обучения, созданию базовых моделей обработки звука, извлечения музыкальной информации, анализа наборов данных аудио и обучение рекомендательных систем и приложений.
Метод создания LAION-DISCO-12M основан на рекурсивном поиске исполнителей на платформе YouTube Music. Начиная с начального списка исполнителей топ-чартов разных стран, новые артисты обнаруживались путем анализа раздела "Похожие исполнители".
Для каждого исполнителя извлекались метаданные: имя, количество подписчиков и список всех песен и музыкальных клипов. Каждая песня или музыкальный клип были связаны с URL-адресом YouTube.
Размер датасета составляет 250 516 исполнителей и 12 648 485 треков.
Поля метаданных:
@ai_machinelearning_big_data
#AI #ML #LAION #Audio #Dataset
Please open Telegram to view this post
VIEW IN TELEGRAM
👍28❤9🔥8
Исследовательская группа опубликовала BVD (Big Video Dataset). Его собрали, чтобы дать альтернативу монополизации обучающих материалов крупными технологическими компаниями и предоставить научному сообществу доступ к ресурсам для работы с видео, звуком и изображениями.
Отправной точкой послужили 1,3 млрд ссылок из архивов CommonCrawl. Из них LAION скачала 80 млн роликов общей длительностью 10 млн часов.
Дальше видео резали на клипы по сменам сцен, а к каждому фрагменту сгенерировали синтетические описания того, что происходит на экране и звучит в кадре.
Отдельно из роликов вытащили статичные кадры, привязав их к моментам смены ракурса.
Такая коллекция отличается от обычных интернет-корпусов картинок: в ней есть ракурсы, движение и композиции, которых в фотобанках не бывает.
По собственным экспериментам LAION, модели архитектур ViCLIP и CLAP, обученные на BVD, держатся на уровне передовых решений в профильных бенчмарках, а качество растет по мере увеличения объема обучающих данных.
Датасет выложен в двух вариантах: облегченный - только URL-адреса видео и метаданные, и полный - с медиафайлами.
Оба варианта разложены на несколько наборов:
Облегченная версия лежит на Hugging Face свободно, а для доступа к вариантам с медиафайлами нужно заполнить анкету.
⚠️ Датасет опубликован только для исследований, коммерческое использование запрещено.
@ai_machinelearning_big_data
#AI #ML #Dataset #LAION
Please open Telegram to view this post
VIEW IN TELEGRAM
👍47❤22🔥16❤🔥4