#career #recsys
Анализ рынка RecSys в России
Мне всегда нравилась аналитика вакансий от Хабра, но область Data Science там представлена достаточно слабо, что уж говорить о RecSys. Чтобы лучше понимать, как устроен рынок Data Scientist-ов в рекомендательных системах, я мониторю вакансии из телеги и одс. За последний год я накопил выборку из сотни вакансий, которые мне стало интересно проанализировать.
В серии постов я поделюсь выводами, которые получилось сделать из этого анализа.
Кто нанимает?
Чаще всего специалистов в рекомендательных системах ищут VK, MTS, Sber, Wildberries, Yandex, Avito, Tinkoff и HeadHunter.
Кого ищут?
В большинстве случаев ищут, конечно же, синьеров (41% вакансий). На втором месте по востребованности – мидлы (34%), которые с большим отрывом обгоняют лидов (всего 20%).
Исчезающе мало вакансий джунов (5%), что можно объяснить тем, что от хорошего джуна не требуется специфичных знаний, важнее хорошая DS база.
Можно ли рекомендовать дистанционно?
В 43% вакансий указана возможность полностью дистанционной работы. Любопытно и не удивительно, что почти всегда она отсутствует у вакансий на лидов.
Сколько платят?
Фан факт 1: если в вакансии и есть данные про деньги (что случается не так уж часто), то нередко указан только один из порогов вилки. А иногда пороги указаны сразу для Middle/Senior специалистов. Поэтому я решил анализировать пороги для каждого уровня отдельно.
Фан факт 2: часто вилки указываются в гросс и это не только потому что так солиднее выглядит, но и из-за прогрессивного налога, под который с такими вилками достаточно легко попасть.
Фан факт 3: почти у всех вакансий дополнительно указана возможность получения годовых\полугодовых бонусов в среднем 20% от оклада за этот период.
Медианы для каждого уровня:
@ds_league
Анализ рынка RecSys в России
Мне всегда нравилась аналитика вакансий от Хабра, но область Data Science там представлена достаточно слабо, что уж говорить о RecSys. Чтобы лучше понимать, как устроен рынок Data Scientist-ов в рекомендательных системах, я мониторю вакансии из телеги и одс. За последний год я накопил выборку из сотни вакансий, которые мне стало интересно проанализировать.
В серии постов я поделюсь выводами, которые получилось сделать из этого анализа.
Кто нанимает?
Чаще всего специалистов в рекомендательных системах ищут VK, MTS, Sber, Wildberries, Yandex, Avito, Tinkoff и HeadHunter.
Кого ищут?
В большинстве случаев ищут, конечно же, синьеров (41% вакансий). На втором месте по востребованности – мидлы (34%), которые с большим отрывом обгоняют лидов (всего 20%).
Исчезающе мало вакансий джунов (5%), что можно объяснить тем, что от хорошего джуна не требуется специфичных знаний, важнее хорошая DS база.
Можно ли рекомендовать дистанционно?
В 43% вакансий указана возможность полностью дистанционной работы. Любопытно и не удивительно, что почти всегда она отсутствует у вакансий на лидов.
Сколько платят?
Фан факт 1: если в вакансии и есть данные про деньги (что случается не так уж часто), то нередко указан только один из порогов вилки. А иногда пороги указаны сразу для Middle/Senior специалистов. Поэтому я решил анализировать пороги для каждого уровня отдельно.
Фан факт 2: часто вилки указываются в гросс и это не только потому что так солиднее выглядит, но и из-за прогрессивного налога, под который с такими вилками достаточно легко попасть.
Фан факт 3: почти у всех вакансий дополнительно указана возможность получения годовых\полугодовых бонусов в среднем 20% от оклада за этот период.
Медианы для каждого уровня:
Junior 187k-262kMiddle 200k-325kSenior 325k-460kLead 400k-500k@ds_league
❤11🔥9💯2😢1
#recsys #news
Путеводитель по RecSys
Меня часто спрашивают, за кем следить, чтобы оставаться в курсе последних разработок. Делюсь с вами подборкой источников, которые я регулярно читаю, чтобы иметь самые свежие знания в области RecSys.
Академия
• Один из первых ресурсов в арсенале любого STEM специалиста – это arXiv. В разделе Information Retrieval ежедневно выходит десяток-другой статей, существенная часть из которых про RecSys.
• Свежие результаты бенчмарков рекомендательных алгоритмов на популярных toy-датасетах можно найти на Papers With Code в разделе Latest papers.
• Материалы большинства конференций есть на ACM DL. Релевантные: RecSys, CIKM, SIGIR, SIGKDD, UMAP, WSDM и WWW.
Индустрия
Чтобы не выискивать индустриальные статьи на arXiv, можно напрямую читать блоги компаний о рекомендательных системах:
• Netflix Research – легендарная компания в рекомендательных системах. В свое время дала большой буст не только RecSys, но и соревновательному DS.
• Spotify R&D – всё, вплоть до социальных исследований, о рекомендациях музыки, аудиокниг, подкастов.
• Amazon Science – гигант e-commerce, который не нуждается в представлении. Последнее время активно экспериментируют с LLM в рекомендациях.
• LinkedIn Engineering – рассказывают про работу с социальными графами на собственном примере.
Имеет смысл просматривать и блоги других корпораций: Х Engineering, Google Research и DeepMind, Pinterest Engineering, Criteo Engineering, Nvidia Technical. Однако будьте готовы приложить чуть больше усилий для поиска, так как они пишут не только про RecSys.
@ds_league
Путеводитель по RecSys
Меня часто спрашивают, за кем следить, чтобы оставаться в курсе последних разработок. Делюсь с вами подборкой источников, которые я регулярно читаю, чтобы иметь самые свежие знания в области RecSys.
Академия
• Один из первых ресурсов в арсенале любого STEM специалиста – это arXiv. В разделе Information Retrieval ежедневно выходит десяток-другой статей, существенная часть из которых про RecSys.
• Свежие результаты бенчмарков рекомендательных алгоритмов на популярных toy-датасетах можно найти на Papers With Code в разделе Latest papers.
• Материалы большинства конференций есть на ACM DL. Релевантные: RecSys, CIKM, SIGIR, SIGKDD, UMAP, WSDM и WWW.
Индустрия
Чтобы не выискивать индустриальные статьи на arXiv, можно напрямую читать блоги компаний о рекомендательных системах:
• Netflix Research – легендарная компания в рекомендательных системах. В свое время дала большой буст не только RecSys, но и соревновательному DS.
• Spotify R&D – всё, вплоть до социальных исследований, о рекомендациях музыки, аудиокниг, подкастов.
• Amazon Science – гигант e-commerce, который не нуждается в представлении. Последнее время активно экспериментируют с LLM в рекомендациях.
• LinkedIn Engineering – рассказывают про работу с социальными графами на собственном примере.
Имеет смысл просматривать и блоги других корпораций: Х Engineering, Google Research и DeepMind, Pinterest Engineering, Criteo Engineering, Nvidia Technical. Однако будьте готовы приложить чуть больше усилий для поиска, так как они пишут не только про RecSys.
@ds_league
🔥12❤8🏆4
#recsys #news
Путеводитель по RecSys каналам
Важно помнить, что, как научные пейперы, так и статьи в блогах больших технологических компаний не всегда раскрывают важные и неочевидные детали. Поэтому я внимательно слежу за каналами моих коллег, в которых можно узнать факты из первых рук:
• @inforetriever Кирилл – legit специалист в рекомендательных системах с большим индустриальным опытом в RnD Яндекса. Часто сам мониторит arXiv и собирает для вас лучшее. Никакого булщита, четко подмеченные утечки в пейперах и строгая терминология.
• Хороший взгляд на рекомендации от людей из компании Х можно найти у @WazowskiRecommends и @knowledge_accumulator.
• Из Wildberries у @wildrecsys и @ml4value.
• @mlvok коллеги из ОК проводят регулярные ридинг-клабы, в которых можно самим поучаствовать. Порой затрагивают более широкие темы, чем просто рекомендации.
• @ru_recommender_systems – канал от Саши Петрова (ex-Amazon). Чуть больше активности в сопутствующем чате @ods_recommender_systems.
Productivity tip
Сегодня очень легко утонуть в информации, поэтому (пока вам не разработали рекомендательную систему постов про рекомендательные системы) лучше подписаться на 2-3 канала, которые вы действительно будете читать, чем на папку с десятком каналов, в которую вы не будете заходить.
Если кого-то несправедливо забыл – пишите в комментариях.
@ds_league
Путеводитель по RecSys каналам
Важно помнить, что, как научные пейперы, так и статьи в блогах больших технологических компаний не всегда раскрывают важные и неочевидные детали. Поэтому я внимательно слежу за каналами моих коллег, в которых можно узнать факты из первых рук:
• @inforetriever Кирилл – legit специалист в рекомендательных системах с большим индустриальным опытом в RnD Яндекса. Часто сам мониторит arXiv и собирает для вас лучшее. Никакого булщита, четко подмеченные утечки в пейперах и строгая терминология.
• Хороший взгляд на рекомендации от людей из компании Х можно найти у @WazowskiRecommends и @knowledge_accumulator.
• Из Wildberries у @wildrecsys и @ml4value.
• @mlvok коллеги из ОК проводят регулярные ридинг-клабы, в которых можно самим поучаствовать. Порой затрагивают более широкие темы, чем просто рекомендации.
• @ru_recommender_systems – канал от Саши Петрова (ex-Amazon). Чуть больше активности в сопутствующем чате @ods_recommender_systems.
Productivity tip
Сегодня очень легко утонуть в информации, поэтому (пока вам не разработали рекомендательную систему постов про рекомендательные системы) лучше подписаться на 2-3 канала, которые вы действительно будете читать, чем на папку с десятком каналов, в которую вы не будете заходить.
Если кого-то несправедливо забыл – пишите в комментариях.
@ds_league
🔥12❤5👍2🌭1
#recsys #dataset #news
VK-LSVD: Large Short-Video Dataset
Особенный домен
Я пришел в RecSys из CV, где публичным бенчмаркам можно было доверять: результаты из научных статей хорошо коррелировали с продом. Поэтому, возглавив RecSys R&D, я предложил стратегию экспериментов с SotA моделями из академических статей, но практически на все предложения услышал: “уже пробовали, на нашем масштабе прироста нет”.
Различия в методах валидации и доступности данных в академии и индустрии оказались внушительными. И хотя сейчас ситуация чуть лучше, RecSys всё ещё сильно отстаёт от CV/NLP.
Что предлагает сообщество?
Многие из выкладываемых датасетов содержат только то, что можно спарсить самостоятельно (например, отзывы и контент, как в Amazon Reviews, MovieLens или MicroLens). Однако ключевые сигналы для рекомендаций индустриальные системы получают вовсе не из отзывов.
Netflix, сильно забустивший индустрию, после знаменитого соревнования погряз в судебных процессах и перестал публиковать свои данные.
Интересные датасеты выкладывают Tencent (Tenrec) и Kuaishou (KuaiRec). Но несмотря на сотни миллионов DAU их сервисов, эти данные все еще очень далеки от индустриальных масштабов.
Что решил сделать я?
Я опубликовал самый близкий к индустриальным масштабам рекомендательный датасет VK-LSVD с 40В взаимодействий. Второй по размеру сейчас MLHD с 27B взаимодействий, а замыкает тройку свежая Yambda на 4.79B записей логов.
Ключевые отличия VK-LSVD
40B взаимодействий. Упорядоченные по времени данные за 6 месяцев, которые включают и просто показы без реакций.
7 видов фидбека. Кроме привычного таймспента есть лайки, открытия комментов, шэры, закладки, дизлайки, клики на автора.
3 вида контекста. Место взаимодействия (лента, поиск, группы,…), платформа (десктоп, тв, смартфон,…), агент (тип браузера, клиента в приложении,…).
20M айтемов. Для каждого клипа известен автор, длительность и контентный эмбеддинг (недавно рассказывали, как их варим).
10M пользователей. С возрастом, полом и гео.
Кастомный сабсемплинг. В индустрии часто приходится решать задачу согласованности оффлайн-метрик с онлайн-результатами для ускорения проверки гипотез. Академия может помочь нам с исследованием стратегий семплинга, результаты которых хорошо соотносятся с метриками на больших выборках.
Почему именно клипы?
В работе мне доступно много форматов (от музыки до знакомств), но именно клипы выглядят самыми подходящими для бенчмаркинга.
Во-первых, в один момент времени на экран помещается один клип, что сильно упрощает атрибуцию фидбека: скип в клипах более осознанный сигнал, чем на витрине из 9 длинных видео, часть которых пользователь даже не заметил.
Во-вторых, в этом формате практически отсутствует фоновое потребление, которое добавляет шум в других видах контента: например в музыке, действительно ли дослушанный пятый из десяти трек в сессии это позитивный сигнал?
В-третьих, удобный интерфейс и десятки просмотров за сессию дают системе много фидбэка.
Все это повышает точность оффлайн-оценки алгоритмов и позволяет добиваться лучшей корреляции с онлайном. Кроме того, выводы, полученные на клипах, хорошо обобщаются и на другие форматы (что мы наблюдали с DB&NWT).
Что дальше?
Датасет готов к вашим экспериментам, впереди еще статья и масштабное соревнование, так что stay tuned.
@ds_league
VK-LSVD: Large Short-Video Dataset
Особенный домен
Я пришел в RecSys из CV, где публичным бенчмаркам можно было доверять: результаты из научных статей хорошо коррелировали с продом. Поэтому, возглавив RecSys R&D, я предложил стратегию экспериментов с SotA моделями из академических статей, но практически на все предложения услышал: “уже пробовали, на нашем масштабе прироста нет”.
Различия в методах валидации и доступности данных в академии и индустрии оказались внушительными. И хотя сейчас ситуация чуть лучше, RecSys всё ещё сильно отстаёт от CV/NLP.
Что предлагает сообщество?
Многие из выкладываемых датасетов содержат только то, что можно спарсить самостоятельно (например, отзывы и контент, как в Amazon Reviews, MovieLens или MicroLens). Однако ключевые сигналы для рекомендаций индустриальные системы получают вовсе не из отзывов.
Netflix, сильно забустивший индустрию, после знаменитого соревнования погряз в судебных процессах и перестал публиковать свои данные.
Интересные датасеты выкладывают Tencent (Tenrec) и Kuaishou (KuaiRec). Но несмотря на сотни миллионов DAU их сервисов, эти данные все еще очень далеки от индустриальных масштабов.
Что решил сделать я?
Я опубликовал самый близкий к индустриальным масштабам рекомендательный датасет VK-LSVD с 40В взаимодействий. Второй по размеру сейчас MLHD с 27B взаимодействий, а замыкает тройку свежая Yambda на 4.79B записей логов.
Ключевые отличия VK-LSVD
40B взаимодействий. Упорядоченные по времени данные за 6 месяцев, которые включают и просто показы без реакций.
7 видов фидбека. Кроме привычного таймспента есть лайки, открытия комментов, шэры, закладки, дизлайки, клики на автора.
3 вида контекста. Место взаимодействия (лента, поиск, группы,…), платформа (десктоп, тв, смартфон,…), агент (тип браузера, клиента в приложении,…).
20M айтемов. Для каждого клипа известен автор, длительность и контентный эмбеддинг (недавно рассказывали, как их варим).
10M пользователей. С возрастом, полом и гео.
Кастомный сабсемплинг. В индустрии часто приходится решать задачу согласованности оффлайн-метрик с онлайн-результатами для ускорения проверки гипотез. Академия может помочь нам с исследованием стратегий семплинга, результаты которых хорошо соотносятся с метриками на больших выборках.
Почему именно клипы?
В работе мне доступно много форматов (от музыки до знакомств), но именно клипы выглядят самыми подходящими для бенчмаркинга.
Во-первых, в один момент времени на экран помещается один клип, что сильно упрощает атрибуцию фидбека: скип в клипах более осознанный сигнал, чем на витрине из 9 длинных видео, часть которых пользователь даже не заметил.
Во-вторых, в этом формате практически отсутствует фоновое потребление, которое добавляет шум в других видах контента: например в музыке, действительно ли дослушанный пятый из десяти трек в сессии это позитивный сигнал?
В-третьих, удобный интерфейс и десятки просмотров за сессию дают системе много фидбэка.
Все это повышает точность оффлайн-оценки алгоритмов и позволяет добиваться лучшей корреляции с онлайном. Кроме того, выводы, полученные на клипах, хорошо обобщаются и на другие форматы (что мы наблюдали с DB&NWT).
Что дальше?
Датасет готов к вашим экспериментам, впереди еще статья и масштабное соревнование, так что stay tuned.
@ds_league
🔥22❤5👏5🏆5
#papers #news #industry
Leveraging Generative Models for Real-Time Query-Driven Text Summarization in Large-Scale Web Search
AB results ✅, Source code ❌
Проблема
Классические многостадийные системы резюмирования текста на каждом этапе воронки теряют информацию и целостность текстов. А End-to-End LLM модели слишком тяжелые для онлайн-инференса в поиске.
Результат статьи
LLM-модель авторов генерирует резюме сайтов на 20.68% лучше по асессорской разметке (GSB) и на 0.81% кликабельнее (CTR) в АБ, чем прошлая многостадийная система. И чтобы выдержать 50k QPS поисковика Baidu с 78ms latency хватает 334 NVIDIA L20.
Как достигли
1. ERNIE-Lite-8K (10B) дообучается на 1000 человеческих саммари;
2. GPT-2-like (0.1B, с кодовым названием Hamburger) дистиллирует ERNIE на 14M саммари (130B токенов) сайтов из поисковой выдачи;
3. Далее Hamburger дообучается (SFT) на 6160 человеческих саммари, чтобы уменьшить искажение фактов;
4. После дообучается (DPO) на клики из онлайн трафика, периодически повторяя SFT, чтобы не уйти в кликбейт;
5. Финальная модель полностью квантуется в FP8 (веса, активации, KV-кэш) и деплоится на TensorRT-LLM со стратегией Lookahead Decoding, что позволяет ей работать в 68 раз быстрее, чем ERNIE почти без потери качества.
P.S. Картинка из статьи — мечта любого продакта
@ds_league
Leveraging Generative Models for Real-Time Query-Driven Text Summarization in Large-Scale Web Search
AB results ✅, Source code ❌
Проблема
Классические многостадийные системы резюмирования текста на каждом этапе воронки теряют информацию и целостность текстов. А End-to-End LLM модели слишком тяжелые для онлайн-инференса в поиске.
Результат статьи
LLM-модель авторов генерирует резюме сайтов на 20.68% лучше по асессорской разметке (GSB) и на 0.81% кликабельнее (CTR) в АБ, чем прошлая многостадийная система. И чтобы выдержать 50k QPS поисковика Baidu с 78ms latency хватает 334 NVIDIA L20.
Как достигли
1. ERNIE-Lite-8K (10B) дообучается на 1000 человеческих саммари;
2. GPT-2-like (0.1B, с кодовым названием Hamburger) дистиллирует ERNIE на 14M саммари (130B токенов) сайтов из поисковой выдачи;
3. Далее Hamburger дообучается (SFT) на 6160 человеческих саммари, чтобы уменьшить искажение фактов;
4. После дообучается (DPO) на клики из онлайн трафика, периодически повторяя SFT, чтобы не уйти в кликбейт;
5. Финальная модель полностью квантуется в FP8 (веса, активации, KV-кэш) и деплоится на TensorRT-LLM со стратегией Lookahead Decoding, что позволяет ей работать в 68 раз быстрее, чем ERNIE почти без потери качества.
P.S. Картинка из статьи — мечта любого продакта
@ds_league
🔥7🦄1
#papers #news #industry
OneSearch: A Preliminary Exploration of the Unified End-to-End Generative Framework for E-commerce Search
AB results ✅, Source code ❌
Проблема
Многостадийность поисковых систем увеличивает фрагментацию вычислений и несогласованность таргетов.
Результат статьи
End-to-End генеративная поисковая модель в маркетплейсе Kuaishou показала рост CTR на +1.67% и покупок на +2.40% в AB. При этом повысила утилизацию GPU с 3.26% до 27.32%.
Как достигли
1. Базовый контентный эмбеддер обучается на коллаборативный таргет (q2i, q2q, i2i) и LLM-разметку релевантности. Из контентного эмбеддинга товара генерируются три семантических ID с помощью RQ K-means, оставшаяся невязка аппроксимируется двумя OPQ ID (для устранения коллизий между айтемами).
2. В энкодер подается запрос пользователя, долгосрочная история покупок, краткосрочная история кликов и RSU (Relevance Search Unit). Эти данные также представляются в виде семантических ID, агрегированных с затуханием по времени.
3. Все компоненты объединяются в предобученной архитектуре BART. Модель проходит несколько стадий дообучения на простые задачи (предсказать семантические ID по запросу, восстановить текст из ID, классифицировать категорию товара по ID, ...). После дообучается на реальный фидбек пользователей и предсказания reward модели со скором релевантности. Предобучение происходит раз в неделю, DPO дообучение near real-time.
P.S.
Конечно, к статье остаются вопросы.
Например, разметка асессоров, по которой выдача OneSearch на 1-2% релевантнее многостадийной, производилась всего на 200 случайных запросах.
А итоговый алгоритм раскатили только на 20% трафика домашней страницы.
В любом случае, статья OneSearch продолжает One-линейку: OneRec, OneSug, OneRec TR, OneLoc, OneRec-V2 TR.
Ваши ставки, что дальше? OneAds? OneOne?
@ds_league
OneSearch: A Preliminary Exploration of the Unified End-to-End Generative Framework for E-commerce Search
AB results ✅, Source code ❌
Проблема
Многостадийность поисковых систем увеличивает фрагментацию вычислений и несогласованность таргетов.
Результат статьи
End-to-End генеративная поисковая модель в маркетплейсе Kuaishou показала рост CTR на +1.67% и покупок на +2.40% в AB. При этом повысила утилизацию GPU с 3.26% до 27.32%.
Как достигли
1. Базовый контентный эмбеддер обучается на коллаборативный таргет (q2i, q2q, i2i) и LLM-разметку релевантности. Из контентного эмбеддинга товара генерируются три семантических ID с помощью RQ K-means, оставшаяся невязка аппроксимируется двумя OPQ ID (для устранения коллизий между айтемами).
2. В энкодер подается запрос пользователя, долгосрочная история покупок, краткосрочная история кликов и RSU (Relevance Search Unit). Эти данные также представляются в виде семантических ID, агрегированных с затуханием по времени.
3. Все компоненты объединяются в предобученной архитектуре BART. Модель проходит несколько стадий дообучения на простые задачи (предсказать семантические ID по запросу, восстановить текст из ID, классифицировать категорию товара по ID, ...). После дообучается на реальный фидбек пользователей и предсказания reward модели со скором релевантности. Предобучение происходит раз в неделю, DPO дообучение near real-time.
P.S.
Конечно, к статье остаются вопросы.
Например, разметка асессоров, по которой выдача OneSearch на 1-2% релевантнее многостадийной, производилась всего на 200 случайных запросах.
А итоговый алгоритм раскатили только на 20% трафика домашней страницы.
В любом случае, статья OneSearch продолжает One-линейку: OneRec, OneSug, OneRec TR, OneLoc, OneRec-V2 TR.
Ваши ставки, что дальше? OneAds? OneOne?
@ds_league
🔥5❤🔥1
#recsys2025 #news
The 19th ACM Recommender Systems Conference
Что изменится?
Уже достаточно долго на ACM конференциях организаторы рассказывают, что статьи станут бесплатными для читателей. Это важно, ведь не каждый может позволить себе подписку за сотни долларов. Однако, очевидно, они станут платными длячукчей писателей.
В этот раз показали, как изменится система оплаты. Призвали подключать к ней свои организации, чтобы авторам не платить тысячи долларов за каждую статью из своего кармана. Стоимость подключения организации к ACM Open уже можно найти на сайте. К сожалению, есть опасность, что некоторые организации не допустят (ведь даже призовые за второе место в RecSys Challenge не выплатили).
Два следующих RecSys будут в США (Миннесота, потом Гавайи). Это обычно снижает разнообразие авторов по странам, так как по правилам ACM конференций At least one author must attend the conference in person to present the paper. Papers that are not presented may be removed from the proceedings. Так что в следующий раз встретимся на RecSys 2028 в Порто.
P.S.
Хотя конференция не избежала наплыва LLM статей, были и оригинальные. К примеру, у постеров был целый стенд с демонстрацией рекомендаций терапии по сигналам напрямую из мозга (неинвазивные EEG и fNIRS - это вам не клики на показы делить).
Слайды и записи выступлений уже доступны. А статьи можно найти в комментариях.
@ds_league
The 19th ACM Recommender Systems Conference
Что изменится?
Уже достаточно долго на ACM конференциях организаторы рассказывают, что статьи станут бесплатными для читателей. Это важно, ведь не каждый может позволить себе подписку за сотни долларов. Однако, очевидно, они станут платными для
В этот раз показали, как изменится система оплаты. Призвали подключать к ней свои организации, чтобы авторам не платить тысячи долларов за каждую статью из своего кармана. Стоимость подключения организации к ACM Open уже можно найти на сайте. К сожалению, есть опасность, что некоторые организации не допустят (ведь даже призовые за второе место в RecSys Challenge не выплатили).
Два следующих RecSys будут в США (Миннесота, потом Гавайи). Это обычно снижает разнообразие авторов по странам, так как по правилам ACM конференций At least one author must attend the conference in person to present the paper. Papers that are not presented may be removed from the proceedings. Так что в следующий раз встретимся на RecSys 2028 в Порто.
P.S.
Хотя конференция не избежала наплыва LLM статей, были и оригинальные. К примеру, у постеров был целый стенд с демонстрацией рекомендаций терапии по сигналам напрямую из мозга (неинвазивные EEG и fNIRS - это вам не клики на показы делить).
Слайды и записи выступлений уже доступны. А статьи можно найти в комментариях.
@ds_league
🔥6❤4👍3❤🔥1