Привет! Недавно у нас вышел материал, в котором мы рассказали про ProfileStream — систему, с помощью которой мы делаем расчёт пользовательских эмбеддингов.
Весь материал доступен по ссылке, а здесь мы кратко расскажем про систему и то, как простые, но изящные инженерные решения помогли нам справиться с нагрузкой.
Весь материал доступен по ссылке, а здесь мы кратко расскажем про систему и то, как простые, но изящные инженерные решения помогли нам справиться с нагрузкой.
🔥24❤19👍9🆒3💅2
Roblox — платформа для онлайн-игр и для их разработки, где пользователи могут непосредственно создавать новые игровые миры и/или игры. Рекомендательные системы на данной платформе предлагают пользователям игры для улучшения пользовательского опыта.
В своей статье авторы рассказывают о том, как они смогли улучшить рекомендации при помощи больших языковых моделей. В силу особенностей платформы и большого числа авторов игр информативность текстового описания, сопровождающего каждую из игр, сильно вариативна. По этой причине авторы решили использовать текстовые данные из самого игрового процесса для генерации более информативных признаков.
Такие признаки позволили существенно улучшить качество рекомендаций. Кроме того, новые признаки оказались полезны для детектирования токсичного поведения, использования читов и в других подобных задачах.
Детали
Разработчики собирают весь доступный текст по игровому процессу в единый файл. Используя свой промпт, генерируют краткое описание игры при помощи GPT-4o. Данное описание включает жанр, ключевые игровые механики, тему, сюжет, цели и задачи игры, режимы игры, транзакции в игре и т. д.
Аналогичным способом поступают с пользователем: собирают краткие описания игр, с которыми он взаимодействовал. После чего генерируется краткое описание пользователя при помощи той же LLM. В итоге дополнительные данные о пользователях и играх используются для переранжирования топ-30 рекомендаций, сгенерированных на основе обычной коллаборативной фильтрации.
Разработанный алгоритм тестировался на трёх датасетах: пользователи были разбиты на квантили примерно по 30 процентов в зависимости от времени, проведённого на платформе. Помимо этого авторы провели абляционное исследование, которое показывает важность каждого шага в их алгоритме.
Результаты
По итогам численных экспериментов исследователи заметили общее улучшение качества рекомендаций. Особенно заметный прирост произошёл для игроков с большой и малой историей взаимодействия с платформой. Хуже всего новая модель показала себя на категории игроков со средней историей взаимодействия. По мнению команды, это происходит из-за сложности выделения паттернов в поведении для таких пользователей.
Разработчики подчёркивают важность использования текстовых данных из игрового процесса. Описание и название часто бывают информативными, но могут быть недостаточными для определения жанра. Однако использование новых признаков само по себе недостаточно: они работают гораздо лучше в паре с персонализацией рекомендаций под конкретного пользователя.
В будущем коллектив планирует доработать систему генерации признаков для более тонкого описания жанра или типа игр. Кроме того, специалисты отмечают вычислительные сложности при использовании своего подхода для всех игр Roblox. В дальнейшем будет исследован вопрос о применении разработанного метода только к тем играм, чья аудитория превысила некоторый порог.
Обзор статьи подготовлен командой AI VK
#обзорстатьи
В своей статье авторы рассказывают о том, как они смогли улучшить рекомендации при помощи больших языковых моделей. В силу особенностей платформы и большого числа авторов игр информативность текстового описания, сопровождающего каждую из игр, сильно вариативна. По этой причине авторы решили использовать текстовые данные из самого игрового процесса для генерации более информативных признаков.
Такие признаки позволили существенно улучшить качество рекомендаций. Кроме того, новые признаки оказались полезны для детектирования токсичного поведения, использования читов и в других подобных задачах.
Детали
Разработчики собирают весь доступный текст по игровому процессу в единый файл. Используя свой промпт, генерируют краткое описание игры при помощи GPT-4o. Данное описание включает жанр, ключевые игровые механики, тему, сюжет, цели и задачи игры, режимы игры, транзакции в игре и т. д.
Аналогичным способом поступают с пользователем: собирают краткие описания игр, с которыми он взаимодействовал. После чего генерируется краткое описание пользователя при помощи той же LLM. В итоге дополнительные данные о пользователях и играх используются для переранжирования топ-30 рекомендаций, сгенерированных на основе обычной коллаборативной фильтрации.
Разработанный алгоритм тестировался на трёх датасетах: пользователи были разбиты на квантили примерно по 30 процентов в зависимости от времени, проведённого на платформе. Помимо этого авторы провели абляционное исследование, которое показывает важность каждого шага в их алгоритме.
Результаты
По итогам численных экспериментов исследователи заметили общее улучшение качества рекомендаций. Особенно заметный прирост произошёл для игроков с большой и малой историей взаимодействия с платформой. Хуже всего новая модель показала себя на категории игроков со средней историей взаимодействия. По мнению команды, это происходит из-за сложности выделения паттернов в поведении для таких пользователей.
Разработчики подчёркивают важность использования текстовых данных из игрового процесса. Описание и название часто бывают информативными, но могут быть недостаточными для определения жанра. Однако использование новых признаков само по себе недостаточно: они работают гораздо лучше в паре с персонализацией рекомендаций под конкретного пользователя.
В будущем коллектив планирует доработать систему генерации признаков для более тонкого описания жанра или типа игр. Кроме того, специалисты отмечают вычислительные сложности при использовании своего подхода для всех игр Roblox. В дальнейшем будет исследован вопрос о применении разработанного метода только к тем играм, чья аудитория превысила некоторый порог.
Обзор статьи подготовлен командой AI VK
#обзорстатьи
👍26❤18🔥11✍2 1
Всё лето мы знакомим вас с членами нашей команды. Лето ещё не закончилось, а значит, и знакомство продолжается! Сегодня о себе расскажет Денис Шавейников — руководитель направления Поиска VK AI.
С чего всё начиналось?
Можно сказать, что моя карьера началась ещё с университета: я учился на мехмате, а он тесно связан с IT. Но ещё больший вклад в будущую карьеру внесло моё участие в олимпиадном программировании. Мы собрали свою команду на втором курсе, много тренировались, ездили на сборы, участвовали в турнирах и добились неплохих результатов. Благодаря этому я не только отточил свои знания, но и получил много полезных знакомств.
Как попал в VK?
После обучения я начал работать middle-разработчиком в Яндексе и дорос до руководителя службы разработки видеопоиска. В VK я пришёл уже опытным лидом, но передо мной всё равно стояли большие вызовы. Я ещё никогда не руководил такой большой командой. Кроме того, я никогда не начинал руководить командой, в которой абсолютно ни с кем не был знаком.
Что помогло мне пройти адаптацию?
Во-первых, я установил контакт с опытными коллегами — теми, кто давно работает в компании и включён во многие процессы. Они помогли и продолжают помогать мне ценными советами. Во-вторых, я сразу понял, что не нужно рубить с плеча. Очень легко принять неверное решение, основываясь на неполной информации. Лучше углубиться в вопрос и понять, стоит ли вообще что–то менять.
Какие задачи стоят перед нашей командой?
У нас много направлений, но одно из главных направлений — повышение качества поиска VK Видео. Наша цель — вывести его на уровень лучших мировых конкурентов. Также мы работаем над платформизацией поиска. Мы строим платформу, которая позволит интегрировать поиск во все продукты VK (ВКонтакте, Одноклассники, Дзен) и быстро запускать новые сценарии — от видео до сообществ.
Что я делаю в свободное время?
В первую очередь я люблю просто отдых на даче с семьёй — готовить на гриле, косить траву. Также я люблю иногда поиграть в компьютерные игры с друзьями — хотя бы в ту же Доту. Ещё я открыл для себя гольф — это намного более доступное развлечение, чем кажется. Приезжаешь на большую красивую поляну — и несколько часов тебя волнуют только клюшки, мяч и лунки. Это отличный способ перезагрузиться, а потом вернуться к работе с новыми силами.
#aivk #команда
С чего всё начиналось?
Можно сказать, что моя карьера началась ещё с университета: я учился на мехмате, а он тесно связан с IT. Но ещё больший вклад в будущую карьеру внесло моё участие в олимпиадном программировании. Мы собрали свою команду на втором курсе, много тренировались, ездили на сборы, участвовали в турнирах и добились неплохих результатов. Благодаря этому я не только отточил свои знания, но и получил много полезных знакомств.
Как попал в VK?
После обучения я начал работать middle-разработчиком в Яндексе и дорос до руководителя службы разработки видеопоиска. В VK я пришёл уже опытным лидом, но передо мной всё равно стояли большие вызовы. Я ещё никогда не руководил такой большой командой. Кроме того, я никогда не начинал руководить командой, в которой абсолютно ни с кем не был знаком.
Что помогло мне пройти адаптацию?
Во-первых, я установил контакт с опытными коллегами — теми, кто давно работает в компании и включён во многие процессы. Они помогли и продолжают помогать мне ценными советами. Во-вторых, я сразу понял, что не нужно рубить с плеча. Очень легко принять неверное решение, основываясь на неполной информации. Лучше углубиться в вопрос и понять, стоит ли вообще что–то менять.
Какие задачи стоят перед нашей командой?
У нас много направлений, но одно из главных направлений — повышение качества поиска VK Видео. Наша цель — вывести его на уровень лучших мировых конкурентов. Также мы работаем над платформизацией поиска. Мы строим платформу, которая позволит интегрировать поиск во все продукты VK (ВКонтакте, Одноклассники, Дзен) и быстро запускать новые сценарии — от видео до сообществ.
Что я делаю в свободное время?
В первую очередь я люблю просто отдых на даче с семьёй — готовить на гриле, косить траву. Также я люблю иногда поиграть в компьютерные игры с друзьями — хотя бы в ту же Доту. Ещё я открыл для себя гольф — это намного более доступное развлечение, чем кажется. Приезжаешь на большую красивую поляну — и несколько часов тебя волнуют только клюшки, мяч и лунки. Это отличный способ перезагрузиться, а потом вернуться к работе с новыми силами.
#aivk #команда
❤21🔥11👍5🏆1
Media is too big
VIEW IN TELEGRAM
Мы зовём ML-инженеров, исследователей и разработчиков обсудить, что движет рекомендательные системы вперёд: Discovery-платформа, нейросетевые трансформеры, мультимодальные модели и новые подходы, которые меняют опыт пользователей в VK.
Никаких трансляций, всё офлайн и только для своих. После — афтепати с винилом, сигарами, вином и покером. Настоящая встреча без галстуков!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤13👍11🔥11👌2 2
Всем привет!
На ридинг-группе 28 августа Алексей Кузин, стажёр в команде DL Core RecSys из МТС, расскажет о том, как он реализовал модель HSTU для библиотеки rectools, с какими сложностями столкнулся, и самое главное – действительно ли она дает двузначные приросты метрик, как утверждают авторы оригинальной статьи. Приглашаем всех послушать в 18:00.
🔹 Ждем вас 28 августа в 18:00.
Зум: ссылка
ID: 707 776 9330
Код: 464167
Параллельно запустим стрим прямо в канале AI VK Hub.
На ридинг-группе 28 августа Алексей Кузин, стажёр в команде DL Core RecSys из МТС, расскажет о том, как он реализовал модель HSTU для библиотеки rectools, с какими сложностями столкнулся, и самое главное – действительно ли она дает двузначные приросты метрик, как утверждают авторы оригинальной статьи. Приглашаем всех послушать в 18:00.
Зум: ссылка
ID: 707 776 9330
Код: 464167
Параллельно запустим стрим прямо в канале AI VK Hub.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥17❤13👍9🎉2💯1
Датасет VK-LSVD (Large Short-Video Dataset) для развития рекомендательных систем
Сейчас в открытом доступе не так много больших открытых датасетов, на базе которых инженеры и ученые могут обучать и оценивать модели. Для построения точных рекомендательных алгоритмов важно учитывать не только явные реакции пользователей, но и дополнительные сигналы: продолжительность просмотра, контекст, содержимое. Короткие видео – это уникальный формат для задач рекомендаций. В отличие от музыки, подкастов или длинных видео, у роликов почти отсутствует фоновое и повторное потребление. В ленте показывается один ролик за раз, что упрощает атрибуцию фидбека. А так как пользователи просматривают десятки клипов за одну сессию, фидбека действительно много. Все это повышает точность оффлайн-оценки алгоритмов и позволяет добиваться лучшей корреляции с онлайном.
Поэтому исследователи AI VK выложили в открытый доступ масштабный датасет VK-LSVD на базе сервиса коротких роликов.
Детали
🔸 40 млрд обезличенных уникальных взаимодействий пользователей с короткими видео за шесть месяцев (январь–июнь 2025);
🔸 20 млн коротких видео с метаданными (автор, длительность) и контентными эмбеддингами;
🔸 10 млн пользователей с соцдем признаками (возраст, пол, регион);
🔸 Богатый фидбек: лайки, дизлайки, шеры, закладки, клики на автора, открытия комментариев, а также время просмотра и контекст взаимодействия.
Вместо деления на фиксированные размеры датасета, VK-LSVD позволяет гибко настраивать выборку под задачи конкретного исследования. Можно самостоятельно задать нужный объём данных, выбрать, как именно их отбирать — случайным образом или по популярности. Такой подход позволяет адаптировать датасет под реальные задачи и вычислительные мощности, которые есть у команд. И применять VK-LSVD как для академических проектов, так и для масштабных индустриальных экспериментов.
Найти датасет можно по ссылке
А уже скоро мы на его базе проведем открытое соревнование для инженеров, следите за обновлениями!
Сейчас в открытом доступе не так много больших открытых датасетов, на базе которых инженеры и ученые могут обучать и оценивать модели. Для построения точных рекомендательных алгоритмов важно учитывать не только явные реакции пользователей, но и дополнительные сигналы: продолжительность просмотра, контекст, содержимое. Короткие видео – это уникальный формат для задач рекомендаций. В отличие от музыки, подкастов или длинных видео, у роликов почти отсутствует фоновое и повторное потребление. В ленте показывается один ролик за раз, что упрощает атрибуцию фидбека. А так как пользователи просматривают десятки клипов за одну сессию, фидбека действительно много. Все это повышает точность оффлайн-оценки алгоритмов и позволяет добиваться лучшей корреляции с онлайном.
Поэтому исследователи AI VK выложили в открытый доступ масштабный датасет VK-LSVD на базе сервиса коротких роликов.
Детали
Вместо деления на фиксированные размеры датасета, VK-LSVD позволяет гибко настраивать выборку под задачи конкретного исследования. Можно самостоятельно задать нужный объём данных, выбрать, как именно их отбирать — случайным образом или по популярности. Такой подход позволяет адаптировать датасет под реальные задачи и вычислительные мощности, которые есть у команд. И применять VK-LSVD как для академических проектов, так и для масштабных индустриальных экспериментов.
Найти датасет можно по ссылке
А уже скоро мы на его базе проведем открытое соревнование для инженеров, следите за обновлениями!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤34🔥27🍾15👍4🙈2
AI VK Hub
Всем привет! На ридинг-группе 28 августа Алексей Кузин, стажёр в команде DL Core RecSys из МТС, расскажет о том, как он реализовал модель HSTU для библиотеки rectools, с какими сложностями столкнулся, и самое главное – действительно ли она дает двузначные…
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7❤2🔥1
Исследователи AI VK открыли доступ к масштабному датасету VK-LSVD для развития рекомендательных систем. В нём собраны 40 млрд обезличенных взаимодействий пользователей с короткими видео (январь–июнь 2025), 20 млн роликов с метаданными и эмбеддингами, а также данные о 10 млн пользователей с соцдем-признаками.
Формат коротких видео удобен для исследований: много фидбека за сессию, чёткая атрибуция реакций и высокая корреляция оффлайн-оценок с онлайном. VK-LSVD позволяет гибко формировать выборку под конкретные задачи и доступные мощности, что делает его полезным как для академических исследований, так и для индустриальных экспериментов.
Датасет уже доступен по ссылке, а скоро на его базе пройдёт открытое соревнование для инженеров.
Gemini 2.5 Flash Image, появившаяся под промо-именем Nano-Banana, заняла первые места на LMArena в ряде категорий, включая общую производительность, креативность, инфографику и работу с персонажами и объектами. Модель принимает на вход как текст, так и изображения (можно подать несколько картинок). Пользователи отмечают хорошую работу модели со шрифтами и качественное комбинирование нескольких изображений в одно.
Модель доступна через Gemini API и Google AI Studio, а также бесплатно через Gemini App.
Компания Salesforce разработала бенчмарк, на котором можно протестировать, насколько LLM хорошо справляется с задачами, требующими использования MCP. Авторы собрали 231 задачу из 6 разных доменов: навигация по картам, управление репозиториями с кодом, финансовый анализ, 3D-проектирование, автоматизация браузера и веб-поиск. Часть задач требует многократного обращения к MCP-серверу, т.е. модель должна хорошо уметь работать с длинным контекстом.
Результаты показали, что GPT-5 лидирует с большим отрывом, но справляется при этом менее чем с 50% задач. Лучшей опенсорсной моделью оказалась GLM-4.5.
ZenFlow — это новое расширение традиционного фреймворка DeepSeed. Решение сокращает время простоя GPU при обучении LLM на 85%, разделяя градиенты по важности: приоритетные обновляются сразу на GPU, остальные — асинхронно на CPU: пока графический процессор занят, градиенты из текущей или предыдущей итерации передаются на CPU по выделенному потоку PCIe. Такой подход с полным перекрытием всех операций ускоряет обучение в среднем в 5 раз по сравнению с DeepSpeed ZeRO-Offload. Решение доступно на GitHub.
xAI выпустил новую модель Grok Code Fast 1 для кодирования. Модель на 314 миллиардов параметров поддерживает контекст до 256К токенов и может генерировать до 92 токенов в секунду. Разработчики позиционируют модель как инструмент решения базовых задач разработки: она отлично подойдет, например, для создания веб-приложений и быстрой разработки прототипов.
Стоимость модели составляет всего $0,2 за 1 млн входных токенов и $1,5 за 1 млн выходных.
В Qoder доступно два режима работы: Agent Mode и Quest Mode. В Agent Mode платформа Qoder выступает в роли помощника по написанию кода, что подойдет для базовых задач и быстрых правок. В режиме Quest Mode помощник Qoder автономно работает с кодовыми базами по развёрнутому техзаданию. Qoder составляет план работы, отмечает выполненные задачи в to-do листе, автоматизирует тестирование и валидацию, может составить документацию по уже существующим проектам. Система поддерживает MCP.
Новый инструмент пополняет ряды IDE с ИИ и конкурирует с другими системами, такими как Cursor и Windsurf.
На период беты Qoder доступен полностью бесплатно.
#дайджест #aivk
Please open Telegram to view this post
VIEW IN TELEGRAM
❤19🔥17👍5 4🍾1
Media is too big
VIEW IN TELEGRAM
Запись встречи уже можно посмотреть!
#ридинггруппа #aivk
Please open Telegram to view this post
VIEW IN TELEGRAM
❤16👍14🔥4 2😎1
Как мы переработали архитектуру item2item-отбора кандидатов?
Наша рекомендательная система обрабатывает миллионы запросов в секунду и использует сотни тысяч ядер. Мы нашли способ в десять раз уменьшить объём занимаемой памяти и при этом повысить Timespent на 4%. Рассказываем, как именно мы это сделали.
За подробностями — сюда.
Наша рекомендательная система обрабатывает миллионы запросов в секунду и использует сотни тысяч ядер. Мы нашли способ в десять раз уменьшить объём занимаемой памяти и при этом повысить Timespent на 4%. Рассказываем, как именно мы это сделали.
За подробностями — сюда.
👍19🔥12❤8🎉2 2