📝 Natural Language YouTube Searcher
Генерация изображений по текстовоу описанию с использованием нейросети CLIP от компании OpenAI, основная задача которой наоборот придумывать описания картинкам. На этот раз из нее собрали поисковик по кадрам из ролика на Ютубе.
Все просто: даете ссылку на видео; пишите что нужно найти (как и раньше, на любом языке) и нейросеть не просто показывает кадр, который вы искали, но и говорит на какой он секунде. Если во время выполнения второго блока будет вылетать, то увеличьте показатель framestoskip. В остальном, я уверен, вы без труда разберетесь.
Колаб для тестов доступен по ссылке: https://colab.research.google.com/github/Veron28/bot_test/blob/master/Natural_Language_YouTube_Searcher.ipynb
#AI #CV
Data Secrets
Генерация изображений по текстовоу описанию с использованием нейросети CLIP от компании OpenAI, основная задача которой наоборот придумывать описания картинкам. На этот раз из нее собрали поисковик по кадрам из ролика на Ютубе.
Все просто: даете ссылку на видео; пишите что нужно найти (как и раньше, на любом языке) и нейросеть не просто показывает кадр, который вы искали, но и говорит на какой он секунде. Если во время выполнения второго блока будет вылетать, то увеличьте показатель framestoskip. В остальном, я уверен, вы без труда разберетесь.
Колаб для тестов доступен по ссылке: https://colab.research.google.com/github/Veron28/bot_test/blob/master/Natural_Language_YouTube_Searcher.ipynb
#AI #CV
Data Secrets
👍3
This media is not supported in your browser
VIEW IN TELEGRAM
🤯 Алгоритмы ИИ для удаления водяных знаков с картинок
➖модель сначала предсказывает местоположение водяного знака на изображении
➖затем отделяет цвета водяного знака от фона изображения
➖и востанавливает фон области, где находился вотермарк
👉 Попробовать
#AI #ML
Data Secrets
➖модель сначала предсказывает местоположение водяного знака на изображении
➖затем отделяет цвета водяного знака от фона изображения
➖и востанавливает фон области, где находился вотермарк
👉 Попробовать
#AI #ML
Data Secrets
👍10⚡4👏2
📌 Как работает ИИ в TikTok?
Задумывались, в чем волшебство сенсационного ТикТока, который так всех увлек? Ответ прост - система рекомендаций, поддерживаемая машинным обучением.
В этом переводе известной статьи расскажут про основы, особенности и алгоритмы рекоммендательной системы TikTok. После прочтения точно станет ясно, как TikTok сделал своего пользователя таким зависимым 🔥
👉 Читать
#статьи #рекомендации #AI
Data Secrets
Задумывались, в чем волшебство сенсационного ТикТока, который так всех увлек? Ответ прост - система рекомендаций, поддерживаемая машинным обучением.
В этом переводе известной статьи расскажут про основы, особенности и алгоритмы рекоммендательной системы TikTok. После прочтения точно станет ясно, как TikTok сделал своего пользователя таким зависимым 🔥
👉 Читать
#статьи #рекомендации #AI
Data Secrets
❤🔥7👍3
👅 Модель распознавания языка
Как человек, ты можешь легко определить, на каком из известных тебе языков написан текст. Но компьютеру это дается не так легко. Например, в Google Translate встроена целая модель машинного обучения для определения языка.
🔥 Мы решили показать, как это работает, в этом колабе. Здесь можно самостоятельно обучить модель и поиграть с ней.
https://colab.research.google.com/github/Veron28/bot_test/blob/master/lang_detection.ipynb
#ML #AI
Data Secrets
Как человек, ты можешь легко определить, на каком из известных тебе языков написан текст. Но компьютеру это дается не так легко. Например, в Google Translate встроена целая модель машинного обучения для определения языка.
🔥 Мы решили показать, как это работает, в этом колабе. Здесь можно самостоятельно обучить модель и поиграть с ней.
https://colab.research.google.com/github/Veron28/bot_test/blob/master/lang_detection.ipynb
#ML #AI
Data Secrets
👍11🔥2🤯2
Слышал про deep fake? Это означает алгоритм смены лица на фото или видео. Ребята из Сбера на днях опебликовали свою новую разработку в этой области. А мы уже сегодня передаем колаб тебе. С ним можно поиграться и проверить, кому из друзей идет твое лицо 🤪
Выглядит круто! А еще там в конце Илон Маск поет "Never gonna give you up" 🤐
👉 https://colab.research.google.com/github/Veron28/bot_test/blob/master/GHOST_inference.ipynb
#AI #deep_fake
Data Secrets
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4😍2❤🔥1🔥1
BIG DATA & TOYOTA
Toyota Motor Corp разработала новую ситсему аварийной безопасности, чтобы предотвращать ошибку при нажатии педали газа вместо педали тормоза 🚗
В карточках – краткий перевод статьи, которую можно прочитать здесь.
#big_data #AI
Data Secrets
Toyota Motor Corp разработала новую ситсему аварийной безопасности, чтобы предотвращать ошибку при нажатии педали газа вместо педали тормоза 🚗
В карточках – краткий перевод статьи, которую можно прочитать здесь.
#big_data #AI
Data Secrets
👍9❤3🔥3
Tesla опять всех шокировала?
На ежегодной конференции Tesla AI Day 2022 на сцене появился робот-гуманоид, который самостоятельно прогулялся и даже станцевал. Зрителям также показали видео, как он поливает цветы и носит коробки 🦋
Винтики и провода пока торчат во все стороны, но показан был так же робот следующего поколения Optimus. Он пока не может ходить, но выглядит симпатичнее.
💥 Несмотря на все недостатки роботов, Tesla добилась таких результатов всего за год – и это поражает.
👉 Посмотреть хайлайт с презентации можно здесь
P.S. По традиции, Илон Маск не смог обойти стороной утопические рассуждения о светлом будущем. По его словам, роботы Tesla помогут построить общество изобилия, в котором не будет бедности.
#AI #робототехника #новости
Data Secrets
На ежегодной конференции Tesla AI Day 2022 на сцене появился робот-гуманоид, который самостоятельно прогулялся и даже станцевал. Зрителям также показали видео, как он поливает цветы и носит коробки 🦋
Винтики и провода пока торчат во все стороны, но показан был так же робот следующего поколения Optimus. Он пока не может ходить, но выглядит симпатичнее.
💥 Несмотря на все недостатки роботов, Tesla добилась таких результатов всего за год – и это поражает.
👉 Посмотреть хайлайт с презентации можно здесь
P.S. По традиции, Илон Маск не смог обойти стороной утопические рассуждения о светлом будущем. По его словам, роботы Tesla помогут построить общество изобилия, в котором не будет бедности.
#AI #робототехника #новости
Data Secrets
YouTube
Optimus Robot Revealed at Tesla AI Day
At 2022 Tesla AI Day, Elon Musk gave the public its first look at his company's humanoid robot nicknamed Optimus. He expects the production model to cost less than $20,000.
Never miss a deal again! See CNET’s browser extension 👉 https://bit.ly/39Ub3bv
Subscribe…
Never miss a deal again! See CNET’s browser extension 👉 https://bit.ly/39Ub3bv
Subscribe…
👍5🔥3❤1
Распознавание лиц, математика и черно-белые прямоугольники
Наверное, ты уже не раз сталкивался с технологией распознавания лиц. А задумывался ли, как это работает? Разбираемся, как айфон понимает, что ты это ты, и при чем тут векторы🍎
#AI #ML
Data Secrets
Наверное, ты уже не раз сталкивался с технологией распознавания лиц. А задумывался ли, как это работает? Разбираемся, как айфон понимает, что ты это ты, и при чем тут векторы
#AI #ML
Data Secrets
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍16
Является основным инструментом для задач классификации и нейронных сетей
Чтобы лучше понять, что это такое, смотри наш небольшой экскурс.
#ML #AI
Data Secrets
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8🐳7🍌3❤2
Созданная искусственным интеллектом работа Джейсона Аллена «Theatre D’opera Spatial» заняла первое место в цифровой категории на Ярмарке штата Колорадо. Художники естественно были в ярости. В чатах и прессе развернулись ожесточенные дебаты
На картине под названием «Пространственный театр оперы» изображена научно-фантастическая сцена оперного спектакля. Автор использовал для её создания генератор изображений с искусственным интеллектом Midjourney.
#AI #GAN
Data Secrets
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13😁5🤯3
Знакомы моменты, когда смотришь на код и удивляешься: “Почему я использую в коде эти параметры?”. Мы как раз рассказали об одном из них
#AI
Data Secrets
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10🍓5🍌4🌭3
Рекомендательные системы 🛍️
Всегда было интересно, как сервисы понимают, какой фильм ты хочешь посмотреть, какой следующий трек тебе включить, что лучше всего подойдет к этой покупке? Рассказываем об основных алгоритмах рекомендательных систем и объясняем, как они работают🎵
#AI
Data Secrets
Всегда было интересно, как сервисы понимают, какой фильм ты хочешь посмотреть, какой следующий трек тебе включить, что лучше всего подойдет к этой покупке? Рассказываем об основных алгоритмах рекомендательных систем и объясняем, как они работают
#AI
Data Secrets
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍17⚡7👏3
Forwarded from Machinelearning
Дайджест первого дня ICLR 2025 от делегации Яндекса
✔️ Computer Vision: прорывы в генерации и анализе изображений.
Исследователи представили многомодальную модель Eagle с множеством энкодеров, теоретическое обоснование ограничений диффузионных моделей с тяжёлыми хвостами, метод FreCaS для генерации изображений высокого разрешения и фреймворк FORTE для автоматического обнаружения аутлайеров в данных.
✔️ NLP: оптимизация предпочтений и эффективный инференс.
Предложены новые подходы к DPO с учётом временного затухания для первых токенов, прогрессивная смешанная точность для эффективного инференса LLM, улучшенные метрики для моделей с длинным контекстом и обучение реворд-моделей для предотвращения reward hacking.
✔️ Speech: расширенные бенчмарки и новые токенизации.
Представлен бенчмарк Dynamic-SUPERB Phase-2 со 180 задачами для речевых моделей, предложена токенизация на уровне слогов в SyllableLM, а также доказаны математические гарантии для алгоритма Flow Matching, показывающие одинаковый порядок сходимости с классическими диффузионными процессами.
✔️ RecSys: инновационные архитектуры для рекомендаций.
Разработана архитектура ContextGNN, объединяющая попарный скор и двухбашенный подход, исследовано применение диффузионных моделей в рекомендациях от TikTok, предложены новые методы персонализации для диалоговых агентов и эффективная дистилляция LLM для секвенциальных рекомендаций.
@ai_machinelearning_big_data
#news #AI #ML #LLM
Исследователи представили многомодальную модель Eagle с множеством энкодеров, теоретическое обоснование ограничений диффузионных моделей с тяжёлыми хвостами, метод FreCaS для генерации изображений высокого разрешения и фреймворк FORTE для автоматического обнаружения аутлайеров в данных.
Предложены новые подходы к DPO с учётом временного затухания для первых токенов, прогрессивная смешанная точность для эффективного инференса LLM, улучшенные метрики для моделей с длинным контекстом и обучение реворд-моделей для предотвращения reward hacking.
Представлен бенчмарк Dynamic-SUPERB Phase-2 со 180 задачами для речевых моделей, предложена токенизация на уровне слогов в SyllableLM, а также доказаны математические гарантии для алгоритма Flow Matching, показывающие одинаковый порядок сходимости с классическими диффузионными процессами.
Разработана архитектура ContextGNN, объединяющая попарный скор и двухбашенный подход, исследовано применение диффузионных моделей в рекомендациях от TikTok, предложены новые методы персонализации для диалоговых агентов и эффективная дистилляция LLM для секвенциальных рекомендаций.
@ai_machinelearning_big_data
#news #AI #ML #LLM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍22❤7🔥7
Почему омни-модели — это больше про инфраструктуру, чем про архитектуру
Последние пару лет вся индустрия пытается склеить модели: текст с изображениями, речь с текстом, диффузию с трансформерами. Со стороны это выглядит как архитектурная задача. Берем несколько моделей, склеим друг с другом, учим на мультимодальных данных — готово.
На практике все оказывается сильно сложнее. На примере собственного опыта это отлично показал Роман Исаченко в докладе. Роман отвечает за базовые технологии ART и VLM в Яндекс R&D, и вот что он рассказывает о том, как на самом деле обстоят дела с омни-моделями:
Первый bottleneck на уровне предобучения — не архитектура, а инфраструктура мультимодального обучения. На тысячах GPU это превращается в сложную систему с несколькими видами параллелизмов. Любая неэффективность сразу стоит скорости. В докладе был хороший пример про картиночный энкодер: в нем половина времени уходит не на основные вычисления, а на операции типа резидуалов и сложения байесов. Такое ловится только через глубокий профайлинг.
Вторый важный нюанс уже на уровне алайнмента. Здесь RL становится ключевой частью системы. Нужно проектировать реворды под разные модальности и следить, чтобы полученная система ревордов обладала свойством независимости, то есть отдельные реворды были нескорелированными между модальностями.
Ну и куда же без данных. Смешивание данных для обучения — отдельная история, тут очень важны пропорции. Нельзя просто добавить картинки к тексту и надеяться, что все заработает. Это долгий путь экспериментов, где подбор правильной микстуры занимает огромное количество времени.
Отсюда главный вывод: омни-модели — это не про новые архитектуры, а про умение обучать сложные системы. И именно на этом уровне сейчас происходит основной прогресс.
Последние пару лет вся индустрия пытается склеить модели: текст с изображениями, речь с текстом, диффузию с трансформерами. Со стороны это выглядит как архитектурная задача. Берем несколько моделей, склеим друг с другом, учим на мультимодальных данных — готово.
На практике все оказывается сильно сложнее. На примере собственного опыта это отлично показал Роман Исаченко в докладе. Роман отвечает за базовые технологии ART и VLM в Яндекс R&D, и вот что он рассказывает о том, как на самом деле обстоят дела с омни-моделями:
Первый bottleneck на уровне предобучения — не архитектура, а инфраструктура мультимодального обучения. На тысячах GPU это превращается в сложную систему с несколькими видами параллелизмов. Любая неэффективность сразу стоит скорости. В докладе был хороший пример про картиночный энкодер: в нем половина времени уходит не на основные вычисления, а на операции типа резидуалов и сложения байесов. Такое ловится только через глубокий профайлинг.
Вторый важный нюанс уже на уровне алайнмента. Здесь RL становится ключевой частью системы. Нужно проектировать реворды под разные модальности и следить, чтобы полученная система ревордов обладала свойством независимости, то есть отдельные реворды были нескорелированными между модальностями.
Ну и куда же без данных. Смешивание данных для обучения — отдельная история, тут очень важны пропорции. Нельзя просто добавить картинки к тексту и надеяться, что все заработает. Это долгий путь экспериментов, где подбор правильной микстуры занимает огромное количество времени.
Отсюда главный вывод: омни-модели — это не про новые архитектуры, а про умение обучать сложные системы. И именно на этом уровне сейчас происходит основной прогресс.
YouTube
Визуально-текстовая омни-модель: путь к объединению LLM и VLM / Роман Исаченко
На Saturday ML Party Роман Исаченко, руководитель группы анализа изображений в Яндекс R&D, рассказал, как выглядел долгий путь к сведению LLM и VLM из части семейства Alice AI в единую омни-модель. Она умеет работать с текстом и изображениями в одном контуре.…
❤44🗿32👍18🔥16🤯4👌1🤝1
Компании платят авторам контента, чтобы те рассказывали об опасностях ИИ
Немецкая исследовательница Сабина Хоссенфельдер, которая занимается теоретической физикой и снимает научно-популярные видео на ютуб, рассказала (youtu.be/lPdmYMHrWKg), что к ней обратилась некая организация с предложением оплатить видео, предупреждающее об экзистенциальных рисках ИИ.
Предложение пришло вместе со сценарием, конкретными фразами и цитатами, которые нужно было включить. Хоссенфельдер отказалась. Название организации она не раскрыла, но упомянула, что похожие предложения получали и другие блогеры, при этом не только от этой конкретной компании.
Среди частых заказчиков подобного контента – Center for AI Safety и Future of Life Institute, у которых, кстати, есть общий крупный донор Open Philanthropy. В последние годы Open Philanthropy активно занимается продвижением безопасности ИИ.
Хоссенфельдер также рассказала, что деньги за лоббирование текут в научпоп и техжурналистику и с других сторон. Например, WIRED недавно писали о том, что маркетинговая фирма, связанная с организацией Build American AI предлагала тиктокерам до 5000 долларов за ролик, продвигающий антикитайские ИИ-тезисы. При этом – с инструкцией не отмечать и не раскрывать, кто платит.
Choose your fighter: реклама в ChatGPT / реклама того, что ИИ нас всех убьет
Немецкая исследовательница Сабина Хоссенфельдер, которая занимается теоретической физикой и снимает научно-популярные видео на ютуб, рассказала (youtu.be/lPdmYMHrWKg), что к ней обратилась некая организация с предложением оплатить видео, предупреждающее об экзистенциальных рисках ИИ.
Предложение пришло вместе со сценарием, конкретными фразами и цитатами, которые нужно было включить. Хоссенфельдер отказалась. Название организации она не раскрыла, но упомянула, что похожие предложения получали и другие блогеры, при этом не только от этой конкретной компании.
Среди частых заказчиков подобного контента – Center for AI Safety и Future of Life Institute, у которых, кстати, есть общий крупный донор Open Philanthropy. В последние годы Open Philanthropy активно занимается продвижением безопасности ИИ.
Хоссенфельдер также рассказала, что деньги за лоббирование текут в научпоп и техжурналистику и с других сторон. Например, WIRED недавно писали о том, что маркетинговая фирма, связанная с организацией Build American AI предлагала тиктокерам до 5000 долларов за ролик, продвигающий антикитайские ИИ-тезисы. При этом – с инструкцией не отмечать и не раскрывать, кто платит.
Choose your fighter: реклама в ChatGPT / реклама того, что ИИ нас всех убьет
3😁111 47❤27🤯10💯5🕊4👍3🦄2🤝1🫡1