Dealer.AI – Telegram

Dealer.AI

14.7K subscribers

684 photos

46 videos

16 files

715 links

Жоский ИИ Дядя
Твой личный поставщик AI 🦾🤖
Канал о мире интересного AI: GenAI, RecSys, поиск, classic ML, бизнес приклад и ai-meme👾

Для связи @dealer_ai (реклама и консультации)

Head of ML, AI.
Kaggle: https://www.kaggle.com/andrilko

РКН: 6348592885

Download Telegram

About

Blog

Apps

Platform

14.7K subscribers

Microsoft (не)учит нейросети пока вы тапаете ~~хомяка~~ макросы в Excel.

Забавная новость дня.
Пользователи Word и Excel узнали,что стали кожАнными подопытными нейросетей. У них мол воруют информацию, чтобы тренировать искусственный интеллект от Microsoft.

Юзеры заметили,что в Word и Excel по умолчанию активна функция отправки в Microsoft информации. Данная информация в дальнейшем будет использоваться для обучения нейросетей.

Ну в целом, как бэ не удивительно, зачем отказываться от такого источника данных для дообучения своих LLM и тп. Тем более для автоматизации аналитики и вычислений при помощи ИИ. Однако, если учесть,что в Excel работают с NDA информацией, становится неприятненько.

Ранее Excel держал фиансовый мир, теперь видать будет AI 🧠 (ща заделаю мем).

Please open Telegram to view this post

VIEW IN TELEGRAM

Microsoft Denies Training AI on Customer Data Following Uproar

Microsoft Corp. rejected claims that it uses customer data from Microsoft 365 consumer and commercial applications, such as Word and Excel, to train large language models, after user worries spread on social media.

❤7👍2

4.64K viewsedited 15:08

Microsoft (не)учит нейросети пока вы тапаете хомяка макросы в Excel. Забавная новость дня. Пользователи Word и Excel узнали,что стали кожАнными подопытными нейросетей. У них мол воруют информацию, чтобы тренировать искусственный интеллект от Microsoft. Юзеры…

Meme

😁44

5.46K views15:08

Создавай игры с GenAI и LLM.

Дядечка Ын продолжает радовать образовательным контентом. Курс про создание игр с ИИ.

Длительность курса 1 час. Можно использовать, кстати, как старт для вката в игровых агентов.

DeepLearning.AI - Learning Platform

Building an AI-Powered Game - DeepLearning.AI

Learn to build with LLMs by creating a fun interactive game from scratch.

❤20👍5🤔2🔥1

5.37K viewsedited 09:49

Говорят, что выходит GPT-4o1 pro super star plus mode (вспомнил нейминг китайских авто). Но есть один нюанс. Цена 200$, Карл!!!

😁25

3.55K views22:44

Anthropic делится современной "базой" для улучшения RAG. Антропики продолжают образовывать разработчиков и предлагают "новый" хинт для работы с RAG - контекстуально дополненные вектора чанков текста. Основная идея использовать не только микст bm25 и dense…

Cohere 3.5 с обновой Reranker.

Конкуренты антропика в домене RAG не дремлют. Cohere 3.5 новый базированный пайп e2e RAG. Тут всё, как мы любим: и преранк на эмбедах и реранк на кросс-энкодере. При этом ребята обновили механизм внимания для улучшения работы с контекстом намерений пользователя. Как утверждают авторы — цель закрыть эксплицитную и имплицитную часть запросов кожАнных. Помимо этого, добавлены новые сеты для 100+ языков по различным доменным запросам (наука,финансы и тп.). Все это дало значимый бОльший прирост к метрикам поиска. Также,напоминаю,что у ребят есть и мультимодальный эмбеддер.

Cohere прекрасный пример того,как можно зарабатывать на сервисе вокруг <your favourite LLM>. Помним,еще подобное и у perplexity.

Радуемся, следим, юзаем.

Introducing Rerank 3.5: Precise AI Search | Cohere Blog

Rerank 3.5 delivers improved reasoning and multilingual capabilities to search complex enterprise data with greater accuracy.

🔥8👍2

3.92K viewsedited 10:48

Cohere 3.5 с обновой Reranker. Конкуренты антропика в домене RAG не дремлют. Cohere 3.5 новый базированный пайп e2e RAG. Тут всё, как мы любим: и преранк на эмбедах и реранк на кросс-энкодере. При этом ребята обновили механизм внимания для улучшения работы…

3.15K views10:49

Классика архитектуры.

👍5

3.43K views10:50

Поддержу канал нашей исследовательницы. Мысли интересные, вопросы тоже. Контент картиночный)👇

Upd. Оригинал отсюда

2.89K viewsedited 15:08

Forwarded from Анастасия Шахматова

Как гиперрост вызывает войны внутри компании

Картинки выглядит угрожающе, но на самом деле она лишь иллюстрирует, кто из первоначальной команды Open AI остался работать в компании. И добрые люди с Reddit сделали ее после внезапного заявления об уходе из компании главного технического директора Миры Мурати. Ее нет на картинке с первоначальной командой, она присоединилась к стартапу в 2018 году.

И говоря о проблема гиперроста, пример Open AI как нельзя лучше подходит в качестве иллюстрации. Именно головокружительный успех их продукта Chat GPT породил многочисленные проблемы, которые мы наблюдали весь прошлый год. После увольнения и возвращения Сэма Альтмана, казалось, что компания уладила внутренние противоречия и готова продолжать завоевывать рынок. Который, справедливости ради, не стоит на месте и выпускает все новых и новых конкурентов.

Компания рассматривает возможность перехода от некоммерческой организации с ограниченной прибылью к новой структуре, в которой инвесторы получат большую долю прибыли. При этом OpenAI обсуждает возможность передачи мистеру Альтману 7% акций в рамках усилий по реструктуризации в коммерческую компанию.

Однако, несмотря на то, что эксперты ожидают, что инвесторы в следующем раунде финансирования оценят компанию в 150 млрд долларов, неспособность Альтмана удержать топ-менеджеров также может стать для них тревожным сигналом. Один давний наблюдатель из Кремниевой долины говорит, что ощущение переворота похоже на то, что было в Uber в те дни, когда ее возглавлял Трэвис Каланик. «Феноменальный продукт, прогнившая культура», — так он описал ситуацию.

Как думаете, какие ошибки были допущены в период гиперроста? Мы видим, как минимум, несовпадение в ценностях компании.

❤9👍3🌭1🗿1

3K views15:08

Forwarded from Kantor.AI

This media is not supported in your browser

VIEW IN TELEGRAM

Есть ли отечественные генеративные нейросети на самом деле?

В соцсетях сейчас вирусится видео, прикрепленное к посту: молодой человек рассказывает о том, как отечественные нейросети выдают крайне подозрительный результат по запросу нарисовать «родное».

Первое, что думают люди, видя такое, это что отечественных нейросетей на самом деле нет и они просто перенаправляют запросы в апишку Midjourney и им подобных зарубежных оригиналов.

Те, кто более прошарен, думают, что наши компании просто берут зарубежный опенсорс, разворачивают у себя, а русские запросы обрабатывают после перевода на английский.

А кто еще более прошарен, знает, что опенсорс в целом поддерживает и русский язык. Остается вопрос: так как же все-таки работают отечественные нейросети?

Зачем гадать, если можно спросить эксперта в области технологий AI, который сам имеет отношение к теме генеративного ИИ — Александра Абрамова. См. ответ у него в канале или репост ниже 👇

😁22👎5❤2

2.39K views10:00

Есть ли отечественные генеративные нейросети на самом деле? В соцсетях сейчас вирусится видео, прикрепленное к посту: молодой человек рассказывает о том, как отечественные нейросети выдают крайне подозрительный результат по запросу нарисовать «родное». Первое…

Вы спросили —Дядя отвечает. Истина находится где-то по середине. Действительно на нашем рынке можно встретить множество решений вокруг открытых моделей с huggingface или же апи модных нынче Midjourney. Это может работать по принципу перевел с ру на ен и вкинул в апиху, далее выдал результат. Обычно, на старте, это было уделом малых команд, стартапов и пр.

На самом деле, ничего в этом зазорного нет, те же ребята с Perplexity строить свое решение начали именно вокруг топовых апи LLM (OpenAI, Google, Anthropic и т.п.). Но при этом perplexity имеют свою доп. логику с поиском, линковкой фактов и пр. Что делает ее решение аналогом поисковика "в кармане". После, они еще и собственные тюны моделей Llama like завезли, благо лицензия открытая позволяет. И это имеет спрос.
Т.е. более крупные игроки, стараются использовать такие решения для холодного старта или во все опираясь на открытые сеты , модели или архитектуры делать собственные решения/тюны/модели. И я думаю, что крупные игроки нашего рынка достигли уже того уровня зрелости, когда могут позволить себе свои исследования, и как следствие, свои решения в виде моделей и сервисов.

Вопрос остается только в источниках данных. Такое поведение, как мы видим на видео, может быть обусловлено, влиянием сетов обучения. Т.к. на рынке множество открытых сетов на английском языке для задач text2image, а для русского языка примеров много меньше. Создание таких ру-ен данных требует затрат на написание/генерацию и чистку. А в открытых сетах для обучения может возникать дисбаланс по ру-ен паре и как следствие превалирование этики из сетов коих больше. Поэтому тот же native/родной после предобучения на таких примерах будет носить знания культуры того языка коего больше. Тк в основном это все переводы с ен языка на ру как есть, да ещё к релевантным для ен языка картинкам. Для того, чтобы решить проблему "перекоса", не достаточно балансировки знаний, надо писать/матчить именно опорные ру тексты с "правильными" картинками к ним,а также придется, скорее всего, прибегнуть к выравниванию поведения — привет alignment/ human feedback и тп. А далее, вооружившись всем этим, нужно будет решать вопросы тюна с эмбеддером text2image, чтобы для языковой пары запрос сводился к "правильной картинке". Именно его представления будут использоваться диффузией как базой генерации. И в тч над этим, думаю, работают исследовательские команды крупных игроков.

Но нет предела совершенству, это непрерывный процесс дообучения и отлова "черных лебедей". Вот как-то так.

👍16👎5❤3🌭2😁1

8.94K views10:00

Вот пример специфичного запроса от подписчиков.

Для русского языка слово "отечество" специфично и поэтому генерация релевантна.
Но родное подвело... Да...

Запросы: История отечества и родная история.

😁11😱6❤2👏1

7.44K views10:24

Откроем новую неделю с мемного поста. Картинка от друже @Erlemar.

Вывод. Не стрессуй. ~~Действуй~~.

1😁27😢9🤣4❤2🔥2🤬1

3.88K viewsedited 10:50

Откроем новую неделю с мемного поста. Картинка от друже @Erlemar. Вывод. Не стрессуй. Действуй.

Ну, что вы так напряглись, ну не справился дядя, ща будет мем. Закроем день с улыбкой.

😁35🤣5🤪2🤔1

3.45K viewsedited 19:50

Хорошо поговорили с Виктором Кантором и командой ТехТок про Deep learning, NLP, и конечно GenAI. 🦾🤖🕺
Спасибо за приглашение 👇

Следите за новостями;)

👍10

2.99K viewsedited 09:03

Forwarded from Kantor.AI

Подкаст про технологии ИИ

Многие из вас в курсе, что я в этом году публикую второй сезон подкаста ТехТок, и этот сезон посвящен технологиям искусственного интеллекта. Цель - рассказать про важные для современного мира технологии на более широкую аудиторию, чем те, кто уже работает в AI. До сих пор подкаст был доступен только на YouTube, а теперь появился канал и на VK Видео, чтобы вы могли скинуть подкаст вашим родственникам и друзьям не из IT :)

VKвидео: https://vkvideo.ru/@kantortechtalk

YouTube: www.youtube.com/@KantorTechTalk

‼️Обязательно подписывайтесь и следите за новыми выпусками! В этом сезоне их будет еще шесть.

🎬Также вышел тизер подкаста с нашим следующим гостем, которого я уже несколько раз упоминал в канале за последнее время - с Александром Абрамовым :) Тема выпуска: большие языковые модели

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥7

3.11K views09:03

Хорошо поговорили с Виктором Кантором и командой ТехТок про Deep learning, NLP, и конечно GenAI. 🦾🤖🕺 Спасибо за приглашение 👇 Следите за новостями;)

А вот и оно.

https://youtu.be/3ra-zgi-dIM

NLP И БОЛЬШИЕ ЯЗЫКОВЫЕ МОДЕЛИ | Александр Абрамов в гостях у ТехТок

В этом выпуске AI эксперт из Сбера Александр Абрамов, автор телеграмм-канала dealerAI, рассказывает нам о том, как обработка текстов на естественном языке (NLP) дошла до построения больших языковых моделей и в чем же их особенности

Таймлайн:
00:00:00 - Начало:…

❤19🔥13👍7👎1

3.06K views17:28

Distillation is all you need? Или опыт репликации знаний из O1. Вышла статья про то,как использование знания (внезапно не новое) из синты созданной через рассуждения модели учителя бустит ученика. Тут мы передаем привет снова Orca, Alpaca и прочим животным…

Возвращаясь снова к вопросу демократизации и инволюции архитектур моделей.

https://xn--r1a.website/zheltyi_ai/408

Что же за таинственные 7б и 32б, не qwen ли like?🤔

Ах да. Там ж так и написано.

Жёлтый AI

Запустили open-source модели на 7 и 32 миллиарда параметров

Сегодня мы выложили в открытый доступ две большие языковые модели на русском языке: T-Pro на 32 млрд параметров и обновленную T-Lite на 7 млрд параметров. Они построены на базе моделей Qwen 2.5…

50😁8❤4👍2

3.43K viewsedited 07:05

3.32K views08:30