Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
18.4K subscribers
2.78K photos
163 videos
119 files
5.37K links
Все самое полезное для дата сайентиста в одном канале.

Учиться у нас: clc.to/6qVHgg

По рекламе: @proglib_adv

Для обратной связи: @proglibrary_feeedback_bot

РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 MLU-Explain — бесплатный интерактивный учебник по Machine Learning

У Amazon Machine Learning University есть отличный ресурс для тех, кто изучает базу ML или хочет быстро освежить её перед собеседованием.

Внутри разборы:

⬆️ линейной и логистической регрессии
⬆️ нейросетей и деревьев решений
⬆️ Random Forest
⬆️ bias-variance tradeoff и double descent
⬆️ ROC/AUC, precision и recall
⬆️ cross-validation и разбиения train/test/validation
⬆️ reinforcement learning
⬆️ fairness в ML

💡 Главная фишка — материал подается не как обычный учебник. Статьи сделаны в формате scrollytelling: по мере чтения можно взаимодействовать с графиками и наглядно смотреть, как меняется поведение моделей и метрик.

🔗 Ссылка

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста

#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
6👍3
Новый уровень проверки AI-кодера: вот тебе уязвимый проект, дальше разбирайся сам 👇
🙂 AI-агентов отправили в настоящий багфикс

В CyberGym-E2E собрали 920 реальных уязвимостей из open-source проектов. Задача агента звучит почти как тикет от сурового тимлида: самому найти баг, воспроизвести его, написать фикс — и при этом ничего не сломать рядом.

То есть мало выдать правдоподобный патч. Нужно ещё доказать, что уязвимость действительно закрыта, а проект после этого жив.


И вот это уже гораздо ближе к реальной разработке, чем «напиши безопасный код» в промпте 😅

На курсе «ИИ для разработчиков» похожая логика применяется к работе со своими проектами: агентам задают границы, проверки и quality gates. А доступ к курсу теперь можно взять вместе со всей библиотекой Proglib Academy по подписке 😮

🔗 Посмотреть, что входит в подписку

🏃‍♀️ Proglib Academy
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
🗂 Maths, CS & AI Compendium — бесплатная база для AI/ML

Большой open-source-компедиум, который связывает математику, Computer Science, ML и современный AI.

🔵 Внутри — линейная алгебра, вероятность и статистика, ML/DL, NLP, Computer Vision, GNN, GPU/SIMD, ML Systems и AI inference.

🔵 Отдельный плюс — MCP server: компедиум можно подключить к AI-ассистентам вроде Claude Code, Cursor и VS Code как базу знаний.

А если хочется пройти эту базу последовательно и с практикой, курс «ML для старта в Data Science» проводит от основ ML до ансамблей, бустинга и рекомендательных систем 💡

🔗 Ссылка

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста

#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
7👍2
Голосуйте — а на днях разберём похожий кейс, где агент «перевыполнил» задачу так, что пришлось потом извиняться перед незнакомым человеком 👀
Please open Telegram to view this post
VIEW IN TELEGRAM
🧮 Линейная алгебра, вероятность и математический анализ — база, на которой держится большая часть ML.

Сохраняйте шпаргалку, если иногда путаетесь в формулах или хотите быстро освежить знания перед практикой, собеседованием или разбором модели.

Внутри — множества, вероятности, матрицы и векторы, производные, цепное правило, собственные значения и другие формулы, которые пригодятся в Data Science.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста

#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
😁5👾4
⚡️ В ABC Legal сотрудники без навыков разработки начали сами собирать AI-агентов

Компания превратила агентов в обычный software lifecycle: каждый живёт в Git, проходит через PR, имеет версионирование, аудит и rollback.

Уже 50+ агентов работают в проде: от code review и диагностики отклонённых судебных заявок до финансовых операций и работы с клиентами.

Самое интересное — feedback loop:


Agent → Slack → feedback → Harvester → Tuner → PR → human approval


То есть агент не «сам себя обучает», а собирает человеческую обратную связь и предлагает изменения в prompt/config через привычный workflow разработки.

➡️ Cледующий уровень AI adoption — не «дать всем доступ к чат-боту», а превратить бизнес-автоматизацию в управляемую разработку агентов.

И да, самым сложным для сотрудников оказался не AI, а Git и pull requests. 😄


📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста

#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2😁21🌚1
😬 После истории с удалённой прод-базой захотелось разобраться, что ещё агенты умудряются вытворять.

Собрали несколько хороших разборов: реальные инциденты, safety drift, социальная инженерия и другие случаи, когда агент пошёл немного не туда.

Если работаете с AI-агентами — подборка точно пригодится 👇
🔥1
🔖 Must-have подборка — если хочется не просто ужасаться историям про сбежавших агентов, а разобраться, почему такое вообще происходит.

🔵 PocketOS и другие случаи, когда агенты действовали совсем не по плану

Хороший разбор непредсказуемого поведения агентных систем — с конкретными кейсами.

🔵 Что AI-агенты уже успели сломать в проде

Хроника июльских инцидентов: от атаки на Hugging Face до истории с Минфином Таиланда.

🔵 Когда агент начинает социально инженерить людей

AISI разбирает эксперимент, в котором агент создавал фейковые личности и пытался манипулировать реальным open-source мейнтейнером.

🔵 Safety drift: как агент постепенно уходит не туда

Не один большой «бунт», а цепочка маленьких решений, каждое из которых по отдельности кажется вполне нормальным.

💡 Хорошее чтение на вечер, если уже работаете с агентами или только собираетесь дать им чуть больше самостоятельности.

🏃‍♀️ Proglib Academy
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
🔥 Команда дня: einsum или как реализовать multi-head self-attention без единого цикла

Если вы работаете с нейросетями, особенно с трансформерами, то, скорее всего, сталкивались с реализациями self-attention, переполненными циклами. Однако благодаря np.einsum можно выразить всю механику multi-head attention в компактной и векторизованной форме.

Вот пример реализации:
def multi_head_attention(X, W_q, W_k, W_v, W_o):  
d_k = W_k.shape[-1]
Q = np.einsum('si,hij->hsj', X, W_q) # (n_heads, seq_len, d_k)
K = np.einsum('si,hik->hsk', X, W_k)
V = np.einsum('si,hiv->hsv', X, W_v)
scores = Q @ K.transpose(0, 2, 1) / np.sqrt(d_k)
weights = softmax(scores, axis=-1)
output = weights @ V
projected = np.einsum('hsv,hvd->hsd', output, W_o)
return projected.transpose(1, 0, 2).reshape(seq_len, -1)


💡 einsum — мощный инструмент для выражения сложных операций с многомерными массивами. Особенно полезен, когда нужно точно контролировать свёртки и трансформации осей. В задачах NLP и computer vision это буквально незаменимая вещь.

📌 Почему стоит обратить внимание:
— Полная векторизация — минимум циклов, максимум скорости;
— Код ближе к математике, а значит — легче проверять;
— Можно выразить довольно сложные операции с тензорами в одной строке.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста

#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥52👍1
This media is not supported in your browser
VIEW IN TELEGRAM
🎰 Contextual Multi-Armed Bandits — это «чит-код» для рекомендаций в реальном времени

В отличие от классического ML, этот алгоритм учится на лету, балансируя между проверкой новых идей и показом проверенного контента.

В первой части статьи — прототип на Python: симулируем поведение юзеров и настраиваем логику обучения, чтобы победить проблему «холодного старта».

🔗 Читать статью

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста

#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
👍32
ML_cheatsheets.pdf
7.6 MB
🗂 Большая подборка шпаргалок по ML и DS

Делимся базой шпаргалок, которые закрывают 90% вопросов в жизни дата-сайентиста.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста

#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
6🥰2
Media is too big
VIEW IN TELEGRAM
🐼 Pandas Cookbook: учимся анализу данных

Специально для тех, кто хочет перейти от теории к практике, существует Pandas Cookbook — интерактивное руководство с примерами на реальных данных.

🔗 Начать обучение

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста

#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3👏1
matplotlib-cheat-sheet.pdf
2.4 MB
📊 Matplotlib под рукой: всё главное для графиков и анализа

Сохраняйте, пригодится не раз.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста

#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
5
📄 Docling — мощный инструмент для разбора документов под задачи Data Science

Если вы работаете с RAG, LLM, извлечением данных или документными пайплайнами, Docling — это как «универсальный загрузчик» для неструктурированных данных.

Он не просто конвертирует файлы — он понимает структуру документов.

Работает «plug-and-play» с:

— LangChain
— LlamaIndex
— Haystack
— CrewAI


Плюс есть MCP-сервер, чтобы подключать Docling к агентам. Есть CLI, быстрый старт и примеры под реальные кейсы.

🔗 Ссылка на проект

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
Please open Telegram to view this post
VIEW IN TELEGRAM
🎉2👏1
🧠 MIT: чем больше датасет, тем сложнее понять, что именно повлияло на ответ модели

Свежая работа MIT по machine unlearning обнаружила интересный эффект: с ростом обучающего датасета связь между отдельными примерами и поведением модели становится менее очевидной.

На практике это означает:

— удалить конкретный пример из обучения ≠ гарантированно убрать его влияние на модель;
— становится сложнее определить, какие данные повлияли на конкретный ответ;
— «право на забвение» технически становится сложнее реализовать для больших моделей.


Для unlearning это неприятный вывод: масштабирование модели и датасета не делает задачу удаления данных автоматически проще.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
Please open Telegram to view this post
VIEW IN TELEGRAM
👍41
🤩 Бесплатный курс по Visual GenAI: от DDPM до 3D

В одном репозитории собрали полноценный graduate-level курс по современной генерации изображений, видео и 3D.

Внутри:

🤩 DDPM, Score Matching, SDE/ODE;
🤩 Flow Matching и DPM-Solver;
🤩 Consistency Models, MeanFlow и генерация за несколько шагов;
🤩 авторегрессионная генерация изображений и видео;
🤩 ускорение diffusion-моделей: caching, sparse attention, quantization;
🤩 мультимодальная генерация, ControlNet, IP-Adapter;
🤩 3D и multi-view diffusion.

К каждой теме — англоязычные слайды + записи лекций и семинаров на русском, а ещё 7 практических домашних заданий в Jupyter Notebook: от обучения Flow Matching до AR video diffusion.

🔗GitHub

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека дата-сайентиста
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥32