Data Science
42.5K subscribers
1.75K photos
4 videos
47 files
2.14K links
DS
По всем вопросам- @haarrp

@ai_machinelearning_big_data - machine learning

@pythonl - Python

@itchannels_telegram - 🔥 best it channels

@ArtificialIntelligencedl - AI

@pythonlbooks-📚

@programming_books_it -📚

Реестр РКН: https://clck.ru/3Fk3zS
Download Telegram
Applied Causal Inference Powered by Machine Learning and AI

📓 Read

@datascienceiot
SQL и Python есть: что часто отсекает на собеседовании

Классика вакансий на аналитика: SQL и Python на уровне «уверенно», статистика — «понимание методов A/B-тестирования и работы с большими выборками». Первые две галочки ставятся спокойно. Третья часто оказывается самым сложным местом на собеседовании.

Статистика и ML (машинное обучение) плохо ложатся на короткие курсы — они дают фрагменты, а не систему. Академическая программа работает иначе: серьезная математическая база плюс прикладные задачи по ML.

Именно так устроена совместная онлайн-магистратура karpovꓸcourses и НИУ ВШЭ «Аналитика больших данных». От ВШЭ — экспертиза и опыт одного из крупнейших вузов России, от karpovꓸcourses — практический опыт в сфере анализа данных.

21 июля в 18:00 мск проведут бесплатный День открытых дверей. На эфире разберут: из чего состоит программа, как устроена практика через тренажеры от karpovꓸcourses и как совмещать обучение с работой.

Ведут эфир Анатолий Карпов — основатель karpovꓸcourses, самый популярный эксперт в сфере аналитики данных (по данным NEWHR) — и Евгений Соколов, руководитель департамента больших данных и информационного поиска ФКН НИУ ВШЭ.

Присоединяйтесь по ссылке — после эфира всем участникам придет запись: https://clc.to/erid_2W5zFGRNGWm

Реклама. ООО «КАРПОВ КУРСЫ». ИНН 7811764627. erid: 2W5zFGRNGWm
Galois Theory of Algorithms
Noson S. Yanofsky∗


📓 Read

@datascienceiot
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку

В IT прокачивается тот, кто каждый день видит сильные идеи, новые инструменты, реальные задачи, вакансии и разборы.

Окружение решает больше, чем кажется.

Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.

AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: t.me/DevopsDocker
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_1001_notes
Java: t.me/java_library
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://xn--r1a.website/gamedev
Haskell: t.me/haskell_tg

Собеседования и карьера:

DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview

Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://xn--r1a.website/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://xn--r1a.website/addlist/mzMMG3RPZhY2M2Iy

Полезное сверху:

ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: @courses
ИТ-книги бесплатно: https://xn--r1a.website/addlist/BkskQciUW_FhNjEy

Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg

Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.

Пока кто-то листает шум, ты будешь видеть инструменты, задачи и идеи, которые помогают расти в профессии.
Understanding Machine Learning: From Theory to Algorithms — фундаментальная книга по математическим основам машинного обучения.

Внутри:

empirical risk minimization и переобучение
PAC learning и uniform convergence
VC dimension и No-Free-Lunch theorem
bias–complexity tradeoff
линейные модели, boosting и AdaBoost
выбор модели и валидация
выпуклая оптимизация, регуляризация и устойчивость

Книга вышла в Cambridge University Press и подойдёт тем, кто хочет разобраться в ML глубже уровня библиотек и готовых API.

Авторы разрешают скачать копию для личного использования, но просят не распространять прямую ссылку на PDF. На официальной странице кнопка Download находится в боковом меню:

http://cs.huji.ac.il/~shais/UnderstandingMachineLearning
Updated 2204-page PDF Mathematics ebook:

"Algebra, Topology, Differential Calculus, and Optimization Theory For Computer Science and Machine Learning"

Find it here: https://cis.upenn.edu/~jean/gbooks/geomath.html
Andrej Karpathy just dropped 12-page PDF on "Graph Engineering" for multi-agentic systems

the shift: Karpathy's loop runs 700 experiments and forgets all of them. A graph remembers forever

here's the full system:

step 1 → build one loop: generate, critique, revise. 630 lines, 700 experiments in 48 hours

step 2 → go parallel: agents in separate worktrees, same repo, different branches, no conflicts

step 3 → add a knowledge graph: extract entities, resolve aliases, assemble typed edges, query through subgraphs

step 4 → ground your evaluator: it checks claims against graph edges, not vibes

step 5 → plug the graph as shared memory. workers write to it. evaluators fact-check against it. Loops persist overnight

step 6 → the agent forgets. the graph does not. stop rebuilding context from scratch every session

Karpathy ran 1 agent in 1 direction. Anthropic's graph runs 1,000 with shared memory - same model, it's the architecture

https://drive.google.com/file/d/1-GOg0kxcp8tx1BMUECMj2yJq6JYGmfhb/view
Сложный индустриальный ML, работа с генеративными подсказками, уровни дообучения и агентский Cotype — на E-CODE 2026 трек ML&DS снова впечатляет.

Программа ещё пополняется. Но уже сейчас понятно, что успевшая заслужить высокоранговую славу конференция Ozon Tech снова станет одним из ключевых событий в индустрии.

Осталось только пройти модерацию, чтобы убедиться лично: https://ecode.ozon.tech/. Ну, и дать огня на вечеринках, конечно!
"Patterns, Predictions, and Actions: A Story About Machine Learning"

📓 Read

@datascienceiot
Как выглядят задачи машинного обучения в бигтехе?

Открыта регистрация на E-CUP 2026 Students — ежегодное соревнование от Ozon Tech. В этом сезоне — для студентов, которые интересуются ML, Data Science, Big Data и аналитикой данных.

Вас ждут три трека: поиск дубликатов товаров, ИИ-модерация карточек маркетплейса и прогнозирование поведения пользователей. Все задачи основаны на реальных обезличенных данных Ozon.

Участвовать можно по одиночке или в команде до пяти человек. Соревнование проходит онлайн с финалом на масштабной конференции E-CODE.

Что ждёт участников:
- призовой фонд 7 200 000 ₽;
- обратная связь от инженеров Ozon Tech;
- нетворк с экспертами индустрии;
- лимитированный мерч;
- билеты на конференцию E-CODE, где наградят победителей.

Подробнее — на сайте E-CUP 2026 Students.
➡️ Регистрация уже открыта!

Присоединяйтесь, чтобы выйти за рамки учебных проектов, попробовать свои силы в задачах настоящего бигтеха и сравнить своё решение с лучшими участниками.
Google gave AI consciousness and it aligned with human beliefs across every domain they tested. They took consciousness away and the model rejected them.

📓 Read

@datascienceiot
Займи слот ИТ-Пикником от Т-Банка

8 августа — время отложить ноутбуки и встретиться офлайн на ИТ-Пикнике от Т-Банка в музее-заповеднике «Коломенское». Вот сколько всего запланировано:

— научпоп-лекции;
— мастер-классы;
— дискуссии об ИИ и больших языковых моделях;
— доклады о кибербезопасности;
— примеры, как данные из логов становятся решениями;
— много музыки — Сream Soda, IOWA, LAB Антона Беляева и другие артисты.

Бери с собой друзей, супругов и детей — каждый найдет себе что-то по душе.

Зарегистрироваться и узнать больше можно здесь
Today's AI systems learn mostly by passively absorbing data, but the brain builds intelligence in the reverse order.

Grounded world models in biological organisms and future embodied AI


📓 Read

@datascienceiot
Kimi Delta Attention.

— a minimal implementation of the Kimi K3 architecture.
http://k-a.in/KDA.html
From Worm to Human:
Scaling Brain Emulation



📓 Read

@datascienceiot
Часто заказчики отказываются от внедрения ИИ-ассистентов из-за «грязных» входных данных: PDF с таблицами или сканы плохо индексируются, нейросеть галлюцинирует 🤯

А что, если был бы ИТ-продукт, который не просто распознает символы, а сохраняет логику документа, превращая его в готовый формат для RAG (Markdown/JSON)
Это позволило бы клиентам в разы быстрее выводить ИИ-продукты в эксплуатацию и закрыть вопрос импортозамещения.

Такой продукт уже есть!

⚡️«Сервис интеллектуального парсинга документов» от Диасофт позволяет автоматизировать сквозную обработку неструктурированных данных из файлов различных форматов для последующей аналитики и использования в ИИ-сценариях. Встроенный единый HTTP API принимает файлы различных форматов (PDF, DOCX, PPTX, XLSX, HTML, изображения, аудиоформаты) и преобразовывает их в структурированные данные (JSON, Markdown, HTML) без потери семантики.

Подробнее — по ссылке!
#реклама
О рекламодателе
Title: "A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing"

arxiv. org/abs/2608.13573
Бесплатная книга по performance engineering

В Algorithmica хорошо разобрали, почему классическая оценка сложности всё хуже отражает реальную производительность на современном железе.

Раньше модель была довольно логичной: процессор выполняет инструкции почти последовательно, у каждой есть своя стоимость, а значит можно примерно оценить время работы алгоритма количеством операций.

Потом всё упростили до асимптотики. Например, вместо точного количества операций в умножении матриц мы просто говорим O(n³) и игнорируем константы. Для сравнения алгоритмов на больших данных это удобно.

Но современные CPU устроены намного сложнее: кэши, конвейеры, параллельное выполнение инструкций, SIMD, prefetching, память с разной задержкой.

Поэтому два алгоритма с одинаковым O(n) могут отличаться по скорости в разы.

А иногда алгоритм с формально «хуже» сложностью на реальных размерах данных оказывается быстрее.

Хорошая серия для тех, кто хочет перейти от «у этого O(n), значит быстро» к пониманию того, как код реально выполняется процессором.

en.algorithmica.org/hpc/complexity/

@machinelearning_books
Deep systemic analysis of AI constraints from context to internal weight editing.

📂 PDF

#AIRedTeaming #AISafety #LLMs #AIJailbreak #Pliny