Data Science
42.5K subscribers
1.75K photos
5 videos
47 files
2.15K links
DS
По всем вопросам- @haarrp

@ai_machinelearning_big_data - machine learning

@pythonl - Python

@itchannels_telegram - 🔥 best it channels

@ArtificialIntelligencedl - AI

@pythonlbooks-📚

@programming_books_it -📚

Реестр РКН: https://clck.ru/3Fk3zS
Download Telegram
Сложный индустриальный ML, работа с генеративными подсказками, уровни дообучения и агентский Cotype — на E-CODE 2026 трек ML&DS снова впечатляет.

Программа ещё пополняется. Но уже сейчас понятно, что успевшая заслужить высокоранговую славу конференция Ozon Tech снова станет одним из ключевых событий в индустрии.

Осталось только пройти модерацию, чтобы убедиться лично: https://ecode.ozon.tech/. Ну, и дать огня на вечеринках, конечно!
"Patterns, Predictions, and Actions: A Story About Machine Learning"

📓 Read

@datascienceiot
Как выглядят задачи машинного обучения в бигтехе?

Открыта регистрация на E-CUP 2026 Students — ежегодное соревнование от Ozon Tech. В этом сезоне — для студентов, которые интересуются ML, Data Science, Big Data и аналитикой данных.

Вас ждут три трека: поиск дубликатов товаров, ИИ-модерация карточек маркетплейса и прогнозирование поведения пользователей. Все задачи основаны на реальных обезличенных данных Ozon.

Участвовать можно по одиночке или в команде до пяти человек. Соревнование проходит онлайн с финалом на масштабной конференции E-CODE.

Что ждёт участников:
- призовой фонд 7 200 000 ₽;
- обратная связь от инженеров Ozon Tech;
- нетворк с экспертами индустрии;
- лимитированный мерч;
- билеты на конференцию E-CODE, где наградят победителей.

Подробнее — на сайте E-CUP 2026 Students.
➡️ Регистрация уже открыта!

Присоединяйтесь, чтобы выйти за рамки учебных проектов, попробовать свои силы в задачах настоящего бигтеха и сравнить своё решение с лучшими участниками.
Google gave AI consciousness and it aligned with human beliefs across every domain they tested. They took consciousness away and the model rejected them.

📓 Read

@datascienceiot
Today's AI systems learn mostly by passively absorbing data, but the brain builds intelligence in the reverse order.

Grounded world models in biological organisms and future embodied AI


📓 Read

@datascienceiot
Kimi Delta Attention.

— a minimal implementation of the Kimi K3 architecture.
http://k-a.in/KDA.html
From Worm to Human:
Scaling Brain Emulation



📓 Read

@datascienceiot
Часто заказчики отказываются от внедрения ИИ-ассистентов из-за «грязных» входных данных: PDF с таблицами или сканы плохо индексируются, нейросеть галлюцинирует 🤯

А что, если был бы ИТ-продукт, который не просто распознает символы, а сохраняет логику документа, превращая его в готовый формат для RAG (Markdown/JSON)
Это позволило бы клиентам в разы быстрее выводить ИИ-продукты в эксплуатацию и закрыть вопрос импортозамещения.

Такой продукт уже есть!

⚡️«Сервис интеллектуального парсинга документов» от Диасофт позволяет автоматизировать сквозную обработку неструктурированных данных из файлов различных форматов для последующей аналитики и использования в ИИ-сценариях. Встроенный единый HTTP API принимает файлы различных форматов (PDF, DOCX, PPTX, XLSX, HTML, изображения, аудиоформаты) и преобразовывает их в структурированные данные (JSON, Markdown, HTML) без потери семантики.

Подробнее — по ссылке!
#реклама
О рекламодателе
Title: "A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing"

arxiv. org/abs/2608.13573
Бесплатная книга по performance engineering

В Algorithmica хорошо разобрали, почему классическая оценка сложности всё хуже отражает реальную производительность на современном железе.

Раньше модель была довольно логичной: процессор выполняет инструкции почти последовательно, у каждой есть своя стоимость, а значит можно примерно оценить время работы алгоритма количеством операций.

Потом всё упростили до асимптотики. Например, вместо точного количества операций в умножении матриц мы просто говорим O(n³) и игнорируем константы. Для сравнения алгоритмов на больших данных это удобно.

Но современные CPU устроены намного сложнее: кэши, конвейеры, параллельное выполнение инструкций, SIMD, prefetching, память с разной задержкой.

Поэтому два алгоритма с одинаковым O(n) могут отличаться по скорости в разы.

А иногда алгоритм с формально «хуже» сложностью на реальных размерах данных оказывается быстрее.

Хорошая серия для тех, кто хочет перейти от «у этого O(n), значит быстро» к пониманию того, как код реально выполняется процессором.

en.algorithmica.org/hpc/complexity/

@machinelearning_books
Deep systemic analysis of AI constraints from context to internal weight editing.

📂 PDF

#AIRedTeaming #AISafety #LLMs #AIJailbreak #Pliny
Вырастили целое дерево из агентов 🌳

Мы в Авито разработали единую платформу для процессов. Самые лучшие и популярные становятся агентами. В итоге каждый сотрудник может создать свой процесс или воспользоваться готовым. Классно? Не то слово! Поэтому мы написали статью, как создавали это решение.

О чём узнаете, если прочитаете:
🔸как устроена архитектура платформы,
🔸как процесс становится агентом,
🔸как измерять качество агентов.

Читать статью 🚀
Please open Telegram to view this post
VIEW IN TELEGRAM
What Does Context Compression Cost an Agent? Interaction Costs Unrevealed by Task-Completion Metrics

5× context compression did surprisingly little to GPT-5.5’s final task result.

📓 Read

@datascienceiot
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку

Окружение решает больше, чем кажется.

Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.

AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: https://xn--r1a.website/+90Z5TAyfuNU5YmRi
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_1001_notes
Java: t.me/javatg
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://xn--r1a.website/gamedev
Haskell: t.me/haskell_tg

Собеседования и карьера:

DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview

Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://xn--r1a.website/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://xn--r1a.website/addlist/mzMMG3RPZhY2M2Iy

Полезное сверху:

ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: https://xn--r1a.website/+rKBQEMccAA01MTcy
ИТ-книги бесплатно: https://xn--r1a.website/addlist/BkskQciUW_FhNjEy

Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg

Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
10 бесплатных книг по программированию, которые можно читать прямо с GitHub

1. The Rust Programming Language
https://github.com/rust-lang/book

2. Rust by Example
https://github.com/rust-lang/rust-by-example

3. The Little Book of Rust Books
https://github.com/lborb/book

4. Python Data Science Handbook
https://github.com/jakevdp/PythonDataScienceHandbook

5. Dive Into Deep Learning
https://github.com/d2l-ai/d2l-en

6. Probabilistic Machine Learning
https://github.com/probml/pml-book

7. Algorithms for Decision Making
https://github.com/algorithmsbooks/algforopt-notebooks

8. Operating Systems: Three Easy Pieces
https://github.com/remzi-arpacidusseau/ostep-homework

9. Crafting Interpreters
https://github.com/munificent/craftinginterpreters

10. Free Programming Books — огромная библиотека бесплатных книг по Python, Java, C++, Go, AI, SQL, Linux и десяткам других тем
https://github.com/EbookFoundation/free-programming-books

Последний репозиторий особенно полезен: там собрана огромная регулярно обновляемая база легально доступных книг и учебных материалов по программированию.
Mathematical Theory of Deep Learning:

333-page PDF.

📓 Read

@datascienceiot
This media is not supported in your browser
VIEW IN TELEGRAM
Встраивайте систему распознавания документов в ваш продукт за 15 минут 🚀

Если вы развиваете SaaS, автоматизируете B2B-процессы или собираете ИИ-агентов, вопрос безопасности и скорости обработки документов всегда встает ребром.

Provision OCR — это мощный российский движок для on-premise и private cloud развертывания.

⚡️ 100% локальности: данные не покидают ваш сервер.
⚡️ Скорость: обработка <3 сек/страница на GPU 2070 и выше, Поддержка CPU , точность до 99%
⚡️ Быстрая и бесшовная интеграция через REST API + gRPC.
⚡️ Поддержка разных документов на русском языке: договоры, счета и другие.

💡 Дистрибутив в нашем Telegram-канале: @ProvisionLabs

💻 Примеры кода на GitHub:
https://github.com/orgs/Provision-Labs/repositories

#OCR #ProvisionOCR #Документы #Разработка #Python #AI #OnPremise
Towards an AI-Augmented Textbook:


📓 Read

@datascienceiot
📚 Бесплатная книга по выпуклой оптимизации - 130 страниц

"Convex Optimization: Algorithms and Complexity" - хорошее введение в алгоритмы выпуклой оптимизации и их вычислительную сложность.

Внутри:

* градиентные методы
* ускоренные методы
* субградиентная оптимизация
* проксимальные алгоритмы
* first-order methods
* оценки скорости сходимости
* сложность оптимизационных алгоритмов

Полезно для ML, математики и тех, кто хочет глубже понять, что стоит за обучением моделей.

PDF:
https://arxiv.org/abs/1405.4980