Data Science | Machinelearning [ru]
19.8K subscribers
874 photos
56 videos
28 files
3.8K links
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.

MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin

РКН: https://vk.cc/cJPGXD
Download Telegram
Робот-секретарь для банка? Никто не просил — а он уже запилен

Этот чел тащится решать нерешаемые проблемы, обожает упрощать людям жизнь и вечно тестит гипотезы. Его конек — собирать продукты, от которых глаз горит. Именно с таким багажом его позвали в Уралсиб. Ну а там он взял и забахал робота-секретаря: тот разруливает встречи и созвоны.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Документы нужно передать наружу, но перед этим — убрать персональные данные: фамилии, телефоны, адреса, подписи. Всё происходит в закрытом контуре, без интернета, на одной машине с одной видеокартой.

С фамилиями автор разобрался за неделю. На подписи ушло полтора месяца — и примерно половина этого времени ушла на то, чтобы похоронить очевидные решения.

Читать далее: https://habr.com/ru/articles/1079484/

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣 Наконец-то батя покажет, как он в детстве ходил в школу за 100 верст

💥 xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁11
🤩 Нашли репу с десятками практических проектов для прокачки навыков и резюме

Внутри 54 проекта разной сложности по Terraform, Kubernetes, Docker, CI/CD, DevSecOps, AWS, Azure, безопасности и мониторингу.

Есть полноценные лабораторные с кодом и конфигами и также пошаговые гайды — так что можно разобраться, повторить всё своими руками и положить результат в портфолио.

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
6
Забудь про Whisper: русская диктовка работает мгновенно и без видеокарты

Автор краем уха услышал, что у Сбера есть открытая модель, которая на бенчмарках по русскому уделывает Whisper. Пошёл проверять — и оказалось, что она не просто не сливает, а шпарит моментально на обычном камне, без GPU, текст вылезает раньше, чем успеваешь отпустить клавишу. Потом сколотил диктовку для себя, скинул корешам, те подсели, посыпались хотелки — и за пару недель из этого вырос полноценный продукт.

Жмёшь правый ⌘ command, говоришь, отпускаешь — и текст с запятыми и заглавными уже воткнут туда, где стоял курсор. Цифры: фраза на 6 сек вставляется за 0.08 сек, запись на 30 сек распознаётся меньше чем за полсекунды, модель подгружается 0,22 сек. Всё локально, звук никуда с компа не уходит, модель весит 204 МБ, приложение 32 МБ, крутится на процессоре, видюху не трогаем, код открыт, лицензия MIT. С именем выпендриваться не стал — раз пишет под диктовку, пусть будет Писарь.

Почему Писарь, а не Whisper: Whisper — модель прекрасная, но она универсал на сотню языков, и русский там далеко не в приоритете, плюс тяжёлая, на процессоре еле ползёт, поэтому обёртки тащат её на видюху, мак греется, комп тормозит, а текст всё равно приходит с задержкой, да и с русским у Whisper беда — падежи, окончания, пунктуация. GigaAM, на которой собран Писарь, Сбер обучал именно под русский, и на нём она заметно точнее, плюс сама расставляет пунктуацию и заглавные, а английские вкрапления в русской речи (термины, названия) переваривает как надо.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
😁53👍3
Мы научили песок думать

Сегодня один из главных вопросов звучит так: а ИИ, часом, не разогнался дальше, чем нужно?

Марк Андриссен, венчурный инвестор, недавно сжал весь этот движ в одну фразу: «Мы научили песок думать».

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4😁1
Утечка на 3.5 часа вперёд: как модель полтора месяца надувала сама себя — и как её застукали

Классика ML на временных рядах: на истории всё шикарно, а в бою — слив. Вот и тут модель заглядывала в будущее на 3.5 часа, а виноват кривой ресемплинг 4-часовых свечей.

Дальше — анатомия этой утечки, математика позиционного теста, которым такое ловится, и сниппет, чтобы больше в это не влетать.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥1
Как 17B активных разносят 70B плотных: анатомия Mixture-of-Experts (MoE)

Прохлопал тот момент, когда разработчики нейронок мерились, у кого циферка рядом с названием модели толще? А когда протёр глаза — нихрена себе, уже модно выпендриваться скромным числом активных параметров. Тогда эта статья ровно для тебя.

Сегодня разжуют без соплей: с какого такого перепуга все опенсорсные флагманы разом уехали в MoE, почему Qwen3.5 на 397 миллиардов параметров строчит токены так, будто у неё всего 17, и почему на видеокартах при этом никто не разорился. А тем, кто зашёл «только спросить», сольют тайну: и в каком кабинете, собственно, обитает тот самый медицинский эксперт.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4
Захотел проверить, правда ли AI-инженеров сейчас рвут с руками. Спойлер: 84% вакансий про ИИ — тишина

Сел я на досуге подумать: а сколько вообще на рынке нужно народу, который шарят в AI? Ощущение у всех одинаковое — ИИ повсюду, без него никуда, каждый второй пост в ленте про агентов. А что по факту с рынком труда?

Спарсил, значит, hh.ru (без помощи LLM, ясное дело, не обошлось), взял все активные вакансии в 25 категориях раздела «Информационные технологии» по России — набралось 34 053 штуки. Потом прикинул, в скольких из них вообще есть упоминания языковых моделей и всего смежного: LLM, GPT, RAG, агенты, промпты, Cursor, LangChain, GigaChat и ещё пара десятков терминов. И отдельно — сколько прошёл по полному тексту описания: 853 вакансии.

Правду ищи — habr.com

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4
Когда ИИ-подписки отправят в отмену? Разбираем, что реально дают за $20

Поначалу автор думал, что просто тупит и не может нарыть нужное в настройках: а сколько токенов вообще насыпают по подписке? ChatGPT Plus, Claude Pro и Google AI Pro держатся где-то у $20, и жирные тарифы тоже подозрительно дружно упираются в те же $100 и $200. Вроде всё сходится: осталось выяснить, где токенов отсыпают больше, и брать там.

Ага, щас.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
😁1
Manticore Search 29.9.0: chunked auto-embeddings и mmap-доступ к columnar-атрибутам

В Manticore Search 29.9.0 появились chunked и multi-vector auto-embeddings, ограничение входа для embedding-моделей, UTF-8 идентификаторы, а также mmap-доступ к columnar-атрибутам по умолчанию.

Кроме того, релиз включает исправления для hybrid search, KNN, bulk ingestion и группировки.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Agent-Ops 0.4.0: ИИ подкидывает идеи, человек ставит подпись, железо делает

Сергей Житинский, который основал Git in Sky (там занимаются эксплуатацией и техподдержкой ИТ-инфраструктуры), выкатил рассказ про Agent-Ops — открытую отраслевую методологию, где инженеры и ИИ-агенты работают в одной упряжке. Стартовали весной этого года, а сейчас на GitHub и GitVerse лежит первый кандидат версии 0.4.0.

На IT Elements 2026 договорились тянуть это вместе с инженерами из двух других контор — они теперь maintainers. Так что Agent-Ops уже не личная песочница одной компании, а общее дело нескольких. Автор зовет контрибуторов подключаться.

Как говорит Житинский, сама организация работы меняется: кто копает проблему, на каком основании предлагает решение, кто дает добро на изменение и кто потом отвечает, если что-то упало. Редакция 0.4.0 сейчас в статусе публичного нормативного кандидата — то есть набор правил, который вынесли на обсуждение и дальнейшее развитие.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
AI переворачивает разработку с ног на голову

Код теперь дешевеет на глазах — спасибо AI. А вот нормально продуманное инженерное решение, наоборот, растёт в цене. Так что фишка уже не в том, чтобы шлёпать код пачками, а в том, чтобы собрать систему так, где и человек, и агент видят одну картину: что именно правим, ради чего, где заканчиваются границы и что должно получиться в итоге.

Viaduct превращает проектирование архитектуры в структурированный и проверяемый контекст, который спокойно переваривают AI-агенты — от модели системы до Change Set, по которому изменение можно спокойно катить.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Copilot слазал в интернет за ответом. В Word ты этого не увидишь, а админ в Purview — увидит

Веб-поиск в Microsoft Copilot и Copilot Chat работает у юзеров по умолчанию. Пока админ не прибил его одной из двух политик — всё, никакого отдельного тумблера «ассистенту разрешён интернет» для этого не прикрутили. Запрос ассистент сочиняет сам, и судьба у него разная в трёх местах: в Copilot Chat цитаты висят 24 часа, в панели ассистента внутри приложений Microsoft 365 — Word, PowerPoint, без разницы — их нет вообще, а вот админ таки лицезреет те же поисковые термины рядом с промптом и ответом через activity explorer в Purview DSPM for AI.

Вся эта разборка — на двух страницах learn.microsoft.com. Цитаты со страницы про веб-поиск сверяли 6 сентября 2026 года, вторую страницу перепроверили в тот же день. Внутри — две схемы и таблица «промпт — сгенерированный запрос», которую можешь прогнать у себя.

Кто и сколько времени видит этот запрос

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
1
MEO: очередная маркетинговая абракадабра или всё-таки реальная техническая боль с ранжированием?

Автор не тянет резину и рубит сразу: MEO (Multiple Engine Optimization) — не отраслевой стандарт. Не спека. Не метрика. И даже не «техника», которую ты возьмёшь и внедришь по методичке. Это рабочая модель — способ описать одну конкретную техническую проблему. Суть простая: у нынешнего бренда — да и продукта, да и отдельной страницы — нет единого алгоритма-судьи, который единолично решает, увидит тебя юзер или нет. Таких алгоритмов автор с лёту накидывает минимум 8. И это не вариации одного и того же: принципиально разные классы, у каждого своя кухня — как сущности извлекаются, как ранжируются, как показываются.

Классический поисковик — это инвертированный индекс плюс модель ранжирования поверх сигналов. В ход идут ссылочная масса сайта, поведенческие факторы, релевантность запросу. Механика прозрачная и вдоль и поперёк задокументированная. Генеративные ответные системы играют по другим правилам. Часть моделей отвечает на вопросы юзера, вытаскивая сведения из параметрических знаний — того, что вбили в веса на этапе претрейна. Другая часть работает через RAG: сначала выдёргивает релевантные документы векторным или гибридным поиском, а потом лепит «наиболее вероятный» ответ поверх найденного контекста. Итого два принципиально разных механизма, от которых зависит, получит бренд значимость в ответе или нет. И рычаги, чтобы повлиять на результат, для каждого свои.

Подробнее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Reasoning Lock: ИИ-агент в проде тратит токены и молчит — живой разбор бага

В прошлой статье автор рассказывал о скрытом баге: ИИ-агент в проде заказчика тратит токены, генерация закрывается со статусом «успех», а клиенту уезжает пустая строка. Обещание разобраться и починить выполнено: причина найдена, правки встали в воркфлоу, счётчик пустых ответов уже 7 дней — чисто. Баг получил имя Reasoning Lock. Агент работает на self-hosted n8n: по ночам принимает заявки в Instagram Direct, ведёт диалог, собирает анкету и создаёт/обновляет сделку в amoCRM. Стек: n8n + Redis + LangChain, основная LLM — DeepSeek V4 Pro через OpenRouter, резервная — недавно поменяна на Qwen3.8 Flash.

История началась задолго до самого бага: с конца июня отказы шли двумя периодами, и разница между ними — ключ к пониманию. Первый период — тесты и запуск, природа инфраструктурная: ограничения Meta — потери вебхуков, окно ответов, двойные доставки; чинилось мгновенным 200 OK, буфером на Redis и дебаунсом. К продакшену этот класс закрыли.

Второй период — последние два месяца: промпт. Правки от заказчика посыпались в системный промпт под живую бизнес-логику: инструкция по пересылке оплаты пользователем, отдельные сценарии ответов для VIP-клиентов, уточнения формулировок после каждого спорного диалога. Каждая правка по отдельности правильная и рабочая, но суммарно промпт разросся примерно до 6.4k токенов, а плотность запретов («КАТЕГОРИЧЕСКИ ЗАПРЕЩЕНО», «Отправь СТРОГО этот текст») стала максимальной за всю жизнь системы.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
👎1
[Перевод] Счастлив тот, кто смог познать причины вещей

На стыке LLM и математики в последнее время кипит движуха — местами любопытная, местами откровенно скандальная. И вот тебе вопрос на подумать: что математикам делать с этой LLM-лавиной? Она их похоронит — или перекроит так, что и вообразить не выйдет?

Оригинал — пост математика Нестора Гильена от 13 сентября 2026 года, вышел в блоге Теренса Тао, на русский его перетащил. Математика и код первыми схлопотали напор LLM. Но этот опыт пригодится и другим отраслям, если завтра LLM и корпорации, что их пилят, устроят «ИИ-революцию» и у них.

На ту же тему на Хабре лежит перевод тезисов доклада самого Тао — «Математика в эпоху ИИ: публичная лекция Теренса Тао на Международном конгрессе математиков», 24 июля 2026. Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
Как сегодня строят рекомендательные системы — и что будет с ними завтра?

30 сентября собираем RecSys-сообщество — разработчиков, ML/DS-специалистов и всех, кто делает персонализацию и рекомендации в реальных продуктах.

В программе — доклады от экспертов Сбера. Поговорим о свежих подходах и нестандартных решениях на реальных кейсах.

А после докладов переключаемся на неформальный режим: знакомимся, спорим про RecSys, обсуждаем идеи, находим единомышленников и просто хорошо проводим вечер среди своих.

📍г. Нижний Новгород, пространство «Гараж»

Количество мест ограничено — успей забрать своё по ссылке!
1
Перепеть трек и пересобрать кодовую базу: почему это не криминал и что делать авторам в эпоху ИИ

В магазине крутили «ту самую» песню — ага, щас. Не она это была: та же композиция, отыгранная с нуля и на два с половиной тона ниже. Авторское право защищает то, как идея выражена, а не саму идею, — но пересборка не обнуляет права на оригинал. Разжёвываю, что это значит для авторов в эпоху ИИ.

Читать далее

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM
ТЗ должно собираться из требований, а не вылизываться как готовый структурированный документ — вот под это нужна система

В крупной финансовой конторе, где автор сидел системным аналитиком, техзадания не клепают ни в Confluence, ни в Word.

Детали — в статье на Habr: читать

👉 Telegram | Max
Please open Telegram to view this post
VIEW IN TELEGRAM