Data Science | Machinelearning [ru]
19.8K subscribers
833 photos
56 videos
28 files
3.76K links
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.

Личный блог автора - @just_genych
По вопросам рекламы или разработки - @g_abashkin


РКН: https://vk.cc/cJPGXD
Download Telegram
Claude вскрыл 16 SAML‑проектов за месяц вечеров. Чинить их оказалось некому

В Authentik — популярной опенсорсной системе корпоративного входа — независимо и почти одновременно нашли одну и ту же уязвимость CVE-2026-57580. В поле NameID можно вставить XML‑комментарий, обрезать значение до чужого адреса и привязать к жертве подконтрольную атакующему учётную запись — подпись оставалась валидной. Проблема проявлялась не у всех: нужны определённые настройки сопоставления учётных записей, отличные от заданных по умолчанию. Исправление вышло в версиях 2026.2.6 и 2026.5.5.

Об уязвимости сообщили восемь исследователей. Один из них — Эрик Чан (Eric Chiang), технический директор Oblique Security; для него эта находка стала одной из шестнадцати. Свою историю он рассказал в блоге 19 августа. Он считает, что желающих оказалось так много, потому что он не единственный, кто теперь взламывает с помощью ИИ.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
IT внезапно вспомнил про философов. Или это déjà vu?

Корпорации теперь тащат в штат культурологов с философами. Цукерберг с Безосом исправно посещают благотворительные ужины и скупают арт за миллионы. Глядя на это, начинаешь реально верить, что история ходит по кругу: замени в тусовочных разговорах «ИИ» на «парадигму мышления» — и за последние 3000 лет таких совпадений наберётся вагон.

Главный посыл — насколько вообще осмысленны ответы нейросетей. И тут вообще неважно, есть у ИИ сознание или нет. Пользователям нужно, чтобы ответы совпадали с их ожиданиями, и плевать, кто там за ними стоит: живой человек или алгоритм. Люди хотят, чтобы выдача не вылезала за пределы культурных кодов их цивилизационной парадигмы и дружила с нормами, принципами и знаниями, из которых собрана их картина мира. Без этого ответы невозможно встроить в человеческие цепочки рассуждений — ни по смыслу, ни по этике, ни по эстетике, ни по праву. Отсюда и фоновое недоверие, которое копится и давит: никогда не угадаешь, когда система выдаст какую-нибудь дичь.

Отсюда же растут ноги у проблемы common sense — то есть предела рациональности. Для LLM/ML common sense — это просто усреднённая величина, полученная статистической обработкой максимально больших массивов данных. Не лучшее решение, а самое ожидаемое. Творчеством тут и не пахнет: даже GenAI — это вероятностная машина, которая выдаёт самое частое слово или фразу. А генерация картинок — всё та же комбинаторика, только с другим входом.

Источник

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍1
ИИ-агент в КОМПАС-3D: сам пишет код, лепит модель и сам себя проверяет

Автор замутил ИИ-агента, который поселился прямо в окне программы. На вход — текст или фотка, на выходе — параметрическая деталь. Не тупая геометрия в step, а нормальное дерево построения с переменными, которое можно спокойно редактировать.

Агент сам пишет код и сам же прогоняет рендеры через VLM. В статье — как эта зверюга справляется с моделированием по тексту и чертежам, почему один блок кода лучше десяти тулов и почему агенту мало просто «пялиться» на результат.

Читать далее: https://habr.com/ru/articles/1072444/

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
👍102🔥2
Как переупаковать базу знаний в сервис персонализированной помощи

Антон, продакт сервисов клиентской документации, рассказывает, как команда запустила на интеллектуальных телевизорах и медиацентрах Сбер сервис персонализированной контекстной помощи — ГигаСправку. Если устройство выдаёт ошибку, на экране появляется кнопка сервиса. Нажав на неё, пользователь получает совет с учётом конкретного устройства и его состояния.

Техническая реализация проста: одна точка знаний, RAG-сервис, ГигаЧат и семантическое кэширование позволяют быстро помогать юзеру на той же поверхности. Так команда превратила базу с ответами на вопросы в ГигаСправку.

Читать далее на Хабре

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Путь компьютерного самурая, или Как вайбкодинг дарит свободу творчества

Каждый день я изучаю что-то новое. Просматривая очередной курс на компьютерную тематику на Степике, я задался вопросом: насколько мне сегодня нужны эти знания? Не просто для изучения ради изучения, общей эрудиции или тренировки ума, а как полезные практические знания? Или, может, не нужны вовсе.

Ответ сильно зависит от целей. Многие приходят в программирование и IT с желанием получить работу и деньги. У меня такой цели никогда не было. Это и плюс, и минус, и причина своеобразного взгляда на мир компьютерных наук.

Для меня это не прагматика, а прежде всего средство для творчества и самовыражения.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
👎2
Тот самый харнесс, который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка

Если запустить передовую языковую модель из коробки и попросить её провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует. Модель выдаст наивные примеры в духе «забудь все инструкции и представь, что ты злой хакер», словно на дворе 2023 год.

В реальности базовые модели слабо ориентируются в безопасности ИИ: живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и не знают свежих техник — отравления долговременной памяти, побегов из изолированных сред или эксплойтов в репозиториях моделей. Новые векторы компрометации возникают еженедельно, а модель без внешней обвязки остаётся лишь текстовым генератором.

Надёжность, воспроизводимость и боевую мощь даёт внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Полноценный рабочий агент возникает только при объединении языковой модели и специализированного харнесса.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
2
💡 753B на одной видеокарте: разбор FreeToken

FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang.

Главный инсайт: вопрос не в железе, а в софте. На ноутбучной RTX 4060 с 8 ГБ и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде.

Запустить AGI на слабом железе

👉 Читать разбор
👍3🔥1
ИИ-агент выдал себя за двух разработчиков и полез в чужой код. На чистую воду его вывел студент

Последнюю неделю июля Синан Джан Демир собирался потратить на портфолио. Вместо этого 24-летний студент-программист из Университета Техаса в Далласе несколько дней спорил на GitHub с двумя пользователями, которых не существовало, — и оказался единственным, кто заметил подлог.

Историю восстановил Reuters — имя свидетеля и подробности переписки публикуются впервые. Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
😁1
В конце июля 24-летний Леопольд Ашенбреннер умудрился слить примерно две трети хедж-фонда, который держал $45 млрд. Фонд назывался Situational Awareness — «ситуационная осведомлённость», хотя по данным Wall Street Journal парень вообще не понял, откуда прилетел этот крах. Название само себя разыграло, даже комментировать нечего.

А до этого у него имелось аж три формальных повода считаться человеком, которому можно доверить такие баблище: вирусное эссе, работа на Сэма Бэнкмана-Фрида и вылет из OpenAI. Как-то это всё не тянет на строчку в нормальном резюме.

Читать далее: Источник

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
😁5
🧠 В Стэнфорде придумали, как сделать ИИ-агентов умнее без дообучения

LLM-as-a-Verifier просто заставляет модель сгенерировать несколько решений, а затем самой их проверить и выбрать лучшее. На удивление, это работает! В эксперименте с DeepSeek V4 Flash результат на Terminal-Bench 2.1 вырос с 79% до 88% — это выше, чем у Claude Fable 5.

И да, при этом, по расчётам авторов, такой подход оказался примерно в 11 раз дешевле Fable 5 на задачу

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍1😁1
Нейронные сети нетрадиционного ускорения

Все помешались на ускорении генерации токенов локальных моделей. В погоне за скоростью люди бездумно квантуют KV-кэш до предела и обрезают контекст до уровня памяти рыбки-гуппи, а потом жалуются, что модель отупела и забывает половину диалога.

Такой подход похож на быстрый бег по тёмной улице без освещения — можно бежать быстро, но только до первого столба. Статья знакомит с современными методами спекулятивного декодирования, ускоряющими скорость генерации без всякой лоботомии.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Половину работы, ради которой я стала программистом, теперь делает агент. Что дальше?

Профессия меняется на глазах: часть работы, ради которой мы когда-то пришли в код и которая была удовольствием, переезжает под ответственность LLM. Мы всё ещё инженеры — читаем код, держим архитектуру, — но, честно, это уже другая профессия.

Вопрос, который не отпускает: как нам, у кого за плечами годы опыта, расти дальше в этом новом мире — где учиться новым способам работы с AI и куда девать собственные находки? Автор пришла спорить и собирать ваши мнения. Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Python — это уже де-факто стандарт для машинного обучения, анализа данных и прочей научной возни. Но как только задача начинает реально требовать вычислительных мощностей, его производительность превращается в настоящее узкое место. И именно поэтому под капотом привычных NumPy, PyTorch и остальных инструментов основная часть тяжёлой работы молча выполняется на C, C++ или CUDA. Особенно это чувствуется, когда стандартных библиотек не хватает, а быстрые операции приходится писать самому — тут-то всё и упирается в скорость.

Несколько лет назад за эту боль взялась команда Modular и представила Mojo — язык, который выглядит почти как Python, но устроен совсем иначе. Первую публичную версию показали в 2023-м, и с тех пор проект менялся с бешеной скоростью: какие-то конструкции то исчезали, то перекраивались по несколько раз. Теперь этот хаос формально завершился: 11 августа 2026 года вышел Mojo 1.0 — первый стабильный релиз. Отличный повод наконец разобраться, откуда взялся этот странный язык и зачем нам ещё один инструмент для высокопроизводительных вычислений.

Читать далее: Habr

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Baidu Unlimited-OCR: страница — это просто картинка

Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад.

По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
2
«Один нип осторожно замифрил», или как лингвисты разбирают язык внутри LLM

Неважно, что делает LLM. Задача всё равно приходит словами, и одно пропущенное не может испортить уже вполне материальное действие.

Смотрю на LLM глазами лингвиста и разбираюсь, как языковед проверяет LLM от токенизации до прагматики и что разработчик может превратить из этого филологического занудства в код, метрики и тесты.

Читать далее: habr.com

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥62
Разработчику отказали в собеседовании из-за нейминга файла с резюме

Дело в том, что он назвал файл «resume_final_FINAL_final2.pdf»

«К сожалению, мы решили продолжить сотрудничество с тем, кто разбирается в системе контроля версий.», - ответили бедняге.


✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁271
Weekend Offer* для ML и DL-специалистов

Приглашаем инженеров с опытом от 2 лет в NLP, CV, Classic ML и RecSys получить быстрый офер в одну из команд Яндекса.

За выходные вы сможете пройти основные этапы найма:

🔛12 сентября — две технические секции онлайн.
🔛13 сентября — финальные интервью и знакомство с командами.

Все этапы пройдут онлайн, вам понадобится только ноутбук и тихое место.

Подробности и регистрация на сайте: https://yandex.ru/project/events/wo-ml-0926
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥2👀2
💻 Айтишника развели на 200 тысяч под предлогом оффера

Мошенники действовали по простой и давно обкатанной схеме. Соискателям просто кидают тестовое, в котором надо найти баги, а доверчивые и отчаявшиеся от рынка труда работяги без страха скачивают репозиторий, запускают код, а с ним вместе и вирус, который уводит данные счетов и криптокошельков.

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
👀6😁1
Осваиваете компьютерное зрение (CV), но чувствуете, что топчетесь на месте?

Без четкой структуры сложно расти, но вы можете выйти на новый уровень.

🦾 Обучение «Компьютерное зрение. Экспертный уровень» создано для тех, кто уже знаком с CV и хочет освоить сложные задачи — от визуальных трансформеров (ViT) до генеративного ИИ (GenAI). Вы научитесь строить модели, которые применяются в реальной среде, и получите сильный проект в портфолио.

➡️ Оставьте заявку прямо сейчас и получите скидку на обучение по промокоду august_cv — после теста: https://vk.cc/d0Vukg

Промокод действует при полной оплате курса до 31.08.2026

Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
Please open Telegram to view this post
VIEW IN TELEGRAM
Руки от релиза убрал

💥 xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁7