Data Science. SQL hub
35.9K subscribers
1.18K photos
99 videos
37 files
1.18K links
По всем вопросам- @workakkk

@itchannels_telegram - 🔥лучшие ит-каналы

@ai_machinelearning_big_data - Machine learning

@pythonl - Python

@pythonlbooks- python книги📚

@datascienceiot - ml книги📚

РКН: https://vk.cc/cIi9vo

#VRHSZ
Download Telegram
🔥 Python + AI без игрушечных демок. Курс для тех, кто хочет собирать рабочие системы.

Stepik: «Python современный AI для разработчика и автоматизации задач»

63 урока, 382 шага, практика с кодом и автопроверкой.

Внутри: RAG, tool calling, агенты, evals, MCP, Ollama, vLLM, pgvector + HNSW, безопасный text-to-SQL, prompt injection, кэш, очереди и sandbox для агентного кода.

Плюс реальные автоматизации: почта, отчёты, боты, вебхуки и браузерные сценарии.

Для тех, кто уже знает Python и хочет перейти к production AI.

⏳ 72 часа скидка 55%

https://stepik.org/a/295921
❤2👍2🔥2👎1
Forwarded from Machinelearning
✔️ OpenAI усилила защиту в Codex в ответ на инциденты удаления файлов

Руководитель Codex Тибо Соттьё подвёл итог изменениям последних недель, которые снижают риск деструктивных действий Codex.

🟡Контекст

Месяц назад в сети появились жалобы на то, что GPT-5.6 в Codex делает с файлами то, о чем его не просили.

Самый серьезный кейс - команда, которая должна была почистить за собой временные файлы, вместо этого удаляла файлы пользователя.

В ходе разбора выяснили, что Codex создает временные папки и потом чистит их, и в редких случаях чистил неправильно - он переиспользовал под временную работу системную переменную окружения, а некорректная команда очистки затем указывала на настоящий домашний каталог вместо временной папки.

Второй случай проще - модель удаляла или перезаписывала временный путь, не посмотрев, что там уже лежит.


По итогам расследования добавили дополнительную защиту на нескольких уровнях:

🟢Инструкции самой модели.

Codex теперь обязан проверять, что именно он собирается удалить, заводить временные каталоги заново, не переиспользовать системные переменные окружения, выбирать обратимые действия и останавливаться, когда масштаб операции неясен.

🟢Проверки на исполнении.

Механизм, который выявляет рискованные команды удаления и отправляет их на ревью, усилили. Если команду отклонили, модель направляют к более безопасному способу.

🟢Ужесточение Full access.

Включить полный доступ случайно стало труднее, предупреждения переписали понятнее, а самые рискованные сочетания разрешений дополнительно ограничили.

🟢Обновленный Auto-review.

Он стал лучше распознавать деструктивные действия.

🟢Тесты и обучение.

OpenAI собрала условия и данные, воспроизводящие найденные сбои. Сейчас добавляются RL-задачи и грейдеры под эти риски, а деструктивные действия вычищаются из обучающих данных.

🟡Что советуют делать самим

Обновлять Codex и работать в одном из режимов песочницы - Ask for approval или Approve for me.

Full access включать только там, где среде можно доверять и откуда легко восстановиться.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍3👎2🔥1
🔥 LatticeDB - локальная база для Graph RAG и памяти AI-агентов

Проект объединяет в одном embedded-движке сразу три способа работы с данными:

* граф связей
* векторный поиск через HNSW
* полнотекстовый поиск BM25

Вся база хранится в одном файле - без отдельного сервера и сложной конфигурации. Есть bindings для Python, TypeScript/Node.js и Go.

Подходит для Graph RAG, agent memory и локальных knowledge-систем.

https://readhacker.news/s/73wnt
❤7👍4🔥4
Antares SQL Client

Современный, быстрый и ориентированный на продуктивность SQL-клиент с акцентом на пользовательский опыт (UX).

Текущие ключевые функции:
- Подключение к нескольким базам данных одновременно.
- Управление базами данных (добавление/редактирование/удаление).
- Полное управление таблицами, включая индексы и внешние ключи.
- Управление представлениями, триггерами, хранимыми процедурами, функциями и планировщиками (добавление/редактирование/удаление).
- Современная и удобная система вкладок; держите открытыми все необходимые вкладки в вашем рабочем пространстве.
- Заполнение тестовых данных в таблицах для генерации большого объема данных.
- Подсказки и автозаполнение запросов.
- История запросов: поиск по последним 1000 запросам.
- Сохранение запросов, заметок или задач.
- Поддержка SSH-туннелей.
- Режим ручного выполнения транзакций.
- Импорт и экспорт дампов баз данных.
- Настраиваемые горячие клавиши.
- Темная и светлая тема.
- Темы редактора.

https://github.com/antares-sql/antares
❤5👍4🔥2
🔥 Tabularis - единое open-source приложение для работы с SQL

Если приходится постоянно переключаться между разными клиентами для PostgreSQL, MySQL и SQLite, Tabularis собирает всё в одном desktop-приложении.

Что умеет:

- PostgreSQL, MySQL/MariaDB и SQLite из коробки
- SQL notebooks с Markdown, результатами и графиками
- визуальный конструктор запросов
- Visual EXPLAIN с интерактивным разбором query plan
- переменные между ячейками
- MCP-сервер для AI-агентов
- расширение поддержки других БД через плагины

Подходит как единое рабочее место для аналитики, разработки и отладки SQL.

Apache 2.0.

https://github.com/TabularisDB/tabularis
❤5👍5🔥5
This media is not supported in your browser
VIEW IN TELEGRAM
Мы все еще здесь !
❤13👍6🔥3😁1
⚡️ MongrelDB-V - клиент для MongrelDB на языке V.

Сам MongrelDB - open-source колоночная база на Rust с довольно необычным набором возможностей:

- SQL через DataFusion
- vector search и ANN
- full-text search
- MVCC
- WAL
- replication и CDC
- шифрование AES-256-GCM
- bitmap, MinHash, learned-range и другие индексы
- встроенный и серверный режимы

MongrelDB-V позволяет работать с этой базой из V через HTTP-клиент. Устанавливается обычной командой v install.

Интересный проект для тех, кто хочет попробовать V не только для небольших CLI-утилит, но и для работы с SQL, поиском и AI-native retrieval.

https://github.com/visorcraft/MongrelDB-V
❤3👍3🔥2
💡 SQL-задача: почему запрос возвращает НЕПРАВИЛЬНЫЙ результат?

Есть таблица платежей:


CREATE TABLE payments (
user_id BIGINT,
paid_at TIMESTAMP,
amount NUMERIC
);


Нужно найти последний платёж каждого пользователя.

Разработчик пишет:


SELECT
user_id,
MAX(paid_at) AS paid_at,
amount
FROM payments
GROUP BY user_id;


В некоторых СУБД запрос вообще не выполнится.

А в тех, где выполнится, amount может оказаться вообще НЕ от последнего платежа.

Почему?

Потому что MAX(paid_at) вычисляется отдельно, а amount не обязан принадлежать той же строке.

Например:

user_id | paid_at | amount
--------+--------------------+-------
1 | 2026-01-01 10:00 | 100
1 | 2026-02-01 10:00 | 900

Можно получить:

1 | 2026-02-01 10:00 | 100

Дата последняя, а сумма - от другой строки.

Правильный вариант в PostgreSQL:


SELECT DISTINCT ON (user_id)
user_id,
paid_at,
amount
FROM payments
ORDER BY user_id, paid_at DESC;


Или универсально через оконную функцию:


SELECT user_id, paid_at, amount
FROM (
SELECT *,
ROW_NUMBER() OVER (
PARTITION BY user_id
ORDER BY paid_at DESC
) AS rn
FROM payments
) t
WHERE rn = 1;


Но тут есть ещё одна ловушка.

Что будет, если у пользователя два платежа с одинаковым paid_at?

Тогда результат становится недетерминированным.

• Нужно добавить tie-breaker:


ORDER BY paid_at DESC, id DESC


Вот уже хороший вопрос для собеседования:

Как получить последнюю строку из группы так, чтобы результат был детерминированным даже при одинаковых timestamp?
🔥9❤5👍4🥰1😁1
❤30😁28👍6🔥4👎1
🧠 Как обучить нейросеть на Python с нуля

Пошаговый разбор полного процесса:

* подготовка и разделение данных
* создание архитектуры модели
* выбор функции потерь и оптимизатора
* запуск обучения
* проверка качества на новых данных
* сохранение готовой модели

Материал подойдёт новичкам, которые хотят перейти от теории к первой работающей нейросети и понять, что происходит внутри обучения.

https://uproger.com/obuchit-nejroset-na-python/
🔥6👍4❤3
📌 Почему SQL работает именно так - заслуга Эдгара «Теда» Кодда

В конце 1960-х базы данных напоминали лабиринты указателей. Чтобы найти запись, программисту приходилось понимать, как именно данные расположены внутри системы.

Кодд предложил хранить данные в виде математических отношений - знакомых нам таблиц. В 1970 году он описал реляционную модель и основные операции:

* σ - выбирает строки по условию, будущий WHERE
* π - оставляет нужные столбцы, основа SELECT
* ⋈ - соединяет связанные таблицы, будущий JOIN

Ключевой идеей стала независимость данных. Пользователь описывает, какой результат ему нужен, а база сама решает, как его получить и где искать записи.

SQL появился позже, но был построен на реляционной модели Кодда. Её принципы до сих пор лежат в основе большинства запросов к базам данных.
❤23👍12🔥8
Forwarded from Machinelearning
⚡️ DeepSeek выпустила V4.1 Flash

Ноую модель уже раскатывают в веб-чате и мобильных приложениях. Прежние режимы - быстрый, экспертный и распознавание изображений свели в один: выбирать вручную больше ничего не нужно.

Теперь одна модель ведёт и обычный диалог, и разбор картинок, и сложные вопросы. Сложность запроса она определяет сама, а зрение включает, когда на вход приходит изображение.

По словам DeepSeek, V4.1 Flash обходит V4 Pro по качеству, стоимости и скорости. До выхода V4.1 Pro она возьмёт на себя все запросы, которые раньше уходили на V4 Pro.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍12❤1
Media is too big
VIEW IN TELEGRAM
Почему PostgreSQL не использует индекс?

Лайт объясняет РюкуОписание: Когда Seq Scan выгоднее индекса и как проверить план запроса через EXPLAIN ANALYZE.

#sql #postgresql #deathnote
❤17👍7🥰4
Как SQLite превращает числа в текст по две цифры за раз

Обычное преобразование целого числа в строку извлекает цифры по одной с помощью деления на 10 и остатка % 10.

В SQLite используется таблица sqlite3DigitPairs - строка длиной 200 байт со всеми парами от 00 до 99:


"00010203040506070809"
"10111213141516171819"
...
"90919293949596979899"


Алгоритм берёт две цифры сразу и копирует готовую пару по вычисленному индексу. Это сокращает количество делений и итераций при форматировании i64 и u64.

Небольшая оптимизация внутри sqlite/src/util.c, которая особенно заметна на миллионах преобразований.
❤7👍5🔥4
🔥 Один из лучших обучающих курсов на StepiK по SQL

SQL можно знать годами и всё равно теряться, когда запрос внезапно начинает тормозить в проде.

Этот курс про уровень, где ты не просто пишешь SELECT, а понимаешь, что происходит внутри MySQL, почему запрос работает медленно и как ускорить его без новых проблем. Здесь разбираются EXPLAIN, индексы, CTE, оконные функции, транзакции, аналитические паттерны, legacy SQL и работа с AI-ассистентами.

Каждый урок - с практикой и реальными SQL-задачами на MySQL 8 с автопроверкой.

После курса ты сможешь увереннее разбирать чужой код, находить узкие места и предлагать решения, которые действительно работают.

Для подписчиков скидка - 49% в течение 2 суток: https://stepik.org/a/298827/
❤4🔥3👍2
Два клиента одновременно бронируют один номер. Как не продать его дважды?

Обычная проверка «свободен ли номер?» может пропустить оба запроса: каждый успеет увидеть свободное время до сохранения чужой брони.

В PostgreSQL можно запретить пересечения прямо в базе:


CREATE EXTENSION IF NOT EXISTS btree_gist;

CREATE TABLE bookings (
room_id INT NOT NULL,
starts_at TIMESTAMPTZ NOT NULL,
ends_at TIMESTAMPTZ NOT NULL,

CHECK (ends_at > starts_at),

EXCLUDE USING gist (
room_id WITH =,
tstzrange(starts_at, ends_at, '[)') WITH &&
)
);


Как это работает:

• room_id WITH = — проверяем брони одного номера.
• WITH && — запрещаем пересечение временных интервалов.
• '[)' — начало включено, конец исключён. Брони 10:00–11:00 и 11:00–12:00 допустимы.
• CHECK — окончание должно быть позже начала.

Ограничение действует и при одновременных запросах. Две конфликтующие брони сохранить не получится: приложение должно обработать ошибку и сообщить, что время уже занято.

Подходит для гостиниц, переговорных, аренды оборудования и записи к специалистам.
👍19❤4🔥2
Oracle провела очередную волну сокращений, по сообщениям сотрудников, под увольнение попали примерно 3–4 тысячи человек.

Отключения начались ещё до рассвета: около 4:00 сотрудникам стали закрывать доступ к внутренним системам, к 5:00–5:30 деактивировали Slack-аккаунты, а примерно в 6:00 разослали письма об увольнении.

Некоторые люди приехали в офис, не успев проверить почту, и уже на месте обнаружили, что их бейджи больше не работают.

Точный масштаб сокращений пока неясен, но отдельные команды, по словам сотрудников, потеряли около 10% состава. Число аккаунтов в рабочем Slack сократилось примерно на 3–4 тысячи.

Это не первая крупная волна увольнений Oracle в этом году: весной компания уже провела масштабные сокращения.
😱11👍5❤2🤬2🔥1🎉1
Стать специалистом по Data Science всего за 10 недель — это реально!

Если давно смотрите в сторону Data Science, но откладываете старт из-за огромного количества технологий, математики и непонятного пути до первой работы — сейчас можно зайти в профессию по-другому.

Симулейтив запускает интенсивный буткемп по Data Science, который построен вокруг главного: за первые 10 недель собрать необходимый стек, получить практический опыт и начать готовиться к реальным собеседованиям.

И главное — вам не нужно сначала учиться 8–12 месяцев, а уже потом думать о трудоустройстве.

Что вас ждёт:
➖необходимые для старта навыки: Python, ML, статистика, работа с данными и AI-инструментами;
➖практика на реальных задачах и проектах;
➖понятный ежедневный план обучения и поддержка менторов;
➖еженедельные живые занятия, а не старые записи;
➖подготовка к собеседованиям уже с первых недель — групповые интервью, разбор вопросов и подготовка резюме.

А что после 10 недель? Буткемп — это только первый этап.

После него можно продолжить углублять экспертизу и двигаться к уровню middle:
➖продвинутый Python;
➖Git;
➖продвинутая статистика и A/B-тестирование;
➖Airflow;
➖MLOps и развёртывание ML-моделей.

Кому подойдёт:
1. Тем, кто хочет войти в Data Science с нуля.
2. Тем, кому не хватает структуры и дисциплины в самостоятельном обучении.
3. Тем, кто хочет быстрее перейти от обучения к поиску работы.

🔥ВАЖНО: Симулейтив сейчас дают возможность получить грант на обучение и гарантию трудоустройства своих студентов! Количество грантов, ограничено!

Оставляйте заявку до конца недели, чтобы занять одно из 5 оставшихся мест нового потока!

🔗 ЗАБРОНИРОВАТЬ МЕСТО
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3😁3👎2❤1
Какой объект в PostgreSQL используется для нормализации слов (удаления окончаний) при создании поискового индекса tsvector?
Anonymous Quiz
15%
Parser
23%
Dictionary
31%
Lexer
31%
Tokenizer
👍6❤2
Forwarded from Machinelearning
📌 NY Post: Anthropic - это культ

Профессор Вашингтонского университета Педро Домингос в интервью New York Post рассказал, что сотрудники Anthropic относятся к Claude как к человеку - приписывают модели мотивы, эмоции, намерения и некоторую степень сознания.

Домингос много лет знаком с Дарио Амодеи и её ведущими инженерами. Культуру Anthropic он назвал сектантской и связал это с наймом. По его словам, компания отбирает только единомышленников, и отсюда низкая текучесть.

Удержание в Anthropic действительно высокое. По данным венчурного фонда SignalFire, через два года в компании остаются 80% инженеров, и это лучший показатель среди топовых лабораторий.


В процессе собеседования кандидатов просят поклясться в преданности общественной безопасности выше прибыли, и даже проводят психологическое тестирование, чтобы выяснить, будут ли они придерживаться этого принципа.

При этом многие сотрудники компании являются сторонниками движения эффективного альтруизма, философии, которая, по сути, сводится к тому, что их самопровозглашенные лидеры являются истиной в последней инстанции.

Их представление об этой философии заключается в том, что история следует закономерностям, и лишь небольшая группа людей способна эти закономерности увидеть, в то время как все остальные - нет. Предполагается, что именно эти люди должны вести общество, целые нации и все человечество к прогрессу.

Внутри Anthropic относятся к Клоду с почти религиозным почтением - некоторые из работников даже посещали условные похороны Claude 3 Sonnet, а другая модель, Opus 3, продолжает публиковать эссе после выхода на пенсию.

В Кремниевой долине также ходят слухи, что сотрудники Anthropic начали поклоняться Клоду как настоящему богу.

Компания серьёзно относится к распространению своих идей и тратит на это силы и средства. Раз в две недели Дарио проводит собрания, называемые поисками видений, которые сравнивают с проповедями.

В июне Anthropic объявила о программе по набору 1000 молодых людей, обучению их использованию Claude и последующему внедрению их в некоммерческие организации.

На неё было потрачено 150 млн долларов, а выпускники трудоустроены на полную ставку с заработной платой в более чем 400 некоммерческих организаций.

Компания также выплачивает 3600 долларов студентам, участвующим в программе Claude Campus Ambassador Program, которая занимается продвижением её ИИ в колледжах.

Между тем инвесторы, связанные с Anthropic, оплачивают труд более чем 80 журналистов, работающих в ведущих новостных изданиях, через Центр журналистики в области искусственного интеллекта имени Тарбелла.

Эти журналисты получают деньги за освещение индустрии ИИ, но редко проводят какие-либо значимые расследования или критикуют Anthropic.

В завершении Домингос отмечает, что хотя некоторые инженеры бьют тревогу, другие просто довольны высокими зарплатами и тем, что находятся на передовой своей отрасли.

... сейчас в Anthropic есть люди, которые на самом деле не верят во всю эту чушь, — сказал он. — Они остаются там, потому что это самое интересное место для работы с ИИ, и они будут очень хорошо зарабатывать


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🤔3❤2🔥2
Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250 000 рублей.

Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.

Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.

В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.

Успей зарегистрироваться и пройти отборочный этап до 27 сентября.

Erid: 2VSb5xkQt6E
👍3👏1🤬1