Big Data AI
18.2K subscribers
1.12K photos
165 videos
19 files
1.12K links
@haarrp - админ

Вопросы с собеседований по Machine Learning, Data Science, Deep Learning и Нейроннным сетям

@data_analysis_ml - анализ данных

@ai_machinelearning_big_data

@itchannels_telegram - важное для программиста

РКН: clck.ru/3Fmqxe
Download Telegram
Вырастили целое дерево из агентов 🌳

Мы в Авито разработали единую платформу для процессов. Самые лучшие и популярные становятся агентами. В итоге каждый сотрудник может создать свой процесс или воспользоваться готовым. Классно? Не то слово! Поэтому мы написали статью, как создавали это решение.

О чём узнаете, если прочитаете:
🔸как устроена архитектура платформы,
🔸как процесс становится агентом,
🔸как измерять качество агентов.

Читать статью 🚀
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍3🤡3🔥2
Ornith-1.5: новая семья open-source моделей с упором на самообучение

В линейку вошли три версии: 9B Dense, 35B MoE и 397B MoE. Авторы делают ставку не только на масштаб, но и на self-improvement: модель сама предлагает новые задачи, строит под них scaffolding и генерирует rollouts для последующего RL-обучения.

По заявленным результатам, Ornith-1.5 показывает сильные цифры на reasoning, coding и agentic-бенчмарках:

Terminal-Bench 2.1 — 86.1
SWE-Bench Verified — 86
SWE-Bench Pro — 65.1
SWE-Bench Multilingual — 79.6
HLE — 44.6
ClawEval — 81.4
Tool Decathlon — 71.2

Авторы также заявляют уровень, сопоставимый с Claude Opus 4.8 в ряде задач.

Все модели выпущены под MIT License. Есть также FP8, GGUF, MLX и NVFP4-квантизации, поэтому линейку можно использовать как для исследований, так и в коммерческих проектах.

Tech Blog:
http://ornith.ai/ornith_1_5.html

Hugging Face:
http://huggingface.co/collections/ornith-ai/ornith-15
4👍3🥰3
Forwarded from Rust
⚡️ Переписывание Bun на Rust превращается в очень странный AI-эксперимент

Bun 1.4 задерживается уже около трёх месяцев, и автор Tero Piirainen считает, что проблема намного интереснее обычного сорванного релиза.

За последний месяц в репозитории Bun 15,8 тыс. коммитов сделал robobun, ещё 1,6 тыс. — autofix-ci[bot], а Jarred Sumner — около 790. При этом у проекта накопилось больше 5 тыс. открытых PR.

По сути, Bun стал одним из крупнейших экспериментов: можно ли переписать важную продакшен-кодовую базу на Rust силами AI-агентов, когда человек в основном направляет процесс.

Отдельный вопрос, зачем вообще понадобился полный переход с Zig на Rust. Одним из аргументов была memory safety, но в новой кодовой базе всё ещё много unsafe, поэтому выгода выглядит не такой очевидной.

https://tipiirai.com/writing/bun-rust-rewrite-worries

@rust_code
3
На старте ИИ-проекта для инференса часто используют API ⤵️

Но по мере роста нагрузки, требований к безопасности и затрат возникает потребность в собственной ИИ-инфраструктуре.

На вебинаре 25 августа эксперты Cloud․ru расскажут, когда пора переходить на Bare Metal и как построить инфраструктуру для запуска моделей в продакшене.

В программе:
▶️Когда для инференса достаточно API, а когда переходить на собственную инфраструктуру

▶️Как выбрать GPU-сервер для инференса и обучения моделей

▶️Как обеспечить быструю связь между GPU-серверами с InfiniBand

▶️Как собрать кластер уровня суперкомпьютера

▶️Как обеспечить изоляцию данных и безопасность

▶️Как избежать непредсказуемого роста расходов


Зарегистрироваться на вебинар
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍2
⚡️ SenseNova U1.5-Lite: не «умеет всё», а умеет делать всё вместе

SenseNova выпустила U1.5-Lite - открытую мультимодальную модель на 8B параметров для понимания изображений, генерации и редактирования.

Главная идея здесь не в размере, а в объединении навыков в одной модели.

U1.5-Lite умеет работать со сложными промптами, нативно генерировать 2K/4K, лучше рисовать текст и делать локальные правки без отдельного роутера или переключения между экспертами.

Обучение идёт через специализированных экспертов для:
— text rendering и инфографики
— визуального качества
— image editing

После этого OPD переносит их способности в одну лёгкую unified-модель.

Плюс task-oriented RL усиливает следование инструкциям, качество композиции и точность редактирования.

🛠️GitHub: https://github.com/OpenSenseNova/SenseNova-U1
🤗HF: https://huggingface.co/collections/sensenova/sensenova-u15
👍32🔥2
This media is not supported in your browser
VIEW IN TELEGRAM
☁️☁️☁️☁️☁️☁️☁️

Yandex Cloud 24 сентября проведёт флагманскую конференцию в Москве Yandex Scale 2026.

🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨
В программе четыре продуктовых трека — AI, Data, Security и Hybrid Infrastructure & DevOps, — и отдельный углублённый технологический трек DeepTech, который пройдёт только онлайн.

В треке AI откроем программу докладом о том, как развиваются платформы для создания ИИ-агентов и рынок GenAI и что такое Agentic OS. Разберём подходы к глубокой аналитике коммуникаций, которая позволяет быстро перейти к ценным бизнес‑инсайтам. А ещё покажем, каким становится голосовой агент, когда перестаёт просто зачитывать текст и начинает вести настоящий диалог — с новым Realtime API и подключением к телефонии.

🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨
Отдельно пройдут воркшопы по AI. Покажем, как за час собрать своего кодинг-агента для анализа данных на базе Yandex AI Studio. Научим собирать ИИ-агента без единой строки кода — от идеи до публикации в веб-виджете или популярных мессенджерах. Разберём, как ИИ-агент Нейроаналитик в DataLens считает чарты, анализирует дашборды и подключается к внешним LLM через MCP. И познакомим с аналитикой каналов коммуникации в Yandex SpeechSense — от шаблонов под сценарии до готовых тегов и отчётов.

🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨

Помимо докладов, будут демозоны, питчинг решений, IT-квест и мерч. В онлайн-студии в это время — розыгрыши призов и секретный гость.


Полную программу можно посмотреть на сайте — там же можно и зарегистрироваться, участие бесплатное!
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥21
🚀 Будущее AI — это не только ум, но и скорость

Одно из самых интересных интервью года — Tibo у Matthew Berman.

Одна мысль особенно цепляет: в ближайшем будущем скорость около 750 токенов в секунду может стать обычным стандартом, а не редким достижением.

И это важно.

Мы всё больше времени проводим, наблюдая, как AI-агенты работают: анализируют, пишут код, запускают задачи.

Каждая секунда ожидания — это потеря времени и денег.

Следующий этап гонки AI — не только кто умнее.

А кто сможет выполнять эту интеллектуальную работу быстрее.

https://x.com/MatthewBerman/status/2091959711423996249
5👍3
📚 Бесплатная книга по выпуклой оптимизации - 130 страниц

"Convex Optimization: Algorithms and Complexity" - хорошее введение в алгоритмы выпуклой оптимизации и их вычислительную сложность.

Внутри:

* градиентные методы
* ускоренные методы
* субградиентная оптимизация
* проксимальные алгоритмы
* first-order methods
* оценки скорости сходимости
* сложность оптимизационных алгоритмов

Полезно для ML, математики и тех, кто хочет глубже понять, что стоит за обучением моделей.

PDF:
https://arxiv.org/abs/1405.4980
5
10 GitHub-репозиториев, которые сильнее всего залетают прямо сейчас

Собрал свежую подборку проектов, которые заметно растут и активно обсуждаются.

1. OpenAI Codex
Coding agent от OpenAI для терминала и автоматизации разработки.

https://github.com/openai/codex

2. God's Eye View
OSINT и открытые геоданные на интерактивном 3D-глобусе: авиация, спутники и другие источники.

https://github.com/bilawalsidhu/gods-eye-view

3. awesome-gpt-image-2
Большая библиотека промптов, примеров и шаблонов для GPT Image 2.

https://github.com/freestylefly/awesome-gpt-image-2

4. mattpocock/skills
Готовые skills и workflows для coding agents, которые можно переиспользовать вместо огромных промптов.

https://github.com/mattpocock/skills

5. Archify
Строит интерактивную карту архитектуры кодовой базы: sequence, data-flow, lifecycle и связи компонентов.

https://github.com/tt-a1i/archify

6. Tailcat
Инструмент от Tailscale для прямого соединения машин через WireGuard и NAT traversal.

https://github.com/tailscale/tailcat

7. Prime Agent
Self-improving coding agent для длинных автономных задач.

https://github.com/PrimeIntellect-ai/prime-agent

8. Semantica
Graph-native инфраструктура для хранения контекста, связей и происхождения данных в AI-системах.

https://github.com/semantica-agi/semantica

9. Cursor Plugins
Официальный репозиторий плагинов Cursor: orchestration, code review, continual learning и другие agent-функции.

https://github.com/cursor/plugins

10. AnyDoc
Инструмент от Firecrawl для превращения документов в структурированный контент для AI и RAG.

https://github.com/firecrawl/anydoc

Если смотреть на общий тренд недели:

AI-агенты → agent skills → память и контекст → визуализация архитектуры → инструменты для автономной работы с окружением

Сохраняй себе, чтобы не потерять!
👍71
🚨 OpenAI прекращает сотрудничество с Cursor после покупки компании SpaceX

OpenAI уведомила SpaceX, что прямой доступ Cursor к её моделям будет отключён 12 ноября 2026 года. Новые модели, включая будущую Astra, Cursor также не получит.

Причина, которую назвала OpenAI, - недоверие к компаниям Илона Маска из-за предыдущих нарушений контрактов и условий использования.

Cursor официально перешёл под контроль SpaceX в августе. При этом в Cursor утверждают, что модели OpenAI сейчас дают лишь около 5% общего трафика платформы.

Конфликт OpenAI и Маска теперь напрямую затронул один из крупнейших AI-инструментов для программистов.

https://openai.com/index/our-decision-on-cursor-following-its-acquisition-by-spacex/
👍42
This media is not supported in your browser
VIEW IN TELEGRAM
Тир-лист открытых ИИ- моделей: кто в S, а кто просто для галочки


Разложил актуальные open source модели по тирам. В S попали GLM-5.3, Hy4-preview, Kimi K3, Qwen3.8-Flash и DeepSeek-R1, в A ушли Qwen3.8-27B, GLM-5.3-Flash, DeepSeek-V3, Gemma 3 и Llama 3.3 70B. Ниже пошли специализированные и маленькие модели вроде Phi-4, Qwen2.5-Coder, TinyLlama и CodeGemma. Нижние строки остались пустыми, и это главный вывод про уровень open-weight прямо сейчас.
👍4👎32
🔥 Python + AI без игрушечных демок. Курс для тех, кто хочет собирать рабочие системы.

Stepik: «Python современный AI для разработчика и автоматизации задач»

63 урока, 382 шага, практика с кодом и автопроверкой.

Внутри: RAG, tool calling, агенты, evals, MCP, Ollama, vLLM, pgvector + HNSW, безопасный text-to-SQL, prompt injection, кэш, очереди и sandbox для агентного кода.

Плюс реальные автоматизации: почта, отчёты, боты, вебхуки и браузерные сценарии.

Для тех, кто уже знает Python и хочет перейти к production AI.

72 часа скидка 55%

https://stepik.org/a/295921
1👍1🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 Бесплатный ElevenLabs, который можно запускать локально:

VoiceStudio - локальная open-source студия для работы с голосом без подписок и лимитов


В одном приложении собрали:

- клонирование голоса по короткому образцу
- создание голоса по описанию - возраст, акцент, стиль, подача
- автоматический дубляж видео с переводом и разделением спикеров
- импорт EPUB/PDF и сборку многоголосых аудиокниг .m4b
- диктовку с очисткой текста локальной LLM
- удаление фонового звука через Demucs
- разделение говорящих через Pyannote/WhisperX
- MCP-сервер и локальный API

Внутри - 16 TTS-движков, 11 ASR-систем и каталог на 646 языков**. Основные данные и проекты по умолчанию остаются на вашем компьютере. Работает на Windows, Linux и Apple Silicon Mac.

Проект пока в активной beta.

https://github.com/debpalash/VoiceStudio
2👍1🔥1
Как будут развиваться технологии искусственного интеллекта в ближайшие годы? Какие исследовательские идеи уже превращаются в работающие продукты? С какими задачами сегодня сталкиваются AI-команды?

17 сентября в Москве пройдёт AI R&D DAY — конференция для исследователей, разработчиков, руководителей R&D-команд и специалистов, которые создают и внедряют передовые решения на основе ИИ.
В центре программы — NextGenAI, проект, который исследует новые вызовы и формирует образ будущего ИИ.

Вас ждут 22 доклада в рамках двух треков. Поговорим о:
-новых подходах к созданию и обучению моделей;
-системах, которые одновременно работают с текстом, изображениями, звуком и другими типами данных;
-развитии голосовых технологий;
-оценке качества AI-решений;
-внедрении технологий в реальные продукты.

Участие бесплатное, места ограничены.
Регистрируйтесь по ссылке https://tglink.io/61b8e8f434cc19?erid=2W5zFGFYJC9
#реклама
О рекламодателе
2
CLIX — агент CLI, который выполняет команды на вашем компьютере.

В настоящее время в clix используется gpt-4 для LLM.
Forwarded from Machinelearning
⚡️ Qwen представила E-Commerce Bench - новый бенчмарк для проверки AI-агентов на долгосрочном управлении бизнесом.

Агент получает ¥100 000 и должен целый год управлять интернет-магазином:

- искать поставщиков
- торговаться
- выставлять цены
- запускать акции
- контролировать склад
- управлять денежным потоком

Среда построена на реальных данных электронной коммерции.

Внутри:

- 6886 товаров
- 576 поставщиков
- 152 из них мошенники
- комиссии за хранение
- возвраты
- репутация
- ограниченный рабочий день

Оценка идёт сразу по 7 направлениям, поэтому одной модели, которая была бы лучшей во всём, пока нет.

Blog: https://qwen.ai/blog?id=e-commerce-bench

Paper: https://arxiv.org/abs/2608.30730

Project: https://ecbench.github.io

Code: https://github.com/QwenLM/E-CommerceBench

@ai_machinelearning_big_data

#Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Anthropic запустила Claude Fable 5.1.

И почти сразу OrcaReplay вытащил системный промпт Claude Code для новой модели.

В опубликованном файле можно посмотреть, какие инструкции получает Claude Code перед началом работы: как он должен использовать инструменты, обращаться с кодом, соблюдать ограничения и вести себя внутри агентного окружения.

Ссылки:

Fable 5.1 System Prompt:
https://github.com/Continuum-AI-Corp/OrcaReplay/blob/main/prompt/CLAUDECODE/claude-fable-5-1-print-system-prompt.md

OrcaReplay:
https://github.com/Continuum-AI-Corp/OrcaReplay
3🔥3👍2