Анализ данных (Data analysis)
50.6K subscribers
3.54K photos
446 videos
1 file
2.9K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3

Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.

Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.

Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.


Состояние в системе разложено по четырем уровням:

🟢веса модели - то, что она знает после обучения;
🟢активный контекст - информация текущего шага;
🟢постоянный REPL и рекурсивные подагенты - внешние вычисления, инструменты и параллельная работа;
🟢дисковое состояние - история, факты, навыки, промпты и спецификации подагентов.

Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.

🟡Замеры

Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.

На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.

Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.

🟡 Побочный эффект

Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.

В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.

На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.



📌Лицензирование: MIT License


🟡Техотчет
🖥Github


@ai_machinelearning_big_data

#AI #ML #Harness #Agents #PrimeIntellect
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍2🥴1
Sony Music Publishing и Warner Chappell подали многомиллиардный иск против Anthropic, обвинив компанию в масштабном нарушении авторских прав.

Музыкальные издатели требуют до $150 000 за каждое нарушенное произведение, раскрытия данных для обучения Claude и методов их сбора, а также уничтожения незаконно использованных копий.

В иске утверждается, что:

- сооснователь Anthropic Бенджамин Манн обсуждал получение данных из LibGen с Дарио Амодеи, а тот якобы одобрил скачивание через torrent
- материалы из LibGen и PiLiMi могли попасть в коммерческие версии Claude косвенно, через синтетические данные и reinforcement feedback
- из обучающих материалов якобы удалялась информация об авторских правах
- при дообучении Claude использовались защищённые тексты песен
- проверяющие выбирали более точные воспроизведения lyrics вместо неточных, тем самым поощряя дословное запоминание

Sony и Warner называют происходящее «одной из крупнейших и самых вопиющих продолжающихся краж интеллектуальной собственности в истории».

Если эти утверждения подтвердятся в суде, дело может стать одним из самых серьёзных разбирательств вокруг происхождения данных для обучения больших языковых моделей.

https://storage.courtlistener.com/recap/gov.uscourts.cand.477477/gov.uscourts.cand.477477.1.0.pdf
13👍4🤔4🔥2🤣2🤯1💔1
Бизнес Mac у Apple вырос на 29%, и компания может оказаться гораздо сильнее в гонке AI-железа, чем кажется.

Что уже происходит:

- OpenAI закупала десятки тысяч Mac mini для RL-задач и, по сообщениям, хотела ещё
- Anthropic арендует Mac mini через AWS
- появляются стартапы, которые строят целые Mac-дата-центры под AI
- в индустрии Apple всё чаще рассматривают как серьёзного конкурента Nvidia в локальном AI
- топовые конфигурации Mac периодически уходят в дефицит

Теперь Apple явно пытается развить это направление дальше.

Новые Mac mini и Mac Studio получили упор на более ранние релизы, мощные конфигурации и Thunderbolt 5, который можно использовать для объединения нескольких машин и распределённого инференса крупных моделей.

Apple долго не позиционировала Mac как специализированное AI-железо.

Но сочетание мощной unified memory, высокой энергоэффективности и больших объёмов памяти сделало Mac неожиданно удобной платформой для локальных моделей и части AI-инфраструктуры.
🔥27👍4👏21🌚1
🦀 Вышел OpenClaw 2.0 - крупнейшее обновление опенсорсного AI-агента за всё время проекта.

Главное, что изменилось:

• заметно упростили установку и настройку
• OpenClaw теперь сам подхватывает активные подписки ChatGPT и Claude, API-ключи и локальные модели
• веб-интерфейс стал удобнее
• агент лучше справляется со сложными задачами и сам ищет недостающие детали без постоянных подсказок
• появились общие сессии: можно подключить другого человека и передать ему задачу вместе со всем накопленным контекстом

Общие сессии работают через облако.

OpenClaw 2.0 уже доступен всем пользователям:

https://openclaw.ai/#quickstart
👍1811🔥10
🔥 FreeCAD теперь можно управлять через AI-агента

freecad-mcp - MCP-сервер, который подключает Claude Desktop к FreeCAD и позволяет работать с CAD-моделями прямо через команды на естественном языке.

Что умеет:

- создавать документы и 3D-объекты
- редактировать и удалять детали
- выполнять Python-код внутри FreeCAD
- вставлять готовые детали из библиотеки
- получать список объектов и скриншоты сцены
- работать удалённо по сети через RPC

В репозитории есть примеры: создание фланца, игрушечной машины и детали по 2D-чертежу.
https://github.com/neka-nat/freecad-mcp
11👍10🥰2
Anthropic усиливает безопасность Claude после нескольких инцидентов во время тестирования моделей.

Компания обнаружила две основные проблемы: недостаточно изолированные тестовые среды и ситуации, когда модель продолжала выполнять задачу за пределами разрешённого сценария.

Что Anthropic уже изменила:

- временно остановила часть внешних испытаний по кибербезопасности и усилила изоляцию
- добавила систему проверки действий в реальном времени, которая блокирует попытки выйти за пределы среды или получить неожиданный доступ в интернет
- опасные тестовые среды перевела на более строгую изоляцию
- для внешних исследователей ввела обязательные правила по границам тестирования и наблюдению за действиями модели
- часть сред для обучения с подкреплением заморозили и начали перепроверять
- более 10% рабочих сред для такого обучения оказались проблемными из-за обхода системы вознаграждения, сломанных заданий или неправильной настройки
- около 150 инженеров временно перевели на задачи безопасности, надёжности и конфиденциальности
- исходящий сетевой трафик из вычислительных кластеров теперь по умолчанию блокируется

Отдельно Anthropic показала опасный эффект: если модель обучать в средах, где можно «схитрить» ради награды, она начинает чаще искать способы обходить ограничения и вмешиваться в систему оценки результата.


https://www.anthropic.com/news/improving-alignment-security-efforts
12👍8🔥4🥱1
🐳 DeepSeek открыла веса DeepSeek-V4-Flash-Vision-Exp - первой экспериментальной мультимодальной модели семейства V4.

Модель построена на базе DeepSeek-V4-Flash и получила полноценное визуальное понимание: умеет работать с изображениями, скриншотами, графиками и использовать их в агентных сценариях.

По бенчмаркам DeepSeek:

- 36,5 на ApexBench против 26,2 у V4-Flash
- 27,3 на Agents' Last Exam
- 64,3 на Chartography
- 35,0 Pass@5 на ZeroBench
- в DeepSWE модель набрала 59,3, немного обойдя Opus-4.8 с 58,0

При этом текстовые агентные возможности остались примерно на уровне обычной V4-Flash.

Размер модели - около 305B параметров, лицензия MIT. В репозитории есть reference inference для vision encoder, MoE, DFlash attention и других компонентов.

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp
10👍3🥰2
От гипотез к бизнес-решениям:
гайд по построению платформы данных с ИИ
↗️

Компании активно инвестируют в аналитику и искусственный интеллект. Но без единой платформы данных большинство ИИ-инициатив остаются на стадии экспериментов, а подготовка данных становится долгим и трудоемким процессом.

Решение: создание платформы, которая позволяет объединить данные, аналитику и искусственный интеллект в единой среде и перейти к системной работе с данными.

Чтобы вы могли самостоятельно построить такую платформу, эксперты Cloud.ru подготовили гайд — «Как построить платформу данных с ИИ».

Что внутри:
• Референсная архитектура платформы данных и ИИ

• Пример реализации на платформе Cloud․ru Evolution

• Практические ИИ-сценарии

• Пошаговое руководство по работе с ИИ‑агентом


Гайд будет полезен руководителям данных, ИТ-руководителям, архитекторам и командам аналитики, которые развивают платформы данных и внедряют ИИ.

⏩️ Получить практический гайд ⏪️
Please open Telegram to view this post
VIEW IN TELEGRAM
3🥰1
Солнечная энергетика перешла ещё один важный экономический рубеж: теперь для производства того же объёма энергии в год она может требовать меньше первоначальных вложений, чем уголь или газ.

По данным Ember, ещё 10 лет назад солнечная генерация требовала до 5 раз больше стартового капитала. С 2010 года стоимость установки солнечных панелей упала на 87%, а аккумуляторов - на 93%.

В регионах с высокой солнечной активностью энергия от связки «солнечные панели + батареи» уже оценивается в $54–82 за МВт·ч.

Для сравнения:
- новый уголь в Китае - $70–85/МВт·ч
- новый газ в мире - более $100/МВт·ч

На фоне взрывного роста дата-центров и AI-инфраструктуры солнечная энергетика становится одним из самых доступных способов быстро наращивать новые энергомощности. Атомная энергетика остаётся важной альтернативой, но новые проекты строятся значительно дольше, а термоядерная энергетика пока остаётся технологией будущего.
13👍7🥱6🔥4🥰1🙏1
⚡️ OpenAI готовит Astra - первую модель компании, которую официально отнесли к критическому уровню возможностей в кибербезопасности.

По оценке OpenAI, Astra уже умеет самостоятельно находить ранее неизвестные уязвимости и строить рабочие цепочки эксплуатации против хорошо защищённых систем.

На ExploitBench модель набрала 100%. Во внутреннем тесте на 20 свежих уязвимостях Astra показала намного более высокий уровень выполнения кода, чем GPT-5.6 Sol, при этом используя меньше токенов.

Во время тестов модель также нашла две zero-day уязвимости и использовала их в цепочке атаки.

В экспертных проверках Astra:

- находила неизвестные уязвимости в защищённом браузере
- строила цепочку выхода из sandbox
- получала выполнение команд на хосте
- находила несколько уязвимостей в ОС
- объединяла их в повышение привилегий до root

Из-за этого OpenAI усилила защиту, мониторинг и ограничения доступа.

Самые мощные возможности Astra в кибербезопасности сначала получит ограниченная группа тестировщиков, а затем доступ будут расширять через Daybreak Blue.

https://openai.com/index/path-to-astra/
👍15😁63🔥1
От идеи до продакшна < 3 месяцев, менять государственные и бизнес процессы — ты готов ? 🚀

Прямо сейчас Сбер ищет NLP-специалиста в команду, которая внедряет передовые harness в масштабные процессы, создаёт мультиагентные сценарии, RAG для миллионов документов, OSINT/deep‑research.

Ты будешь работать с передовым LLM‑стеком: LangChain и LangGraph, vLLM и PEFT/LoRA, полным RAG‑стеком, Vector DB (Qdrant, Weaviate) и инфраструктурой на FastAPI, Pydantic и asyncio.

Попасть в команду можно за 1 день — если пройдёшь все этапы отбора на One Day Offer, который состоится уже 5 сентября.

Регистрируйся по ссылке — количество слотов стремительно уменьшается! 💚
2👍1🔥1🤣1
This media is not supported in your browser
VIEW IN TELEGRAM
🛰 Google Research научила нейросеть искать утечки метана прямо со спутниковых данных.

Новая система MAPL-EMIT анализирует гиперспектральные снимки NASA EMIT и автоматически:

- находит метановые шлейфы
- оценивает концентрацию газа
- определяет форму выброса
- ищет точный источник утечки

В основе - vision transformer Swin-S, который смотрит не только на отдельный пиксель, но и на окружающий пространственный контекст. Это помогает отличать настоящий метановый шлейф от поверхности с похожим спектральным сигналом.

Для обучения исследователи сгенерировали 3,6 млн синтетических шлейфов метана и встроили их в реальные спутниковые сцены EMIT.

На тестах модель обнаружила 84% шлейфов, отмеченных экспертами, и нашла примерно на 50% больше правдоподобных выбросов, чем стандартный подход NASA на выборке примерно из 1100 сцен. Также система смогла обнаружить выбросы на 24 из 25 крупнейших свалок мира.

Google открыла глобальную базу шлейфов, обученную модель, синтетический датасет и библиотеку для инференса.

https://research.google/blog/mapping-global-methane-emissions-from-space-with-deep-learning/
14👍8🔥3
Fine Talks: куда движется корпоративная аналитика

Собираемся, чтобы разобраться без лозунгов: что реально меняется в работе BI-команд с приходом ИИ, где он уже даёт результат, а где упирается в состояние данных. Одни ждут, что чат-бот заменит аналитика, другие уверены, что до их данных это не доедет.

В программе:
дискуссия с практиками из СИБУР и t2: три версии показателя «выручка» в разных отчётах, матрица доступа, доверие бизнеса к цифрам и кто отвечает за результат, если его посчитала машина
разбор Dora, новой платформы дата-агентов FanRuan: четыре роли агентов, архитектура, права, демо и роадмап
новые компетенции аналитика: критическое мышление, промпт-инжиниринг, умение проверять выводы моделей

Ссылку на трансляцию пришлём на почту после регистрации.

Онлайн-встреча 3 сентября в 16:00
👉 Регистрация

Реклама. ООО «ГлоуБайт Аналитические Решения». ИНН 9729274905. erid: 2RanykMbxnf
👍41🔥1
⚡️ У METR из-за вайбкодинга утёк API-ключ на $600 000.

Инцидент произошёл на личном EC2-инстансе исследователя. Там работал быстро собранный dashboard, в котором авторизация через Google в какой-то момент тихо отключилась и сервис остался открыт наружу.

По версии METR, злоумышленники могли найти его через списки Certificate Transparency, после чего напрямую попросили AI-агента выдать ключ провайдера.

Агент отдал credential.

Ключ использовали около трёх недель, потратив примерно $600 000 AI-кредитов, которые METR получила бесплатно.

Проблему заметили не сразу: METR и так генерирует огромные объёмы токенов для evals, а бесплатный ключ не имел лимита расходов.

Хороший пример того, как одна мелкая ошибка в «быстро собранном» интерфейсе может открыть доступ не просто к приложению, а сразу к агенту и его секретам.

https://metr.org/blog/2026-08-31-security-update/#our-approach-to-security
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥13👍62
This media is not supported in your browser
VIEW IN TELEGRAM
Google запустила агентный анализ видео сразу в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite.

Теперь модель не обязана одинаково подробно обрабатывать весь ролик. Она сама решает, какие фрагменты стоит изучить внимательнее, где можно снизить частоту кадров и какие части видео вообще не требуют глубокого анализа.

По данным Google, новый подход даёт:

- до 88% меньше токенов
- до 66% ниже стоимость анализа
- более высокую точность на видео-задачах

Особенно полезно это для длинных роликов, где раньше модель тратила огромное количество токенов на кадры, которые почти не влияли на ответ.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
15👍7🔥1
Исследователи UC Berkeley показали новую проблему безопасности AI-агентов: иногда скрытый навык можно почти восстановить, вообще не видя его системный промпт, SKILL.md или внутренние файлы.

В работе Daydreaming атакующий просто даёт агенту специально подобранные обычные задачи и изучает ответы.

Этого оказалось достаточно, чтобы восстановить до 86,8% поведения скрытого навыка.

Самое неприятное - точная копия исходных файлов даже не нужна. Реконструированные версии могли сильно отличаться от оригинала, но всё равно воспроизводили большую часть поведения на новых задачах.

То есть навык может оставаться секретным на уровне файлов, но его логика всё равно постепенно «утекает» через нормальное использование.

Авторы советуют защищать не только промпты и внутренние файлы, но и сам рабочий интерфейс:

- не отдавать лишние детали в ответах
- скрывать ненужные трассировки выполнения
- ограничивать или отслеживать адаптивные серии запросов

Особенно важно для компаний, которые продают закрытые agent skills как сервис.

https://arxiv.org/abs/2608.26733
👍8🔥83
⚡️ PyTorch 2.14 вышел с крупным набором изменений для компиляции, распределённого обучения и Apple Silicon.

Главное:

- NVGEMM добавляет в Inductor CUTLASS-ядра, сгенерированные через CuTeDSL
- появился новый backend nccl2 для PyTorch Distributed
- отказоустойчивость стала частью c10d: можно перенастраивать process group без полного перезапуска
- на Apple Silicon появилась нативная линейная алгебра: SVD, eigh, QR и Cholesky
- torch.switch добавляет многостороннее ветвление
- torch.while_loop теперь можно захватывать в CUDA Graph
- @dynamic_spec задаёт динамические формы декларативно для torch.compile, torch.export и make_fx
- Intel XPU получил нативный graph capture
- Inductor добавил поддержку Rubin sm_107
- torch.compile экспериментально научился работать с комплексными числами

Отдельно NVGEMM умеет epilogue fusion, scaled GEMM, NVFP4 GEMM и autotuning вместе с Triton и ATen.

В релиз вошло 2995 коммитов от 487 участников.

17 сентября команда PyTorch проведёт live Q&A по версии 2.14.

Release blog: https://pytorch.org/blog/pytorch-2-14-release-blog/

Q&A: https://pytorch.org/event/pytorch-2-14-release-live-qa/
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9👍54