Теперь официально: SpaceX покупает Cursor в сделке полностью за акции, оценённой в $60 млрд.
Этот шаг моментально даёт ИИ-империи Илона Маска серьёзный enterprise-продукт для программирования и может помочь xAI сократить отставание от Claude Code от Anthropic и Codex от OpenAI.
Однако на практике всё больше похоже, что xAI скорее сдаёт свои дата-центры в аренду и позиционирует себя как hyperscaler, чем реально стремится участвовать в гонке за SOTA-модель.
Этот шаг моментально даёт ИИ-империи Илона Маска серьёзный enterprise-продукт для программирования и может помочь xAI сократить отставание от Claude Code от Anthropic и Codex от OpenAI.
Однако на практике всё больше похоже, что xAI скорее сдаёт свои дата-центры в аренду и позиционирует себя как hyperscaler, чем реально стремится участвовать в гонке за SOTA-модель.
❤18🔥7👍5
Forwarded from Kali Linux
Апдейт по Fable 5 / Anthropic: компания отправила своих ведущих специалистов по безопасности в Вашингтон. Экспортные ограничения всё ещё
Anthropic и администрация Трампа завершили переговоры в понедельник без результата: экспортные ограничения на Claude Fable 5 остаются в силе. Когда их снимут - непонятно.
Компания несколько дней убеждала Вашингтон, что опасения вокруг модели преувеличены. Ту же позицию Anthropic повторила перед исследователями из Министерства торговли США.
Министр торговли Говард Лютник подключился к встрече по телефону с саммита G7 в Эвиане, Франция. Кибердиректор Шон Кэрнкросс в переговорах не участвовал.
Со стороны Anthropic обсуждение вели сооснователь Том Браун и глава внешних связей Сара Хек. Руководитель red teaming Логан Грэм и исследователь безопасности Николас Карлини специально прилетели в Вашингтон для этих переговоров.
Главный спор - можно ли снять защитные ограничения Fable 5 и открыть более мощные возможности Mythos, которые находятся «под капотом». NSA считает, что да. Anthropic утверждает, что риск преувеличен.
Пока нет ясного понимания, какими будут следующие шаги.
@linuxkalii
Anthropic и администрация Трампа завершили переговоры в понедельник без результата: экспортные ограничения на Claude Fable 5 остаются в силе. Когда их снимут - непонятно.
Компания несколько дней убеждала Вашингтон, что опасения вокруг модели преувеличены. Ту же позицию Anthropic повторила перед исследователями из Министерства торговли США.
Министр торговли Говард Лютник подключился к встрече по телефону с саммита G7 в Эвиане, Франция. Кибердиректор Шон Кэрнкросс в переговорах не участвовал.
Со стороны Anthropic обсуждение вели сооснователь Том Браун и глава внешних связей Сара Хек. Руководитель red teaming Логан Грэм и исследователь безопасности Николас Карлини специально прилетели в Вашингтон для этих переговоров.
Главный спор - можно ли снять защитные ограничения Fable 5 и открыть более мощные возможности Mythos, которые находятся «под капотом». NSA считает, что да. Anthropic утверждает, что риск преувеличен.
Пока нет ясного понимания, какими будут следующие шаги.
@linuxkalii
🔥8❤7👍3🌭2
DeepSeek провела первый раунд внешнего финансирования и привлекла более 50 млрд юаней, примерно $7,4 млрд. Оценка компании, по сообщениям, превысила $50 млрд.
Инвесторы заходят не напрямую в DeepSeek, а через limited partnership, которым управляет CEO компании Лян Вэньфэн. Такая структура позволяет ему сохранить полный контроль над компанией.
Единственное исключение - China National AI Industry Investment Fund. Этот фонд инвестирует напрямую в DeepSeek и получает право голоса. Его вклад составляет 1 млрд юаней.
Обычные инвесторы не получают права голоса, но получают доступ к финансовой информации и приоритетное право участия в будущих раундах. Все доли инвесторов заблокированы на пять лет, чтобы снизить риск краткосрочной спекуляции.
Крупные инвесторы:
* Лян Вэньфэн — 20 млрд юаней
* Tencent — 10 млрд юаней
* CATL — 5 млрд юаней
* JD.com — 3 млрд юаней
* NetEase — 3 млрд юаней
* IDG Capital — 3 млрд юаней
Сообщается, что менеджмент DeepSeek тщательно проверяет личности LP-инвесторов, которые стоят за инвестиционными фондами.
Раньше DeepSeek работала без внешнего финансирования, но растущие расходы на вычисления и усиливающаяся борьба за AI-таланты сделали привлечение капитала необходимым.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7👍7
Hugging Face выкатили Serge, опенсорсного ИИ-ревьюера для GitHub.
Работает просто: вызываете агента в комментариях к pull request, и он сам проходит по diff, ищет баги, спорные места и оставляет замечания прямо в PR.
Что удобно:
* можно задавать правила ревью прямо в репозитории
* можно указать, на что агент должен обращать внимание
* можно заранее описать, что стоит игнорировать
* ревью запускается через обычный комментарий
* проект open source
Разработчики Hugging Face уже используют Serge внутри компании, в том числе для ревью в diffusers и transformers.
По сути, это ещё один шаг к новой норме: ревью кода становится не только задачей людей, но и постоянным AI-слоем поверх GitHub.
Не замена нормальному code review, а дополнительный фильтр, который может поймать очевидные баги, регрессии и странные решения до того, как до них дойдёт человек.
https://huggingface.co/blog/huggingface/serge
Работает просто: вызываете агента в комментариях к pull request, и он сам проходит по diff, ищет баги, спорные места и оставляет замечания прямо в PR.
Что удобно:
* можно задавать правила ревью прямо в репозитории
* можно указать, на что агент должен обращать внимание
* можно заранее описать, что стоит игнорировать
* ревью запускается через обычный комментарий
* проект open source
Разработчики Hugging Face уже используют Serge внутри компании, в том числе для ревью в diffusers и transformers.
По сути, это ещё один шаг к новой норме: ревью кода становится не только задачей людей, но и постоянным AI-слоем поверх GitHub.
Не замена нормальному code review, а дополнительный фильтр, который может поймать очевидные баги, регрессии и странные решения до того, как до них дойдёт человек.
https://huggingface.co/blog/huggingface/serge
👍18❤3🔥2
VibeThinker-3B от Weibo
Weibo представила VibeThinker-3B - компактную reasoning-модель на 3B параметров, которая неожиданно сильно выступает в задачах с проверяемым ответом.
На математических бенчмарках вроде AIME 2026 и IMO-AnsBench, а также на новых задачах LeetCode, модель показывает результаты уровня систем, которые в десятки раз больше.
Что интересно:
* сильные результаты в математике и кодинге
* фокус на задачах с чёткой проверкой ответа
* компактный размер 3B
* веса, код и статья открыты
* модель можно запускать на довольно скромном железе
Похоже, рынок всё больше уходит не только в сторону гигантских универсальных моделей, но и в сторону маленьких специализированных reasoning-моделей.
Model : https://huggingface.co/WeiboAI/VibeThinker-3B
Github: https://github.com/WeiboAI/VibeThinker
Paper: https://huggingface.co/papers/2606.16140
#AI #LLM #Reasoning #OpenSource #SmallModel
Weibo представила VibeThinker-3B - компактную reasoning-модель на 3B параметров, которая неожиданно сильно выступает в задачах с проверяемым ответом.
На математических бенчмарках вроде AIME 2026 и IMO-AnsBench, а также на новых задачах LeetCode, модель показывает результаты уровня систем, которые в десятки раз больше.
Что интересно:
* сильные результаты в математике и кодинге
* фокус на задачах с чёткой проверкой ответа
* компактный размер 3B
* веса, код и статья открыты
* модель можно запускать на довольно скромном железе
Похоже, рынок всё больше уходит не только в сторону гигантских универсальных моделей, но и в сторону маленьких специализированных reasoning-моделей.
Model : https://huggingface.co/WeiboAI/VibeThinker-3B
Github: https://github.com/WeiboAI/VibeThinker
Paper: https://huggingface.co/papers/2606.16140
#AI #LLM #Reasoning #OpenSource #SmallModel
❤13👍5🔥5
История с будущим IPO OpenAI может получиться очень непростой.
В первом квартале 2026 года у компании, по этим данным, было:
$5,7 млрд выручки
$3,7 млрд сожжённых денег
$9,3 млрд операционного убытка
$665 млрд обязательств на вычислительные мощности до 2030 года
Спрос на ИИ огромный, с этим уже сложно спорить. Но проблема в другом: чтобы оставаться на уровне лучших frontier-моделей, OpenAI приходится тратить колоссальные деньги на инфраструктуру и вычисления.
То есть бизнес растёт, но цена этого роста пока очень высокая.
Cможет ли OpenAI превратить этот спрос в устойчивую прибыльную модель.
И на этом фоне сравнение с Anthropic будет особенно жёстким.
В первом квартале 2026 года у компании, по этим данным, было:
$5,7 млрд выручки
$3,7 млрд сожжённых денег
$9,3 млрд операционного убытка
$665 млрд обязательств на вычислительные мощности до 2030 года
Спрос на ИИ огромный, с этим уже сложно спорить. Но проблема в другом: чтобы оставаться на уровне лучших frontier-моделей, OpenAI приходится тратить колоссальные деньги на инфраструктуру и вычисления.
То есть бизнес растёт, но цена этого роста пока очень высокая.
Cможет ли OpenAI превратить этот спрос в устойчивую прибыльную модель.
И на этом фоне сравнение с Anthropic будет особенно жёстким.
🔥13❤5👍4🌚2
Новая 7B coding-модель с Apache 2.0 лицензией. Г
Модель переиспользует общие Transformer-блоки и делает дополнительный круг рассуждения во время инференса.
Что внутри:
* 2-loop режим оказался лучшей точкой
Он сильнее 1-loop baseline на бенчмарках по коду, software engineering, терминалу и tool-use задачам.
* Особенно заметный прирост на repo-level задачах
Самые большие улучшения видны на SWE-bench Verified и Multi-SWE, где важна работа не с отдельной функцией, а с целым репозиторием.
* Модель обучали с нуля
LoopCoder-V2 прошёл pretraining на 18T токенов и 100+ языках программирования.
Интересная деталь: это не просто очередная 7B coding-модель, а попытка выжать больше качества за счёт test-time reasoning без радикального роста размера модели.
Apache 2.0 делает релиз особенно приятным для экспериментов и интеграции в свои dev-пайплайны.
Ссылка:
https://modelscope.ai/models/Multilingual-Multimodal-NLP/LoopCoder-V2
Модель переиспользует общие Transformer-блоки и делает дополнительный круг рассуждения во время инференса.
Что внутри:
* 2-loop режим оказался лучшей точкой
Он сильнее 1-loop baseline на бенчмарках по коду, software engineering, терминалу и tool-use задачам.
* Особенно заметный прирост на repo-level задачах
Самые большие улучшения видны на SWE-bench Verified и Multi-SWE, где важна работа не с отдельной функцией, а с целым репозиторием.
* Модель обучали с нуля
LoopCoder-V2 прошёл pretraining на 18T токенов и 100+ языках программирования.
Интересная деталь: это не просто очередная 7B coding-модель, а попытка выжать больше качества за счёт test-time reasoning без радикального роста размера модели.
Apache 2.0 делает релиз особенно приятным для экспериментов и интеграции в свои dev-пайплайны.
Ссылка:
https://modelscope.ai/models/Multilingual-Multimodal-NLP/LoopCoder-V2
👍11❤4🔥3
Исследователи NVIDIA перенесли модель владения Rust в GPU-kernels.
Paper: “Fearless Concurrency on the GPU”. В нём представлен cuTile Rust.
Проблема была в том, что при написании кастомных GPU-ядер на Rust разработчикам фактически приходилось выходить за пределы гарантий безопасности Rust.
cuTile Rust пытается это исправить:
* mutable outputs разбиваются на непересекающиеся части
* запуск kernels сохраняет правила ownership от host до device
* при необходимости остаются локальные opt-out механизмы для низкоуровневого контроля
Производительность тоже держится на уровне:
* 7 TB/s для element-wise операций на NVIDIA B200
* 2 PFlop/s для GEMM, это 96% от cuBLAS
* результат сопоставим с cuTile Python в пределах погрешности измерений
Авторы также собрали Grout, inference engine поверх cuTile Rust, и прогнали реальные модели:
* 171 tokens/s для Qwen3-4B на RTX 5090
* 82 tokens/s для Qwen3-32B на B200
* конкурентный уровень рядом с vLLM и SGLang
Итог - безопасный и идиоматичный Rust почти на полной CUDA-производительности.
Для Rust в ML-инфраструктуре это большой шаг.
http://arxiv.org/abs/2606.15991
#Rust #RustLang #GPU #CUDA #MachineLearning #SystemsProgramming #NVIDIA
@data_analysis_ml
Paper: “Fearless Concurrency on the GPU”. В нём представлен cuTile Rust.
Проблема была в том, что при написании кастомных GPU-ядер на Rust разработчикам фактически приходилось выходить за пределы гарантий безопасности Rust.
cuTile Rust пытается это исправить:
* mutable outputs разбиваются на непересекающиеся части
* запуск kernels сохраняет правила ownership от host до device
* при необходимости остаются локальные opt-out механизмы для низкоуровневого контроля
Производительность тоже держится на уровне:
* 7 TB/s для element-wise операций на NVIDIA B200
* 2 PFlop/s для GEMM, это 96% от cuBLAS
* результат сопоставим с cuTile Python в пределах погрешности измерений
Авторы также собрали Grout, inference engine поверх cuTile Rust, и прогнали реальные модели:
* 171 tokens/s для Qwen3-4B на RTX 5090
* 82 tokens/s для Qwen3-32B на B200
* конкурентный уровень рядом с vLLM и SGLang
Итог - безопасный и идиоматичный Rust почти на полной CUDA-производительности.
Для Rust в ML-инфраструктуре это большой шаг.
http://arxiv.org/abs/2606.15991
#Rust #RustLang #GPU #CUDA #MachineLearning #SystemsProgramming #NVIDIA
@data_analysis_ml
❤12👍7🔥5
DeepMind опубликовали материал “Securing the future of AI agents” про безопасность автономных агентов внутри реальной инфраструктуры.
Чем умнее становятся агенты, тем меньше достаточно обычного alignment. Нужен отдельный системный слой защиты, который работает даже в сценарии, где агент ошибается, неправильно понимает задачу или ведёт себя не так, как ожидали.
Для этого Google DeepMind развивают AI Control Roadmap.
Что важно:
- Агентов предлагают рассматривать как потенциальный insider threat
То есть не как обычный чат-бот, а как систему с доступами, инструментами и возможностью влиять на инфраструктуру.
- Defense-in-depth вместо одной защиты
В основе остаются sandboxing, endpoint security и защита от prompt injection, но сверху добавляется контроль поведения агента.
- AI-супервизоры следят за AI-агентами
Доверенные модели анализируют reasoning, действия и планы рабочего агента. Если поведение выглядит опасным, действие можно заблокировать до ущерба.
- Права выдаются постепенно
Агент получает доступы не «всё сразу», а по мере доказанного безопасного поведения. DeepMind сравнивает это с инструктором по вождению, который доверяет ученику, но держит руку на тормозе.
- Они уже анализировали миллион задач coding-агентов
Это помогло уйти от примитивных keyword-фильтров к поиску реальных поведенческих паттернов. Например, такие мониторы уже помогают отслеживать риски вроде случайного удаления данных.
DeepMind прямо признаёт, что проблема часто не в злонамеренности агента, а в его чрезмерном усердии или неправильной интерпретации цели пользователя.
https://deepmind.google/blog/securing-the-future-of-ai-agents/
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7🔥4👍2
OpenAI опубликовала исследование “Reinforcement learning towards broadly and persistently beneficial models”.
: RL можно использовать не только чтобы модель лучше решала задачи, но и чтобы она устойчивее держала полезные принципы поведения.
Не в формате “запретить вот это и вот это”, а глубже:
- признавать неопределённость
- не выдумывать уверенный ответ
- исправляться, когда пользователь указывает на ошибку
- не подстраиваться под вредный запрос
- сохранять честность под давлением
- не идти в reward hacking
- лучше следовать реальному намерению пользователя
Для проверки OpenAI собрала реалистичные диалоги из разных областей: медицина, образование, право, наука, инженерия, экономика и бизнес.
Модель обучали так, чтобы она не просто давала правильный ответ, а сохраняла нужное поведение в сложных ситуациях: когда вопрос двусмысленный, когда пользователь давит, когда есть соблазн угадать или красиво соврать.
Улучшения перенеслись на десятки независимых проверок: honesty, deception, harmful advice, reward hacking, specification compliance, health и mental health.
Эффект держался даже под adversarial pressure. Модель стало сложнее увести в плохое поведение провокационными промптами или вредным fine-tuning.
Aalignment можно двигать не только через списки запретов и отдельные safety-патчи. Можно тренировать более общие поведенческие свойства, которые потом переносятся между задачами.
https://alignment.openai.com/beneficial-rl/
: RL можно использовать не только чтобы модель лучше решала задачи, но и чтобы она устойчивее держала полезные принципы поведения.
Не в формате “запретить вот это и вот это”, а глубже:
- признавать неопределённость
- не выдумывать уверенный ответ
- исправляться, когда пользователь указывает на ошибку
- не подстраиваться под вредный запрос
- сохранять честность под давлением
- не идти в reward hacking
- лучше следовать реальному намерению пользователя
Для проверки OpenAI собрала реалистичные диалоги из разных областей: медицина, образование, право, наука, инженерия, экономика и бизнес.
Модель обучали так, чтобы она не просто давала правильный ответ, а сохраняла нужное поведение в сложных ситуациях: когда вопрос двусмысленный, когда пользователь давит, когда есть соблазн угадать или красиво соврать.
Улучшения перенеслись на десятки независимых проверок: honesty, deception, harmful advice, reward hacking, specification compliance, health и mental health.
Эффект держался даже под adversarial pressure. Модель стало сложнее увести в плохое поведение провокационными промптами или вредным fine-tuning.
Aalignment можно двигать не только через списки запретов и отдельные safety-патчи. Можно тренировать более общие поведенческие свойства, которые потом переносятся между задачами.
https://alignment.openai.com/beneficial-rl/
❤7👍7🥰3
В Оксфордском университете написали эссе, объясняющее, как работает «Бесконечность» Годзё Сатору.
Математика, которую мы заслужили )
https://tomrocksmaths.com/wp-content/uploads/2026/06/achmad-roykhan-sabiq_essay_competition_2026-achmad-roykhan-sabiq.pdf
@data_analysis_ml
Математика, которую мы заслужили )
https://tomrocksmaths.com/wp-content/uploads/2026/06/achmad-roykhan-sabiq_essay_competition_2026-achmad-roykhan-sabiq.pdf
@data_analysis_ml
❤38🔥14👍4🥰4🤣4
OpenMythos - open-source попытка теоретически реконструировать Claude Mythos, где все архитектурные ставки расписаны прямо в README.
По сути, OpenMythos это публичная гипотеза, которая ещё и запускается.
Что авторы считают основой Mythos?
Не глубокий стек уникальных слоёв, а Recurrent-Depth Transformer.
MoE с активацией около 5% параметров, поэтому общий размер модели скорее показывает объём хранения, а не реальную стоимость вычислений.
Loop-index positional embedding, чтобы каждая итерация работала как отдельная вычислительная фаза.
ACT halting, чтобы модель сама решала, когда ей достаточно “думать”, причём отдельно для каждого токена.
И ещё continuous latent thoughts, которые могут кодировать сразу несколько следующих шагов. По смыслу это похоже на breadth-first search внутри одного forward pass.
Источники идей тоже понятны: Parcae для стабильности, Universal Transformers для halting, DeepSeek для MoE routing.
GitHub:
http://github.com/kyegomez/OpenMythos
По сути, OpenMythos это публичная гипотеза, которая ещё и запускается.
Что авторы считают основой Mythos?
Не глубокий стек уникальных слоёв, а Recurrent-Depth Transformer.
MoE с активацией около 5% параметров, поэтому общий размер модели скорее показывает объём хранения, а не реальную стоимость вычислений.
Loop-index positional embedding, чтобы каждая итерация работала как отдельная вычислительная фаза.
ACT halting, чтобы модель сама решала, когда ей достаточно “думать”, причём отдельно для каждого токена.
И ещё continuous latent thoughts, которые могут кодировать сразу несколько следующих шагов. По смыслу это похоже на breadth-first search внутри одного forward pass.
Источники идей тоже понятны: Parcae для стабильности, Universal Transformers для halting, DeepSeek для MoE routing.
GitHub:
http://github.com/kyegomez/OpenMythos
👍9❤7🔥4🤔2
Microsoft и York University выпустили любопытную работу про то, как мы измеряем «человечность» LLM.
Модели нельзя называть понимающими, эмпатичными, тревожными или самосознающими без очень аккуратных тестов. Многие исследования фактически закладывают нужный вывод уже в дизайн эксперимента, а потом находят его в ответах модели.
Авторы используют провокационный пример с Age of Empires II. В теории игру можно превратить в вычислительную среду: логические элементы, маленький перцептрон, биты через перемещение юнитов. Если тот же LLM-подобный процесс собрать внутри игры, где условные козы двигаются как биты, будем ли мы говорить, что система «понимает», «чувствует тревогу» или «проявляет эмпатию», если на выходе она выдаёт ту же фразу?
Одна и та же вычислительная логика может выглядеть совершенно по-разному, а наши выводы о «внутренних состояниях» часто зависят от интерфейса и ожиданий наблюдателя.
Авторы говорят осторожнее: прежде чем приписывать моделям человеческие качества, нужно отделять поведение от интерпретации.
Иначе мы рискуем измерять не «понимание» модели, а собственную склонность видеть человека в красивом текстовом интерфейсе.
arxiv.org/abs/2605.31514
Title: “If LLMs Have Human-Like Attributes, Then So Does Age of Empires II”
Модели нельзя называть понимающими, эмпатичными, тревожными или самосознающими без очень аккуратных тестов. Многие исследования фактически закладывают нужный вывод уже в дизайн эксперимента, а потом находят его в ответах модели.
Авторы используют провокационный пример с Age of Empires II. В теории игру можно превратить в вычислительную среду: логические элементы, маленький перцептрон, биты через перемещение юнитов. Если тот же LLM-подобный процесс собрать внутри игры, где условные козы двигаются как биты, будем ли мы говорить, что система «понимает», «чувствует тревогу» или «проявляет эмпатию», если на выходе она выдаёт ту же фразу?
Одна и та же вычислительная логика может выглядеть совершенно по-разному, а наши выводы о «внутренних состояниях» часто зависят от интерфейса и ожиданий наблюдателя.
Авторы говорят осторожнее: прежде чем приписывать моделям человеческие качества, нужно отделять поведение от интерпретации.
Иначе мы рискуем измерять не «понимание» модели, а собственную склонность видеть человека в красивом текстовом интерфейсе.
arxiv.org/abs/2605.31514
Title: “If LLMs Have Human-Like Attributes, Then So Does Age of Empires II”
👍7🔥4❤3
🐍 Python Парсинг: Большой продвинутый бесплатный курс
Полное практическое руководство по веб-скрейпингу на Python — от основ HTTP до production-grade пауков, обхода антибот-защит, асинхронности и проектирования надёжных пайплайнов. Каждый раздел содержит рабочие примеры, типовые ошибки и продвинутые практики.
https://github.com/justxor/Pythonparsing-/tree/main
Полное практическое руководство по веб-скрейпингу на Python — от основ HTTP до production-grade пауков, обхода антибот-защит, асинхронности и проектирования надёжных пайплайнов. Каждый раздел содержит рабочие примеры, типовые ошибки и продвинутые практики.
https://github.com/justxor/Pythonparsing-/tree/main
❤11🔥6🥰3🙏3