DeepSeek предложили новый способ улучшить мультимодальные модели
Сейчас модели нормально “видят” изображение, но рассуждают о нем через текст. Из-за этого они теряют точную привязку к объектам и начинают путаться в сложных сценах. В статье это называют Reference Gap.
Решение довольно прямое. Вместо чисто текстового ризонинга модель вставляет в процесс координаты. Это точки, чтобы вести путь по изображению, и рамки вокруг объектов. Сначала модель фиксирует, на что смотрит, потом строит рассуждение уже на этих привязках.
Архитектура при этом стандартная. ViT кодирует изображение, дальше все идет в MoE LLM. Новое именно в том, что визуальные примитивы становятся частью chain-of-thought, а не просто выходом модели.
Лучше всего это работает в задачах, где важна структура. Подсчет объектов, пространственные сравнения, лабиринты, трассировка линий.
Интересно, что DeepSeek довольно быстро удалил статью без объяснения причин. Скорее всего случился преждевременный релиз, а может и финальные результаты будут изменены. В любом случае (зеркало):
https://github.com/ailuntx/Thinking-with-Visual-Primitives/blob/main/Thinking_with_Visual_Primitives.pdf
Сейчас модели нормально “видят” изображение, но рассуждают о нем через текст. Из-за этого они теряют точную привязку к объектам и начинают путаться в сложных сценах. В статье это называют Reference Gap.
Решение довольно прямое. Вместо чисто текстового ризонинга модель вставляет в процесс координаты. Это точки, чтобы вести путь по изображению, и рамки вокруг объектов. Сначала модель фиксирует, на что смотрит, потом строит рассуждение уже на этих привязках.
Архитектура при этом стандартная. ViT кодирует изображение, дальше все идет в MoE LLM. Новое именно в том, что визуальные примитивы становятся частью chain-of-thought, а не просто выходом модели.
Лучше всего это работает в задачах, где важна структура. Подсчет объектов, пространственные сравнения, лабиринты, трассировка линий.
Интересно, что DeepSeek довольно быстро удалил статью без объяснения причин. Скорее всего случился преждевременный релиз, а может и финальные результаты будут изменены. В любом случае (зеркало):
https://github.com/ailuntx/Thinking-with-Visual-Primitives/blob/main/Thinking_with_Visual_Primitives.pdf
❤109👍39😁22🔥10🤔1🤯1
Data Secrets
OpenAI изобрели способ отвоевать у Anthropic хотя бы часть enterprise рынка Сейчас Anthropic максимально быстро отъедает долю у OpenAI. Пишут, что они забирают более 70% бюджетов компаний, которые впервые закупают AI‑инструменты. Поэтому OpenAI пошли на рискованный…
OpenAI и Anthropic одновременно запустили крупные совместные предприятия (joint ventures) для привлечения enterprise клиентов
Примерно в конце марта мы писали о том, что и OpenAI, и Anthropic ведут переговоры с PE фондами по созданию так называемых joint ventures. В общем, вели они, вели, и буквально в один день открыли каждый свой JV-проект.
Суть в обоих случаях в том, что фонд вкладывается в организованное совместное предприятие, и в его рамках стартап разворачивает свое решение в портфельных компаниях фонда.
При этом фонд получает доходность и долю в юрлице (плюс приоритетный доступ к новым разработкам стартапа). А стартап – новых корпоративных клиентов и инвестиции.
Различие между подходами OpenAI и Anthropic – только в условиях для инвесторов (ну и в самих инвесторах).
OpenAI, так как им нужно очень активно осваивать корпоративный рынок и буквально зубами его вырывать у Anthropic, предлагают более жирные условия: аж 17.5% гарантированной минимальной доходности. Они планируют получить 4 миллиарда от 19 инвесторов при оценке JV в 10 миллиардов.
Осталось им с Anthropic еще об IPO объявить в один день. Кстати, ради IPO вся эта JV история и затевается, в обоих случаях.
Примерно в конце марта мы писали о том, что и OpenAI, и Anthropic ведут переговоры с PE фондами по созданию так называемых joint ventures. В общем, вели они, вели, и буквально в один день открыли каждый свой JV-проект.
Суть в обоих случаях в том, что фонд вкладывается в организованное совместное предприятие, и в его рамках стартап разворачивает свое решение в портфельных компаниях фонда.
При этом фонд получает доходность и долю в юрлице (плюс приоритетный доступ к новым разработкам стартапа). А стартап – новых корпоративных клиентов и инвестиции.
Различие между подходами OpenAI и Anthropic – только в условиях для инвесторов (ну и в самих инвесторах).
OpenAI, так как им нужно очень активно осваивать корпоративный рынок и буквально зубами его вырывать у Anthropic, предлагают более жирные условия: аж 17.5% гарантированной минимальной доходности. Они планируют получить 4 миллиарда от 19 инвесторов при оценке JV в 10 миллиардов.
Осталось им с Anthropic еще об IPO объявить в один день. Кстати, ради IPO вся эта JV история и затевается, в обоих случаях.
2😁80 35👍14❤6🔥3 1
Сооснователь Anthropic Джек Кларк утверждает, что само-развивающийся ИИ с 60% вероятностью появится уже к концу 2028 года
Другими словами, по его мнению, ИИ системы совсем скоро смогут рекурсивно создавать и улучшать самих себя.
Статья: importai.substack.com/p/import-ai-455-automating-ai-research
Это не просто догадка: его оценка основана в большей степени на анализе прогресса на бенчмарках.
Например, на CORE-bench, где нужно имплементировать научные статьи (а из подобной работы и рождается основной прогресс в AI рисерче), агенты уже выбивают >95%. Или MLE-bench, где нужно решать ML-задачи с Kaggle и обучать модели для конкретных задач, – решен на 65%.
Параллельно растет продолжительность задач, которые модели могут выполнять автономно + количество индустриальных проектов, где ИИ уже неплохо выполняет какие-то крупные задачи AI-инжиниринга, типа проектирования чипов.
Учитывая темпы развития, совсем скоро есть шанс перейти к тому, что автор называет «end-to-end автоматизацией». ИИ перестанет быть инструментом для отдельных задач, и будет сам ставить цели, дизайнить эксперименты и действовать. Короче говоря, возьмет на себя R&D полностью.
Другими словами, по его мнению, ИИ системы совсем скоро смогут рекурсивно создавать и улучшать самих себя.
Статья: importai.substack.com/p/import-ai-455-automating-ai-research
Это не просто догадка: его оценка основана в большей степени на анализе прогресса на бенчмарках.
Например, на CORE-bench, где нужно имплементировать научные статьи (а из подобной работы и рождается основной прогресс в AI рисерче), агенты уже выбивают >95%. Или MLE-bench, где нужно решать ML-задачи с Kaggle и обучать модели для конкретных задач, – решен на 65%.
Параллельно растет продолжительность задач, которые модели могут выполнять автономно + количество индустриальных проектов, где ИИ уже неплохо выполняет какие-то крупные задачи AI-инжиниринга, типа проектирования чипов.
Учитывая темпы развития, совсем скоро есть шанс перейти к тому, что автор называет «end-to-end автоматизацией». ИИ перестанет быть инструментом для отдельных задач, и будет сам ставить цели, дизайнить эксперименты и действовать. Короче говоря, возьмет на себя R&D полностью.
Мне трудно осознать масштаб происходящего. Я делюсь этим, потому что, трезво проанализировав данные, пришел к выводу: то, что десятилетиями казалось научной фантастикой, становится реальностью. Вероятно, мы на пороге фундаментальных перемен, к которым общество может быть попросту не готово.
2❤104👍40😁27🤔25 13🔥11🗿9🦄4👌2
Дмитрий Ушанов - новый руководитель AI-центра Т-Банка. В команде он уже более 2,5 лет: пришёл на позицию Head of ML и отвечал за сквозное внедрение машинного обучения в продукты компании.
За это время Дмитрий вместе с командой дообучил и запустил семейство open-source LLM моделей, адаптированных для русского языка, улучшил ML-скоринг в системе антифрода и усилил рекомендации и поиск в разделе «Шопинг».
Теперь команда сосредоточится на создании общей AI-инфраструктуры и построении внутренней LLM-платформы — чтобы любой сотрудник Компании мог создавать новые инструменты на единой технологической базе.
Вторая ключевая задача — разработка внешних AI-продуктов, включая AI-ассистентов, которые будут работать и за пределами экосистемы компании, и предназначаться не только её клиентам.
В компании считают, что ИИ — это не отдельная функция, а способ работать. Желаем Дмитрию успехов на новой позиции.
За это время Дмитрий вместе с командой дообучил и запустил семейство open-source LLM моделей, адаптированных для русского языка, улучшил ML-скоринг в системе антифрода и усилил рекомендации и поиск в разделе «Шопинг».
Теперь команда сосредоточится на создании общей AI-инфраструктуры и построении внутренней LLM-платформы — чтобы любой сотрудник Компании мог создавать новые инструменты на единой технологической базе.
Вторая ключевая задача — разработка внешних AI-продуктов, включая AI-ассистентов, которые будут работать и за пределами экосистемы компании, и предназначаться не только её клиентам.
В компании считают, что ИИ — это не отдельная функция, а способ работать. Желаем Дмитрию успехов на новой позиции.
2❤113🗿68👍66😁25🤨22🔥6🤔6 2 2🤯1
Маск пообещал сделать Альтмана и Брокмана «самыми ненавидимыми людьми в Америке»
Так он ответил Брокману после того как тот накануне суда предложил ему взаимный отказ от претензий:
Это произошло в личной переписке за несколько дней до суда. А теперь OpenAI приобщают эту переписку к делу в федеральном суде. Их юристы используют ее как доказательство того, что преследования Маска сводятся к личной обиде на Альтмана и Брокмана, и он организует масштабную публичную компанию против них, а не просто суд.
Так он ответил Брокману после того как тот накануне суда предложил ему взаимный отказ от претензий:
К концу этой недели вы с Сэмом станете самыми ненавидимыми людьми в Америке. Если вы будете настаивать, так и случится.
Это произошло в личной переписке за несколько дней до суда. А теперь OpenAI приобщают эту переписку к делу в федеральном суде. Их юристы используют ее как доказательство того, что преследования Маска сводятся к личной обиде на Альтмана и Брокмана, и он организует масштабную публичную компанию против них, а не просто суд.
This media is not supported in your browser
VIEW IN TELEGRAM
Wildberries & Russ проведет Inside AI Meetup 20 мая в Москве и онлайн
Будут реальные кейсы:
— Высоконагруженная модерация с векторным поиском
— AIOps-подходы к управлению ML-сервисами
— Практики построения RAG-систем
— Тонкости реранкинга
— Реальные этапы запуска LLM-продуктов и еще многое другое.
Среди спикеров эксперты Wildberries & Russ, MWS, Avito, Сбера, Альфа-Банка, red_mad_robot.
Советуем ивент для senior ML/AI инженеров, MLE, DS, инженеров платформ и для всех, кто строит или масштабирует AI-системы в продакшене.
Регистрация и прочие подробности — по ссылке. Приглашайте коллег.
Будут реальные кейсы:
— Высоконагруженная модерация с векторным поиском
— AIOps-подходы к управлению ML-сервисами
— Практики построения RAG-систем
— Тонкости реранкинга
— Реальные этапы запуска LLM-продуктов и еще многое другое.
Среди спикеров эксперты Wildberries & Russ, MWS, Avito, Сбера, Альфа-Банка, red_mad_robot.
Советуем ивент для senior ML/AI инженеров, MLE, DS, инженеров платформ и для всех, кто строит или масштабирует AI-системы в продакшене.
Регистрация и прочие подробности — по ссылке. Приглашайте коллег.
🗿54❤10🤔10😁9👍5🤯4🔥3🤨2👨💻1
Создатели SWE-bench представили новый бенчмарк по программированию, на котором абсолютно все современные модели выбивают ровно 0%
Он называется ProgramBench, и суть его проста: агент получает только скомпилированный исполняемый бинарник и документацию, и его задача – спроектировать код, который при сборке будет полностью соответствовать поведению исходного файла (без доступа к Интернету).
При этом агент должен самостоятельно определиться с архитектурой и выбрать структуру проекта. Собственно, здесь сложности и начинаются: LLM хорошо умеют писать плоский код в одном файле, а вот с многофайловыми проектами, где нужна низкоуровневая логика, работают плохо.
Итог: даже результат Claude Opus 4.7 и GPT-5.4 – это полный ноль.
Кажется, у нас новый претендент на звание самого интересного бенчмарка.
https://programbench.com/
Он называется ProgramBench, и суть его проста: агент получает только скомпилированный исполняемый бинарник и документацию, и его задача – спроектировать код, который при сборке будет полностью соответствовать поведению исходного файла (без доступа к Интернету).
При этом агент должен самостоятельно определиться с архитектурой и выбрать структуру проекта. Собственно, здесь сложности и начинаются: LLM хорошо умеют писать плоский код в одном файле, а вот с многофайловыми проектами, где нужна низкоуровневая логика, работают плохо.
Итог: даже результат Claude Opus 4.7 и GPT-5.4 – это полный ноль.
Кажется, у нас новый претендент на звание самого интересного бенчмарка.
https://programbench.com/
🔥353😁112👍54❤28🗿13🕊2🤝1
This media is not supported in your browser
VIEW IN TELEGRAM
Калистеника от Boston Dynamics
Новое вирусное видео робота Atlas они выложили с подписью:
Кстати, вполне возможно, что экземпляр на видео уже работает но основе Gemini Robotics от Google. Компании заключили партнерство в начале года, и теперь совместно работают над новым поколением гуманоидов.
Новое вирусное видео робота Atlas они выложили с подписью:
Балансировать коммерческие цели и исследования в робототехнике непросто, но с Atlas мы заставляем это работать.
Кстати, вполне возможно, что экземпляр на видео уже работает но основе Gemini Robotics от Google. Компании заключили партнерство в начале года, и теперь совместно работают над новым поколением гуманоидов.
🔥164❤40🤯23 10👍7😁5👏4
Стартап Subquadratic анонсировал языковую модель SubQ с контекстным окном 12М токенов
Это не все: она также выдает невероятную скорость в 150 токенов/сек, обгоняет Claude Opus 4.6 на SWE-bench, и при этом ее стоимость составляет 5% от стоимости Opus (прочитайте это снова).
Секрет SubQ, как говорят создатели, в архитектуре. А точнее, в использовании нового вида механизма внимания – sub-quadratic sparse-attention. Идея в том, чтобы вычислять внимание только по разреженному набору наиболее важных связей, а не по всей матрице целиком.
Метод позволяет достичь линейной (!!!) вычислительной сложности относительно длины контекста и на длинных контекстных окнах достигает ускорения в 52 раза относительно FlashAttention.
Звучит как полный прорыв в экономике инференса. Но, как обычно, есть нюанс: пока все эти громкие заявления живут только на словах.
Проект находится в закрытой бете, техрепорта нет, доступов нет. Пока выложили только небольшой блог и разбор их механизма внимания.
Посмотрим, что из этого выйдет
Это не все: она также выдает невероятную скорость в 150 токенов/сек, обгоняет Claude Opus 4.6 на SWE-bench, и при этом ее стоимость составляет 5% от стоимости Opus (прочитайте это снова).
Секрет SubQ, как говорят создатели, в архитектуре. А точнее, в использовании нового вида механизма внимания – sub-quadratic sparse-attention. Идея в том, чтобы вычислять внимание только по разреженному набору наиболее важных связей, а не по всей матрице целиком.
Метод позволяет достичь линейной (!!!) вычислительной сложности относительно длины контекста и на длинных контекстных окнах достигает ускорения в 52 раза относительно FlashAttention.
Звучит как полный прорыв в экономике инференса. Но, как обычно, есть нюанс: пока все эти громкие заявления живут только на словах.
Проект находится в закрытой бете, техрепорта нет, доступов нет. Пока выложили только небольшой блог и разбор их механизма внимания.
Посмотрим, что из этого выйдет
😁157 82🤯61❤24🤔14⚡12👍5🤩3👨💻1
Nvidia и один из крупнейших застройщиков США PulteGroup в сотрудничестве со стартапом Span будут устанавливать мини-датацентры на стены новых домов
Чего только не придумаешь, когда нужен компьют для ИИ. Кто-то предлагает строить датацентры в космосе, а вот в стартапе Span придумали концепцию распределенного дата‑центра, расбросанного по тысячам жилых домов.
В партнерстве с Nvidia и PulteGroup они прямо сейчас тестируют XFRA – небольшие вычислительные узлы, которые размещаются снаружи домов и состоят из ~ 16 GPU Blackwell. Умный электрощит Span следит, сколько энергии потребляет дом, и остаточную свободную мощность отдает XFRA на ИИ-нагрузки.
При этом владелец будет получать огромную скидку на тарифы электричества (и, вероятно, платить даже меньше, чем без XFRA) + дополнительный доход.
Фишка в том, что установить много таких ящичков – быстрее и дешевле, чем строить огромный датацентр (по расчетам Span, примерно в 5-6 раз). Так что идея неплохая, не считая рисков, стоимости обслуживания и, конечно, необходимости сложной инфры под все это дело.
К 2027 году Span с этим проектом планирует выйти на гигаваттный масштаб.
Чего только не придумаешь, когда нужен компьют для ИИ. Кто-то предлагает строить датацентры в космосе, а вот в стартапе Span придумали концепцию распределенного дата‑центра, расбросанного по тысячам жилых домов.
В партнерстве с Nvidia и PulteGroup они прямо сейчас тестируют XFRA – небольшие вычислительные узлы, которые размещаются снаружи домов и состоят из ~ 16 GPU Blackwell. Умный электрощит Span следит, сколько энергии потребляет дом, и остаточную свободную мощность отдает XFRA на ИИ-нагрузки.
При этом владелец будет получать огромную скидку на тарифы электричества (и, вероятно, платить даже меньше, чем без XFRA) + дополнительный доход.
Фишка в том, что установить много таких ящичков – быстрее и дешевле, чем строить огромный датацентр (по расчетам Span, примерно в 5-6 раз). Так что идея неплохая, не считая рисков, стоимости обслуживания и, конечно, необходимости сложной инфры под все это дело.
К 2027 году Span с этим проектом планирует выйти на гигаваттный масштаб.
👍154👏36🔥23😁20❤11🤯10😎7 5 3
DeepSeek ведет переговоры о первом раунде внешнего финансирования
Компания планирует привлечь $3–4 млрд при оценке до $50 млрд, как сообщает Reuters.
Правда, большинство денег, скорее всего, все равно вложит государство. А точнее, Китайский национальный фонд искусственного интеллекта. Кроме того, принять участие в раунде может Tencent Holdings.
Напоминаем, что DeepSeek ранее отказывался от внешних инвестиций, но теперь, судя по всему, меняет стратегию.
Компания планирует привлечь $3–4 млрд при оценке до $50 млрд, как сообщает Reuters.
Правда, большинство денег, скорее всего, все равно вложит государство. А точнее, Китайский национальный фонд искусственного интеллекта. Кроме того, принять участие в раунде может Tencent Holdings.
Напоминаем, что DeepSeek ранее отказывался от внешних инвестиций, но теперь, судя по всему, меняет стратегию.
❤85👍33🔥18😁9
Gemma-4 теперь умеет предсказывать токены не по одному, а партиями
Google только что выпустили Multi-Token Prediction (MTP) драфтеры. Это штука, которая позволяет Gemma-4 предсказывать сразу несколько токенов вперед.
Обычно LLM генерируют строго по одному токену за шаг, и это одна из главных проблем архитектуры трансформеров, потому что работает медленно.
Что сделали Google:
– Они взяли еще одну модель, крошечную, обучили ее на задаче multi-token prediction, и поставили на роль drafter. Называется так, потому что эта модель пишет черновики, то есть пытается угадать действия большой модели на несколько токенов вперед.
– Батч черновых токенов проверяет основная модель. Фишка в том, что на проверку нужен всего один проход (вместо нескольких, если бы модель генерировала все эти токены сама).
– Если в черновой последовательности попадается ошибка, то: (1) этот токен заменяется на тот, который большая модель считает верным; (2) проверка прерывается и дальше драфтер предсказывает новую партию с этого места.
Например, мы сгенерировали 5 черновых токенов. Три перых совпало, четвертый заменили. Всего сэкономили три прохода большой модели.
Итог: MTP ускоряет генерацию примерно в 3 раза вообще без потерь в качестве. Все драфтеры выложили, так что уже можно попробовать погенерить что-нибудь в таком режиме.
blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/
Google только что выпустили Multi-Token Prediction (MTP) драфтеры. Это штука, которая позволяет Gemma-4 предсказывать сразу несколько токенов вперед.
Обычно LLM генерируют строго по одному токену за шаг, и это одна из главных проблем архитектуры трансформеров, потому что работает медленно.
Что сделали Google:
– Они взяли еще одну модель, крошечную, обучили ее на задаче multi-token prediction, и поставили на роль drafter. Называется так, потому что эта модель пишет черновики, то есть пытается угадать действия большой модели на несколько токенов вперед.
– Батч черновых токенов проверяет основная модель. Фишка в том, что на проверку нужен всего один проход (вместо нескольких, если бы модель генерировала все эти токены сама).
– Если в черновой последовательности попадается ошибка, то: (1) этот токен заменяется на тот, который большая модель считает верным; (2) проверка прерывается и дальше драфтер предсказывает новую партию с этого места.
Например, мы сгенерировали 5 черновых токенов. Три перых совпало, четвертый заменили. Всего сэкономили три прохода большой модели.
Итог: MTP ускоряет генерацию примерно в 3 раза вообще без потерь в качестве. Все драфтеры выложили, так что уже можно попробовать погенерить что-нибудь в таком режиме.
blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/
5👍218🔥85❤37🤔8🤯8😁3😢1