Media is too big
VIEW IN TELEGRAM
Helix - локальный AI для роботов
Компания Figure объявила о разрыве сотрудничества с OpenAI, заявив о значительном технологическом прорыве. Все действия роботов на представленных видео выполняются локальной моделью, работающей непосредственно на устройстве. Helix управляет верхней частью корпуса, позволяет координировать действия двух роботов и манипулировать небольшими объектами.
Система состоит из двух компонентов:
System 2 - отвечает за планирование, основана на неназванной 7B VLM модели с открытым исходным кодом, работает на частоте 7–9 Гц.
System 1 - исполняет планы, представляет собой encoder-decoder с 80 млн параметров, функционирует на частоте 200 Гц, обеспечивая высокую точность движений и быструю реакцию.
Обе системы работают на отдельных GPU для предотвращения взаимного влияния и повышения производительности.
Модель была обучена на 500 часах данных, что делает её разработку доступной для многих стартапов. В настоящее время Helix находится на раннем этапе развития, однако ожидается её быстрое масштабирование.
Компания Figure объявила о разрыве сотрудничества с OpenAI, заявив о значительном технологическом прорыве. Все действия роботов на представленных видео выполняются локальной моделью, работающей непосредственно на устройстве. Helix управляет верхней частью корпуса, позволяет координировать действия двух роботов и манипулировать небольшими объектами.
Система состоит из двух компонентов:
System 2 - отвечает за планирование, основана на неназванной 7B VLM модели с открытым исходным кодом, работает на частоте 7–9 Гц.
System 1 - исполняет планы, представляет собой encoder-decoder с 80 млн параметров, функционирует на частоте 200 Гц, обеспечивая высокую точность движений и быструю реакцию.
Обе системы работают на отдельных GPU для предотвращения взаимного влияния и повышения производительности.
Модель была обучена на 500 часах данных, что делает её разработку доступной для многих стартапов. В настоящее время Helix находится на раннем этапе развития, однако ожидается её быстрое масштабирование.
🔥14❤8👍6
Media is too big
VIEW IN TELEGRAM
Студия КаКа ( что бы это значило на японском ) 🤫
полностью сгенерировало в Flux и Midjourney аниме - премьера в 2025 году.
Сюжет «Близнецов Хинахима»: две девушки хотят стать популярными в тиктоке, пока не замечают таинственные странности в своих роликах.
полностью сгенерировало в Flux и Midjourney аниме - премьера в 2025 году.
Сюжет «Близнецов Хинахима»: две девушки хотят стать популярными в тиктоке, пока не замечают таинственные странности в своих роликах.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔10❤4😁4🤩2👍1
Список ИИ -сервисов, работающих на DeepSeek.
В нем есть все, что нужно: начиная от агентов для кодинга и заканчивая Discord-ботаи.
Нажимаем сюда, чтобы сохранить список.
В нем есть все, что нужно: начиная от агентов для кодинга и заканчивая Discord-ботаи.
Нажимаем сюда, чтобы сохранить список.
❤13👍1
The Drive AI - ваш второй мозг
Организуй файлы, задавай вопросы и получай инсайты с помощью AI.
Умное хранилище для документов, чатов и совместной работы!
Храни, читай и пиши с AI
Контекстные чат-каналы для команд
Доступ к 10+ AI моделям (GPT-4, Deepseek, Claude, Gemini и др.)
Превращает ваши документы в базу знаний
thedrive.ai - попробуй бесплатно
Организуй файлы, задавай вопросы и получай инсайты с помощью AI.
Умное хранилище для документов, чатов и совместной работы!
Храни, читай и пиши с AI
Контекстные чат-каналы для команд
Доступ к 10+ AI моделям (GPT-4, Deepseek, Claude, Gemini и др.)
Превращает ваши документы в базу знаний
thedrive.ai - попробуй бесплатно
🔥12👍6👎1
ИИ-энтузиаст за 2 часа создал мобильную игру с помощью нейронки Илона Маска. Grok 3 по команде "Create a basic 2D vertical jump game using HTML/CSS. The characters and platforms should be just shapes (will add assets later). Code everything in one file" написал готовый код, сгенерировал графику, и получился простенький платформер.
❤14👍7🔥3
This media is not supported in your browser
VIEW IN TELEGRAM
AirBrush - убрать вотермарки на видео
Есть нюанс: все вотермарки стираются, но одна добавляется - самого сервиса в самом низу видео. Можно легко исправить совмещением с фрагментом оригинала на любом видеоредакторе🤫
Есть нюанс: все вотермарки стираются, но одна добавляется - самого сервиса в самом низу видео. Можно легко исправить совмещением с фрагментом оригинала на любом видеоредакторе
Please open Telegram to view this post
VIEW IN TELEGRAM
👍17❤7😁5🔥1
5 фреймворков ИИ-агентов, выпущенных в 2025 году, о которых вы не знали.
Нет, это не LangChain, CrewAI или AutoGen.
Postman AI Agent Builder
Создавайте агентов ИИ и подключайте их к более чем 100 000 API с помощью Postman AI Agent Builder. Он оснащён визуальным интерфейсом с функцией перетаскивания, что позволяет создавать рабочие процессы агентов без написания кода.
Orchestra
Orchestra ставит задачи в центр ИИ-воркфлоу, а не схемы диалогов. Построенная на модульной архитектуре, платформа позволяет создавать пайплайны для LLM и команды из нескольких агентов, оставаясь лёгкой и минимизируя количество зависимостей.
Agno Framework
Agno Framework позволяет создавать мультимодальные ИИ-агенты на Python. Он обеспечивает создание агентов в 5000 раз быстрее и с использованием в 50 раз меньшего объёма памяти по сравнению с LangGraph, при этом включает более 100 предустановленных инструментов.
Eliza AI Agent Framework
Eliza AI Agent Framework позволяет создавать автономных агентов с постоянными личностными характеристиками для платформ Discord, Twitter и Telegram. Фреймворк поддерживает работу на нескольких платформах, имеет встроенную систему памяти RAG и возможности обработки документов.
Lecca
Lecca позволяет создавать ИИ-агентов без необходимости писать код. Его визуальный конструктор рабочих процессов соединяет LLM с более чем 40 инструментами и сервисами (в том числе Slack, Gmail и Google Calendar) и работает со всеми основными поставщиками ИИ.
Нет, это не LangChain, CrewAI или AutoGen.
Postman AI Agent Builder
Создавайте агентов ИИ и подключайте их к более чем 100 000 API с помощью Postman AI Agent Builder. Он оснащён визуальным интерфейсом с функцией перетаскивания, что позволяет создавать рабочие процессы агентов без написания кода.
Orchestra
Orchestra ставит задачи в центр ИИ-воркфлоу, а не схемы диалогов. Построенная на модульной архитектуре, платформа позволяет создавать пайплайны для LLM и команды из нескольких агентов, оставаясь лёгкой и минимизируя количество зависимостей.
Agno Framework
Agno Framework позволяет создавать мультимодальные ИИ-агенты на Python. Он обеспечивает создание агентов в 5000 раз быстрее и с использованием в 50 раз меньшего объёма памяти по сравнению с LangGraph, при этом включает более 100 предустановленных инструментов.
Eliza AI Agent Framework
Eliza AI Agent Framework позволяет создавать автономных агентов с постоянными личностными характеристиками для платформ Discord, Twitter и Telegram. Фреймворк поддерживает работу на нескольких платформах, имеет встроенную систему памяти RAG и возможности обработки документов.
Lecca
Lecca позволяет создавать ИИ-агентов без необходимости писать код. Его визуальный конструктор рабочих процессов соединяет LLM с более чем 40 инструментами и сервисами (в том числе Slack, Gmail и Google Calendar) и работает со всеми основными поставщиками ИИ.
❤20🔥1🎉1
This media is not supported in your browser
VIEW IN TELEGRAM
Это удобный сервис, который за секунды генерирует отчёты, по качеству сопоставимо с материалами Википедии. Автоматически вставляет точные ссылки на источники.
Полезы масса, не только исследователям и журналистам, но и всем, кто хочет быстро получить качественный и проверенный отчёт по интересующей теме.
Storm - пробуйте
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥22👍15💩5❤4👏2
Forwarded from Kolosim
Ссылки на порно — не будет 😏
Вместо этого я покажу свой SaaS сервис и изнанку как AI-агенты будут взаимодействовать с сайтами и приложениями. И тут Google на днях выкатил штуку под названием WebMCP — по сути, они предлагают стандарт, чтобы любой сайт мог "объяснить" AI-агенту, что на нём можно делать. Забронировать рейс, оформить заказ, заполнить форму — не через слепое тыканье по кнопкам, а через структурированный диалог между агентом и сайтом.
🔗 Ссылка тык: https://developer.chrome.com/blog/webmcp-epp
🤖 Почему это важно
Сейчас, когда агент заходит на сайт, он по сути "смотрит" на него как слепой — парсит HTML, пытается понять где кнопка, где поле ввода, что куда нажать. Это ненадёжно и медленно. Google предлагает: давайте сайты сами будут говорить агентам "вот мои инструменты, вот что я умею, вот как со мной работать". Два подхода — простой через HTML-формы и сложный через JavaScript для динамических штук.
По сути это следующий шаг к тому, что интернет перестаёт быть только для людей — он становится средой, где агенты работают наравне с нами. И это прямо связано с трендом на симуляцию поведения, о котором я писал раньше — агентам нужна среда, в которой они могут действовать.
✊ Забавное совпадение
Я в своём проекте автоматизации для маркетплейсов уже построил ровно такой слой — ещё до того, как Google это анонсировал. Суть простая: каждый элемент интерфейса (кнопка, карточка, поле) получает понятный идентификатор. Агент сканирует страницу и видит не кашу из тегов, а структурированную карту — "вот список задач, вот кнопка создания, вот форма". Дальше он планирует шаги, выполняет их и даже восстанавливается, если что-то пошло не так.
Самое крутое — пользователь видит, как агент работает. Буквально курсор двигается по экрану, кликает, заполняет поля. Как будто рядом сидит человек и делает за тебя рутину.
🤤 Что это значит для рынка
Я думаю, что через пару лет каждый серьёзный веб-сервис будет обязан поддерживать что-то вроде WebMCP. Потому что если твой сайт не умеет "разговаривать" с агентами — ты проигрываешь. Пользователь просто скажет своему агенту "забронируй мне билет" — и агент пойдёт на тот сервис, который умеет с ним работать, а не на тот, где надо вручную ковыряться.
Это как с мобильной адаптацией 10 лет назад — сначала казалось необязательным, а потом без неё стало невозможно. Так же будет и с agent-ready интерфейсами.
А мы, получается, уже в этом будущем живём 🦀
Вместо этого я покажу свой SaaS сервис и изнанку как AI-агенты будут взаимодействовать с сайтами и приложениями. И тут Google на днях выкатил штуку под названием WebMCP — по сути, они предлагают стандарт, чтобы любой сайт мог "объяснить" AI-агенту, что на нём можно делать. Забронировать рейс, оформить заказ, заполнить форму — не через слепое тыканье по кнопкам, а через структурированный диалог между агентом и сайтом.
🔗 Ссылка тык: https://developer.chrome.com/blog/webmcp-epp
🤖 Почему это важно
Сейчас, когда агент заходит на сайт, он по сути "смотрит" на него как слепой — парсит HTML, пытается понять где кнопка, где поле ввода, что куда нажать. Это ненадёжно и медленно. Google предлагает: давайте сайты сами будут говорить агентам "вот мои инструменты, вот что я умею, вот как со мной работать". Два подхода — простой через HTML-формы и сложный через JavaScript для динамических штук.
По сути это следующий шаг к тому, что интернет перестаёт быть только для людей — он становится средой, где агенты работают наравне с нами. И это прямо связано с трендом на симуляцию поведения, о котором я писал раньше — агентам нужна среда, в которой они могут действовать.
✊ Забавное совпадение
Я в своём проекте автоматизации для маркетплейсов уже построил ровно такой слой — ещё до того, как Google это анонсировал. Суть простая: каждый элемент интерфейса (кнопка, карточка, поле) получает понятный идентификатор. Агент сканирует страницу и видит не кашу из тегов, а структурированную карту — "вот список задач, вот кнопка создания, вот форма". Дальше он планирует шаги, выполняет их и даже восстанавливается, если что-то пошло не так.
Самое крутое — пользователь видит, как агент работает. Буквально курсор двигается по экрану, кликает, заполняет поля. Как будто рядом сидит человек и делает за тебя рутину.
🤤 Что это значит для рынка
Я думаю, что через пару лет каждый серьёзный веб-сервис будет обязан поддерживать что-то вроде WebMCP. Потому что если твой сайт не умеет "разговаривать" с агентами — ты проигрываешь. Пользователь просто скажет своему агенту "забронируй мне билет" — и агент пойдёт на тот сервис, который умеет с ним работать, а не на тот, где надо вручную ковыряться.
Это как с мобильной адаптацией 10 лет назад — сначала казалось необязательным, а потом без неё стало невозможно. Так же будет и с agent-ready интерфейсами.
А мы, получается, уже в этом будущем живём 🦀
👍19👎5❤4🔥1😁1
Forwarded from Kolosim
Семантический поиск в браузере.html
5.8 MB
Кто то опять положил интернет, а у меня поиск работает. Локальный поиск по смыслу в одном HTML-файле
Последние недели копаюсь в теме сжатия эмбеддингов. Задача простая: можно ли сделать поиск по смыслу, который работает прямо в браузере — без сервера, без API, без бэкенда вообще?
Короткий ответ: можно!
Длинный: взял каталог товаров (~1000 позиций), прогнал через модель эмбеддингов, сжал каждый вектор с 3 КБ до 64 байт — это в 48 раз. Картинки ужал до миниатюр. Всё запаковал в один HTML-файл на 6 МБ.
Открываешь файл в браузере, пишешь «плёнка антишпион» — получаешь плёнки антишпион. Не по совпадению слов в названии, а по смыслу. Работает оффлайн, с флешки, хоть на самолёте.
Что на тестах:
recall@10 ~74% (из 10 «правильных» товаров находит 7-8)
весь индекс на 1000 товаров — 64 КБ
масштаб: на 100K товаров — ~6 МБ, на миллион — 61 МБ
лимит памяти браузера позволяет теоретически до 25M документов
Для сравнения — что есть сейчас на рынке:
Voy (WASM brute-force) — float32, без сжатия. На 50-100K товаров упирается в память. На миллион — не влезет.
hnswlib-wasm — тоже float32 + граф HNSW сверху. Быстрее ищет, но по памяти ещё тяжелее: ~4 КБ на документ.
Transformers.js — может запустить модель эмбеддинга в браузере, но поиск по индексу не решает — это только генерация векторов.
Все три варианта работают с полными векторами. При 768 измерениях это 3 КБ на документ. 100K документов = 300 МБ, миллион = 3 ГБ — браузер ляжет. Со сжатием до 64 байт тот же миллион — 61 МБ, 25 миллионов — в лимит 2 ГБ.
Пока это тестовый прототип на защитных плёнках с Ozon. Но сам факт, что векторный поиск можно запихнуть в один файл без инфраструктуры — мне кажется, это интересное направление. Думаю, куда можно применить дальше.
Потыкать:
Скачать файл ниже, открыть в браузере двойным кликом — всё
Для технических: внутри — cosine similarity по декодированным PEC-векторам (это название моего алгоритма сжатия ), линейный скан O(N×768), данные в base64 внутри <script>, подробности в описании внутри файла
файл прикрепил с картинками на 1000 товаров (без изображений это было бы 100к )
Последние недели копаюсь в теме сжатия эмбеддингов. Задача простая: можно ли сделать поиск по смыслу, который работает прямо в браузере — без сервера, без API, без бэкенда вообще?
Короткий ответ: можно!
Длинный: взял каталог товаров (~1000 позиций), прогнал через модель эмбеддингов, сжал каждый вектор с 3 КБ до 64 байт — это в 48 раз. Картинки ужал до миниатюр. Всё запаковал в один HTML-файл на 6 МБ.
Открываешь файл в браузере, пишешь «плёнка антишпион» — получаешь плёнки антишпион. Не по совпадению слов в названии, а по смыслу. Работает оффлайн, с флешки, хоть на самолёте.
Что на тестах:
recall@10 ~74% (из 10 «правильных» товаров находит 7-8)
весь индекс на 1000 товаров — 64 КБ
масштаб: на 100K товаров — ~6 МБ, на миллион — 61 МБ
лимит памяти браузера позволяет теоретически до 25M документов
Для сравнения — что есть сейчас на рынке:
Voy (WASM brute-force) — float32, без сжатия. На 50-100K товаров упирается в память. На миллион — не влезет.
hnswlib-wasm — тоже float32 + граф HNSW сверху. Быстрее ищет, но по памяти ещё тяжелее: ~4 КБ на документ.
Transformers.js — может запустить модель эмбеддинга в браузере, но поиск по индексу не решает — это только генерация векторов.
Все три варианта работают с полными векторами. При 768 измерениях это 3 КБ на документ. 100K документов = 300 МБ, миллион = 3 ГБ — браузер ляжет. Со сжатием до 64 байт тот же миллион — 61 МБ, 25 миллионов — в лимит 2 ГБ.
Пока это тестовый прототип на защитных плёнках с Ozon. Но сам факт, что векторный поиск можно запихнуть в один файл без инфраструктуры — мне кажется, это интересное направление. Думаю, куда можно применить дальше.
Потыкать:
Скачать файл ниже, открыть в браузере двойным кликом — всё
Для технических: внутри — cosine similarity по декодированным PEC-векторам (это название моего алгоритма сжатия ), линейный скан O(N×768), данные в base64 внутри <script>, подробности в описании внутри файла
файл прикрепил с картинками на 1000 товаров (без изображений это было бы 100к )
🔥6❤4👏2🌚1👀1