This media is not supported in your browser
VIEW IN TELEGRAM
Тенсент идёт к буйволу
Tencent показала Hunyuan3D-Buffalo 1.0 - экспериментальное развитие Hunyuan3D, которое умеет не только генерировать 3D-модели, но и понимать их структуру. Buffalo может отвечать на вопросы об объекте, находить отдельные детали, удалять или заменять их по текстовой команде, а также генерировать геометрию напрямую из текста. В основе все еще лежит генератор Hunyuan3D-2.1, но к нему добавили 3D-VLM, работающую как «мозг» системы.
Главное отличие от обычного Hunyuan3D - акцент не на красивом image-to-3D, а на осмысленном редактировании и работе с частями модели. Звучит перспективно, но пока Buffalo существует скорее как ресерч прототип: публичных весов, кода и рабочего Hugging Face Demo нет, требования к железу неизвестны, а большинство результатов показано самими разабами.
Если на пальцах(хотя нынче это неоднозначно):
Hunyuan3D 2.1 умеет сгенерить модель. Buffalo пытается сначала понять, что за модель перед ним и где у нее крылья, колеса илисиськи голова, а потом уже что-то с этим сделать.
https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/
@cgevent
Tencent показала Hunyuan3D-Buffalo 1.0 - экспериментальное развитие Hunyuan3D, которое умеет не только генерировать 3D-модели, но и понимать их структуру. Buffalo может отвечать на вопросы об объекте, находить отдельные детали, удалять или заменять их по текстовой команде, а также генерировать геометрию напрямую из текста. В основе все еще лежит генератор Hunyuan3D-2.1, но к нему добавили 3D-VLM, работающую как «мозг» системы.
Главное отличие от обычного Hunyuan3D - акцент не на красивом image-to-3D, а на осмысленном редактировании и работе с частями модели. Звучит перспективно, но пока Buffalo существует скорее как ресерч прототип: публичных весов, кода и рабочего Hugging Face Demo нет, требования к железу неизвестны, а большинство результатов показано самими разабами.
Если на пальцах(хотя нынче это неоднозначно):
Hunyuan3D 2.1 умеет сгенерить модель. Buffalo пытается сначала понять, что за модель перед ним и где у нее крылья, колеса или
https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/
@cgevent
👍24❤8🔥8👎3😱2
This media is not supported in your browser
VIEW IN TELEGRAM
Seedance 2.5 раскатывают на штаты и, возможно, в агрегаторы
Сегодня.
Шуруйте в твиттор Капкатского - там ещё 3.5 часа можно отхватить 1000 кредитов:
https://x.com/capcutapp/status/2085355533943357650
@cgevent
Сегодня.
Шуруйте в твиттор Капкатского - там ещё 3.5 часа можно отхватить 1000 кредитов:
https://x.com/capcutapp/status/2085355533943357650
@cgevent
👎15❤11👍9
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Wan 3.0 в городе!
Я уже писал про новые фичи тут.
Ща про цены, доступ и рефы.
Кратко: Alibaba официально открыла публичную бету Wan 3.0. Новая модель генерирует ролики со звуком продолжительностью до 30 секунд в 480p, 720p и 1080p. Также появились автоматический подбор длительности, продолжение готового видео и более стабильное сохранение персонажей, объектов и сцены на длинной дистанции.
https://article.9466.com/news/aKweEQlm
Цены API:
480p - около $0.04 за секунду
720p - около $0.08 за секунду
1080p - около $0.17 за секунду
Таким образом, максимальный 30-секундный ролик стоит примерно $1.25 в 480p; $2.50 в 720p; около $5 в 1080p.
Но: при использовании видео-референса Alibaba считает не только результат, но и длительность загруженного видео. Формула выглядит так: входное видео плюс сгенерированное видео. Например, 10-секундный референс и 30-секундный результат в 1080p обойдутся уже примерно в $6.70.
Где доступен Ванский:
модель уже появилась в Alibaba Cloud Model Studio, сервисе Wanjing Yike, на китайском сайте Wanxiang и в десктопном приложении Qwen Creation. В приложении Qwen доступ раздаётся постепенно, поэтому модель пока видят не все пользователи. API с идентификатором wan3.0-video уже внесён в каталоги регионов Beijing и Singapore, но пока помечен как invitation testing. Полностью открыть API Alibaba обещает позднее. Иными словами, публичная веб-бета уже началась, а свободного API-доступа для всех ещё нет.
Что доступно в бете: помимо обычных text-to-video и image-to-video, Wan 3.0 принимает текст, изображения, аудио и видео в одной задаче. Alibaba обещает переносить из референсов лицо, причёску, телосложение, одежду, аксессуары, голос, логотипы, материалы предметов, расположение персонажей относительно камеры и общий визуальный стиль. Есть и странная функция генерации видео из документов: поддерживаются DOC, XLS, PPT, PDF, TXT, Keynote, Pages, Numbers и Markdown. Можно загрузить один файл или ссылку размером до 100 МБ и объёмом до 50 страниц.
Что с количеством референсов:
Alibabsky пока не назвал официального лимита для изображений, видео и аудио. Подтверждено только совместное использование разных типов референсов и заявленная консистентность персонажей, объектов, голоса, пространства и стиля.
Ссылки:
Цены и детали: https://x.com/Alibaba_Wan/status/2085339765860364601
Тут доступен: https://create.wan.video/generate
Постепенно раскатывают
Тарифы веб-сервиса: https://create.wan.video/pricing
API: https://wan.video/api
Китайский Wanxiang: https://tongyi.aliyun.com/wanxiang/videoCreation
Alibaba Cloud Model Studio: https://bailian.console.aliyun.com/welcome
Wanjing Yike: https://www.yikeai.com/
Qwen Creation: https://create.qianwen.com/
Клиент Qwen: https://www.qianwen.com/download
Реддиторские уже заметили пропадающую речь и фон, переходящий в белый шум, странный липсинк и исчезающего на несколько секунд персонажа.
Веса? Какие веса? Что такое веса?
@cgevent
Я уже писал про новые фичи тут.
Ща про цены, доступ и рефы.
Кратко: Alibaba официально открыла публичную бету Wan 3.0. Новая модель генерирует ролики со звуком продолжительностью до 30 секунд в 480p, 720p и 1080p. Также появились автоматический подбор длительности, продолжение готового видео и более стабильное сохранение персонажей, объектов и сцены на длинной дистанции.
https://article.9466.com/news/aKweEQlm
Цены API:
480p - около $0.04 за секунду
720p - около $0.08 за секунду
1080p - около $0.17 за секунду
Таким образом, максимальный 30-секундный ролик стоит примерно $1.25 в 480p; $2.50 в 720p; около $5 в 1080p.
Но: при использовании видео-референса Alibaba считает не только результат, но и длительность загруженного видео. Формула выглядит так: входное видео плюс сгенерированное видео. Например, 10-секундный референс и 30-секундный результат в 1080p обойдутся уже примерно в $6.70.
Где доступен Ванский:
модель уже появилась в Alibaba Cloud Model Studio, сервисе Wanjing Yike, на китайском сайте Wanxiang и в десктопном приложении Qwen Creation. В приложении Qwen доступ раздаётся постепенно, поэтому модель пока видят не все пользователи. API с идентификатором wan3.0-video уже внесён в каталоги регионов Beijing и Singapore, но пока помечен как invitation testing. Полностью открыть API Alibaba обещает позднее. Иными словами, публичная веб-бета уже началась, а свободного API-доступа для всех ещё нет.
Что доступно в бете: помимо обычных text-to-video и image-to-video, Wan 3.0 принимает текст, изображения, аудио и видео в одной задаче. Alibaba обещает переносить из референсов лицо, причёску, телосложение, одежду, аксессуары, голос, логотипы, материалы предметов, расположение персонажей относительно камеры и общий визуальный стиль. Есть и странная функция генерации видео из документов: поддерживаются DOC, XLS, PPT, PDF, TXT, Keynote, Pages, Numbers и Markdown. Можно загрузить один файл или ссылку размером до 100 МБ и объёмом до 50 страниц.
Что с количеством референсов:
Alibabsky пока не назвал официального лимита для изображений, видео и аудио. Подтверждено только совместное использование разных типов референсов и заявленная консистентность персонажей, объектов, голоса, пространства и стиля.
Ссылки:
Цены и детали: https://x.com/Alibaba_Wan/status/2085339765860364601
Тут доступен: https://create.wan.video/generate
Постепенно раскатывают
Тарифы веб-сервиса: https://create.wan.video/pricing
API: https://wan.video/api
Китайский Wanxiang: https://tongyi.aliyun.com/wanxiang/videoCreation
Alibaba Cloud Model Studio: https://bailian.console.aliyun.com/welcome
Wanjing Yike: https://www.yikeai.com/
Qwen Creation: https://create.qianwen.com/
Клиент Qwen: https://www.qianwen.com/download
Реддиторские уже заметили пропадающую речь и фон, переходящий в белый шум, странный липсинк и исчезающего на несколько секунд персонажа.
Веса? Какие веса? Что такое веса?
@cgevent
🔥17👍13👎6❤4
This media is not supported in your browser
VIEW IN TELEGRAM
#Нейропрожарка
Эксперимент: рекламный ролик «ПЕРЕКЛЮЧИ СЕБЯ» для Gorilla Energy в стиле рваного MTV-монтажа
Автор: Режиссер-оператор @Aktas_k
Срок: 2 дня.
Как всё началось: Принимаю участие в челендже. Одним из заданий было создать рекламный ролик в стиле эпохи MTV - клиповый монтаж. Самому стало интересно проверить как справится нейронка с клиповым MTV-монтажом. Взял реальный продукт — банку Gorilla Energy Green Boost, написал жёсткий посекундный сценарий на 30 секунд — концепция «старый кинескопный телевизор, по которому щёлкают каналы». При написании сценария ставил задачу нейросети в каждом шоте сохранять стиль.
Пайплайн: Сценарий и концепция - Fable5, Референсы (фото) Fable5, доработка в Nano Banana. Промты - Fable5. Весь видеоряд — Seedance 2.0. Придерживался правила: одно движение камеры на план (crash zoom ИЛИ whip pan ИЛИ орбита).
Главный производственный вывод: просить у модели Seedance 2.0 CRT-эффекты, static и datamosh — лотерея. На каждый шот приходилось делать несколько генераций. Больше 3–4 планов в одной генерации — качество заметно падает. Мелкий текст и логотипы плывут — лечится только референс-листом и повторами формулировок.
Технические детали:
Видеоряд: Seedance 2.0
Референс-лист банки: Fable5
Промпты: Fable5 писались от сценария, на английском, по формуле «стиль → референс → таймкоды планов → аудио → запреты»
Музыка: Suno
Монтаж: CapCut
Итог: MTV-монтаж генерацией сделать можно, только необходимо прописывать жесткий тайм код и профессиональные операторские термины для камеры.
@cgevent
Эксперимент: рекламный ролик «ПЕРЕКЛЮЧИ СЕБЯ» для Gorilla Energy в стиле рваного MTV-монтажа
Автор: Режиссер-оператор @Aktas_k
Срок: 2 дня.
Как всё началось: Принимаю участие в челендже. Одним из заданий было создать рекламный ролик в стиле эпохи MTV - клиповый монтаж. Самому стало интересно проверить как справится нейронка с клиповым MTV-монтажом. Взял реальный продукт — банку Gorilla Energy Green Boost, написал жёсткий посекундный сценарий на 30 секунд — концепция «старый кинескопный телевизор, по которому щёлкают каналы». При написании сценария ставил задачу нейросети в каждом шоте сохранять стиль.
Пайплайн: Сценарий и концепция - Fable5, Референсы (фото) Fable5, доработка в Nano Banana. Промты - Fable5. Весь видеоряд — Seedance 2.0. Придерживался правила: одно движение камеры на план (crash zoom ИЛИ whip pan ИЛИ орбита).
Главный производственный вывод: просить у модели Seedance 2.0 CRT-эффекты, static и datamosh — лотерея. На каждый шот приходилось делать несколько генераций. Больше 3–4 планов в одной генерации — качество заметно падает. Мелкий текст и логотипы плывут — лечится только референс-листом и повторами формулировок.
Технические детали:
Видеоряд: Seedance 2.0
Референс-лист банки: Fable5
Промпты: Fable5 писались от сценария, на английском, по формуле «стиль → референс → таймкоды планов → аудио → запреты»
Музыка: Suno
Монтаж: CapCut
Итог: MTV-монтаж генерацией сделать можно, только необходимо прописывать жесткий тайм код и профессиональные операторские термины для камеры.
@cgevent
👍59👎36🔥14😱3❤2😁1
Умная колонка-пончик от OpenAI
Появился дизайн первого устройства OpenAI и Джони Айва. По данным Марка Гурмана, это будет портативный AI-динамик без экрана - металлический «пончик» размером с хоккейную шайбу, который можно держать одной рукой или поставить на стол.
Внутри - аккумулятор, динамики, микрофоны, камеры и другие сенсоры для распознавания окружающей обстановки, а также световые индикаторы. Самая необычная деталь - подвижные механические элементы: они будут самостоятельно двигаться(?), показывая, что ассистент слушает, думает или отвечает. Устройство должно работать как продвинутая версия голосового режима ChatGPT, постепенно изучать привычки владельца и общаться все более "персонально".Залезая в мозг.
OpenAI обсуждает цену $300-400, хотя еще в феврале фигурировал диапазон $200-300. Представить гаджет планируют до конца 2026 года, а продажи начать в 2027-м. Это будет первый продукт из целого семейства устройств, которыми OpenAI в перспективе хочет частично заменить смартфон.
Главная идея - контекстный ИИ-помощник, который постоянно считывает окружающую обстановку, запоминает привычки пользователя и запускает автономные сценарии и ИИ-агентов без необходимости открывать приложения. Вместо очередного экрана OpenAI хочет создать отдельный интерфейс для взаимодействия с цифровыми сервисами через голос и контекст. Джони Айв, по слухам, сознательно отказался от формата очков(слава богу!) и носимого гаджета, сделав ставку на самостоятельное устройство, которое должно снизить(?) зависимость от смартфонов.
https://www.theverge.com/ai-artificial-intelligence/976431/openai-chatgpt-battery-smart-speaker-rumor
@cgevent
Появился дизайн первого устройства OpenAI и Джони Айва. По данным Марка Гурмана, это будет портативный AI-динамик без экрана - металлический «пончик» размером с хоккейную шайбу, который можно держать одной рукой или поставить на стол.
Внутри - аккумулятор, динамики, микрофоны, камеры и другие сенсоры для распознавания окружающей обстановки, а также световые индикаторы. Самая необычная деталь - подвижные механические элементы: они будут самостоятельно двигаться(?), показывая, что ассистент слушает, думает или отвечает. Устройство должно работать как продвинутая версия голосового режима ChatGPT, постепенно изучать привычки владельца и общаться все более "персонально".
OpenAI обсуждает цену $300-400, хотя еще в феврале фигурировал диапазон $200-300. Представить гаджет планируют до конца 2026 года, а продажи начать в 2027-м. Это будет первый продукт из целого семейства устройств, которыми OpenAI в перспективе хочет частично заменить смартфон.
Главная идея - контекстный ИИ-помощник, который постоянно считывает окружающую обстановку, запоминает привычки пользователя и запускает автономные сценарии и ИИ-агентов без необходимости открывать приложения. Вместо очередного экрана OpenAI хочет создать отдельный интерфейс для взаимодействия с цифровыми сервисами через голос и контекст. Джони Айв, по слухам, сознательно отказался от формата очков(слава богу!) и носимого гаджета, сделав ставку на самостоятельное устройство, которое должно снизить(?) зависимость от смартфонов.
https://www.theverge.com/ai-artificial-intelligence/976431/openai-chatgpt-battery-smart-speaker-rumor
@cgevent
👎28👍16😁9❤7🙏7🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
chatGpt - настоящий меломан
В отличие от кожаных, которые, узнав, что им дали послушать ИИ, сразу переобуваются и изрыгают проклятия, он слышит гармонию (и басы) везде.
https://www.instagram.com/reel/DbTZri3MFHo/
@cgevent
В отличие от кожаных, которые, узнав, что им дали послушать ИИ, сразу переобуваются и изрыгают проклятия, он слышит гармонию (и басы) везде.
https://www.instagram.com/reel/DbTZri3MFHo/
@cgevent
1😁168❤9👎4🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Раскатывают Seedance 2.5 API
Поисследовал за цены. Ибо модель обросла фичами: 180 с, 4к, рефы.
У самого ByteDance тариф потокенный: примерно $10.37 за 1 млн tokens без видео во входе и $6.22 за 1 млн с video-reference.
У агрегаторов разброс уже приличный.
Atlas Cloud сейчас самый понятный по прайсу - от $0.134/сек, то есть около $4.02 за 30 секунд.
На fal сильно дороже: примерно $0.2205/сек в 480p ($6.62 за 30 с) и $0.473/сек в 720p ($14.19 за 30 с). С video-reference ставка падает до $0.1323/$0.2838, но fal тарифицирует еще и длительность входного видео - например, 30 секунд 720p + 10-секундный видеореференс выходит примерно в $11.09. Скокаскока?
WaveSpeed пока держит 2.5 в coming soon без цены, у EvoLink API-схема уже опубликована, но generation route и финальный тариф еще не активированы.
Пока писал, там пошла движуха.
И отдельно про 4K и 180 секунд, потому что здесь уже началась маркетинговые непонятки. 4K у Seedance 2.5 действительно заявлен, а Dreamina прямо пишет про 4K и ролики до 30 секунд. Но в реально доступном сегодня API fal у 2.5 пока только 480p и 720p. 180 секунд есть как beta Long Video Mode в Dreamina, а не обычная нативная 180-секундная генерация через публичный API: там только до 30 секунд.
Если смотреть чисто по API на сегодня, Atlas за $0.134/с выглядит гораздо интереснее fal, но надо еще проверить, какой именно resolution/режим Atlas дает за эту минимальную ставку.
На Креа, магнифике, и даже Хиггсе пока нет, но есть уже на Рунвее. Причем и по АПИ тоже. 720р Макс.
Опдейт:
KIE - в полный рост : в официальной API-документации есть рабочий POST endpoint и model ID bytedance/seedance-2-5. Поддерживаются 720p, длительность, изображения, видео и аудиореференсы.
https://kie.ai/seedance-2-5
WaveSpeed - 8 endpoint'ов Seedance 2.5: T2V, I2V, edit, extend, Turbo и др. Цена обычного T2V/I2V: $0.90 за 5 сек 480p и $1.80 за 5 сек 720p, то есть $5.40/$10.80 за 30 сек.
SYNTX - Сейчас по акции 15 секунд стоят 200 токенов, что эквивалентно примерно $4-4.3 на старших тарифах.
Replicate - пока нет.
Atlas Cloud
https://www.atlascloud.ai/zh/models/bytedance/seedance-2.5/reference-to-video
fal.ai Text-to-Video
https://fal.ai/models/bytedance/seedance-2.5/text-to-video
fal.ai Reference-to-Video
https://fal.ai/models/bytedance/seedance-2.5/reference-to-video
WaveSpeed
https://wavespeed.ai/seedance-2-5-api
EvoLink
https://evolink.ai/docs/en/api-manual/video-series/seedance2.5/seedance-2.5-overview
@cgevent
Поисследовал за цены. Ибо модель обросла фичами: 180 с, 4к, рефы.
У самого ByteDance тариф потокенный: примерно $10.37 за 1 млн tokens без видео во входе и $6.22 за 1 млн с video-reference.
У агрегаторов разброс уже приличный.
Atlas Cloud сейчас самый понятный по прайсу - от $0.134/сек, то есть около $4.02 за 30 секунд.
На fal сильно дороже: примерно $0.2205/сек в 480p ($6.62 за 30 с) и $0.473/сек в 720p ($14.19 за 30 с). С video-reference ставка падает до $0.1323/$0.2838, но fal тарифицирует еще и длительность входного видео - например, 30 секунд 720p + 10-секундный видеореференс выходит примерно в $11.09. Скокаскока?
WaveSpeed пока держит 2.5 в coming soon без цены, у EvoLink API-схема уже опубликована, но generation route и финальный тариф еще не активированы.
Пока писал, там пошла движуха.
И отдельно про 4K и 180 секунд, потому что здесь уже началась маркетинговые непонятки. 4K у Seedance 2.5 действительно заявлен, а Dreamina прямо пишет про 4K и ролики до 30 секунд. Но в реально доступном сегодня API fal у 2.5 пока только 480p и 720p. 180 секунд есть как beta Long Video Mode в Dreamina, а не обычная нативная 180-секундная генерация через публичный API: там только до 30 секунд.
Если смотреть чисто по API на сегодня, Atlas за $0.134/с выглядит гораздо интереснее fal, но надо еще проверить, какой именно resolution/режим Atlas дает за эту минимальную ставку.
На Креа, магнифике, и даже Хиггсе пока нет, но есть уже на Рунвее. Причем и по АПИ тоже. 720р Макс.
Опдейт:
KIE - в полный рост : в официальной API-документации есть рабочий POST endpoint и model ID bytedance/seedance-2-5. Поддерживаются 720p, длительность, изображения, видео и аудиореференсы.
https://kie.ai/seedance-2-5
WaveSpeed - 8 endpoint'ов Seedance 2.5: T2V, I2V, edit, extend, Turbo и др. Цена обычного T2V/I2V: $0.90 за 5 сек 480p и $1.80 за 5 сек 720p, то есть $5.40/$10.80 за 30 сек.
SYNTX - Сейчас по акции 15 секунд стоят 200 токенов, что эквивалентно примерно $4-4.3 на старших тарифах.
Replicate - пока нет.
Atlas Cloud
https://www.atlascloud.ai/zh/models/bytedance/seedance-2.5/reference-to-video
fal.ai Text-to-Video
https://fal.ai/models/bytedance/seedance-2.5/text-to-video
fal.ai Reference-to-Video
https://fal.ai/models/bytedance/seedance-2.5/reference-to-video
WaveSpeed
https://wavespeed.ai/seedance-2-5-api
EvoLink
https://evolink.ai/docs/en/api-manual/video-series/seedance2.5/seedance-2.5-overview
@cgevent
1🔥16👍8❤7
This media is not supported in your browser
VIEW IN TELEGRAM
Будущее Минимакса
Красавчики. Пришли на реддит и бахнули огромную АМА сессию. Ответили на тьму вопросов.
https://www.reddit.com/r/StableDiffusion/s/O0rqbtpxzn
Для староверов и ADHD:
Tldr:
2K Regenerate - будет open-source и, судя по формулировке команды, относительно скоро;
Sparse Attention - первая версия тоже “near term”;
официальный 4/8-step рассматривается, но без обещаний по срокам;
отдельная image-модель из линии H3 - в разработке.
Для нормисов :
Самое главное: нативный H3-Regenerate-2K действительно откроют. Это не обычный апскейлер и не «второй прогон тем же H3». Команда пояснила за отдельный latent-space DiT regeneration checkpoint, который генерирует на более высоком разрешении, используя результат базовой модели как дополнительный контекст. Часть референсов также подаётся в повышенном разрешении. Модуль сейчас дорабатывают по скорости и качеству именно для локального использования, поэтому точной даты нет, но на отдельный вопрос «аскороли?» разработа ответили буквально: “yep, not very far”.
По Sparse Attention ещё наряднее. H3 не использует MSA из MiniMax M3, как многие предполагали. Их схема ближе к MoBA-style block selection: соседние visual tokens сильно коррелируют, поэтому MiniMax делает mean-pooling блоков и по этому представлению определяет важные блоки, без отдельного обученного indexer. Сейчас 3D sparsification применяется только к video tokens, потому что именно они съедают большую часть sequence. Image/text tokens пока изучаются как следующие кандидаты.
Кто нихрена не понял - первую открытую реализацию sparse attention обещают в ближайшее время, причём сначала в консервативной конфигурации с целью получить ускорение без заметной потери качества. (Это круто, скорость - главный минус)
С 4/8-step H3 всё чуть менее нарядно. Выпущенный checkpoint уже содержит CFG distillation, плюс на финальной стадии обучения использовалась дополнительная стратегия, благодаря которой модель и сейчас умеет несколько снижать число inference steps. Но это не полноценная step-distilled Turbo-модель. MiniMax продолжает исследовать distillation и прямо рассматривает официальный 4-NFE или 8-NFE вариант, однако честно пишет, что не может пообещать его в ближайшее время. То есть community Turbo LoRA пока останутся актуальны.
Ещё одна неожиданно прельстивая новость - картинки!!
На вопрос про настоящий Text-to-Image / single-frame H3 MiniMax ответил, что они уже делают отдельную image model из общего предка H3 (круто звучит) и рассчитывают выпустить её для сообщества. То есть нынешние хаки «сгенерировать 5 кадров и выдернуть первый» действительно временные - полноценная H3 image-модель официально в разработке.
Из архитектурных деталей команда также поъяснила за prompt adherence. По их словам, дело не в каком-то одном хитром модуле, а в очень широком и разнообразном наборе данных и задач, обученных на общей масштабируемой архитектуре. Иными словами, меньше магических костылей под отдельные задачи, больше общего multimodal training. (Gemini Omni нервничает и готовится апдейтнуться)
За цензуру не говорили. Но видео в шапке говорит само за себя.
Красавцы, чо.
@cgevent
Красавчики. Пришли на реддит и бахнули огромную АМА сессию. Ответили на тьму вопросов.
https://www.reddit.com/r/StableDiffusion/s/O0rqbtpxzn
Для староверов и ADHD:
Tldr:
2K Regenerate - будет open-source и, судя по формулировке команды, относительно скоро;
Sparse Attention - первая версия тоже “near term”;
официальный 4/8-step рассматривается, но без обещаний по срокам;
отдельная image-модель из линии H3 - в разработке.
Для нормисов :
Самое главное: нативный H3-Regenerate-2K действительно откроют. Это не обычный апскейлер и не «второй прогон тем же H3». Команда пояснила за отдельный latent-space DiT regeneration checkpoint, который генерирует на более высоком разрешении, используя результат базовой модели как дополнительный контекст. Часть референсов также подаётся в повышенном разрешении. Модуль сейчас дорабатывают по скорости и качеству именно для локального использования, поэтому точной даты нет, но на отдельный вопрос «аскороли?» разработа ответили буквально: “yep, not very far”.
По Sparse Attention ещё наряднее. H3 не использует MSA из MiniMax M3, как многие предполагали. Их схема ближе к MoBA-style block selection: соседние visual tokens сильно коррелируют, поэтому MiniMax делает mean-pooling блоков и по этому представлению определяет важные блоки, без отдельного обученного indexer. Сейчас 3D sparsification применяется только к video tokens, потому что именно они съедают большую часть sequence. Image/text tokens пока изучаются как следующие кандидаты.
Кто нихрена не понял - первую открытую реализацию sparse attention обещают в ближайшее время, причём сначала в консервативной конфигурации с целью получить ускорение без заметной потери качества. (Это круто, скорость - главный минус)
С 4/8-step H3 всё чуть менее нарядно. Выпущенный checkpoint уже содержит CFG distillation, плюс на финальной стадии обучения использовалась дополнительная стратегия, благодаря которой модель и сейчас умеет несколько снижать число inference steps. Но это не полноценная step-distilled Turbo-модель. MiniMax продолжает исследовать distillation и прямо рассматривает официальный 4-NFE или 8-NFE вариант, однако честно пишет, что не может пообещать его в ближайшее время. То есть community Turbo LoRA пока останутся актуальны.
Ещё одна неожиданно прельстивая новость - картинки!!
На вопрос про настоящий Text-to-Image / single-frame H3 MiniMax ответил, что они уже делают отдельную image model из общего предка H3 (круто звучит) и рассчитывают выпустить её для сообщества. То есть нынешние хаки «сгенерировать 5 кадров и выдернуть первый» действительно временные - полноценная H3 image-модель официально в разработке.
Из архитектурных деталей команда также поъяснила за prompt adherence. По их словам, дело не в каком-то одном хитром модуле, а в очень широком и разнообразном наборе данных и задач, обученных на общей масштабируемой архитектуре. Иными словами, меньше магических костылей под отдельные задачи, больше общего multimodal training. (Gemini Omni нервничает и готовится апдейтнуться)
За цензуру не говорили. Но видео в шапке говорит само за себя.
Красавцы, чо.
@cgevent
🔥45👍15❤11😁8👎1
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Гугл нервничает
Google пока не анонсирует новую Omni, а просто сегодня хвастаеца пятью реальными демками от пользователей и компаний. Главный посыл - видео теперь можно не просто генерировать, а редактировать почти как в чате.
Пригорело от Минимакса видать.
Они даже продлили акцию "10 бесплатных видосов в Омни бесплатно для всех" до 11 августа.
Что показывают:
Смена камеры и ракурса - одну и ту же сцену с женщиной пересобрали примерно с 20 разных точек, включая крупные планы, вид сверху/снизу и другие окружения.
Редактирование сцены голосом - день превращают в ночь, добавляют облака, дождь со звуком, осень, снег, при этом исходная сцена сохраняется.
Doodle-to-video - рисуешь поверх кадра простые каракули, а Omni использует их как указания: лимон становится подлодкой, чашка кофе - воздушным шаром, спичка - ракетой.
Рестайлинг видео - один ролик плавно переводят из live-action в anime, claymation и другие стили, сохраняя движение персонажа.
Практические кейсы - Hyperagent добавляет ландшафтный дизайн в реальное видео парка, оживляет бизнес-дашборды виртуальным профессором и превращает todo-лист в игровую сцену.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-builders/
@cgevent
Google пока не анонсирует новую Omni, а просто сегодня хвастаеца пятью реальными демками от пользователей и компаний. Главный посыл - видео теперь можно не просто генерировать, а редактировать почти как в чате.
Пригорело от Минимакса видать.
Они даже продлили акцию "10 бесплатных видосов в Омни бесплатно для всех" до 11 августа.
Что показывают:
Смена камеры и ракурса - одну и ту же сцену с женщиной пересобрали примерно с 20 разных точек, включая крупные планы, вид сверху/снизу и другие окружения.
Редактирование сцены голосом - день превращают в ночь, добавляют облака, дождь со звуком, осень, снег, при этом исходная сцена сохраняется.
Doodle-to-video - рисуешь поверх кадра простые каракули, а Omni использует их как указания: лимон становится подлодкой, чашка кофе - воздушным шаром, спичка - ракетой.
Рестайлинг видео - один ролик плавно переводят из live-action в anime, claymation и другие стили, сохраняя движение персонажа.
Практические кейсы - Hyperagent добавляет ландшафтный дизайн в реальное видео парка, оживляет бизнес-дашборды виртуальным профессором и превращает todo-лист в игровую сцену.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-builders/
@cgevent
🔥26👎14👍9❤5😁2🙏1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
"Lord of the Taiga"
Автор: @ev_gnedkow
Идея / история создания:
Как собирал:
1. Промпты и добивка сценария — Claude Opus 4.8. Закинул в Cowork все материалы, подключил пару своих скиллов и начал с подбора главных героев.
2. Листы персонажей — Nano Banana Pro и Seedream 5.0 Pro. Каждый лист потом дорабатывал в фотошопе. Локации делал через Cinema Studio в самом Higgsfield — как я понимаю, это та же «банана», только с добивкой по конкретной камере.
3. Вся анимация — Seedance 2. Чтобы не сильно раздувать бюджет, гонял его через безлимит в Runway.
4. Интересное наблюдение по безлимиту Runway: после оплаты тарифа первые ~30 роликов генерятся где-то по полчаса, но после этой тридцатки Runway сильно просаживает скорость — вне зависимости от времени суток выдавал мне 2 ролика в час. Запускал генерации с 7 утра и заканчивал ближе к часу ночи, так за день получалось вытащить 28–36 роликов. Когда сроки поджали, переключился с безлимита и скушал все кредиты в Runway.
5. Музыка и озвучка — ElevenLabs. Suno на бесплатном тарифе делал не совсем то, что хотелось.
Сборка — в обычном CapCut. Для ютуба прогнал через локальный Topaz и поднял до 4K.
https://youtu.be/6HbWYDdD9EU?si=gQwStld-0iyE2rJk
По срокам и деньгам:
На весь ролик ушло 5 дней — начал в последний момент, поэтому и пришлось прыгать с безлимита на кредиты.
Claude — $20.00
Runway — $47.50
ElevenLabs — $22.00
Higgsfield посчитать сложно, там годовой план. Сжёг где-то 2000 их кредитов — сейчас предлагают докупить столько же за $95.00.
@cgevent
"Lord of the Taiga"
Автор: @ev_gnedkow
Идея / история создания:
Решил поучаствовать в конкурсе от Higgsfield — они раздавали гранты на 100 000 кредитов. Очень уж сильно хотелось его получить. Стал думать, что бы такое нагенерить, и как-то вышел на старого лесника, который умеет превращаться в медведя, чтобы защищать тайгу от массовой вырубки. По сценарию каждое такое превращение стирает часть его человеческой памяти, и в финале он должен был смотреть на родную внучку как на чужую. Так бы трейлер и закончился, но из-за ограничения по хронометражу пришлось его подрезать.
Как собирал:
1. Промпты и добивка сценария — Claude Opus 4.8. Закинул в Cowork все материалы, подключил пару своих скиллов и начал с подбора главных героев.
2. Листы персонажей — Nano Banana Pro и Seedream 5.0 Pro. Каждый лист потом дорабатывал в фотошопе. Локации делал через Cinema Studio в самом Higgsfield — как я понимаю, это та же «банана», только с добивкой по конкретной камере.
3. Вся анимация — Seedance 2. Чтобы не сильно раздувать бюджет, гонял его через безлимит в Runway.
4. Интересное наблюдение по безлимиту Runway: после оплаты тарифа первые ~30 роликов генерятся где-то по полчаса, но после этой тридцатки Runway сильно просаживает скорость — вне зависимости от времени суток выдавал мне 2 ролика в час. Запускал генерации с 7 утра и заканчивал ближе к часу ночи, так за день получалось вытащить 28–36 роликов. Когда сроки поджали, переключился с безлимита и скушал все кредиты в Runway.
5. Музыка и озвучка — ElevenLabs. Suno на бесплатном тарифе делал не совсем то, что хотелось.
Сборка — в обычном CapCut. Для ютуба прогнал через локальный Topaz и поднял до 4K.
https://youtu.be/6HbWYDdD9EU?si=gQwStld-0iyE2rJk
По срокам и деньгам:
На весь ролик ушло 5 дней — начал в последний момент, поэтому и пришлось прыгать с безлимита на кредиты.
Claude — $20.00
Runway — $47.50
ElevenLabs — $22.00
Higgsfield посчитать сложно, там годовой план. Сжёг где-то 2000 их кредитов — сейчас предлагают докупить столько же за $95.00.
@cgevent
👍97👎29🔥22❤9
This media is not supported in your browser
VIEW IN TELEGRAM
Wan Animate 2. ADHD-трейлер
Alibaba выкатила Wan Animate 2, и старый pose-control ползет умирать. Теперь модель напрямую смотрит driving video без скелетов и промежуточных костылей, тащит мимику, руки, несколько персонажей и умеет менять ракурс камеры текстом, не ломая движение.
По смыслу это типа конкурент SCAIL-2, но акценты разные: SCAIL-2 пока обкатаннее в replacement и сложных multi-character сценах, а Wan Animate 2 выглядит круто именно как motion transfer + camera control. Уже есть веса, код, ComfyUI и 10-step Distilled
Есть даже streaming Lite на заявленных 24 fps, но пока только в статье, веса не выложили.
🔗 Demo: https://humanaigc.github.io/wan-animate-2/
🔗 GitHub: https://github.com/Wan-Video/Wan-Animate-2
🔗 Hugging Face: https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14B
@cgevent
Alibaba выкатила Wan Animate 2, и старый pose-control ползет умирать. Теперь модель напрямую смотрит driving video без скелетов и промежуточных костылей, тащит мимику, руки, несколько персонажей и умеет менять ракурс камеры текстом, не ломая движение.
По смыслу это типа конкурент SCAIL-2, но акценты разные: SCAIL-2 пока обкатаннее в replacement и сложных multi-character сценах, а Wan Animate 2 выглядит круто именно как motion transfer + camera control. Уже есть веса, код, ComfyUI и 10-step Distilled
Есть даже streaming Lite на заявленных 24 fps, но пока только в статье, веса не выложили.
🔗 Demo: https://humanaigc.github.io/wan-animate-2/
🔗 GitHub: https://github.com/Wan-Video/Wan-Animate-2
🔗 Hugging Face: https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14B
@cgevent
👍26🔥9❤3👎1
Please open Telegram to view this post
VIEW IN TELEGRAM
❤26🔥12👎6👍3