Метаверсище и ИИще
52.4K subscribers
6.61K photos
5.47K videos
49 files
7.74K links
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие.
Для связи: @SergTsyp
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Тенсент идёт к буйволу

Tencent показала Hunyuan3D-Buffalo 1.0 - экспериментальное развитие Hunyuan3D, которое умеет не только генерировать 3D-модели, но и понимать их структуру. Buffalo может отвечать на вопросы об объекте, находить отдельные детали, удалять или заменять их по текстовой команде, а также генерировать геометрию напрямую из текста. В основе все еще лежит генератор Hunyuan3D-2.1, но к нему добавили 3D-VLM, работающую как «мозг» системы.

Главное отличие от обычного Hunyuan3D - акцент не на красивом image-to-3D, а на осмысленном редактировании и работе с частями модели. Звучит перспективно, но пока Buffalo существует скорее как ресерч прототип: публичных весов, кода и рабочего Hugging Face Demo нет, требования к железу неизвестны, а большинство результатов показано самими разабами.


Если на пальцах(хотя нынче это неоднозначно):

Hunyuan3D 2.1 умеет сгенерить модель. Buffalo пытается сначала понять, что за модель перед ним и где у нее крылья, колеса или сиськи голова, а потом уже что-то с этим сделать.

https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/

@cgevent
👍248🔥8👎3😱2
This media is not supported in your browser
VIEW IN TELEGRAM
Seedance 2.5 раскатывают на штаты и, возможно, в агрегаторы

Сегодня.

Шуруйте в твиттор Капкатского - там ещё 3.5 часа можно отхватить 1000 кредитов:


https://x.com/capcutapp/status/2085355533943357650

@cgevent
👎1511👍9
Wan 3.0 в городе!

Я уже писал про новые фичи тут.

Ща про цены, доступ и рефы.

Кратко: Alibaba официально открыла публичную бету Wan 3.0. Новая модель генерирует ролики со звуком продолжительностью до 30 секунд в 480p, 720p и 1080p. Также появились автоматический подбор длительности, продолжение готового видео и более стабильное сохранение персонажей, объектов и сцены на длинной дистанции.
https://article.9466.com/news/aKweEQlm

Цены API:

480p - около $0.04 за секунду

720p - около $0.08 за секунду

1080p - около $0.17 за секунду

Таким образом, максимальный 30-секундный ролик стоит примерно $1.25 в 480p; $2.50 в 720p; около $5 в 1080p.

Но: при использовании видео-референса Alibaba считает не только результат, но и длительность загруженного видео. Формула выглядит так: входное видео плюс сгенерированное видео. Например, 10-секундный референс и 30-секундный результат в 1080p обойдутся уже примерно в $6.70.

Где доступен Ванский:
модель уже появилась в Alibaba Cloud Model Studio, сервисе Wanjing Yike, на китайском сайте Wanxiang и в десктопном приложении Qwen Creation. В приложении Qwen доступ раздаётся постепенно, поэтому модель пока видят не все пользователи. API с идентификатором wan3.0-video уже внесён в каталоги регионов Beijing и Singapore, но пока помечен как invitation testing. Полностью открыть API Alibaba обещает позднее. Иными словами, публичная веб-бета уже началась, а свободного API-доступа для всех ещё нет.

Что доступно в бете: помимо обычных text-to-video и image-to-video, Wan 3.0 принимает текст, изображения, аудио и видео в одной задаче. Alibaba обещает переносить из референсов лицо, причёску, телосложение, одежду, аксессуары, голос, логотипы, материалы предметов, расположение персонажей относительно камеры и общий визуальный стиль. Есть и странная функция генерации видео из документов: поддерживаются DOC, XLS, PPT, PDF, TXT, Keynote, Pages, Numbers и Markdown. Можно загрузить один файл или ссылку размером до 100 МБ и объёмом до 50 страниц.

Что с количеством референсов:
Alibabsky пока не назвал официального лимита для изображений, видео и аудио. Подтверждено только совместное использование разных типов референсов и заявленная консистентность персонажей, объектов, голоса, пространства и стиля.
Ссылки:

Цены и детали: https://x.com/Alibaba_Wan/status/2085339765860364601

Тут доступен: https://create.wan.video/generate
Постепенно раскатывают

Тарифы веб-сервиса: https://create.wan.video/pricing

API: https://wan.video/api

Китайский Wanxiang: https://tongyi.aliyun.com/wanxiang/videoCreation

Alibaba Cloud Model Studio: https://bailian.console.aliyun.com/welcome

Wanjing Yike: https://www.yikeai.com/

Qwen Creation: https://create.qianwen.com/

Клиент Qwen: https://www.qianwen.com/download

Реддиторские уже заметили пропадающую речь и фон, переходящий в белый шум, странный липсинк и исчезающего на несколько секунд персонажа.

Веса? Какие веса? Что такое веса?

@cgevent
🔥17👍13👎64
This media is not supported in your browser
VIEW IN TELEGRAM
Сравниваем...

Вот только у Минимакса есть открытые веса

@cgevent
28👍6👎5
This media is not supported in your browser
VIEW IN TELEGRAM
#Нейропрожарка

Эксперимент: рекламный ролик «ПЕРЕКЛЮЧИ СЕБЯ» для Gorilla Energy в стиле рваного MTV-монтажа

Автор: Режиссер-оператор @Aktas_k

Срок: 2 дня.

Как всё началось: Принимаю участие в челендже. Одним из заданий было создать рекламный ролик в стиле эпохи MTV - клиповый монтаж. Самому стало интересно проверить как справится нейронка с клиповым MTV-монтажом. Взял реальный продукт — банку Gorilla Energy Green Boost, написал жёсткий посекундный сценарий на 30 секунд — концепция «старый кинескопный телевизор, по которому щёлкают каналы». При написании сценария ставил задачу нейросети в каждом шоте сохранять стиль.
Пайплайн: Сценарий и концепция - Fable5, Референсы (фото) Fable5, доработка в Nano Banana. Промты - Fable5. Весь видеоряд — Seedance 2.0. Придерживался правила: одно движение камеры на план (crash zoom ИЛИ whip pan ИЛИ орбита).
Главный производственный вывод: просить у модели Seedance 2.0 CRT-эффекты, static и datamosh — лотерея. На каждый шот приходилось делать несколько генераций. Больше 3–4 планов в одной генерации — качество заметно падает. Мелкий текст и логотипы плывут — лечится только референс-листом и повторами формулировок.
Технические детали:
Видеоряд: Seedance 2.0
Референс-лист банки: Fable5
Промпты: Fable5 писались от сценария, на английском, по формуле «стиль → референс → таймкоды планов → аудио → запреты»
Музыка: Suno
Монтаж: CapCut
Итог: MTV-монтаж генерацией сделать можно, только необходимо прописывать жесткий тайм код и профессиональные операторские термины для камеры.

@cgevent
👍59👎36🔥14😱32😁1
Умная колонка-пончик от OpenAI

Появился дизайн первого устройства OpenAI и Джони Айва. По данным Марка Гурмана, это будет портативный AI-динамик без экрана - металлический «пончик» размером с хоккейную шайбу, который можно держать одной рукой или поставить на стол.
Внутри - аккумулятор, динамики, микрофоны, камеры и другие сенсоры для распознавания окружающей обстановки, а также световые индикаторы. Самая необычная деталь - подвижные механические элементы: они будут самостоятельно двигаться(?), показывая, что ассистент слушает, думает или отвечает. Устройство должно работать как продвинутая версия голосового режима ChatGPT, постепенно изучать привычки владельца и общаться все более "персонально". Залезая в мозг.

OpenAI обсуждает цену $300-400, хотя еще в феврале фигурировал диапазон $200-300. Представить гаджет планируют до конца 2026 года, а продажи начать в 2027-м. Это будет первый продукт из целого семейства устройств, которыми OpenAI в перспективе хочет частично заменить смартфон.

Главная идея - контекстный ИИ-помощник, который постоянно считывает окружающую обстановку, запоминает привычки пользователя и запускает автономные сценарии и ИИ-агентов без необходимости открывать приложения. Вместо очередного экрана OpenAI хочет создать отдельный интерфейс для взаимодействия с цифровыми сервисами через голос и контекст. Джони Айв, по слухам, сознательно отказался от формата очков(слава богу!) и носимого гаджета, сделав ставку на самостоятельное устройство, которое должно снизить(?) зависимость от смартфонов.

https://www.theverge.com/ai-artificial-intelligence/976431/openai-chatgpt-battery-smart-speaker-rumor

@cgevent
👎28👍16😁97🙏7🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
chatGpt - настоящий меломан

В отличие от кожаных, которые, узнав, что им дали послушать ИИ, сразу переобуваются и изрыгают проклятия, он слышит гармонию (и басы) везде.

https://www.instagram.com/reel/DbTZri3MFHo/

@cgevent
1😁1689👎4🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Раскатывают Seedance 2.5 API

Поисследовал за цены. Ибо модель обросла фичами: 180 с, 4к, рефы.

У самого ByteDance тариф потокенный: примерно $10.37 за 1 млн tokens без видео во входе и $6.22 за 1 млн с video-reference.
У агрегаторов разброс уже приличный.
Atlas Cloud сейчас самый понятный по прайсу - от $0.134/сек, то есть около $4.02 за 30 секунд.

На fal сильно дороже: примерно $0.2205/сек в 480p ($6.62 за 30 с) и $0.473/сек в 720p ($14.19 за 30 с). С video-reference ставка падает до $0.1323/$0.2838, но fal тарифицирует еще и длительность входного видео - например, 30 секунд 720p + 10-секундный видеореференс выходит примерно в $11.09. Скокаскока?

WaveSpeed пока держит 2.5 в coming soon без цены, у EvoLink API-схема уже опубликована, но generation route и финальный тариф еще не активированы.
Пока писал, там пошла движуха.

И отдельно про 4K и 180 секунд, потому что здесь уже началась маркетинговые непонятки. 4K у Seedance 2.5 действительно заявлен, а Dreamina прямо пишет про 4K и ролики до 30 секунд. Но в реально доступном сегодня API fal у 2.5 пока только 480p и 720p. 180 секунд есть как beta Long Video Mode в Dreamina, а не обычная нативная 180-секундная генерация через публичный API: там только до 30 секунд.

Если смотреть чисто по API на сегодня, Atlas за $0.134/с выглядит гораздо интереснее fal, но надо еще проверить, какой именно resolution/режим Atlas дает за эту минимальную ставку.

На Креа, магнифике, и даже Хиггсе пока нет, но есть уже на Рунвее. Причем и по АПИ тоже. 720р Макс.

Опдейт:

KIE - в полный рост : в официальной API-документации есть рабочий POST endpoint и model ID bytedance/seedance-2-5. Поддерживаются 720p, длительность, изображения, видео и аудиореференсы.
https://kie.ai/seedance-2-5

WaveSpeed - 8 endpoint'ов Seedance 2.5: T2V, I2V, edit, extend, Turbo и др. Цена обычного T2V/I2V: $0.90 за 5 сек 480p и $1.80 за 5 сек 720p, то есть $5.40/$10.80 за 30 сек.

SYNTX - Сейчас по акции 15 секунд стоят 200 токенов, что эквивалентно примерно $4-4.3 на старших тарифах.

Replicate - пока нет.

Atlas Cloud
https://www.atlascloud.ai/zh/models/bytedance/seedance-2.5/reference-to-video

fal.ai Text-to-Video
https://fal.ai/models/bytedance/seedance-2.5/text-to-video

fal.ai Reference-to-Video
https://fal.ai/models/bytedance/seedance-2.5/reference-to-video

WaveSpeed
https://wavespeed.ai/seedance-2-5-api

EvoLink
https://evolink.ai/docs/en/api-manual/video-series/seedance2.5/seedance-2.5-overview

@cgevent
1🔥16👍87
This media is not supported in your browser
VIEW IN TELEGRAM
Будущее Минимакса

Красавчики. Пришли на реддит и бахнули огромную АМА сессию. Ответили на тьму вопросов.

https://www.reddit.com/r/StableDiffusion/s/O0rqbtpxzn

Для староверов и ADHD:
Tldr:
2K Regenerate - будет open-source и, судя по формулировке команды, относительно скоро;
Sparse Attention - первая версия тоже “near term”;
официальный 4/8-step рассматривается, но без обещаний по срокам;
отдельная image-модель из линии H3 - в разработке.

Для нормисов :

Самое главное: нативный H3-Regenerate-2K действительно откроют. Это не обычный апскейлер и не «второй прогон тем же H3». Команда пояснила за отдельный latent-space DiT regeneration checkpoint, который генерирует на более высоком разрешении, используя результат базовой модели как дополнительный контекст. Часть референсов также подаётся в повышенном разрешении. Модуль сейчас дорабатывают по скорости и качеству именно для локального использования, поэтому точной даты нет, но на отдельный вопрос «аскороли?» разработа ответили буквально: “yep, not very far”.

По Sparse Attention ещё наряднее. H3 не использует MSA из MiniMax M3, как многие предполагали. Их схема ближе к MoBA-style block selection: соседние visual tokens сильно коррелируют, поэтому MiniMax делает mean-pooling блоков и по этому представлению определяет важные блоки, без отдельного обученного indexer. Сейчас 3D sparsification применяется только к video tokens, потому что именно они съедают большую часть sequence. Image/text tokens пока изучаются как следующие кандидаты.
Кто нихрена не понял - первую открытую реализацию sparse attention обещают в ближайшее время, причём сначала в консервативной конфигурации с целью получить ускорение без заметной потери качества. (Это круто, скорость - главный минус)

С 4/8-step H3 всё чуть менее нарядно. Выпущенный checkpoint уже содержит CFG distillation, плюс на финальной стадии обучения использовалась дополнительная стратегия, благодаря которой модель и сейчас умеет несколько снижать число inference steps. Но это не полноценная step-distilled Turbo-модель. MiniMax продолжает исследовать distillation и прямо рассматривает официальный 4-NFE или 8-NFE вариант, однако честно пишет, что не может пообещать его в ближайшее время. То есть community Turbo LoRA пока останутся актуальны.

Ещё одна неожиданно прельстивая новость - картинки!!
На вопрос про настоящий Text-to-Image / single-frame H3 MiniMax ответил, что они уже делают отдельную image model из общего предка H3 (круто звучит) и рассчитывают выпустить её для сообщества. То есть нынешние хаки «сгенерировать 5 кадров и выдернуть первый» действительно временные - полноценная H3 image-модель официально в разработке.

Из архитектурных деталей команда также поъяснила за prompt adherence. По их словам, дело не в каком-то одном хитром модуле, а в очень широком и разнообразном наборе данных и задач, обученных на общей масштабируемой архитектуре. Иными словами, меньше магических костылей под отдельные задачи, больше общего multimodal training. (Gemini Omni нервничает и готовится апдейтнуться)

За цензуру не говорили. Но видео в шапке говорит само за себя.

Красавцы, чо.

@cgevent
🔥45👍1511😁8👎1
Гугл нервничает

Google пока не анонсирует новую Omni, а просто сегодня хвастаеца пятью реальными демками от пользователей и компаний. Главный посыл - видео теперь можно не просто генерировать, а редактировать почти как в чате.
Пригорело от Минимакса видать.
Они даже продлили акцию "10 бесплатных видосов в Омни бесплатно для всех" до 11 августа.

Что показывают:

Смена камеры и ракурса - одну и ту же сцену с женщиной пересобрали примерно с 20 разных точек, включая крупные планы, вид сверху/снизу и другие окружения.

Редактирование сцены голосом - день превращают в ночь, добавляют облака, дождь со звуком, осень, снег, при этом исходная сцена сохраняется.

Doodle-to-video - рисуешь поверх кадра простые каракули, а Omni использует их как указания: лимон становится подлодкой, чашка кофе - воздушным шаром, спичка - ракетой.

Рестайлинг видео - один ролик плавно переводят из live-action в anime, claymation и другие стили, сохраняя движение персонажа.

Практические кейсы - Hyperagent добавляет ландшафтный дизайн в реальное видео парка, оживляет бизнес-дашборды виртуальным профессором и превращает todo-лист в игровую сцену.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-builders/

@cgevent
🔥26👎14👍95😁2🙏1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

"Lord of the Taiga"

Автор: @ev_gnedkow

Идея / история создания:

Решил поучаствовать в конкурсе от Higgsfield — они раздавали гранты на 100 000 кредитов. Очень уж сильно хотелось его получить. Стал думать, что бы такое нагенерить, и как-то вышел на старого лесника, который умеет превращаться в медведя, чтобы защищать тайгу от массовой вырубки. По сценарию каждое такое превращение стирает часть его человеческой памяти, и в финале он должен был смотреть на родную внучку как на чужую. Так бы трейлер и закончился, но из-за ограничения по хронометражу пришлось его подрезать.


Как собирал:

1. Промпты и добивка сценария — Claude Opus 4.8. Закинул в Cowork все материалы, подключил пару своих скиллов и начал с подбора главных героев.

2. Листы персонажей — Nano Banana Pro и Seedream 5.0 Pro. Каждый лист потом дорабатывал в фотошопе. Локации делал через Cinema Studio в самом Higgsfield — как я понимаю, это та же «банана», только с добивкой по конкретной камере.

3. Вся анимация — Seedance 2. Чтобы не сильно раздувать бюджет, гонял его через безлимит в Runway.

4. Интересное наблюдение по безлимиту Runway: после оплаты тарифа первые ~30 роликов генерятся где-то по полчаса, но после этой тридцатки Runway сильно просаживает скорость — вне зависимости от времени суток выдавал мне 2 ролика в час. Запускал генерации с 7 утра и заканчивал ближе к часу ночи, так за день получалось вытащить 28–36 роликов. Когда сроки поджали, переключился с безлимита и скушал все кредиты в Runway.

5. Музыка и озвучка — ElevenLabs. Suno на бесплатном тарифе делал не совсем то, что хотелось.
Сборка — в обычном CapCut. Для ютуба прогнал через локальный Topaz и поднял до 4K.
https://youtu.be/6HbWYDdD9EU?si=gQwStld-0iyE2rJk

По срокам и деньгам:

На весь ролик ушло 5 дней — начал в последний момент, поэтому и пришлось прыгать с безлимита на кредиты.

Claude — $20.00
Runway — $47.50
ElevenLabs — $22.00
Higgsfield посчитать сложно, там годовой план. Сжёг где-то 2000 их кредитов — сейчас предлагают докупить столько же за $95.00.


@cgevent
👍97👎29🔥229
This media is not supported in your browser
VIEW IN TELEGRAM
Wan Animate 2. ADHD-трейлер

Alibaba выкатила Wan Animate 2, и старый pose-control ползет умирать. Теперь модель напрямую смотрит driving video без скелетов и промежуточных костылей, тащит мимику, руки, несколько персонажей и умеет менять ракурс камеры текстом, не ломая движение.

По смыслу это типа конкурент SCAIL-2, но акценты разные: SCAIL-2 пока обкатаннее в replacement и сложных multi-character сценах, а Wan Animate 2 выглядит круто именно как motion transfer + camera control. Уже есть веса, код, ComfyUI и 10-step Distilled
Есть даже streaming Lite на заявленных 24 fps, но пока только в статье, веса не выложили.

🔗 Demo: https://humanaigc.github.io/wan-animate-2/
🔗 GitHub: https://github.com/Wan-Video/Wan-Animate-2
🔗 Hugging Face: https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14B

@cgevent
👍26🔥93👎1
Please open Telegram to view this post
VIEW IN TELEGRAM
26🔥12👎6👍3