This media is not supported in your browser
VIEW IN TELEGRAM
#Нейропрожарка
Эксперимент: рекламный ролик «ПЕРЕКЛЮЧИ СЕБЯ» для Gorilla Energy в стиле рваного MTV-монтажа
Автор: Режиссер-оператор @Aktas_k
Срок: 2 дня.
Как всё началось: Принимаю участие в челендже. Одним из заданий было создать рекламный ролик в стиле эпохи MTV - клиповый монтаж. Самому стало интересно проверить как справится нейронка с клиповым MTV-монтажом. Взял реальный продукт — банку Gorilla Energy Green Boost, написал жёсткий посекундный сценарий на 30 секунд — концепция «старый кинескопный телевизор, по которому щёлкают каналы». При написании сценария ставил задачу нейросети в каждом шоте сохранять стиль.
Пайплайн: Сценарий и концепция - Fable5, Референсы (фото) Fable5, доработка в Nano Banana. Промты - Fable5. Весь видеоряд — Seedance 2.0. Придерживался правила: одно движение камеры на план (crash zoom ИЛИ whip pan ИЛИ орбита).
Главный производственный вывод: просить у модели Seedance 2.0 CRT-эффекты, static и datamosh — лотерея. На каждый шот приходилось делать несколько генераций. Больше 3–4 планов в одной генерации — качество заметно падает. Мелкий текст и логотипы плывут — лечится только референс-листом и повторами формулировок.
Технические детали:
Видеоряд: Seedance 2.0
Референс-лист банки: Fable5
Промпты: Fable5 писались от сценария, на английском, по формуле «стиль → референс → таймкоды планов → аудио → запреты»
Музыка: Suno
Монтаж: CapCut
Итог: MTV-монтаж генерацией сделать можно, только необходимо прописывать жесткий тайм код и профессиональные операторские термины для камеры.
@cgevent
Эксперимент: рекламный ролик «ПЕРЕКЛЮЧИ СЕБЯ» для Gorilla Energy в стиле рваного MTV-монтажа
Автор: Режиссер-оператор @Aktas_k
Срок: 2 дня.
Как всё началось: Принимаю участие в челендже. Одним из заданий было создать рекламный ролик в стиле эпохи MTV - клиповый монтаж. Самому стало интересно проверить как справится нейронка с клиповым MTV-монтажом. Взял реальный продукт — банку Gorilla Energy Green Boost, написал жёсткий посекундный сценарий на 30 секунд — концепция «старый кинескопный телевизор, по которому щёлкают каналы». При написании сценария ставил задачу нейросети в каждом шоте сохранять стиль.
Пайплайн: Сценарий и концепция - Fable5, Референсы (фото) Fable5, доработка в Nano Banana. Промты - Fable5. Весь видеоряд — Seedance 2.0. Придерживался правила: одно движение камеры на план (crash zoom ИЛИ whip pan ИЛИ орбита).
Главный производственный вывод: просить у модели Seedance 2.0 CRT-эффекты, static и datamosh — лотерея. На каждый шот приходилось делать несколько генераций. Больше 3–4 планов в одной генерации — качество заметно падает. Мелкий текст и логотипы плывут — лечится только референс-листом и повторами формулировок.
Технические детали:
Видеоряд: Seedance 2.0
Референс-лист банки: Fable5
Промпты: Fable5 писались от сценария, на английском, по формуле «стиль → референс → таймкоды планов → аудио → запреты»
Музыка: Suno
Монтаж: CapCut
Итог: MTV-монтаж генерацией сделать можно, только необходимо прописывать жесткий тайм код и профессиональные операторские термины для камеры.
@cgevent
👍59👎36🔥14😱3❤2😁1
Умная колонка-пончик от OpenAI
Появился дизайн первого устройства OpenAI и Джони Айва. По данным Марка Гурмана, это будет портативный AI-динамик без экрана - металлический «пончик» размером с хоккейную шайбу, который можно держать одной рукой или поставить на стол.
Внутри - аккумулятор, динамики, микрофоны, камеры и другие сенсоры для распознавания окружающей обстановки, а также световые индикаторы. Самая необычная деталь - подвижные механические элементы: они будут самостоятельно двигаться(?), показывая, что ассистент слушает, думает или отвечает. Устройство должно работать как продвинутая версия голосового режима ChatGPT, постепенно изучать привычки владельца и общаться все более "персонально".Залезая в мозг.
OpenAI обсуждает цену $300-400, хотя еще в феврале фигурировал диапазон $200-300. Представить гаджет планируют до конца 2026 года, а продажи начать в 2027-м. Это будет первый продукт из целого семейства устройств, которыми OpenAI в перспективе хочет частично заменить смартфон.
Главная идея - контекстный ИИ-помощник, который постоянно считывает окружающую обстановку, запоминает привычки пользователя и запускает автономные сценарии и ИИ-агентов без необходимости открывать приложения. Вместо очередного экрана OpenAI хочет создать отдельный интерфейс для взаимодействия с цифровыми сервисами через голос и контекст. Джони Айв, по слухам, сознательно отказался от формата очков(слава богу!) и носимого гаджета, сделав ставку на самостоятельное устройство, которое должно снизить(?) зависимость от смартфонов.
https://www.theverge.com/ai-artificial-intelligence/976431/openai-chatgpt-battery-smart-speaker-rumor
@cgevent
Появился дизайн первого устройства OpenAI и Джони Айва. По данным Марка Гурмана, это будет портативный AI-динамик без экрана - металлический «пончик» размером с хоккейную шайбу, который можно держать одной рукой или поставить на стол.
Внутри - аккумулятор, динамики, микрофоны, камеры и другие сенсоры для распознавания окружающей обстановки, а также световые индикаторы. Самая необычная деталь - подвижные механические элементы: они будут самостоятельно двигаться(?), показывая, что ассистент слушает, думает или отвечает. Устройство должно работать как продвинутая версия голосового режима ChatGPT, постепенно изучать привычки владельца и общаться все более "персонально".
OpenAI обсуждает цену $300-400, хотя еще в феврале фигурировал диапазон $200-300. Представить гаджет планируют до конца 2026 года, а продажи начать в 2027-м. Это будет первый продукт из целого семейства устройств, которыми OpenAI в перспективе хочет частично заменить смартфон.
Главная идея - контекстный ИИ-помощник, который постоянно считывает окружающую обстановку, запоминает привычки пользователя и запускает автономные сценарии и ИИ-агентов без необходимости открывать приложения. Вместо очередного экрана OpenAI хочет создать отдельный интерфейс для взаимодействия с цифровыми сервисами через голос и контекст. Джони Айв, по слухам, сознательно отказался от формата очков(слава богу!) и носимого гаджета, сделав ставку на самостоятельное устройство, которое должно снизить(?) зависимость от смартфонов.
https://www.theverge.com/ai-artificial-intelligence/976431/openai-chatgpt-battery-smart-speaker-rumor
@cgevent
👎28👍16😁9❤7🙏7🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
chatGpt - настоящий меломан
В отличие от кожаных, которые, узнав, что им дали послушать ИИ, сразу переобуваются и изрыгают проклятия, он слышит гармонию (и басы) везде.
https://www.instagram.com/reel/DbTZri3MFHo/
@cgevent
В отличие от кожаных, которые, узнав, что им дали послушать ИИ, сразу переобуваются и изрыгают проклятия, он слышит гармонию (и басы) везде.
https://www.instagram.com/reel/DbTZri3MFHo/
@cgevent
1😁168❤9👎4🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
Раскатывают Seedance 2.5 API
Поисследовал за цены. Ибо модель обросла фичами: 180 с, 4к, рефы.
У самого ByteDance тариф потокенный: примерно $10.37 за 1 млн tokens без видео во входе и $6.22 за 1 млн с video-reference.
У агрегаторов разброс уже приличный.
Atlas Cloud сейчас самый понятный по прайсу - от $0.134/сек, то есть около $4.02 за 30 секунд.
На fal сильно дороже: примерно $0.2205/сек в 480p ($6.62 за 30 с) и $0.473/сек в 720p ($14.19 за 30 с). С video-reference ставка падает до $0.1323/$0.2838, но fal тарифицирует еще и длительность входного видео - например, 30 секунд 720p + 10-секундный видеореференс выходит примерно в $11.09. Скокаскока?
WaveSpeed пока держит 2.5 в coming soon без цены, у EvoLink API-схема уже опубликована, но generation route и финальный тариф еще не активированы.
Пока писал, там пошла движуха.
И отдельно про 4K и 180 секунд, потому что здесь уже началась маркетинговые непонятки. 4K у Seedance 2.5 действительно заявлен, а Dreamina прямо пишет про 4K и ролики до 30 секунд. Но в реально доступном сегодня API fal у 2.5 пока только 480p и 720p. 180 секунд есть как beta Long Video Mode в Dreamina, а не обычная нативная 180-секундная генерация через публичный API: там только до 30 секунд.
Если смотреть чисто по API на сегодня, Atlas за $0.134/с выглядит гораздо интереснее fal, но надо еще проверить, какой именно resolution/режим Atlas дает за эту минимальную ставку.
На Креа, магнифике, и даже Хиггсе пока нет, но есть уже на Рунвее. Причем и по АПИ тоже. 720р Макс.
Опдейт:
KIE - в полный рост : в официальной API-документации есть рабочий POST endpoint и model ID bytedance/seedance-2-5. Поддерживаются 720p, длительность, изображения, видео и аудиореференсы.
https://kie.ai/seedance-2-5
WaveSpeed - 8 endpoint'ов Seedance 2.5: T2V, I2V, edit, extend, Turbo и др. Цена обычного T2V/I2V: $0.90 за 5 сек 480p и $1.80 за 5 сек 720p, то есть $5.40/$10.80 за 30 сек.
SYNTX - Сейчас по акции 15 секунд стоят 200 токенов, что эквивалентно примерно $4-4.3 на старших тарифах.
Replicate - пока нет.
Atlas Cloud
https://www.atlascloud.ai/zh/models/bytedance/seedance-2.5/reference-to-video
fal.ai Text-to-Video
https://fal.ai/models/bytedance/seedance-2.5/text-to-video
fal.ai Reference-to-Video
https://fal.ai/models/bytedance/seedance-2.5/reference-to-video
WaveSpeed
https://wavespeed.ai/seedance-2-5-api
EvoLink
https://evolink.ai/docs/en/api-manual/video-series/seedance2.5/seedance-2.5-overview
@cgevent
Поисследовал за цены. Ибо модель обросла фичами: 180 с, 4к, рефы.
У самого ByteDance тариф потокенный: примерно $10.37 за 1 млн tokens без видео во входе и $6.22 за 1 млн с video-reference.
У агрегаторов разброс уже приличный.
Atlas Cloud сейчас самый понятный по прайсу - от $0.134/сек, то есть около $4.02 за 30 секунд.
На fal сильно дороже: примерно $0.2205/сек в 480p ($6.62 за 30 с) и $0.473/сек в 720p ($14.19 за 30 с). С video-reference ставка падает до $0.1323/$0.2838, но fal тарифицирует еще и длительность входного видео - например, 30 секунд 720p + 10-секундный видеореференс выходит примерно в $11.09. Скокаскока?
WaveSpeed пока держит 2.5 в coming soon без цены, у EvoLink API-схема уже опубликована, но generation route и финальный тариф еще не активированы.
Пока писал, там пошла движуха.
И отдельно про 4K и 180 секунд, потому что здесь уже началась маркетинговые непонятки. 4K у Seedance 2.5 действительно заявлен, а Dreamina прямо пишет про 4K и ролики до 30 секунд. Но в реально доступном сегодня API fal у 2.5 пока только 480p и 720p. 180 секунд есть как beta Long Video Mode в Dreamina, а не обычная нативная 180-секундная генерация через публичный API: там только до 30 секунд.
Если смотреть чисто по API на сегодня, Atlas за $0.134/с выглядит гораздо интереснее fal, но надо еще проверить, какой именно resolution/режим Atlas дает за эту минимальную ставку.
На Креа, магнифике, и даже Хиггсе пока нет, но есть уже на Рунвее. Причем и по АПИ тоже. 720р Макс.
Опдейт:
KIE - в полный рост : в официальной API-документации есть рабочий POST endpoint и model ID bytedance/seedance-2-5. Поддерживаются 720p, длительность, изображения, видео и аудиореференсы.
https://kie.ai/seedance-2-5
WaveSpeed - 8 endpoint'ов Seedance 2.5: T2V, I2V, edit, extend, Turbo и др. Цена обычного T2V/I2V: $0.90 за 5 сек 480p и $1.80 за 5 сек 720p, то есть $5.40/$10.80 за 30 сек.
SYNTX - Сейчас по акции 15 секунд стоят 200 токенов, что эквивалентно примерно $4-4.3 на старших тарифах.
Replicate - пока нет.
Atlas Cloud
https://www.atlascloud.ai/zh/models/bytedance/seedance-2.5/reference-to-video
fal.ai Text-to-Video
https://fal.ai/models/bytedance/seedance-2.5/text-to-video
fal.ai Reference-to-Video
https://fal.ai/models/bytedance/seedance-2.5/reference-to-video
WaveSpeed
https://wavespeed.ai/seedance-2-5-api
EvoLink
https://evolink.ai/docs/en/api-manual/video-series/seedance2.5/seedance-2.5-overview
@cgevent
1🔥16👍8❤7
This media is not supported in your browser
VIEW IN TELEGRAM
Будущее Минимакса
Красавчики. Пришли на реддит и бахнули огромную АМА сессию. Ответили на тьму вопросов.
https://www.reddit.com/r/StableDiffusion/s/O0rqbtpxzn
Для староверов и ADHD:
Tldr:
2K Regenerate - будет open-source и, судя по формулировке команды, относительно скоро;
Sparse Attention - первая версия тоже “near term”;
официальный 4/8-step рассматривается, но без обещаний по срокам;
отдельная image-модель из линии H3 - в разработке.
Для нормисов :
Самое главное: нативный H3-Regenerate-2K действительно откроют. Это не обычный апскейлер и не «второй прогон тем же H3». Команда пояснила за отдельный latent-space DiT regeneration checkpoint, который генерирует на более высоком разрешении, используя результат базовой модели как дополнительный контекст. Часть референсов также подаётся в повышенном разрешении. Модуль сейчас дорабатывают по скорости и качеству именно для локального использования, поэтому точной даты нет, но на отдельный вопрос «аскороли?» разработа ответили буквально: “yep, not very far”.
По Sparse Attention ещё наряднее. H3 не использует MSA из MiniMax M3, как многие предполагали. Их схема ближе к MoBA-style block selection: соседние visual tokens сильно коррелируют, поэтому MiniMax делает mean-pooling блоков и по этому представлению определяет важные блоки, без отдельного обученного indexer. Сейчас 3D sparsification применяется только к video tokens, потому что именно они съедают большую часть sequence. Image/text tokens пока изучаются как следующие кандидаты.
Кто нихрена не понял - первую открытую реализацию sparse attention обещают в ближайшее время, причём сначала в консервативной конфигурации с целью получить ускорение без заметной потери качества. (Это круто, скорость - главный минус)
С 4/8-step H3 всё чуть менее нарядно. Выпущенный checkpoint уже содержит CFG distillation, плюс на финальной стадии обучения использовалась дополнительная стратегия, благодаря которой модель и сейчас умеет несколько снижать число inference steps. Но это не полноценная step-distilled Turbo-модель. MiniMax продолжает исследовать distillation и прямо рассматривает официальный 4-NFE или 8-NFE вариант, однако честно пишет, что не может пообещать его в ближайшее время. То есть community Turbo LoRA пока останутся актуальны.
Ещё одна неожиданно прельстивая новость - картинки!!
На вопрос про настоящий Text-to-Image / single-frame H3 MiniMax ответил, что они уже делают отдельную image model из общего предка H3 (круто звучит) и рассчитывают выпустить её для сообщества. То есть нынешние хаки «сгенерировать 5 кадров и выдернуть первый» действительно временные - полноценная H3 image-модель официально в разработке.
Из архитектурных деталей команда также поъяснила за prompt adherence. По их словам, дело не в каком-то одном хитром модуле, а в очень широком и разнообразном наборе данных и задач, обученных на общей масштабируемой архитектуре. Иными словами, меньше магических костылей под отдельные задачи, больше общего multimodal training. (Gemini Omni нервничает и готовится апдейтнуться)
За цензуру не говорили. Но видео в шапке говорит само за себя.
Красавцы, чо.
@cgevent
Красавчики. Пришли на реддит и бахнули огромную АМА сессию. Ответили на тьму вопросов.
https://www.reddit.com/r/StableDiffusion/s/O0rqbtpxzn
Для староверов и ADHD:
Tldr:
2K Regenerate - будет open-source и, судя по формулировке команды, относительно скоро;
Sparse Attention - первая версия тоже “near term”;
официальный 4/8-step рассматривается, но без обещаний по срокам;
отдельная image-модель из линии H3 - в разработке.
Для нормисов :
Самое главное: нативный H3-Regenerate-2K действительно откроют. Это не обычный апскейлер и не «второй прогон тем же H3». Команда пояснила за отдельный latent-space DiT regeneration checkpoint, который генерирует на более высоком разрешении, используя результат базовой модели как дополнительный контекст. Часть референсов также подаётся в повышенном разрешении. Модуль сейчас дорабатывают по скорости и качеству именно для локального использования, поэтому точной даты нет, но на отдельный вопрос «аскороли?» разработа ответили буквально: “yep, not very far”.
По Sparse Attention ещё наряднее. H3 не использует MSA из MiniMax M3, как многие предполагали. Их схема ближе к MoBA-style block selection: соседние visual tokens сильно коррелируют, поэтому MiniMax делает mean-pooling блоков и по этому представлению определяет важные блоки, без отдельного обученного indexer. Сейчас 3D sparsification применяется только к video tokens, потому что именно они съедают большую часть sequence. Image/text tokens пока изучаются как следующие кандидаты.
Кто нихрена не понял - первую открытую реализацию sparse attention обещают в ближайшее время, причём сначала в консервативной конфигурации с целью получить ускорение без заметной потери качества. (Это круто, скорость - главный минус)
С 4/8-step H3 всё чуть менее нарядно. Выпущенный checkpoint уже содержит CFG distillation, плюс на финальной стадии обучения использовалась дополнительная стратегия, благодаря которой модель и сейчас умеет несколько снижать число inference steps. Но это не полноценная step-distilled Turbo-модель. MiniMax продолжает исследовать distillation и прямо рассматривает официальный 4-NFE или 8-NFE вариант, однако честно пишет, что не может пообещать его в ближайшее время. То есть community Turbo LoRA пока останутся актуальны.
Ещё одна неожиданно прельстивая новость - картинки!!
На вопрос про настоящий Text-to-Image / single-frame H3 MiniMax ответил, что они уже делают отдельную image model из общего предка H3 (круто звучит) и рассчитывают выпустить её для сообщества. То есть нынешние хаки «сгенерировать 5 кадров и выдернуть первый» действительно временные - полноценная H3 image-модель официально в разработке.
Из архитектурных деталей команда также поъяснила за prompt adherence. По их словам, дело не в каком-то одном хитром модуле, а в очень широком и разнообразном наборе данных и задач, обученных на общей масштабируемой архитектуре. Иными словами, меньше магических костылей под отдельные задачи, больше общего multimodal training. (Gemini Omni нервничает и готовится апдейтнуться)
За цензуру не говорили. Но видео в шапке говорит само за себя.
Красавцы, чо.
@cgevent
🔥45👍15❤11😁8👎1
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Гугл нервничает
Google пока не анонсирует новую Omni, а просто сегодня хвастаеца пятью реальными демками от пользователей и компаний. Главный посыл - видео теперь можно не просто генерировать, а редактировать почти как в чате.
Пригорело от Минимакса видать.
Они даже продлили акцию "10 бесплатных видосов в Омни бесплатно для всех" до 11 августа.
Что показывают:
Смена камеры и ракурса - одну и ту же сцену с женщиной пересобрали примерно с 20 разных точек, включая крупные планы, вид сверху/снизу и другие окружения.
Редактирование сцены голосом - день превращают в ночь, добавляют облака, дождь со звуком, осень, снег, при этом исходная сцена сохраняется.
Doodle-to-video - рисуешь поверх кадра простые каракули, а Omni использует их как указания: лимон становится подлодкой, чашка кофе - воздушным шаром, спичка - ракетой.
Рестайлинг видео - один ролик плавно переводят из live-action в anime, claymation и другие стили, сохраняя движение персонажа.
Практические кейсы - Hyperagent добавляет ландшафтный дизайн в реальное видео парка, оживляет бизнес-дашборды виртуальным профессором и превращает todo-лист в игровую сцену.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-builders/
@cgevent
Google пока не анонсирует новую Omni, а просто сегодня хвастаеца пятью реальными демками от пользователей и компаний. Главный посыл - видео теперь можно не просто генерировать, а редактировать почти как в чате.
Пригорело от Минимакса видать.
Они даже продлили акцию "10 бесплатных видосов в Омни бесплатно для всех" до 11 августа.
Что показывают:
Смена камеры и ракурса - одну и ту же сцену с женщиной пересобрали примерно с 20 разных точек, включая крупные планы, вид сверху/снизу и другие окружения.
Редактирование сцены голосом - день превращают в ночь, добавляют облака, дождь со звуком, осень, снег, при этом исходная сцена сохраняется.
Doodle-to-video - рисуешь поверх кадра простые каракули, а Omni использует их как указания: лимон становится подлодкой, чашка кофе - воздушным шаром, спичка - ракетой.
Рестайлинг видео - один ролик плавно переводят из live-action в anime, claymation и другие стили, сохраняя движение персонажа.
Практические кейсы - Hyperagent добавляет ландшафтный дизайн в реальное видео парка, оживляет бизнес-дашборды виртуальным профессором и превращает todo-лист в игровую сцену.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-builders/
@cgevent
🔥26👎14👍9❤5😁2🙏1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
"Lord of the Taiga"
Автор: @ev_gnedkow
Идея / история создания:
Как собирал:
1. Промпты и добивка сценария — Claude Opus 4.8. Закинул в Cowork все материалы, подключил пару своих скиллов и начал с подбора главных героев.
2. Листы персонажей — Nano Banana Pro и Seedream 5.0 Pro. Каждый лист потом дорабатывал в фотошопе. Локации делал через Cinema Studio в самом Higgsfield — как я понимаю, это та же «банана», только с добивкой по конкретной камере.
3. Вся анимация — Seedance 2. Чтобы не сильно раздувать бюджет, гонял его через безлимит в Runway.
4. Интересное наблюдение по безлимиту Runway: после оплаты тарифа первые ~30 роликов генерятся где-то по полчаса, но после этой тридцатки Runway сильно просаживает скорость — вне зависимости от времени суток выдавал мне 2 ролика в час. Запускал генерации с 7 утра и заканчивал ближе к часу ночи, так за день получалось вытащить 28–36 роликов. Когда сроки поджали, переключился с безлимита и скушал все кредиты в Runway.
5. Музыка и озвучка — ElevenLabs. Suno на бесплатном тарифе делал не совсем то, что хотелось.
Сборка — в обычном CapCut. Для ютуба прогнал через локальный Topaz и поднял до 4K.
https://youtu.be/6HbWYDdD9EU?si=gQwStld-0iyE2rJk
По срокам и деньгам:
На весь ролик ушло 5 дней — начал в последний момент, поэтому и пришлось прыгать с безлимита на кредиты.
Claude — $20.00
Runway — $47.50
ElevenLabs — $22.00
Higgsfield посчитать сложно, там годовой план. Сжёг где-то 2000 их кредитов — сейчас предлагают докупить столько же за $95.00.
@cgevent
"Lord of the Taiga"
Автор: @ev_gnedkow
Идея / история создания:
Решил поучаствовать в конкурсе от Higgsfield — они раздавали гранты на 100 000 кредитов. Очень уж сильно хотелось его получить. Стал думать, что бы такое нагенерить, и как-то вышел на старого лесника, который умеет превращаться в медведя, чтобы защищать тайгу от массовой вырубки. По сценарию каждое такое превращение стирает часть его человеческой памяти, и в финале он должен был смотреть на родную внучку как на чужую. Так бы трейлер и закончился, но из-за ограничения по хронометражу пришлось его подрезать.
Как собирал:
1. Промпты и добивка сценария — Claude Opus 4.8. Закинул в Cowork все материалы, подключил пару своих скиллов и начал с подбора главных героев.
2. Листы персонажей — Nano Banana Pro и Seedream 5.0 Pro. Каждый лист потом дорабатывал в фотошопе. Локации делал через Cinema Studio в самом Higgsfield — как я понимаю, это та же «банана», только с добивкой по конкретной камере.
3. Вся анимация — Seedance 2. Чтобы не сильно раздувать бюджет, гонял его через безлимит в Runway.
4. Интересное наблюдение по безлимиту Runway: после оплаты тарифа первые ~30 роликов генерятся где-то по полчаса, но после этой тридцатки Runway сильно просаживает скорость — вне зависимости от времени суток выдавал мне 2 ролика в час. Запускал генерации с 7 утра и заканчивал ближе к часу ночи, так за день получалось вытащить 28–36 роликов. Когда сроки поджали, переключился с безлимита и скушал все кредиты в Runway.
5. Музыка и озвучка — ElevenLabs. Suno на бесплатном тарифе делал не совсем то, что хотелось.
Сборка — в обычном CapCut. Для ютуба прогнал через локальный Topaz и поднял до 4K.
https://youtu.be/6HbWYDdD9EU?si=gQwStld-0iyE2rJk
По срокам и деньгам:
На весь ролик ушло 5 дней — начал в последний момент, поэтому и пришлось прыгать с безлимита на кредиты.
Claude — $20.00
Runway — $47.50
ElevenLabs — $22.00
Higgsfield посчитать сложно, там годовой план. Сжёг где-то 2000 их кредитов — сейчас предлагают докупить столько же за $95.00.
@cgevent
👍97👎29🔥22❤9
This media is not supported in your browser
VIEW IN TELEGRAM
Wan Animate 2. ADHD-трейлер
Alibaba выкатила Wan Animate 2, и старый pose-control ползет умирать. Теперь модель напрямую смотрит driving video без скелетов и промежуточных костылей, тащит мимику, руки, несколько персонажей и умеет менять ракурс камеры текстом, не ломая движение.
По смыслу это типа конкурент SCAIL-2, но акценты разные: SCAIL-2 пока обкатаннее в replacement и сложных multi-character сценах, а Wan Animate 2 выглядит круто именно как motion transfer + camera control. Уже есть веса, код, ComfyUI и 10-step Distilled
Есть даже streaming Lite на заявленных 24 fps, но пока только в статье, веса не выложили.
🔗 Demo: https://humanaigc.github.io/wan-animate-2/
🔗 GitHub: https://github.com/Wan-Video/Wan-Animate-2
🔗 Hugging Face: https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14B
@cgevent
Alibaba выкатила Wan Animate 2, и старый pose-control ползет умирать. Теперь модель напрямую смотрит driving video без скелетов и промежуточных костылей, тащит мимику, руки, несколько персонажей и умеет менять ракурс камеры текстом, не ломая движение.
По смыслу это типа конкурент SCAIL-2, но акценты разные: SCAIL-2 пока обкатаннее в replacement и сложных multi-character сценах, а Wan Animate 2 выглядит круто именно как motion transfer + camera control. Уже есть веса, код, ComfyUI и 10-step Distilled
Есть даже streaming Lite на заявленных 24 fps, но пока только в статье, веса не выложили.
🔗 Demo: https://humanaigc.github.io/wan-animate-2/
🔗 GitHub: https://github.com/Wan-Video/Wan-Animate-2
🔗 Hugging Face: https://huggingface.co/Wan-AI/Wan2.2-Animate-2-14B
@cgevent
👍26🔥9❤3👎1
Please open Telegram to view this post
VIEW IN TELEGRAM
❤26🔥12👎6👍3
Media is too big
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Грок Imagine Image 2.0 - огненное редактирование
Ну, за переодеваторы! Редактирующие модели их просто пожрали.
Ну и сам релиз твитторного генератора картинок выглядит очень прельстиво.
Grok Imagine Image 2.0 как бы заменяет заменяет прежний Quality Mode в Grok Imagine. Главный упор теперь не только на красивую генерацию, но и на нормальную работу с текстом, сложными макетами, инфографикой и сохранением персонажей и объектов между итерациями.
На Arenе модель сейчас занимает 2-е место и в Text-to-Image, и в Image Editing, уступая GPT-Image-2.
По разрешению есть вопросы: xAI пока не раскрыла нативное внутреннее разрешение Image 2.0, но официально заявленный вывод сейчас - до 2K, без 4K.
Новые фичи:
- заметно лучшее следование промптам
- более чёткий текст и сильно улучшенная типографика
- сложные макеты, которые действительно не разваливаются
- точное редактирование выбранной области через Magic Wand
- сегментация для правки конкретных частей изображения
- удаление фона в один клик
- мультиреференсное редактирование с поддержкой до 5 изображений сразу
- Smart Resize, с дорисовкой кадра под 1:2, 9:16, 2:3, 3:4, 1:1, 4:3, 3:2, 16:9 и 2:1
- гораздо более сильная консистентность между генерациями и правками
- новые готовые шаблоны для product shots, headshots, e-commerce, игровых ассетов, иконок, мерча и не только
Самое интересное - это редактирование. Magic Wand для изменения только нужной области, сегментация объектов, удаление фона с прозрачностью, Multi-Ref Editing до 5 изображений одновременно и Smart Resize.
Примеры довольно нарядные во всех смыслах. Переодеваторы, переподстригаторы, переобуваторы - всё.
Доступен здесь:
Web: grok.com/imagine
iOS: через приложение Grok в App Store - https://apps.apple.com/us/app/grok-ai/id6670324846
Android: через приложение Grok в Google Play - https://play.google.com/store/apps/details?id=ai.x.grok
API - подвезут везде попозже
Примеры и хвастовство тут:
https://x.ai/news/grok-imagine-image-2
@cgevent
Ну, за переодеваторы! Редактирующие модели их просто пожрали.
Ну и сам релиз твитторного генератора картинок выглядит очень прельстиво.
Grok Imagine Image 2.0 как бы заменяет заменяет прежний Quality Mode в Grok Imagine. Главный упор теперь не только на красивую генерацию, но и на нормальную работу с текстом, сложными макетами, инфографикой и сохранением персонажей и объектов между итерациями.
На Arenе модель сейчас занимает 2-е место и в Text-to-Image, и в Image Editing, уступая GPT-Image-2.
По разрешению есть вопросы: xAI пока не раскрыла нативное внутреннее разрешение Image 2.0, но официально заявленный вывод сейчас - до 2K, без 4K.
Новые фичи:
- заметно лучшее следование промптам
- более чёткий текст и сильно улучшенная типографика
- сложные макеты, которые действительно не разваливаются
- точное редактирование выбранной области через Magic Wand
- сегментация для правки конкретных частей изображения
- удаление фона в один клик
- мультиреференсное редактирование с поддержкой до 5 изображений сразу
- Smart Resize, с дорисовкой кадра под 1:2, 9:16, 2:3, 3:4, 1:1, 4:3, 3:2, 16:9 и 2:1
- гораздо более сильная консистентность между генерациями и правками
- новые готовые шаблоны для product shots, headshots, e-commerce, игровых ассетов, иконок, мерча и не только
Самое интересное - это редактирование. Magic Wand для изменения только нужной области, сегментация объектов, удаление фона с прозрачностью, Multi-Ref Editing до 5 изображений одновременно и Smart Resize.
Примеры довольно нарядные во всех смыслах. Переодеваторы, переподстригаторы, переобуваторы - всё.
Доступен здесь:
Web: grok.com/imagine
iOS: через приложение Grok в App Store - https://apps.apple.com/us/app/grok-ai/id6670324846
Android: через приложение Grok в Google Play - https://play.google.com/store/apps/details?id=ai.x.grok
API - подвезут везде попозже
Примеры и хвастовство тут:
https://x.ai/news/grok-imagine-image-2
@cgevent
🔥20😱16👍12❤8👎1🙏1
Немного утечек про Seedance 2.0
Модель оценивают примерно в 200 млрд параметров. Главная ставка - один огромный unified-backbone, который умеет text-to-video, image-to-video, first/last frame, multi-reference, video editing и работу одновременно с изображениями и референсным видео.
Причём решение масштабировать Seedance минимум до 200B якобы приняли ещё в конце 2025 года, несмотря на внутренние споры.
Для сравнения - Минимакс Н3 - 33 миллиарда параметров.
Ещё интереснее экономика: источники оценивают маржу Seedance в 70-90%, в одном из расследований фигурирует около 80%. Seedance уже якобы приносит больше половины MaaS-выручки Volcano Engine.
@cgevent
Модель оценивают примерно в 200 млрд параметров. Главная ставка - один огромный unified-backbone, который умеет text-to-video, image-to-video, first/last frame, multi-reference, video editing и работу одновременно с изображениями и референсным видео.
Причём решение масштабировать Seedance минимум до 200B якобы приняли ещё в конце 2025 года, несмотря на внутренние споры.
Для сравнения - Минимакс Н3 - 33 миллиарда параметров.
Ещё интереснее экономика: источники оценивают маржу Seedance в 70-90%, в одном из расследований фигурирует около 80%. Seedance уже якобы приносит больше половины MaaS-выручки Volcano Engine.
@cgevent
👍12🔥3❤1👎1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
Трейлер "Красное солнце Педжента".
Автор: Режиссер-оператор-сценарист: Дмитрий Корниенко
тг @Fidelmov
Сразу о важном. Это дань уважения Великому фильму, режиссеру и актерам. Это не танцы на костях и не ради хайпа. Это творческая история. Мне казалось было бы интересным увидеть вновь на экране любимых героев: Сухова, Саида и показать возможное продолжение "Белого солнца пустыни".
Читал записки сценариста оригинала, интервью Мотыля и примерно представлял что планировалось.
Там поговаривали и о сериале и о приквеле, но можно точно утверждать одно - арка Джевдета, была оставлена на продолжение.
✍В общем и целом на создание ушло три дня.
Сценарий у меня написан давно - всего полного метра.
Создавал карты персонажей в Nana Banana 2: Сухов, Джавдет, Саид, Старцы (кто заметил их - респект), Екатерина Матвеевна, Британец и мальчик.
Локации создавал в режиме Cinematic в агрегаторе Freepic (там можно выбирать камеры, объективы и фокусное расстояние, со светом - очень вкусно).
🎬Генерации: Seedance 2.0, Kling 2.6.
Голоса я клонировал в Suno.
В общей сложности по деньгам если прикинуть вышло около 6.000 рублей.
@cgevent
Трейлер "Красное солнце Педжента".
Автор: Режиссер-оператор-сценарист: Дмитрий Корниенко
тг @Fidelmov
Сразу о важном. Это дань уважения Великому фильму, режиссеру и актерам. Это не танцы на костях и не ради хайпа. Это творческая история. Мне казалось было бы интересным увидеть вновь на экране любимых героев: Сухова, Саида и показать возможное продолжение "Белого солнца пустыни".
Читал записки сценариста оригинала, интервью Мотыля и примерно представлял что планировалось.
Там поговаривали и о сериале и о приквеле, но можно точно утверждать одно - арка Джевдета, была оставлена на продолжение.
✍В общем и целом на создание ушло три дня.
Сценарий у меня написан давно - всего полного метра.
Создавал карты персонажей в Nana Banana 2: Сухов, Джавдет, Саид, Старцы (кто заметил их - респект), Екатерина Матвеевна, Британец и мальчик.
Локации создавал в режиме Cinematic в агрегаторе Freepic (там можно выбирать камеры, объективы и фокусное расстояние, со светом - очень вкусно).
🎬Генерации: Seedance 2.0, Kling 2.6.
Голоса я клонировал в Suno.
В общей сложности по деньгам если прикинуть вышло около 6.000 рублей.
@cgevent
👎94👍29❤6🔥5😁2🙏2