Нейросети для анимации?

20 сообщений / 0 новое
Последнее сообщение
egorkae
Аватар пользователя egorkae
Не в сети
Последнее посещение: 39 мин. 25 сек. назад
Регистрация: 19.09.2016
Сообщения: 6514
Рейтинг: 2260
Нейросети для анимации?

Добра, я вероятно ни когда не начну делать анимацию, да думаю теперь уже и не к чему, ведь есть нейросети. Последнее время попадается много всяких прикольных анимацей на аи основе. Раньше было кривовато и мазанно это все, а последнее время прям очень не плохо выглядит. Может кто уже пробовал, чего лучше скачать, чтоб оно и выглядело хорошо и на наши с вами проно арты не ругалось?

Вверх
Понравилось 0.
slawdos
Аватар пользователя slawdos
Не в сети
Последнее посещение: 7 месяцев 3 недели назад
Регистрация: 30.04.2017
Сообщения: 136
Рейтинг: 35

Cascadeur. Но анимацию самому делать нужно. Этакий напильник.

Вверх
Понравилось 0.
egorkae
Аватар пользователя egorkae
Не в сети
Последнее посещение: 39 мин. 25 сек. назад
Регистрация: 19.09.2016
Сообщения: 6514
Рейтинг: 2260

Cascadeur

Да я не про то, я про нейро видео, типа нейронки умеют генерить видео из картинки, мнеб такую "анимацию"

Вверх
Понравилось 0.

И хотя нам прошлого немного жаль, ХУДЬШЕЕ конечно впереди

Gugiramz
Аватар пользователя Gugiramz
Не в сети
Последнее посещение: 4 часа 25 мин. назад
Регистрация: 06.01.2025
Сообщения: 234
Рейтинг: 19

Ну контроль все ещё в приоритете, поэтому попытка изучить блендер только в необходимых моментах вроде анимации и создание хотя бы коротких анимаций попутно оттачивая эти моменты все же пригодятся очень не слабо. ИИ все таки очень хаотичен в этом, да и он все равно не выдаст тот результат который хочется не имея крепкой основы. Кстати ща хз как, но пару месяцев я поинтересовался у одного чувака создающего анимации с помощью ии как то сказал мне, что на его 4090 на 5 сек анимацию уходило примерно по 30 минут

Вверх
Понравилось 0.
Kote
Аватар пользователя Kote
Не в сети
Последнее посещение: 3 недели 1 день назад
Регистрация: 07.04.2017
Сообщения: 312
Рейтинг: 124

Все анимации в нейронках без своей модели не имеют смысла. Так как процесс рандомный и сгенерированные куски будут отличаться во всём. Тем более генерация видео из текстового промта. Во всех генераторах всё изображение плывет и чем дольше видео, тем масштабнее эффект. Поэтому такие генерации сами создатели нейронок часто ограничивают 5 секундами. Это касается абсолютно всех генераторов. И абсолютно все генераторы дают вам загрузить свою лора и ли ещё какую модель. Вот с такой моделью и достигается нормальный выход видео.
У вас, как профессионального 3дешника огромное конкурентное преимущество перед всеми этими ютуберами и инфоцыганами. Научитесь делать свои модели для нейронок из ваших же кукол и станете миллионером Biggrin К вам очредь будет.
В подготовке контента для нейронок даз вне конкуренции, впрочем как и для 3д печати. Вся эта канитель с моделями на самом деле не сложная. На ютубе всё есть. Достаточно английским владеть.

Вверх
Понравилось 0.

alt-lab.org/LAB/

egorkae
Аватар пользователя egorkae
Не в сети
Последнее посещение: 39 мин. 25 сек. назад
Регистрация: 19.09.2016
Сообщения: 6514
Рейтинг: 2260

модели

Вы про 3д модели, типа нейронке можно скормить 3д модель я и она ее будет рисовать? Или вы про нейро модели, типа тренировать их своими картинками?

Вверх
Понравилось 0.

И хотя нам прошлого немного жаль, ХУДЬШЕЕ конечно впереди

Kote
Аватар пользователя Kote
Не в сети
Последнее посещение: 3 недели 1 день назад
Регистрация: 07.04.2017
Сообщения: 312
Рейтинг: 124

Тренировать своими картинками. Хотя можно и скормить 3д модель. Но, если скармливать 3д, то это только для статичного изображения. В стабильной диффузии есть возможность работы и с 3д и с файлами поз (типа анимации) и с картами плотностей (типа фотошоп). Но у них недостаток - они требуют большой видео памяти, в противном случае вы получите скорость генерации, сравнимую со скоростью рендера айрея. Поэтому для видео они не годятся.
Но мы генерили видео во фреймпаке и на 8гиг 3060т с дикой скоростью и продолжительностью до 5 минут.

Вверх
Понравилось 0.

alt-lab.org/LAB/

Некто_Дима
Аватар пользователя Некто_Дима
Не в сети
Последнее посещение: 1 час 30 мин. назад
Регистрация: 13.05.2020
Сообщения: 1534
Рейтинг: 786

если использовать какое то готовое решение то там много приколов. То перс головой начнет крутить из-за чего его лицо меняется, то губы начинают шевелится будто говорит что-то. Потом выясняется что большинство выдает качество видео 460p а если очень повезет то 720p. То есть ты рендерил, настраивал шейдеры, карты всякие шероховатостей крутил, а он тебе все это зашакалил. То что я видел сносного качества - обычно тренируют свои модели. То есть берут 10-20 видеороликов 5 секундных, где одно и то же движение, один и тот же ракурс, темп и направление движения и запускают на компе. Видюха 2-3 дня жарит на максималках без остановки. На выходе получается модель которая может генерить 5 секундый видеоролик. Если нужен другой ракурс или поза - тренируем новую модель. Нужно чтобы персонаж сменил позу в процессе? - тренируем для этого отдельную модель. В общем такая схема.

Вверх
Понравилось 0.

Ум - это способность быстрее, и вернее других, определять причинно-следственные связи,
основываясь на меньшем количестве информации

Kote
Аватар пользователя Kote
Не в сети
Последнее посещение: 3 недели 1 день назад
Регистрация: 07.04.2017
Сообщения: 312
Рейтинг: 124

По существу - модель это ключ к любому ии. На ютубе все ролики с практическим применением ии для заработка в инете хотя бы той же порнушки (на чем зациклен топикстартер), начинаются с разработки своего концепта и модели. А поскольку платить живой модели за нейрофотосессию у нас не принято, то они опять берут стабильную диффузию и генерят рандомные рожи и фигуры. А затем выбирают наиболее эффектную методом "стоит- не стоит" и генерят сотни картинок с одним и тем же промптом и сидом. И пытаются строить свою модель. А по факту получается, что весь онлифанс завален типовыми персонажами, имеющими одно и тоже лицо и говорящие одни и теже фразы. И если сюда добавить ещё чат боты, то картина совсем грустная. По факту во всем инете фигурируют всего три модели как в порнухе, так и в рекламных роликах и обоях. Они легко идетнтифицируются если рассматривать изображение больше 5 секунд. И они все вышли из стабильной диффузии SDXL. Это Пони, Иластриас и Нуб. А вот кастомные модели уже стоят адского бабла. Почему? Просто с реальным человеком всегда работать в разы сложнее чем с 3д болваном. Там и студия и свет и фотошоп. А еще надо ездить на пленеры. А тут за день можно провернуть месяц работы и тучу накладных расходов.

Вверх
Понравилось 0.

alt-lab.org/LAB/

Некто_Дима
Аватар пользователя Некто_Дима
Не в сети
Последнее посещение: 1 час 30 мин. назад
Регистрация: 13.05.2020
Сообщения: 1534
Рейтинг: 786

Скачал я тут Wan 2.1 14B какую то там супер-дупер популярную оптимизированную сборку. И попробовал сгенерить 5 секундый ролик из картинки. Я думая что у меня хорошее железо - rtx 3090, выставил средние настройки, 720p, убрал тиа кэш и прочие ускорения для сохранения качества. Ну и по итогу в процессе вся видеопамять 24 гига забиты, прошел ЧАС а оно только на 30% сделано. Ну такое. Для сравнения - я пробовал платные сервисы с тем же Wan 2.1 и 2.2 Там результат получался за 3-5 минут. Видимо или видюха нужна h200 на 140 гигов или настройки шаманить, но там их куча, что крутить пока не ясно

Вверх
Понравилось 0.

Ум - это способность быстрее, и вернее других, определять причинно-следственные связи,
основываясь на меньшем количестве информации

Шурик
Аватар пользователя Шурик
Не в сети
Последнее посещение: 4 месяца 3 недели назад
Регистрация: 20.09.2024
Сообщения: 173
Рейтинг: 67

Давно сюда не заходил, полностью ушел в видеонейронки, так и заглохло мое желание изучить блендер и подобные софты. Распробовал Wan и меня затянуло, а это китайцы которые клепают опенсорсные модели, и их модели не сильно уступают тем же платным. Есть свои моменты, конечно за бабки на платных сервисах вам будут стараться угодить и оно быстрее у них делается. НО благодаря открытым исходным кодам, там все кипит и нет застоя.

У Wan уже своя экосистема, есть очень много моделей Wan заточенных под какую-то одну цель. Есть t2v = text to video (из написания текста-промпта получаем видео), есть i2v = image to video (из картинки получаем видео), есть Vace который дает контроль, когда можно загрузить как реф любую картинку или любое движение, любое видео и по разным препроцессорам типа (openpose, depth, shapes, flow, transfer motion и др.) переделывать и создавать что вам угодно. И появляются еще и еще, под любые ваши хотелки.
Сейчас кстати актуальна wan 2.2 в открытом доступе, уже маячит 2.5 (пока открытого нет)
На данный момент сбалансированный результат получается по 5-8 секунд, при 10 и более сыпется согласованность и консистентность в кадрах. Приходится делать по кусочкам, потом склеивать на монтаже.

Естественно не все идеально. Но тенденция такова, что глобально сами процессы все перестраиваются и по моим ощущениям все блендеры, фотошопы вынуждены перестраиваться, если они не перестроются они вымрут. Ужасно быстрые темпы. К самому простому примеру, вот выкатили недавно гугловцы свою Нану Банану, это самая первая еще не оперившаяся ласточка, которая убивает или точнее полностью перестраивает процесс коллажирования, обтравки масок в фотошопе и лишней долгой возни. Да сейчас можно спорить что оно не идеально работает, что разрешение мелкое, что детали теряются, что контроля мало. Но посмотрите что было год назад и задумайтесь что будет года через два-три

У вас хорошая карта rtx 3090. Для Wan и вообще на данное время для видеогенераций 720p. А 720p это достойный размер из которого потом можно сделать апскейл. Но как и везде есть свои нюансы.

Нужно изначально ставить Attention Type Sage2, чтобы поставить Sage2 нужно поставить triton. Не с первого раза удается разобраться и поставить этот triton, так как этот код написан под линуксом и до недавнего времени triton тяжело было портировать на windows. Но сейчас все упростилось. Есть чат гпт и другие, которые помогут установить и разобраться.

1.) Вот когда вы установите sage attention 2, генерация уже будет на 40% быстрее не в ущерб качеству.
2.) Далее можно ускорить, подключая всякие тикэш, магкэш, skip шагов и др. Но эта вся хрень уже идет в ущерб качеству поэтому для 3090 этими приблудами не стоит портить себе качество.
3.) Далее есть специальные лоры которые дают возможность снизить шаги (steps), например с 30 шагов до 8, они разительно сокращают время. При этих лорах cfg держится на 1 и не используется негативная подсказка, что ускоряет процесс.

В итоге: я получаю на своей 4090 размер 720*1280 (5 сек, 81 кадр, 16 fps) за 4 минуты, вполне хорошего качества так скажем чуть выше среднего при 5 шагах.
Все еще зависит от модели (естественно от размера) и сколько рефов или препроцессоров подгружены. С тем же размером 720*1280 и с несколькими рефами и работой двух препроцессоров время увеличится, но ненамного, около 4,5 - 5,5 мин.
Карты 3090 и 4090 и их линейки, (ну и 50 серия само собой), это тот сегмент с которыми можно работать с нейросетями локально. Карты моделями ниже и нехваткой памяти уже будут кушать ваше время или вы будете вынуждены использовать всякие "урезаторы которые защемляют качество" чтобы сократить время генерации.

Я не говорю что не надо изучать то или другое, люди которые имеют огромный опыт в создании моделей, которые годами повязаны с 3D, которые на этом уже зарабатывают и знают очень много. У них как бы есть сейчас преимущество, но часть этого преимущества со временем нивелируется. А у молодежи наоборот есть время, больше времени и они будут сосредоточены на другом и им не надо будет тратить время на те старые технологии которые мы когда то изучали.

Ну с чем бы сравнить, кароче это переломный момент глобально, какой нибудь мелкий пиздюк не знает что такое телефон с диском, и то как такие телефоны работали раньше, и ему это до лампочки и знать не надо, у него есть в кармане свой ПОКИФОН и он знает как этим смартфоном пользоваться.
Ну или раньше катались на лошадках, как бы лошадь была основным средством передвижения, как придумали двигатель, надобность в лошадках постепенно отпала. Вымерли лошади? Нет, но используют их уже не столь масштабно, для съемок в фильмах, на ранчо, на бегах и т.д. Но это уже другая история.

Вверх
Понравилось 2.
Шурик
Аватар пользователя Шурик
Не в сети
Последнее посещение: 4 месяца 3 недели назад
Регистрация: 20.09.2024
Сообщения: 173
Рейтинг: 67

egorkae попробуйте Wan 2.2, у вас он нормально будет работать локально. Сейчас делать анимацию через каскадеры или путем всяких оснасток скелетов это время в трубу (это мое мнение никому не навязываю). За пару недель вы спокойно освоитесь. Через месяц а то и раньше начнете комбинировать свои 3d и клепать из них анимации.

Их на самом деле много LTX, Wan, Hunyuan, Framepack у каждого есть свои фишки плюшки, но на мой взгяд Wan на данный момент лучший. А уже конкретно погрузившись в Wan там найдете кучу моделей под себя.

Вверх
Понравилось 0.
egorkae
Аватар пользователя egorkae
Не в сети
Последнее посещение: 39 мин. 25 сек. назад
Регистрация: 19.09.2016
Сообщения: 6514
Рейтинг: 2260

Шурик, спасибо вам огромное за подробный тутор, буду пробовать.

это переломный момент

Тоже думаю, я думаю что 3д совсем не вымрет оно уйдет на фторой план. Типа как были раньше художники, они были единственным способом запечатлеть человека или место, потом появились способы сделать это проще, быстрее, качественнее, но ведь живопись не вымерла, теперь она просто менее востребована. Так же и с 3д мне думается будет. Ну и главное не сама суть 3д а что ты с ней делаешь, главное то что ты творишь, а не как и на чем ты это делаешь

Вверх
Понравилось 1.

И хотя нам прошлого немного жаль, ХУДЬШЕЕ конечно впереди

Gugiramz
Аватар пользователя Gugiramz
Не в сети
Последнее посещение: 4 часа 25 мин. назад
Регистрация: 06.01.2025
Сообщения: 234
Рейтинг: 19

Если не трудно выложи примеры свои сгенерированные какие нибудь, интересно глянуть

Вверх
Понравилось 0.
Шурик
Аватар пользователя Шурик
Не в сети
Последнее посещение: 4 месяца 3 недели назад
Регистрация: 20.09.2024
Сообщения: 173
Рейтинг: 67

Вот примеры https://dropmefiles.com/RtzgG
Ребяты 500 метров, не стал ужимать их просто в архив накидал, по примеру.

И на мои примеры даже близко не стоит ориентироваться, так как сам относительно недавно в эту тему залез.

1. пример Detective_rus_eng.mp4 - пробовал липсинк это (wan) Infinite Talk.
2. пример Gangnam Style.mp4 - пробовал перенос движений модели (wan) Vace.
3. остальные простые примеры - 5секундки, чтобы понять какое качество за 5-8 шагов, за время 4-8 минут на моей карте.

Вверх
Понравилось 0.
Tonga
Аватар пользователя Tonga
Не в сети
Последнее посещение: 28 мин. 41 сек. назад
Регистрация: 08.06.2025
Сообщения: 308
Рейтинг: 77

Шурик, в Вашем видео Gangnam Style в первые несколько секунд идёт голос диктора.
Это ведь тоже нейронка озвучивала ?
Если "да", то какая ? WAN?

Просто голос везде правильно ставит ударения и по нему вообще никак не понятно, что это ИИ-озвучка (если это ИИ озвучка).

Или же этот аудиофрагмент взят в готовом виде из интернета ?

Так то сейчас частенько в Ютубе натыкаюсь на каналы, где автор не только своё лицо не показывает, но и говорить стесняется своим голосом - вся озвучка от ИИ.
Так там это сразу видно. Вернее слышно. Паузы между словами и частями предложения не совсем правильные, а ударения - это вообще тихий ужас.

==============
немного юмора:

1-1758777477

Вверх
Понравилось 1.
Master
Аватар пользователя Master
Не в сети
Последнее посещение: 2 часа 34 мин. назад
Регистрация: 04.06.2020
Сообщения: 703
Рейтинг: 290

На счёт озвучки и музыки соглашусь, реально справляется. Картинки так себе, а видосы - пока что как прикол. Я бы поковырял нейросеть, которая обрабатывает видео через какой-нибудь фильтр, типа, анимация в том же Дазе во вьюпорте, на выходе хотя бы филамент, только без шумов и правильными тенями. То есть с сохранением всего, помимо графики. Придумали что-нибудь такое?

Вверх
Понравилось 0.
Шурик
Аватар пользователя Шурик
Не в сети
Последнее посещение: 4 месяца 3 недели назад
Регистрация: 20.09.2024
Сообщения: 173
Рейтинг: 67

Да, там все нейронки кроме самого оригинального трека Gangnam Style.

Голос диктора это нейронка ESpeech TTS. Делал озвучку таким образом, нашел где-то в нете голос старца, он нужен как образец (семпл) 12-30 сек. (желательно чистый образец искать без примесей других звуков или почистить, отделть голос от других звуков, для этого тоже есть нейронка). Этот чистый образец голоса кидаешь в нейронку ESpeech, она тренирована специально под русский. У нее есть расстановка ударений, ставятся ударение знаками тире -, типа так: "Как чег-о ни генер-ируй...". Есть расстановка автоматом, без возни (автомат рабоатет супер, пока даже не было чтобы он не правильно ударение поставил, но если надо можно вручную поставить ударение как вам надо). Полагаю с ударениями русская озвучка уже этап прошла, теперь думают и рожают как правильно передавать интонацию и эмоции.

Чтобы правильно собрать интонацию пришлось примерно 5-6 раз сгенерировать, и склеить 2 или 3 куска озвучки.

На данный момент с русским круто справляется ESpeech TTS и Vibe Voice от микрософт, которая утекла в свободный доступ. Этими двумя пользуюсь локально = бесплатно, но интонация пока дается тяжело.
Есть платная от 11labs (элевенлабс), которая очень хороша в речи, наверное она бы сделала с двух-трех попыток, но не знаю, платными не пользуюсь.

Вверх
Понравилось 0.
Шурик
Аватар пользователя Шурик
Не в сети
Последнее посещение: 4 месяца 3 недели назад
Регистрация: 20.09.2024
Сообщения: 173
Рейтинг: 67

Master есть такое у Wan как video to video если вы об этом. По сути это модель Text2video 14B, в которой есть опция Video to Video guided by Text Prompt

То есть кидаете ему видео и просите c помощью описания заменить ваше реализм видео на другой стиль (к примеру: анимэ или 3d, или натренерованную лору с конкретным стилем под ваш филамент).

Подключаете лоры нужного стиля. Потом регулируете параметр denoise strength который от 0 до 1, ставите примерно 0,7 и он ваше видео реализма переделает под заданный вами стиль (который вы задали лорой) с шумом 0,7, то есть он смешает ваше основное видео реализма с заданным лорой стилем филамент в процентом соотношении которое больше в сторону филамент.

Предварительно стиль под ваш филамент, а то есть лору надо будет сделать. Как это сделать для видео, не углублялся в эту тему и не изучал этот момент. Тренировал только лоры на картинки. Здесь нужно узнать у человека который имеет опыт в тренировки лор и стилей на видео.
На civitai.com есть много разных стилей и лор натренированных сообществом, но как их делать правильно у каждого свой опыт. Самый верняк поговорить с такими людьми, чтобы поделились опытом.

Но надо понимать что вы не можете кинуть ему 5 мин. видео и он сделает вам за один раз 5 мин. (в другом стиле). Пока все кусочками.

Вверх
Понравилось 0.
daptsol
Аватар пользователя daptsol
Не в сети
Последнее посещение: 9 месяцев 3 недели назад
Регистрация: 19.08.2025
Сообщения: 50
Рейтинг: 7

Есть Wan2.2 animate. Можно и на комп закачать, а также попробовать бесплатно на сайте у них. Ограничений особых не заметил, если только специально не тормозят для халявщиков.https://wan2animate.com/ru#gradio_embed
Я думаю, на сайте реальнее работать, чем на домашнем компе. Есть два режима. Полный дипфейк. Замена в реальном видео на другого человека. Используется преференс картинка для создания аватара.
Есть качество - про и std. PRO генерирует видео дольше и качество лучше. STD - быстрее и качество, естественно, похуже. Но не сильно. Количество фреймов в секунду меньше.
Я использовал другой режим -move. То есть движение на видео используется для анимации картинки. Доволен? в общих чертах - очень да. Поделюсь сразу, чего надо избегать. Картинка и фигура в видео лучше, чтобы была в одной позе. И понятно, чем четче видео, с хорошим освещением, тем проше ИИ понять, что от него требуется. Условия для создания видео - размер, объем и тд там есть на сайте. Разрешено максимум 30 сек за раз. Придется видео делить по 30 сек. Из опыта - ближе к 30 сек появляется желтизна на коже (азиаты, видимо, проглядывают) и могут появиться небольшие ошибки в отображении.
Одним словом, можно анимировать хоть фото, хоть любую картинку. Скорее всего, только человека. А может и нет. Lol
Когда сделаю свой музыкальный клип, используя этот сервис, то здесь в теме опубликую.

Вверх
Понравилось 0.