Google Lumiere: Будућност генерисања реалистичних видеа помоћу вештачке интелигенције

  • Користи архитектуру простор-време-U-Net за генерисање комплетних видео записа у једном кораку, избегавајући визуелна изобличења.
  • Омогућава вам да креирате видео записе из текста, анимирате статичке слике и правите прецизне измене објеката у постојећим клиповима.
  • Превазилази ограничења генерисања кадар по кадар, постижући супериорну временску кохерентност и флуидност покрета.
  • Тренутно је у експерименталној и истраживачкој фази, без приступа широј јавности из безбедносних и етичких разлога.

Вештачка интелигенција у видео формату

Да ли сте икада стали да размислите колико би невероватно било написати једноставан ред текста и, у трен ока, имати Фотореалистичан и кохерентан видеоТо није научна фантастика, то је обећање Гугл Лумијера, модела вештачке интелигенције који разбија калуп визуелног стваралаштва кроз најсавременију технологију под називом просторно-временска дифузијаЗа свакога ко је укључен у технолошки сектор или је једноставно фасциниран иновацијама, разумевање овог скока је кључно да не заостане у данашњем дигиталном окружењу.

Супротно ономе што многи верују, не говоримо о програму који једноставно додаје покрет статичким сликама. Имамо посла са архитектура дизајнирана од нуле да разуме физику померања објеката у времену и простору. Овај пројекат, замишљен у Гугловим лабораторијама, настао је са јасним циљем елиминишите нагле скокове И ти чудни покрети који су чинили да видео снимци генерисани вештачком интелигенцијом делују, до сада, помало надреално.

Шта је тачно Лимијерова магија?

Највећи проблем са генеративним вештачким интелигенцијом видео записа био је недостатак конзистентности. Објекат би мењао облик или се искривљавао из секунде у секунду. Лумијер решава овај проблем јер... обрађује све информације истовременоспречавајући вештачку интелигенцију да „заборави“ како је изгледао први кадар док не стигне до десетог. Ово осигурава да визуелна стабилност буди тоталан: ако мачка трчи кроз башту, она ће остати иста мачка током целог снимка, без трансформације у нешто друго на пола.

Технички кључ лежи у систему Простор-Време-U-Net (STUNet)Док већина традиционалних алата креира видео кадар по кадар (класичан стил анимације), Lumiere генерише комплетан низ у једном коракуОвај приступ омогућава флуидно и природно кретање, јер модел анализира пикселе и време истовремено, разумевајући основне физичке концепте као што су проток воде или тежина падајућих предмета.

Креативне могућности и алати за уређивање

Могућности за креативне одељења су, искрено, невероватне. Једна од њихових главних функција је текст у видеогде је једноставно описивање детаљне сцене довољно да вештачка интелигенција оживи сцену. Али то се ту не зауставља; може и да оживе фотографијетрансформисање статичне слике у видео где се облаци крећу или река тече природно.

Штавише, Лумијер се истиче у аутоматизованој постпродукцији. Омогућава задатке као што су префарбавање и селективна монтажа коришћењем текстуалних команди. На пример, можете га замолити да промени само боју одеће особе у претходно снимљеном видеу или да дода додатке попут наочара или круна, а да остатак сцене остане исти. потпуно нетакнут и конзистентанЧак вам омогућава да креирате синемаграфе, анимирајући само одређени део фотографије док остатак остаје непокретан.

Техничка анализа и перформансе

Што се тиче бројева, систем је способан да генерише клипове од око пет секундипроизводећи 80 кадрова брзином од 16 кадрова у секунди и са резолуцијом од 1.024 x 1.024 пиксела. Иако Google оцењује ове резултате као „ниске резолуције“, реализам у текстурама коже, металургији и динамичко управљање осветљењем Изненађујуће је. Да би се ово постигло, модел је трениран са масовним распоређивањем 30 милиона видео снимака праћено текстуалним описима.

Поређење са конкуренцијом и доступност

Ако га упоредимо са другим гигантима, видимо занимљиве нијансе. Док Сора од ОпенАИ Иако се Lumiere истиче по креирању дужих клипова, фокусира се на ефикасност своје једнокорачне архитектуре и прецизност монтаже. У поређењу са Писта или ПикаГуглов предлог се опредељује за више фотографски и технички реализам, идеалан за професионално и маркетиншко окружење, донекле се удаљавајући од фантастичнијих стилова.

Сада, ево ситних слова: Није отворено за јавност. Генерално. Тренутно је истраживачки пројекат у контролисаном тестирању. Гугл је веома опрезан са објављивањем како би усавршио безбедносне филтере и спречио стварање дипфејкови или дезинформацијеПрича се да би неке функције могле бити интегрисане у YouTube или Google Workspace у блиској будућности.

Утицај на индустрију и етику

Примена ове технологије донеће радикалну промену у кинематографији, омогућавајући редитељима да... преглед сцене веома јефтино пре снимања. У маркетингу, брендови ће моћи аутоматски да генеришу хиперперсонализоване огласе. Међутим, ова моћ долази са огромном одговорношћу, приморавајући индустрију да ствара водени жигови и системи верификације да разликује оно што је стварно од онога што је вештачки створено.

Овај модел, који одаје почаст пионирима кинематографије, браћи Лимијер, означава прекретницу у којој Креативност више нема техничка ограничења.Способност разумевања тродимензионалности и времена у једној неуронској мрежи приближава нас будућности у којој је баријера између маште и визуелног извршења практично нестала, трансформишући начин на који причамо приче у дигиталном добу.


Додај као жељени извор