30 sekund to nie tylko podwojenie: Seedance 2.5 przenosi wyzwania AI wideo poza obiektyw
Raport z CoinWorld:
Pierwszy raz korzystając z AI do tworzenia wideo, większość ludzi szybko przechodzi przez dwa etapy.
Na początku jest ekscytacja. Postacie się poruszają, kamera zbliża, światło wygląda dobrze. Po kilku próbach ekscytacja ustępuje miejsca innemu uczuciu: piękne ujęcia zbierają się w czasie, ale nie tworzą spójnego filmu. Ta postać przed chwilą była w czarnym ubraniu, a po obrocie kamery zmienia się jej kołnierz; w jednej sekundzie pada deszcz, w następnej ziemia jest sucha; poszczególne obrazy wyglądają dobrze, ale w całości coś nie gra.
Seedance 2.5 zwiększa limit jednorazowego generowania z 15 sekund do 30 sekund, a także pozwala na jednoczesne przyjmowanie większej liczby zdjęć, wideo i dźwięków jako odniesień. Po premierze pod koniec lipca, dyskusje koncentrowały się głównie na "30 sekundach bezpośrednio". Ci, którzy korzystali z modeli wideo, wiedzą, że podwojenie czasu to nie tylko kwestia czekania dłużej.
15 sekund wystarcza na wykonanie jednego ruchu, stworzenie atmosfery lub zaprezentowanie produktu. 30 sekund zaczyna mieć minimalną formę opowieści: postać musi przejść z jednego stanu do drugiego, ruch musi mieć przyczynę, a emocje muszą mieć punkt kulminacyjny. Im więcej kroków wykonuje postać, tym więcej rzeczy model musi zapamiętać.
Podczas testów Geek Park napisano o scenie w kawiarni: dziennikarz wpatruje się w pusty dokument, pije kawę, zaczyna pisać, a za oknem kolor zmienia się z ciepłego żółtego na głęboki niebieski, na końcu zamyka komputer. Słowa kluczowe nie są skomplikowane, ale trudności kryją się w procesie - relacja między ręką a kubkiem, zmiany światła za oknem, rytm pisania na klawiaturze, wyraz twarzy postaci od niepokoju do relaksu. Jeśli te szczegóły będą błędne w dwóch lub trzech miejscach, widzowie stracą zainteresowanie.
Dlatego presja, którą przynosi Seedance 2.5, spoczywa przede wszystkim na twórcach. Kiedyś wystarczyło napisać "filmowy klimat, zmierzch, powolne zbliżenie", aby uzyskać piękny fragment; teraz trzeba najpierw przemyśleć, co dokładnie wydarzy się w ciągu 30 sekund.
Większa pojemność materiałów wiąże się z tym samym problemem. Model może przyjąć więcej odniesień w postaci zdjęć, wideo i dźwięków, ale materiały nie ustawią się automatycznie w kolejce. Które zdjęcie odpowiada za postać, które wideo tylko pożycza ruch kamery, skąd zaczyna się muzyka, które odniesienia są sprzeczne, wszystko to musi być ustalone przez kogoś. Pole wejściowe znów staje się warsztatem.
To również wyjaśnia, dlaczego ostatnio "inteligentne klipy" i "zarządzanie storyboardem" zyskały na popularności. To, co robią, nie jest tajemnicze: rozdzielają dojrzałe wideo na ujęcia, ruchy i muzykę, aby twórcy wiedzieli, co właściwie naśladują, a następnie przypisują odniesienia do odpowiednich etapów.
Generowanie wideo doszło do punktu, który przypomina wczesną fotografię cyfrową. Aparaty stają się coraz mądrzejsze, nie eliminując kompozycji i montażu, a jedynie sprawiając, że naciśnięcie spustu migawki stało się tańsze. Wideo AI działa podobnie. Model odpowiada za generowanie materiałów, ale gotowy film nadal wymaga wyboru.
30 sekund zmienia również podział pracy w zespole. W erze krótkich fragmentów, osoby najlepiej znające model często zajmowały się słowami kluczowymi, losowaniem i wstępnym montażem; gdy czas się wydłuża, waga wstępnych scenariuszy i zarządzania zasobami zyskuje na znaczeniu. Jakie kąty muszą być przygotowane dla tej samej postaci, w których ujęciach kostiumy i rekwizyty muszą być spójne, czy dźwięk jest generowany przez model, czy dodawany później, wszystko to musi być ustalone przed generowaniem. W przeciwnym razie zaoszczędzony czas na zdjęciach zamieni się w niekończące się powtórki.
To również wyjaśnia, dlaczego "50 materiałów referencyjnych" może być łatwo źle zrozumiane. Pojemność wskazuje, ile informacji model może przyjąć, ale nie gwarantuje, że każda informacja zostanie zrozumiana w równym stopniu. Im więcej odniesień, tym większe prawdopodobieństwo konfliktów. To, co twórcy muszą zrobić, to nie wypełniać limitu, ale ustalać priorytety dla materiałów: to zdjęcie skupia się na twarzy, ten fragment odnosi się tylko do ruchu, ta ścieżka dźwiękowa decyduje o rytmie. W tym momencie słowa kluczowe stają się bardziej jak uproszczony plan zdjęciowy.
Problemy z prawami autorskimi również stają się bardziej widoczne wraz z wydłużeniem czasu. Podobna twarz, sekunda zbliżająca się do kompozycji z jakiegoś filmu, mogą w fragmentarycznym przekazie przejść niezauważone; w pełnej narracji źródła postaci, scen i muzyki są łatwiejsze do rozpoznania. Jeśli zespół komercyjny planuje wykorzystać generowane wideo w reklamach i serialach, samo "model może generować" nie wystarczy, muszą również zachować źródła materiałów referencyjnych, zakres licencji i rejestr zmian.
Dźwięk również nie może być oceniany tylko pod kątem "czy jest synchronizowany". Czy dialogi nie są zniekształcone, czy dźwięki otoczenia nie przerywają nagle, czy muzyka nie zagłusza postaci, wszystko to musi być poddane przeglądowi. Gdy obraz jest już widoczny, problemy, które wcześniej były rozwiązywane przez nagranie, montaż i miksowanie, wracają jeden po drugim do procesu.
Dla zespołów komercyjnych rachunki muszą być jeszcze bardziej szczegółowe. Zbliżenie na główną postać warto generować wielokrotnie przy użyciu wysokiej jakości modelu, podczas gdy półtorasekundowy przelot uliczny może nie być konieczny. Użycie najdroższego modelu do każdego ujęcia niekoniecznie poprawi jakość gotowego filmu, ale może szybko przekroczyć budżet na moc obliczeniową. To, czy 30 sekund można wykorzystać, nie zależy od tego, jak oszałamiająca jest oficjalna prezentacja, ale od tego, ile razy zespół musi przerobić, aby uzyskać wersję gotową do dostarczenia.
Seedance 2.5 to oczywiście kolejny krok w rozwoju umiejętności. Umożliwia lepszą spójność postaci i ciągłe wyrażanie, a także przekształca problem z "czy model może to narysować" w "czy twórca wie, czego chce".
Jedna minuta, dwie minuty prędzej czy później nadejdą. Wtedy firmy zajmujące się modelami będą kontynuować rozmowy o czasie, a prawdziwi twórcy filmów prawdopodobnie będą się martwić tylko o trzy rzeczy: ile razy to poprawić, ile to kosztuje, i czy widzowie będą chcieli to obejrzeć do końca.
Cena --
Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.
Możesz również polubić

Serenity: Uniwersalne roboty powinny dostosować się do ludzkiego świata, Tesla Optimus skupi się na humanoidalnym designie

Tudor Investment zwiększa udział w akcjach IBIT do 688529

Finansowanie w wysokości 500 miliardów dolarów od NVIDIA wspiera sprzedaż GPU

P2P.org umożliwia klientom Arkis handel z wykorzystaniem stakowanych aktywów

Grubhub wypłaca 23,8 miliona USD dostawcom i klientom po umowie z FTC

Form Energy pozyskuje 750 milionów dolarów na zwiększenie produkcji baterii długoterminowego magazynowania energii

DTCC, tokenizacja papierów wartościowych przechowywanych w DTC w rzeczywistych transakcjach

Zalecenia celne dotyczące tranzytu ukraińskich towarów przez Mołdawię

Interwencja w jen: wspólna manewra, która manipuluje jego bogactwem i ujawnia państwową kruchość

Nawet jeśli Bitcoin rośnie, to niekoniecznie ma to związek z tobą

Wywiad z założycielem Axis Robotics: Dane robotów nowym ulubieńcem kapitału, jak „sprzedawcy łopat” zarabiają?

Wywiad z CEO Bifu: Budowanie następnej generacji sieci transakcyjnej z finansową równością w centrum

Asmpt Tokenized Stock (xStock): profil tokena ASMPTx

Grayscale wycofuje trzy wnioski o ETF-y altcoinów w 190 sekund

Czy reasekuracja może stać się źródłem dochodów on-chain?… Alea Research analizuje model łączenia RWA i DeFi w Re

Zgłoszenia podatników w zakresie kryptowalut w USA wynoszą od 32% do 56% – badania

Nadchodzi hossa na rynku aktywów cyfrowych... Podobieństwo do przełomu w szybkim internecie na początku lat 2000

Najlepszy konkurs kryptowalutowy w sierpniu: Strona pokerowa CoinPoker ujawnia globalne mistrzostwa online w pokerze o wartości 50 milionów dolarów

Kruchość zatrudnienia: prawdopodobieństwo utrzymania pracy spadło do najniższego poziomu w ostatniej dekadzie

Vitalik Buterin wita badania Signal nad rejestracją bez numeru telefonu

MiniMax Code wprowadza wersję CLI na terminal

Wyoming ujawnia pośrednie zaangażowanie w HYPE w drugim kwartale w zgłoszeniu 13F

Ciemne baseny dominują, wieloryby ukrywają się: Jakie są sygnały z rynku publicznego, ile można im ufać?

Podróż do Japonii będzie droższa: wzrost jena i nowe ograniczenia dla turystów
![[Artykuł] Rozszerzenie terytoriów handlowych i stablecoiny w wonie… Dajcie nam szansę na nową grę](/public-static/24_18140364e2.png?format=avif)
[Artykuł] Rozszerzenie terytoriów handlowych i stablecoiny w wonie… Dajcie nam szansę na nową grę

60 lat od "Revolver": album, którym The Beatles zrewolucjonizowali zasady nowoczesnej muzyki

Rząd zezwala JetSMART Airlines na uruchomienie lotów między Medellín a Buenos Aires

Dubai Duty Free wprowadza płatności kryptowalutowe

Prawda o niepokoju w branży kryptowalut: tracimy zdolność do innowacji






