Recenzja Adobe Firefly: Czy trzy nowe narzędzia audio oparte na sztucznej inteligencji są dobre?
Przetestowaliśmy trzy nowe narzędzia audio Adobe Firefly oparte na sztucznej inteligencji. Dowiedz się, jak skuteczne są i czy warto je wypróbować w swojej firmie.
Najważniejsze rzeczy, które musisz wiedzieć
- Generate Music to „prawdziwy zwycięzca” wśród narzędzi, tworzący początkowo akceptowalne utwory, które znacznie się poprawiają, gdy używa się precyzyjnych poleceń tekstowych definiujących nastrój, styl, cel i poziom energii.
- Narzędzie Generuj efekty dźwiękowe jest bardzo przydatne, wymaga precyzyjnych, ręcznych poleceń tekstowych i umożliwia dodawanie wielu ścieżek audio, kontrolując ich położenie i poziom na osi czasu.
- Generate Speech 45 oferuje mówcom opcje sterowania pauzami, co jest przydatne dla marketerów i twórców treści, którzy chcą przyspieszyć codzienną produkcję filmów wideo, jednak nie zastępuje profesjonalnego dubbingu.
- Adobe wprowadza trzy nowe narzędzia audio Dzięki sztucznej inteligencji W Świetliku
- Twórcy mogą teraz korzystać z funkcji Generuj muzykę, Generuj mowę i Generuj efekty dźwiękowe.
- Przetestowałem, żeby zobaczyć jak sprawdza się przy tworzeniu filmów.
Po okresie testów beta, Adobe Firefly wydało trzy nowe narzędzia audio oparte na sztucznej inteligencji, obiecujące „dźwięk studyjnej jakości” dostępny dla wszystkich twórców. Przetestowałem każde z nich, aby sprawdzić, czy rezultaty są zgodne z oczekiwaniami – i generalnie tak było, z kilkoma drobnymi problemami.

Generowanie muzyki, generowanie efektów dźwiękowych i generowanie mowy to najnowsze funkcje audio, które pojawiły się na platformie AI firmy Adobe opartej na przeglądarce (ich funkcje są jasne, gdy spojrzymy na ich nazwy).
Z mojego doświadczenia ze wszystkimi trzema narzędziami, Generate Music wyróżnia się; jest o wiele lepsze, niż się spodziewałem i wierzę, że marketerzy i twórcy bardzo na nim skorzystają. Możesz wypróbować je samodzielnie, klikając tutaj.
Co więc nowego?
Trzy narzędzia AI są teraz dostępne dla każdego. Ich funkcje są w dużej mierze oczywiste, ale oto, co warto wiedzieć:
- Generuj muzykę Umożliwia tworzenie licencjonowanych utworów muzycznych, które będą pasować do długości i nastroju Twoich filmów.
- Generuj mowę Teksty pisane są zamieniane na komentarze głosowe.
- Generuj efekty dźwiękowe Generuje – jak się domyślasz – efekty dźwiękowe, które dopasowują się do ruchu i tempa filmu.
Ale czy jest to naprawdę takie dobre?
Pisałem już wcześniej o moim sceptycyzmie wobec sztucznej inteligencji w ogóle i obawach związanych z jej wykorzystaniem w twórczości. To jedynie symulacja sztuki.
Jednak narzędzia Adobe zrobiły wrażenie nawet na najbardziej zagorzałych sceptykach sztucznej inteligencji w moim zespole – zwłaszcza takie funkcje jak Generative Extend w oprogramowaniu do edycji wideo. Jestem osobą otwartą, więc postanowiłem wypróbować te narzędzia osobiście i przekonać się, jak naprawdę działają.
Na razie skupiamy się na przyspieszeniu procesu kreatywnego, zarówno dla marketerów, jak i twórców treści .
Tworzenie muzyki za pomocą sztucznej inteligencji

Zacząłem od narzędzia Generate Music , w którym można swobodnie wprowadzać polecenia tekstowe lub przesyłać klipy wideo, a sztuczna inteligencja spróbuje odgadnąć rodzaj muzyki, której szukasz. Wykorzystałem krótki, 27-sekundowy klip, który nagrałem na potrzeby mojej recenzji reMarkable Paper Pure (ponieważ wciąż znajdował się w folderze z pobranymi plikami).
Na tej podstawie Firefly zaproponował polecenie skryptu dla „spokojnej, głębokiej, elektronicznej piosenki w klimacie ambient na prezentację produktu”.
Nacisnąłem przycisk „Generuj” i w ciągu kilku sekund – prędkość była naprawdę zdumiewająca – zobaczyłem cztery utwory do wyboru, wszystkie różne, ale o tym samym klimacie. Były… akceptowalne. Trochę generyczne, ale mogły się sprawdzić w nagłych wypadkach lub do szybkiego ukończenia projektu. (Aby dowiedzieć się więcej o wpływie sztucznej inteligencji na branżę muzyczną, przeczytaj nasz artykuł o tym, jak Apple Music wymaga od artystów tagowania utworów tworzonych przez AI ).
Postanowiłem dodać do polecenia skryptu kilka innych terminów, takich jak „jazz” i „cinematic”, do użycia w „vlogu” i „zwiastunie”. Zmieniłem ustawienie „Energia” z „niskiej” na „średnią”. Rezultaty były znacznie lepsze.
Jak we wszystkich narzędziach AI, im bardziej precyzyjne polecenia tekstowe, tym lepszy wynik. Istnieje również możliwość samodzielnego opisania atmosfery, stylu i celu, jeśli masz konkretny pomysł.
Stąd możesz pobierać muzykę, filmy lub tylko muzykę.
Tworzenie narracji generowanych przez sztuczną inteligencję

Przechodząc do narzędzia Generate Speech , najpierw użyłem paska bocznego, aby wybrać model sztucznej inteligencji, który chcę wykorzystać; w chwili pisania tego tekstu dostępny był bezpieczny komercyjnie model Firefly firmy Adobe oraz model partnerski ElevenLabs Multilingual V2.
Następnie wybrałem mówcę z listy 45 opcji, z których każda była opisana jako mężczyzna, kobieta, osoba niebinarna, młoda, w średnim wieku, starsza itd.
Na koniec wkleiłem tekst w pole tekstowe; Firefly potrafi wykryć używany przeze mnie język, ale możesz go wybrać samodzielnie. Użyłem wiersza „Ozymandias” (z najszczerszymi przeprosinami dla Shelley).
Spodobało mi się to, że po wprowadzeniu tekstu możesz wybrać, czy chcesz dodać więcej tekstu, czy poinstruować sztuczną inteligencję, aby zatrzymała się w określonych miejscach.
Aby faktycznie odsłuchać dźwięk, musiałem zaznaczyć cały klip i skorzystać z menu kontekstowego. Można tam też poprawić wymowę i dostosować ton głosu.
Przy całym tym gadaniu o przyspieszaniu przepływów pracy, wydaje mi się to błędem. Wystarczy przycisk Start u dołu ekranu.
Musiałem dostosować interwały pauzy, aby tekst miał więcej przestrzeni, a po ich ustawieniu mogłem zmieniać czasy, klikając przycisk pauzy na ekranie podglądu. Z jakiegoś powodu to słowo „land” (kraina) zmyliło sztuczną inteligencję, która wymówiła je jako „ lan ” (nieczytelne ).
Tworzenie efektów dźwiękowych (SFX) wspomaganych przez sztuczną inteligencję

Do tego testu ponownie wykorzystałem film, który nakręciłem na potrzeby mojej recenzji reMarkable – tym razem był to 12-sekundowy klip porównujący reMarkable 2 i Paper Pure.
Ten proces jest znacznie bardziej złożony, co oznacza, że sztuczna inteligencja nie zgadnie, jakie są możliwe efekty dźwiękowe (SFX). Musiałem ręcznie opisać, czego chcę. Następnie kliknąłem „Ulepsz monit”, który dodał więcej opisów.
I tak oto powstał „przesuwany gwizdek, który płynnie opada z cichym, metalicznym dźwiękiem”. Kliknięcie „Generuj” szybko wygenerowało cztery różne, ogłuszające warianty. Nie będę wam pokazywał tych wyników. To niesprawiedliwe wobec nikogo.
Zamiast tego, przez 12 sekund powtarzano cichszy „dźwięk chrupnięcia na polu”, aby wypełnić długość filmu.
Największą zaletą opcji Efekty dźwiękowe (SFX) jest możliwość dodawania wielu ścieżek dźwiękowych i używania uchwytów w celu dostosowania ich położenia.
Z linią czasu biegnącą u dołu ekranu, program bardziej przypomina prawdziwy edytor audio (przynajmniej do pewnego stopnia). Przeciągając uchwyty głośności, możesz dostosować głośność lub usunąć utwór.
Czy warto podejmować taki wysiłek?
Ogólnie rzecz biorąc, chciałbym tu zobaczyć kilka udoskonaleń interfejsu użytkownika, które przyspieszyłyby proces produkcyjny.
Nie sądzę, żeby w najbliższym czasie zastąpiło profesjonalnych projektantów dźwięku, kompozytorów i muzyków. Ale po mojej pracy w marketingu widzę jego miejsce w marketingu i codziennym tworzeniu filmów.
Od czasów, gdy Microsoft Sam wydawał głosy przypominające te z robotów, sposób mówienia bardzo się rozwinął, ale jeśli chodzi o wierne odtwarzanie głosu, nic nie przebije profesjonalnego wykonawcy w studiu.
Jednak efekty dźwiękowe (SFX) oferują o wiele większą przewagę. W różnych generacjach nie potrafiłem odróżnić dźwięków generowanych przez sztuczną inteligencję od tych odtwarzanych na starej płycie SFX, którą posiadałem.
Prawdziwym zwycięzcą jest funkcja „Generuj muzykę”. Nawet podstawowe stwierdzenie generowało dźwięk, który nie brzmiał niestosownie w prezentacji produktu, recenzji, wyjaśnieniu biznesowym czy czymkolwiek podobnym. I poprawiało się z każdym kolejnym pokoleniem, które odtwarzałem.
Warto więc rozważyć tę aktualizację, jeśli zależy Ci na szybkiej produkcji wideo.
Możliwość dodawania komentarzy nie jest dostępna.