Sprawdź wejście, wyjście, kredyty i przykładowy wynik, a potem wypróbuj ten model bezpośrednio na stronie. Przejdź do Studio, gdy potrzebujesz zapisanej historii, zasobów albo dłuższej iteracji.
Przykładowy wynik
Volcengine Video Lip Sync
Najlepsze do
Ponowne udźwiękowienie klipu prezentera zastępczą ścieżką głosowąLokalizowanie istniejących wideo z jednym mówcąPoprawianie dialogu przy zachowaniu zatwierdzonego materiałuFrontalne klipy społecznościowe, instruktażowe lub z rzecznikiem
Obsługuje
Wideo + dźwięk na wideo
Próba online
Wypróbuj Volcengine Video Lip Sync
Prześlij jedno obsługiwane wideo źródłowe i jedną ścieżkę głosową, następnie wybierz przetwarzanie Lite lub Basic i tylko ustawienia dostępne w danym trybie.
Wyniki
Volcengine Video Lip Sync
VolcengineAI.generator.modes.video-audio-to-video
Użyj Volcengine Video Lip Sync, gdy materiał źródłowy ma już właściwą osobę, kadr i ruch, ale ruch ust ma podążać za innym nagraniem głosu.
Volcengine Video Lip Sync
Brak wyniku. Prześlij prompt, aby rozpocząć uruchomienie.
Wideo + dźwięk na wideo
Dopasowanie decyzyjne
Kiedy ten model jest właściwym wyborem
Dopasowanie decyzyjne
Sygnały dopasowania
Dokładnie jedno wideo źródłowe i jedna docelowa ścieżka audio
Tryb Lite dla frontalnego materiału z jedną osobą
Tryb Basic dla bardziej złożonych scen z jedną osobą
Opcjonalne oddzielanie głosu i ustawienia dopasowania zależne od trybu
Kredyty i czas wyniku podążają za zweryfikowaną ścieżką audio
Najlepiej dopasowane zadania
Użyj go, gdy zadanie wygląda tak
Ponowne udźwiękowienie klipu prezentera zastępczą ścieżką głosowąLokalizowanie istniejących wideo z jednym mówcąPoprawianie dialogu przy zachowaniu zatwierdzonego materiałuFrontalne klipy społecznościowe, instruktażowe lub z rzecznikiem
Najważniejsze fakty
Wejścia, wyjście i kredyty do potwierdzenia
Dostawca
Volcengine
Kategoria
Wideo
Możliwości
Wideo + dźwięk na wideo
Model kredytów
per_input_second · default=8 · ⌈total⌉
Ścieżka wejścia
Do 2 plików referencyjnych
Konfiguracja promptu
Prowadzone promptem
FAQ
FAQ Volcengine Video Lip Sync
Do czego najlepiej używać Volcengine Video Lip Sync?
Użyj go, gdy wideo źródłowe jest już wynikiem wizualnym do zachowania, a tylko wypowiedź ma podążać za inną ścieżką głosową. To przepływ synchronizacji ust oparty na wideo i audio, a nie generator wideo prowadzony promptem ani model animacji portretu.
Jakie pliki mogę przesłać w Rivya?
Prześlij dokładnie jedno wideo MP4 lub MOV o rozmiarze do 95 MB oraz jeden plik audio MP3, M4A, WAV, AAC albo OGG o rozmiarze do 10 MB. Wideo musi mieścić się w obsługiwanej geometrii od 360p do 1080p, działać z częstotliwością od 24 do 60 fps i bitrate od 1 do 30 Mbps, a oba pliki muszą mieć dodatni, zweryfikowany czas trwania.
Czy wybrać tryb Lite czy Basic?
Wybierz Lite dla jednej osoby zwróconej do kamery, gdy przydają się szybsze przetwarzanie i ustawienia dopasowania audio do wideo. Wybierz Basic dla bardziej złożonej sceny z jedną osobą, szczególnie gdy potrzebne są segmentacja scen i identyfikacja mówcy.
Jak działają ustawienia dostępne tylko w Lite?
W trybie Lite dopasowanie audio może zapętlać wideo, gdy docelowe audio jest dłuższe. Pętla odwrócona jest dostępna tylko przy włączonym dopasowaniu, a wartość początku szablonu wybiera miejsce rozpoczęcia sekwencji źródłowej. Tryb Basic nie używa tych ustawień.
Jak obliczane są kredyty?
Rivya stosuje stawkę 8 kredytów za zweryfikowaną sekundę audio, a czas wyniku podąża za tym audio. Ułamkowy czas pozostaje częścią pełnego obliczenia, a w górę do pełnego kredytu zaokrąglana jest tylko suma rezerwacji. Gdy zgłoszone rzeczywiste zużycie jest prawidłowe i nie przekracza rezerwacji, Rivya rozlicza zadanie według tej wartości; brakujące, nieprawidłowe lub przekraczające rezerwację zużycie trafia do uzgodnienia zamiast powodować ukryte dodatkowe obciążenie.
Co mogę zrobić na tej stronie synchronizacji ust?
Połącz istniejące wideo z jedną osobą z docelową ścieżką głosową, aby widoczna mowa podążała za nowym audio, a materiał źródłowy pozostał podstawą wizualną.
Co sprawdzić przed przesłaniem?
Użyj obsługiwanego pliku MP4 lub MOV z wyraźnie widocznym mówcą, następnie przygotuj czystą ścieżkę głosową. Sprawdź, czy wideo ma nie więcej niż 95 MB, a jego rozdzielczość, liczba klatek i bitrate mieszczą się w podanych limitach.
Od którego trybu zacząć?
Zacznij od Lite dla prostego materiału frontalnego. Użyj Basic, gdy scena jest bardziej złożona albo przydają się segmentacja scen i identyfikacja mówcy.
Czy muszę się zalogować i jak działają kredyty?
Szczegóły są publiczne, ale przesyłanie i generowanie wymagają logowania. Cena wynosi 8 kredytów za zweryfikowaną sekundę audio, wynik podąża za czasem audio, a w górę zaokrąglana jest tylko końcowa obliczona suma.
Kiedy otworzyć pełne Studio?
Zostań tutaj dla jednego testu wideo źródłowego i ścieżki głosowej. Otwórz Studio dla zapisanych dubbingów, kolejnych języków lub ujęć, porównań albo dłuższego przepływu lokalizacyjnego.
Porównaj alternatywy
Inne modele warte rozważenia
Wideo
Seedance 2.0
Pełny model wideo Seedance 2.0 od ByteDance z jawną obsługą generowania tylko z promptu, animacji prowadzonej klatkami i generowania z referencją multimodalną. Rivya utrzymuje udokumentowany podział ról jawnie, aby wejścia klatek i referencje multimodalne pozostały wzajemnie wykluczające się, zamiast zlewać się w jeden niejasny koszyk uploadu.
Dlaczego warto go rozważyć
Rozważ go, gdy następne zadanie wymaga Prompt, klatki albo referencje obrazu/wideo/audio.
WejściePrompt, klatki albo referencje obrazu/wideo/audio
Szybszy model wideo Seedance 2.0 od ByteDance z pełnym routingiem scen dla generowania tylko z promptu, animacji obrazu prowadzonej klatkami i multimodalnego generowania wideo z referencją. Rivya utrzymuje udokumentowany podział scen jawnie, aby wejścia pierwszej i ostatniej klatki nie mieszały się z rolami obrazów, wideo i audio referencyjnych.
Dlaczego warto go rozważyć
Rozważ go, gdy następne zadanie wymaga Prompt, klatki albo referencje obrazu/wideo/audio.
WejściePrompt, klatki albo referencje obrazu/wideo/audio
Najlepsze doSzybkie prewizualizacje reklam z promptów lub klatek storyboardu
Wideo
Seedance 1.5 Pro
Model wideo Seedance do text-to-video i image-to-video z natywną synchronizacją audio-wideo. Obsługuje klipy 480p–1080p o długości 4–12 sekund, 6 proporcji obrazu, dynamiczny lub stały obiektyw, opcjonalne generowanie audio i lip-sync.
Dlaczego warto go rozważyć
Rozważ go, gdy następne zadanie wymaga Prompt + opcjonalne obrazy.