Użyj OmniHuman 1.5, gdy osoba, zwierzę domowe lub ilustrowana postać ma wystąpić na podstawie gotowej ścieżki głosowej, a portret źródłowy ma pozostać kotwicą wizualną. Identyfikacja osób, wykrywanie obiektów i wybór oparty na masce nie są dostępne na tej stronie.
Dokładnie jeden obraz portretowy i jedna ścieżka audio utrzymują skupiony przepływDziała z ludźmi, zwierzętami domowymi i postaciami ilustrowanymi lub w stylu anime
Wybieralny wynik 720p i 1080p
Wejście
1 obraz + 1 audio
Wyjście
Generator wideo AI
Kredyty
per_input_second · default=27 · ⌈total⌉
Najlepsze do
Wideo prezentera prowadzone gotową ścieżką głosową
Sprawdź wejście, wyjście, kredyty i przykładowy wynik, a potem wypróbuj ten model bezpośrednio na stronie. Przejdź do Studio, gdy potrzebujesz zapisanej historii, zasobów albo dłuższej iteracji.
Przykładowy wynik
OmniHuman 1.5
Najlepsze do
Wideo prezentera prowadzone gotową ścieżką głosowąKrótkie występy postaci z jednego zatwierdzonego portretuMówiące klipy zwierząt domowych lub postaci ilustrowanychWideo społecznościowe i objaśnienia prowadzone narracją
Obsługuje
Obraz + dźwięk na wideo
Próba online
Wypróbuj OmniHuman 1.5
Prześlij jeden portret i jeden klip audio krótszy niż 60 sekund, następnie wybierz rozdzielczość wyniku, tryb przetwarzania i opcjonalny seed.
Wyniki
OmniHuman 1.5
ByteDanceAI.generator.modes.image-audio-to-video
Użyj OmniHuman 1.5, gdy osoba, zwierzę domowe lub ilustrowana postać ma wystąpić na podstawie gotowej ścieżki głosowej, a portret źródłowy ma pozostać kotwicą wizualną. Identyfikacja osób, wykrywanie obiektów i wybór oparty na masce nie są dostępne na tej stronie.
OmniHuman 1.5
Brak wyniku. Prześlij prompt, aby rozpocząć uruchomienie.
Obraz + dźwięk na wideo
Dopasowanie decyzyjne
Kiedy ten model jest właściwym wyborem
Dopasowanie decyzyjne
Sygnały dopasowania
Dokładnie jeden obraz portretowy i jedna ścieżka audio utrzymują skupiony przepływ
Działa z ludźmi, zwierzętami domowymi i postaciami ilustrowanymi lub w stylu anime
Wybieralny wynik 720p i 1080p
Opcjonalny szybszy tryb przetwarzania
Kredyty zależą od zweryfikowanego czasu audio
Najlepiej dopasowane zadania
Użyj go, gdy zadanie wygląda tak
Wideo prezentera prowadzone gotową ścieżką głosowąKrótkie występy postaci z jednego zatwierdzonego portretuMówiące klipy zwierząt domowych lub postaci ilustrowanychWideo społecznościowe i objaśnienia prowadzone narracją
Najważniejsze fakty
Wejścia, wyjście i kredyty do potwierdzenia
Dostawca
ByteDance
Kategoria
Wideo
Możliwości
Obraz + dźwięk na wideo
Model kredytów
per_input_second · default=27 · ⌈total⌉
Ścieżka wejścia
1 obraz + 1 audio
Konfiguracja promptu
Do 300 znaków
FAQ
FAQ OmniHuman 1.5
Do czego najlepiej używać OmniHuman 1.5?
OmniHuman 1.5 jest przeznaczony do skupionego przepływu obrazu i audio: jeden portret dostarcza temat, a jedna ścieżka głosowa prowadzi wynikowy występ. Lepiej pasuje do klipów prezenterów, narracji postaci i krótkich wideo z mówiącym tematem niż do ogólnego zadania prompt-to-video.
Jakie pliki portretu i audio mogę przesłać?
Prześlij dokładnie jeden obraz JPEG, PNG lub WebP o rozmiarze do 10 MB i jeden plik audio MP3, M4A, WAV, AAC albo OGG o rozmiarze do 10 MB. Zweryfikowany czas audio musi być większy od zera i ściśle krótszy niż 60 sekund.
Jak obliczane są kredyty OmniHuman 1.5?
Rivya stosuje stawkę 27 kredytów za zweryfikowaną sekundę audio. Ułamkowy czas pozostaje częścią pełnego obliczenia, a w górę do pełnego kredytu zaokrąglana jest tylko suma rezerwacji. Gdy zgłoszone rzeczywiste zużycie jest prawidłowe i nie przekracza rezerwacji, Rivya rozlicza zadanie według tej wartości; brakujące, nieprawidłowe lub przekraczające rezerwację zużycie trafia do uzgodnienia zamiast powodować ukryte dodatkowe obciążenie.
Co zmienia tryb szybki?
Tryb szybki stawia na krótszy czas przetwarzania kosztem możliwego spadku jakości. Pozostaw go wyłączonym dla przebiegu nastawionego na jakość, a włącz, gdy wczesny test bardziej wymaga szybkiego wyniku.
Czy mogę dodać prompt do portretu i audio?
Tak, ale jest opcjonalny i ograniczony w Rivya do 300 znaków. Obecna ścieżka promptu przyjmuje tekst chiński, angielski, japoński, koreański, hiszpański lub indonezyjski; portret i audio pozostają wymaganymi danymi wejściowymi.
Co mogę utworzyć na tej stronie OmniHuman 1.5?
Utwórz prowadzone dźwiękiem wideo postaci z dokładnie jednego obrazu portretowego i jednego klipu audio. Tematem może być osoba, zwierzę domowe lub ilustrowana postać, a wynik może mieć 720p albo 1080p.
Co przygotować przed generowaniem?
Wybierz wyraźny portret, który już przedstawia temat do zachowania, następnie przygotuj końcową wersję głosu. Audio musi trwać krócej niż 60 sekund, a oba pliki muszą przejść kontrolę przesyłania przed generowaniem.
Które ustawienia są najważniejsze?
Wybierz 720p lub 1080p, zdecyduj, czy użyć szybszego przetwarzania, i pozostaw seed na -1 dla losowego wyniku, chyba że potrzebujesz bardziej powtarzalnego porównania.
Czy muszę się zalogować i jak działają kredyty?
Szczegóły są publiczne, ale przesyłanie i generowanie wymagają logowania. OmniHuman 1.5 kosztuje 27 kredytów za zweryfikowaną sekundę audio, a w górę zaokrąglana jest tylko końcowa obliczona suma.
Kiedy otworzyć pełne Studio?
Zostań tutaj, aby sprawdzić jeden portret i jedną ścieżkę głosową. Otwórz Studio, gdy potrzebujesz zapisanych ujęć, wielu postaci, powtarzanych wersji głosu lub dłuższego przepływu produkcyjnego.
Porównaj alternatywy
Inne modele warte rozważenia
Wideo
Seedance 2.0
Pełny model wideo Seedance 2.0 od ByteDance z jawną obsługą generowania tylko z promptu, animacji prowadzonej klatkami i generowania z referencją multimodalną. Rivya utrzymuje udokumentowany podział ról jawnie, aby wejścia klatek i referencje multimodalne pozostały wzajemnie wykluczające się, zamiast zlewać się w jeden niejasny koszyk uploadu.
Dlaczego warto go rozważyć
Rozważ go, gdy następne zadanie wymaga Prompt, klatki albo referencje obrazu/wideo/audio.
WejściePrompt, klatki albo referencje obrazu/wideo/audio
Szybszy model wideo Seedance 2.0 od ByteDance z pełnym routingiem scen dla generowania tylko z promptu, animacji obrazu prowadzonej klatkami i multimodalnego generowania wideo z referencją. Rivya utrzymuje udokumentowany podział scen jawnie, aby wejścia pierwszej i ostatniej klatki nie mieszały się z rolami obrazów, wideo i audio referencyjnych.
Dlaczego warto go rozważyć
Rozważ go, gdy następne zadanie wymaga Prompt, klatki albo referencje obrazu/wideo/audio.
WejściePrompt, klatki albo referencje obrazu/wideo/audio
Najlepsze doSzybkie prewizualizacje reklam z promptów lub klatek storyboardu
Wideo
Seedance 1.5 Pro
Model wideo Seedance do text-to-video i image-to-video z natywną synchronizacją audio-wideo. Obsługuje klipy 480p–1080p o długości 4–12 sekund, 6 proporcji obrazu, dynamiczny lub stały obiektyw, opcjonalne generowanie audio i lip-sync.
Dlaczego warto go rozważyć
Rozważ go, gdy następne zadanie wymaga Prompt + opcjonalne obrazy.