Usa OmniHuman 1.5 quando una persona, un animale domestico o un personaggio illustrato deve esibirsi a partire da una traccia vocale definitiva, mantenendo il ritratto sorgente come riferimento visivo principale. L’identificazione delle persone, il rilevamento dei soggetti e la selezione tramite maschera non sono disponibili in questa pagina.
Esattamente un'immagine ritratto e una traccia audio mantengono mirato il flussoFunziona con persone, animali domestici e soggetti illustrati o in stile animeOutput selezionabile a 720p e 1080p
Input
1 immagine + 1 audio
Output
Generatore video AI
Crediti
per_input_second · default=27 · ⌈total⌉
Ideale per
Video di presentatori guidati da una traccia vocale definitiva
Controlla input, output, crediti e risultato di esempio, poi prova questo modello direttamente sulla pagina. Passa a Studio quando ti servono cronologia salvata, asset o iterazioni più lunghe.
Output di esempio
OmniHuman 1.5
Ideale per
Video di presentatori guidati da una traccia vocale definitivaBrevi interpretazioni di personaggi da un ritratto approvatoClip parlate di animali domestici o personaggi illustratiVideo social e tutorial guidati dalla narrazione
Supporta
Immagine + audio in video
Prova online
Prova OmniHuman 1.5
Carica un ritratto e una clip audio inferiore a 60 secondi, quindi scegli risoluzione di output, modalità di elaborazione e seed opzionale.
Risultati
OmniHuman 1.5
ByteDanceAI.generator.modes.image-audio-to-video
Usa OmniHuman 1.5 quando una persona, un animale domestico o un personaggio illustrato deve esibirsi a partire da una traccia vocale definitiva, mantenendo il ritratto sorgente come riferimento visivo principale. L’identificazione delle persone, il rilevamento dei soggetti e la selezione tramite maschera non sono disponibili in questa pagina.
OmniHuman 1.5
Ancora nessun risultato. Invia un prompt per avviare un'esecuzione.
Immagine + audio in video
Fit decisionale
Quando questo modello è la scelta giusta
Fit decisionale
Segnali di fit
Esattamente un'immagine ritratto e una traccia audio mantengono mirato il flusso
Funziona con persone, animali domestici e soggetti illustrati o in stile anime
Output selezionabile a 720p e 1080p
Modalità di elaborazione più rapida opzionale
I crediti seguono la durata verificata dell'audio
Task più adatti
Usalo quando il task assomiglia a questo
Video di presentatori guidati da una traccia vocale definitivaBrevi interpretazioni di personaggi da un ritratto approvatoClip parlate di animali domestici o personaggi illustratiVideo social e tutorial guidati dalla narrazioneConfrontare elaborazione orientata alla qualità e più rapida sulla stessa coppia ritratto-audio
Fatti essenziali
Input, output e crediti da confermare
Provider
ByteDance
Categoria
Video
Capacità
Immagine + audio in video
Modello crediti
per_input_second · default=27 · ⌈total⌉
Percorso input
1 immagine + 1 audio
Setup prompt
Fino a 300 caratteri
FAQ
FAQ OmniHuman 1.5
Per quali utilizzi è più indicato OmniHuman 1.5?
OmniHuman 1.5 è progettato per un flusso mirato basato su immagine e audio: un ritratto fornisce il soggetto e una traccia vocale guida l'interpretazione risultante. È più adatto a clip di presentatori, narrazioni di personaggi e brevi video con soggetti parlanti che a un'attività generica prompt-to-video.
Quali file ritratto e audio posso caricare?
Carica esattamente un'immagine JPEG, PNG o WebP fino a 10 MB e un file audio MP3, M4A, WAV, AAC o OGG fino a 10 MB. La durata verificata dell'audio deve essere maggiore di zero e rigorosamente inferiore a 60 secondi.
Come vengono calcolati i crediti di OmniHuman 1.5?
Rivya usa una tariffa di 27 crediti per secondo di audio verificato. La durata decimale resta parte del calcolo completo e solo il totale della prenotazione viene arrotondato per eccesso a un credito intero. Quando viene comunicato un consumo effettivo valido e non superiore alla prenotazione, Rivya esegue il conguaglio su tale importo; un consumo assente, non valido o superiore a quanto prenotato resta in riconciliazione, senza generare addebiti aggiuntivi nascosti.
Cosa cambia la modalità rapida?
La modalità rapida privilegia tempi di elaborazione più brevi, con un possibile compromesso sulla qualità. Lasciala disattivata per un'esecuzione orientata alla qualità e attivala quando, in un primo test, la velocità di risposta è più importante.
Posso aggiungere un prompt al ritratto e all'audio?
Sì, ma è facoltativo e su Rivya è limitato a 300 caratteri. L'attuale percorso del prompt accetta testo in cinese, inglese, giapponese, coreano, spagnolo o indonesiano; ritratto e audio restano gli input obbligatori.
Cosa posso creare in questa pagina di OmniHuman 1.5?
Crea un video di un personaggio guidato dall'audio a partire da esattamente un'immagine ritratto e una clip audio. Il soggetto può essere una persona, un animale domestico o un personaggio illustrato e l'output può essere a 720p o 1080p.
Cosa devo preparare prima di generare?
Scegli un ritratto nitido che rappresenti già il soggetto da mantenere, quindi prepara la versione definitiva della voce. L'audio deve essere più breve di 60 secondi ed entrambi i file devono superare i controlli di caricamento prima della generazione.
Quali impostazioni contano di più?
Scegli 720p o 1080p, decidi se usare l'elaborazione più rapida e lascia il seed su -1 per un risultato casuale, a meno che non ti serva un confronto più ripetibile.
Devo accedere e come funzionano i crediti?
I dettagli sono pubblici, ma per caricare e generare è necessario accedere. OmniHuman 1.5 costa 27 crediti per secondo di audio verificato e viene arrotondato per eccesso solo il totale finale calcolato.
Quando dovrei aprire lo Studio completo?
Resta qui per provare un ritratto e una traccia vocale. Apri lo Studio quando ti servono take salvate, più personaggi, versioni vocali ripetute o un flusso di produzione più lungo.
Confronta alternative
Altri modelli da considerare dopo
Video
Seedance 2.0
Modello video Seedance 2.0 completo di ByteDance, con supporto esplicito per generazione solo da prompt, animazione guidata da frame e generazione con riferimenti multimodali. Rivya mantiene esplicita la divisione documentata dei ruoli, così gli input frame e i riferimenti multimodali restano mutuamente esclusivi invece di finire in un unico contenitore di upload ambiguo.
Perché considerarlo
Consideralo quando il prossimo task richiede Prompt, frame o riferimenti immagine/video/audio.
InputPrompt, frame o riferimenti immagine/video/audio
Modello video Seedance 2.0 più veloce di ByteDance, con instradamento completo delle scene per generazione solo da prompt, animazione guidata da frame e generazione video con riferimenti multimodali. Rivya mantiene esplicita la divisione documentata delle scene, così gli input di primo/ultimo frame non si confondono con i ruoli di immagini, video e audio di riferimento.
Perché considerarlo
Consideralo quando il prossimo task richiede Prompt, frame o riferimenti immagine/video/audio.
InputPrompt, frame o riferimenti immagine/video/audio
Un modello video Seedance per text-to-video e image-to-video con sincronizzazione audiovisiva nativa. Supporta risoluzioni da 480p a 1080p, clip da 4 a 12 secondi, 6 proporzioni, camera dinamica o fissa, generazione audio opzionale e lip-sync.
Perché considerarlo
Consideralo quando il prossimo task richiede Prompt + immagini opzionali.