Crea video Wan 3.0 da testo, fotogrammi guida o riferimenti multimodali verificati, quindi scegli Standard o Prime, risoluzione, proporzioni, durata, audio generato e seed.
Standard e Prime condividono lo stesso contratto di scene e parametriOutput a 480P, 720P e 1080P con sei opzioni di proporzioniDurate di output intere da 2 a 30 secondi o durata intelligente
Controlla input, output, crediti e risultato di esempio, poi prova questo modello direttamente sulla pagina. Passa a Studio quando ti servono cronologia salvata, asset o iterazioni più lunghe.
Output di esempio
Wan 3.0 Video
Ideale per
Storyboard e studi di movimento del prodotto che richiedono una durata di output esplicitaTrasformazioni dal primo all’ultimo fotogramma con inizio e fine controllatiClip di campagna basate su riferimenti visivi, di movimento e brevi segnali sonoriRiprese più lunghe basate sul testo fino a 30 secondi
Supporta
Da testo a videoDa immagine a videoDa riferimento a videoDa video a video
Prova online
Crea con Wan 3.0 Video
Scegli prima la scena esclusiva, quindi imposta livello, risoluzione, proporzioni, durata, audio, seed e qualsiasi contenuto guida o di riferimento verificato.
Risultati
Wan 3.0 Video
AlibabaDa testo a video
Crea video Wan 3.0 da testo, fotogrammi guida o riferimenti multimodali verificati, quindi scegli Standard o Prime, risoluzione, proporzioni, durata, audio generato e seed.
Wan 3.0 Video
Ancora nessun risultato. Invia un prompt per avviare un'esecuzione.
Da testo a videoDa immagine a videoDa riferimento a videoDa video a video
Fit decisionale
Quando questo modello è la scelta giusta
Fit decisionale
Segnali di fit
Standard e Prime condividono lo stesso contratto di scene e parametri
Output a 480P, 720P e 1080P con sei opzioni di proporzioni
Durate di output intere da 2 a 30 secondi o durata intelligente
Guida con primo e ultimo fotogramma e riferimenti firmati di immagini, video e audio
Prenotazione esatta per versione e risoluzione con rendicontazione effettiva fail-closed
Task più adatti
Usalo quando il task assomiglia a questo
Storyboard e studi di movimento del prodotto che richiedono una durata di output esplicitaTrasformazioni dal primo all’ultimo fotogramma con inizio e fine controllatiClip di campagna basate su riferimenti visivi, di movimento e brevi segnali sonoriRiprese più lunghe basate sul testo fino a 30 secondiTeam che confrontano Standard e Prime con la stessa raccolta di riferimenti
Fatti essenziali
Input, output e crediti da confermare
Provider
Alibaba
Categoria
Video
Capacità
Da testo a video · Da immagine a video · Da riferimento a video · Da video a video
Wan 3.0 Video ha modalità Public API chiamabili, ma le modalità con media di riferimento richiedono ancora il supporto upload Files API. Controlla il riferimento modello prima dell'invio.
In cosa differiscono le tre scene di generazione di Wan 3.0 Video?
La scena Testo non accetta contenuti caricati. Fotogrammi richiede una prima immagine e accetta facoltativamente un’ultima immagine. Riferimento accetta una raccolta multimodale firmata di immagini, video e audio, ma l’audio non può essere l’unico contenuto. Le scene sono mutuamente esclusive. Il prompt è obbligatorio in modalità testo e facoltativo nelle modalità fotogrammi e riferimenti, con un massimo di 20.000 caratteri dopo la rimozione degli spazi.
Quanto costa Wan 3.0 Standard?
Standard: 8 / 16 / 32; Prime: 12.2 / 25.2 / 50.4 per secondo fatturato (480P / 720P / 1080P). La prenotazione moltiplica la tariffa di variante e risoluzione per i secondi verificati del video di input più i secondi di output prenotati, poi arrotonda il totale una sola volta. La durata intelligente prenota 30 secondi di output e non è disponibile con un video di riferimento.
Quanto costa Wan 3.0 Prime?
Standard: 8 / 16 / 32; Prime: 12.2 / 25.2 / 50.4 per secondo fatturato (480P / 720P / 1080P). La prenotazione moltiplica la tariffa di variante e risoluzione per i secondi verificati del video di input più i secondi di output prenotati, poi arrotonda il totale una sola volta. La durata intelligente prenota 30 secondi di output e non è disponibile con un video di riferimento.
Quali sono gli attuali limiti dei riferimenti Wan 3.0 su Rivya?
Riferimento accetta fino a 10 immagini, 5 video MP4 o MOV e 5 clip audio MP3 o WAV. Ogni clip video o audio deve durare da 1 a 15 secondi; video e audio hanno ciascuno un limite aggregato separato di 15 secondi. Non è possibile inviare soltanto audio.
Quali immagini e video caricati può usare Wan 3.0?
Le immagini possono essere JPEG, PNG senza trasparenza, WebP o BMP, fino a 20 MB ciascuna, con larghezza e altezza da 240 a 8.000 pixel e proporzioni non superiori a 8. I video devono essere MP4 o MOV, fino a 95 MB ciascuno, da 240 a 4.096 pixel per lato e sempre entro il limite di proporzioni 8:1.
In che modo la durata intelligente influisce su prenotazione e rendicontazione?
L’opzione -1 consente al modello di scegliere la durata dell’output, quindi Rivya prenota il limite di 30 secondi. La durata intelligente non può essere abbinata a un video di riferimento; con un video in input, scegli una durata esplicita affinché input verificato e output restino entro 30 secondi. Un consumo effettivo valido e non superiore alla prenotazione viene rendicontato con rimborso della differenza; un consumo mancante, non valido o superiore conserva la prenotazione ed entra in riconciliazione senza addebiti aggiuntivi nascosti.
Cosa posso configurare in questa pagina di Wan 3.0 Video?
Scegli testo, fotogrammi o riferimenti multimodali; seleziona Standard o Prime; imposta 480P, 720P o 1080P; scegli proporzioni adattive o fisse; usa da 2 a 30 secondi o la durata intelligente e controlla audio generato e seed.
Posso usare insieme un primo e un ultimo fotogramma?
Sì. La scena Fotogrammi richiede una prima immagine e accetta facoltativamente un’ultima immagine. Rifiuta video e audio per mantenere inequivocabile il contratto di inquadratura.
Una richiesta di riferimento può contenere soltanto audio?
No. L’audio può accompagnare riferimenti di immagini o video, ma non può essere l’unico contenuto caricato.
Il video di riferimento cambia la regola sulla durata?
Sì. Un video di riferimento richiede una durata di output esplicita e la somma dei secondi verificati del video in input e dei secondi di output richiesti non può superare 30.
Perché i riferimenti devono essere caricati tramite Rivya?
Prima di creare l’attività e prenotare i crediti, Rivya lega utente, modello, URL, tipo MIME reale, dimensione in byte, geometria e durata del contenuto in metadati firmati. Link esterni arbitrari e scorciatoie per file restano non disponibili.
Quando conviene continuare in Studio?
Usa questa pagina per verificare una scena, un livello e una gerarchia di riferimenti. Continua in Studio quando il progetto richiede iterazioni salvate, più raccolte di riferimenti o confronti tra Standard e Prime.
Confronta alternative
Altri modelli da considerare dopo
Video
Seedance 2.0
Modello video Seedance 2.0 completo di ByteDance, con supporto esplicito per generazione solo da prompt, animazione guidata da frame e generazione con riferimenti multimodali. Rivya mantiene esplicita la divisione documentata dei ruoli, così gli input frame e i riferimenti multimodali restano mutuamente esclusivi invece di finire in un unico contenitore di upload ambiguo.
Perché considerarlo
Consideralo quando il prossimo task richiede Prompt, frame o riferimenti immagine/video/audio.
InputPrompt, frame o riferimenti immagine/video/audio
Modello video Seedance 2.0 più veloce di ByteDance, con instradamento completo delle scene per generazione solo da prompt, animazione guidata da frame e generazione video con riferimenti multimodali. Rivya mantiene esplicita la divisione documentata delle scene, così gli input di primo/ultimo frame non si confondono con i ruoli di immagini, video e audio di riferimento.
Perché considerarlo
Consideralo quando il prossimo task richiede Prompt, frame o riferimenti immagine/video/audio.
InputPrompt, frame o riferimenti immagine/video/audio
Un modello video Seedance per text-to-video e image-to-video con sincronizzazione audiovisiva nativa. Supporta risoluzioni da 480p a 1080p, clip da 4 a 12 secondi, 6 proporzioni, camera dinamica o fissa, generazione audio opzionale e lip-sync.
Perché considerarlo
Consideralo quando il prossimo task richiede Prompt + immagini opzionali.