Crea un video MiniMax H3 da 4 a 15 secondi partendo da testo, uno o due fotogrammi guida o un pacchetto multimodale verificato, con un livello 2K dedicato e un prezzo esplicito per i riferimenti.
Un livello 2K dedicato accanto all'output 768PPercorsi distinti per testo, guida tramite fotogrammi e riferimenti multimodaliPacchetti di riferimento con un massimo di nove immagini, tre video e tre file audio
Controlla input, output, crediti e risultato di esempio, poi prova questo modello direttamente sulla pagina. Passa a Studio quando ti servono cronologia salvata, asset o iterazioni più lunghe.
Output di esempio
MiniMax H3
Ideale per
Concept video brevi in 2K costruiti da un brief scritto dell'inquadraturaAnimazione dal primo fotogramma o dal primo e ultimo fotogramma con un soggetto ben definitoRiferimenti di movimento che combinano direzione visiva e audio di supportoScene ricche di riferimenti in cui il prezzo legato al numero di immagini deve restare visibile
Supporta
Da testo a videoDa immagine a videoDa riferimento a video
Prova online
Crea con MiniMax H3
Seleziona testo, guida tramite fotogrammi o riferimenti multimodali, quindi scegli 768P o 2K e una durata da 4 a 15 secondi.
Risultati
MiniMax H3
MiniMaxDa testo a video
Crea un video MiniMax H3 da 4 a 15 secondi partendo da testo, uno o due fotogrammi guida o un pacchetto multimodale verificato, con un livello 2K dedicato e un prezzo esplicito per i riferimenti.
MiniMax H3
Ancora nessun risultato. Invia un prompt per avviare un'esecuzione.
Da testo a videoDa immagine a videoDa riferimento a video
Fit decisionale
Quando questo modello è la scelta giusta
Fit decisionale
Segnali di fit
Un livello 2K dedicato accanto all'output 768P
Percorsi distinti per testo, guida tramite fotogrammi e riferimenti multimodali
Pacchetti di riferimento con un massimo di nove immagini, tre video e tre file audio
Durate intere dell'output da 4 a 15 secondi
Formula trasparente per la durata dei video in input e le immagini oltre le prime cinque
Task più adatti
Usalo quando il task assomiglia a questo
Concept video brevi in 2K costruiti da un brief scritto dell'inquadraturaAnimazione dal primo fotogramma o dal primo e ultimo fotogramma con un soggetto ben definitoRiferimenti di movimento che combinano direzione visiva e audio di supportoScene ricche di riferimenti in cui il prezzo legato al numero di immagini deve restare visibileTeam che confrontano un livello bozza a 768P con un passaggio di direzione finale in 2K
Fatti essenziali
Input, output e crediti da confermare
Provider
MiniMax
Categoria
Video
Capacità
Da testo a video · Da immagine a video · Da riferimento a video
MiniMax H3 ha modalità Public API chiamabili, ma le modalità con media di riferimento richiedono ancora il supporto upload Files API. Controlla il riferimento modello prima dell'invio.
Per quali utilizzi è più indicato MiniMax H3 su Rivya?
Usa MiniMax H3 per lavori video da 4 a 15 secondi che richiedono un'inquadratura basata solo sul prompt, uno o due fotogrammi guida oppure un pacchetto di riferimenti multimodali. I suoi controlli distintivi sono i livelli 768P e 2K, oltre al conteggio esplicito della durata dei video in input e delle immagini oltre le prime cinque.
In cosa differiscono gli scenari di MiniMax H3?
Tutti e tre gli scenari usano un prompt non vuoto fino a 7.000 caratteri. Testo non accetta caricamenti e richiede un rapporto d'aspetto specifico, non adattivo. Lo scenario Fotogrammi accetta esattamente un'immagine come fotogramma iniziale o finale, oppure due immagini ordinate come inizio e fine, senza video né audio. Riferimento richiede almeno un caricamento; l'audio non può essere usato da solo e deve accompagnare un'immagine o un video.
Quali media posso usare in una richiesta di riferimento MiniMax H3?
Rivya accetta fino a nove immagini JPEG, PNG o WebP, tre video MP4 o MOV e tre file audio MP3 o WAV, per un massimo di 15 file complessivi. Le immagini sono limitate a 30 MB ciascuna. Ogni video è limitato a 50 MB e a una durata da 2 a 15 secondi, con 15 secondi video in totale; ogni file audio è limitato a 15 MB e da 2 a 15 secondi, con 15 secondi audio in totale.
Quale geometria di immagini e video accetta MiniMax H3?
Le immagini e i video di riferimento devono avere larghezza e altezza comprese tra 256 e 5.760 pixel e un rapporto d'aspetto compreso tra 0,4 e 2,5. I video di riferimento devono inoltre avere una frequenza compresa tra 23,976 e 60 fotogrammi al secondo.
Come vengono calcolati i crediti di MiniMax H3?
La tariffa è di 16 crediti a 768P o 26 a 2K, moltiplicata per la somma dei secondi di output richiesti e dei secondi verificati dei video in input. Le prime cinque immagini non aggiungono costi; le immagini dalla sesta alla nona aggiungono 8 crediti ciascuna. L'audio in input non aumenta questa formula. Rivya arrotonda per eccesso il totale combinato una sola volta.
Quali rapporti d'aspetto sono disponibili in MiniMax H3?
Il text-to-video richiede 21:9, 16:9, 4:3, 1:1, 3:4 o 9:16 e non accetta l'opzione adattiva. Il reference-to-video può usare anche l'opzione adattiva. Il percorso guidato da fotogrammi ricava l'inquadratura dall'immagine o dalla coppia di immagini fornite, senza inviare un valore separato per il rapporto d'aspetto.
Come viene regolato l'addebito finale di MiniMax H3?
Rivya prenota la formula calcolata prima della generazione, mantenendo invariati tutti i termini tariffari e arrotondando solo il totale complessivo. Quando viene comunicato un consumo effettivo valido e non superiore alla prenotazione, Rivya esegue il conguaglio su tale importo. Un consumo assente, non valido o superiore a quanto prenotato resta in riconciliazione, senza generare addebiti aggiuntivi nascosti.
Cosa posso configurare in questa pagina di MiniMax H3?
Scegli testo, guida tramite fotogrammi o uno scenario di riferimenti multimodali; imposta 768P o 2K; seleziona una durata intera da 4 a 15 secondi; usa il rapporto d'aspetto solo quando lo scenario scelto lo accetta.
Posso caricare solo un file audio?
No. Nello scenario riferimento, l'audio deve essere accompagnato da almeno un'immagine o un video. Gli scenari testo e fotogrammi non accettano audio.
Posso usare un fotogramma finale senza un fotogramma iniziale?
Sì. Con un'immagine, scegli se è il fotogramma iniziale o finale. Con due immagini, disponile come inizio e poi fine.
Quando le immagini aumentano il prezzo di MiniMax H3?
Le prime cinque immagini sono incluse nella formula temporale di base. Ogni immagine aggiuntiva dalla sesta alla nona aggiunge 8 crediti alla stima combinata prima che il totale venga arrotondato per eccesso una sola volta.
Con quale risoluzione di MiniMax H3 dovrei iniziare?
Usa 768P a 16 crediti per secondo fatturato mentre verifichi movimento e ruolo dei riferimenti. Scegli 2K a 26 crediti per secondo fatturato quando la direzione della scena è pronta per il livello superiore.
Quando conviene continuare nello Studio?
Usa questa pagina per convalidare un singolo scenario, la durata e la gerarchia dei riferimenti. Passa allo Studio per confronti salvati tra 768P e 2K, revisioni ripetute dei riferimenti o un flusso di progetto più lungo.
Confronta alternative
Altri modelli da considerare dopo
Video
Seedance 2.0
Modello video Seedance 2.0 completo di ByteDance, con supporto esplicito per generazione solo da prompt, animazione guidata da frame e generazione con riferimenti multimodali. Rivya mantiene esplicita la divisione documentata dei ruoli, così gli input frame e i riferimenti multimodali restano mutuamente esclusivi invece di finire in un unico contenitore di upload ambiguo.
Perché considerarlo
Consideralo quando il prossimo task richiede Prompt, frame o riferimenti immagine/video/audio.
InputPrompt, frame o riferimenti immagine/video/audio
Modello video Seedance 2.0 più veloce di ByteDance, con instradamento completo delle scene per generazione solo da prompt, animazione guidata da frame e generazione video con riferimenti multimodali. Rivya mantiene esplicita la divisione documentata delle scene, così gli input di primo/ultimo frame non si confondono con i ruoli di immagini, video e audio di riferimento.
Perché considerarlo
Consideralo quando il prossimo task richiede Prompt, frame o riferimenti immagine/video/audio.
InputPrompt, frame o riferimenti immagine/video/audio
Un modello video Seedance per text-to-video e image-to-video con sincronizzazione audiovisiva nativa. Supporta risoluzioni da 480p a 1080p, clip da 4 a 12 secondi, 6 proporzioni, camera dinamica o fissa, generazione audio opzionale e lip-sync.
Perché considerarlo
Consideralo quando il prossimo task richiede Prompt + immagini opzionali.