OmniHuman 1.5Vidéo de portrait pilotée par l’audio
Utilisez OmniHuman 1.5 lorsqu’une personne, un animal ou un personnage illustré doit interpréter une piste vocale finalisée, le portrait source restant l’ancrage visuel. L’identification des personnes, la détection des sujets et la sélection par masque ne sont pas disponibles sur cette page.
Exactement un portrait et une piste audio pour conserver un flux cibléFonctionne avec des personnes, des animaux et des sujets illustrés ou de style anime
Des sorties réglables en 720p et 1080p
Entrée
1 image + 1 audio
Sortie
Générateur de vidéos IA
Crédits
per_input_second · default=27 · ⌈total⌉
Idéal pour
Des vidéos de présentation pilotées par une piste vocale finalisée
Vérifiez l'entrée, la sortie, les crédits et le résultat d'exemple, puis essayez ce modèle directement sur la page. Passez dans Studio lorsque vous avez besoin d'un historique enregistré, de ressources ou d'une itération plus longue.
Sortie d'exemple
OmniHuman 1.5
Idéal pour
Des vidéos de présentation pilotées par une piste vocale finaliséeDe courtes interprétations de personnage à partir d’un portrait validéDes séquences parlées avec un animal ou un personnage illustréDes vidéos sociales et explicatives guidées par une narration
Prend en charge
Image + audio vers vidéo
Essai en ligne
Essayer OmniHuman 1.5
Importez un portrait et une piste audio de moins de 60 secondes, puis choisissez la résolution de sortie, le mode de traitement et une seed facultative.
Résultats
OmniHuman 1.5
ByteDanceAI.generator.modes.image-audio-to-video
Utilisez OmniHuman 1.5 lorsqu’une personne, un animal ou un personnage illustré doit interpréter une piste vocale finalisée, le portrait source restant l’ancrage visuel. L’identification des personnes, la détection des sujets et la sélection par masque ne sont pas disponibles sur cette page.
OmniHuman 1.5
Aucun résultat pour le moment. Envoyez un prompt pour démarrer une exécution.
Image + audio vers vidéo
Repères de choix
Quand ce modèle est le bon choix
Repères de choix
Signaux d'adéquation
Exactement un portrait et une piste audio pour conserver un flux ciblé
Fonctionne avec des personnes, des animaux et des sujets illustrés ou de style anime
Des sorties réglables en 720p et 1080p
Un mode de traitement plus rapide facultatif
Des crédits fondés sur la durée audio vérifiée
Tâches les mieux adaptées
Utilisez-le quand la tâche ressemble à ceci
Des vidéos de présentation pilotées par une piste vocale finaliséeDe courtes interprétations de personnage à partir d’un portrait validéDes séquences parlées avec un animal ou un personnage illustréDes vidéos sociales et explicatives guidées par une narration
Repères factuels
Entrées, sortie et crédits à confirmer
Fournisseur
ByteDance
Catégorie
Vidéo
Capacités
Image + audio vers vidéo
Modèle de crédits
per_input_second · default=27 · ⌈total⌉
Mode d'entrée
1 image + 1 audio
Configuration du prompt
Jusqu'à 300 caractères
FAQ
FAQ OmniHuman 1.5
Pour quels usages OmniHuman 1.5 est-il le plus adapté ?
OmniHuman 1.5 est conçu pour un flux ciblé image-audio : un portrait fournit le sujet et une piste vocale pilote l’interprétation produite. Il convient mieux aux séquences de présentation, aux narrations de personnages et aux courtes vidéos de sujets parlants qu’à une tâche générale de génération vidéo à partir d’un prompt.
Quels fichiers de portrait et d’audio puis-je importer ?
Importez exactement une image JPEG, PNG ou WebP de 10 MB maximum et un fichier audio MP3, M4A, WAV, AAC ou OGG de 10 MB maximum. La durée audio vérifiée doit être supérieure à zéro et strictement inférieure à 60 secondes.
Comment les crédits OmniHuman 1.5 sont-ils calculés ?
Rivya applique un tarif de 27 crédits par seconde d’audio vérifiée. La durée décimale est conservée dans le calcul complet et seul le montant total réservé est arrondi au crédit entier supérieur. Lorsque l’usage réel communiqué est valide et inférieur ou égal au montant réservé, Rivya ajuste le débit à cet usage réel. Si l’usage est absent, non valide ou supérieur au montant réservé, la tâche passe en rapprochement, sans débit supplémentaire dissimulé.
Que change le mode rapide ?
Le mode rapide privilégie un délai de traitement plus court, avec un possible compromis sur la qualité. Laissez-le désactivé pour donner la priorité à la qualité, ou activez-le lorsqu’un retour plus rapide compte davantage pour un premier essai.
Puis-je ajouter un prompt au portrait et à l’audio ?
Oui, mais il est facultatif et limité à 300 caractères sur Rivya. Le prompt écrit n’accepte actuellement que le chinois, l’anglais, le japonais, le coréen, l’espagnol ou l’indonésien ; le portrait et l’audio restent les deux entrées obligatoires.
Que puis-je créer sur cette page OmniHuman 1.5 ?
Créez une vidéo de personnage pilotée par l’audio à partir d’exactement un portrait et une piste audio. Le sujet peut être une personne, un animal ou un personnage illustré, et la sortie peut être en 720p ou 1080p.
Que dois-je préparer avant la génération ?
Choisissez un portrait clair qui représente déjà le sujet à conserver, puis préparez la prise vocale finale. L’audio doit durer moins de 60 secondes et les deux fichiers doivent réussir les contrôles d’importation avant la génération.
Quels réglages comptent le plus ?
Choisissez 720p ou 1080p, décidez d’utiliser ou non le traitement plus rapide, puis laissez la seed à -1 pour un résultat aléatoire, sauf si vous avez besoin d’une comparaison plus reproductible.
Dois-je me connecter et comment fonctionnent les crédits ?
Les informations sont publiques, mais l’importation et la génération exigent une connexion. OmniHuman 1.5 coûte 27 crédits par seconde d’audio vérifiée, et seul le total calculé final est arrondi au supérieur.
Quand dois-je ouvrir le Studio complet ?
Restez ici pour tester un portrait et une piste vocale. Ouvrez Studio si vous avez besoin de prises enregistrées, de plusieurs personnages, de versions vocales répétées ou d’un flux de production plus long.
Comparer les alternatives
Autres modèles à envisager ensuite
Vidéo
Seedance 2.0
Le modèle vidéo Seedance 2.0 complet de ByteDance, avec prise en charge explicite de la génération à partir d'un prompt seul, de l'animation guidée par frames et de la génération avec références multimodales. Rivya garde la séparation documentée des rôles explicite afin que les entrées de frames et les références multimodales restent exclusives au lieu de se mélanger dans un seul champ d'import ambigu.
Pourquoi l'envisager
Envisagez-le lorsque votre prochaine tâche a besoin de Prompt, images ou références image/vidéo/audio.
EntréePrompt, images ou références image/vidéo/audio
Le modèle vidéo Seedance 2.0 plus rapide de ByteDance, avec un routage complet des scènes pour la génération à partir d'un prompt seul, l'animation d'image guidée par frames et la génération vidéo avec références multimodales. Rivya garde la séparation de scènes explicite afin que les entrées de première/dernière frame ne se confondent pas avec les rôles des images, vidéos et audios de référence.
Pourquoi l'envisager
Envisagez-le lorsque votre prochaine tâche a besoin de Prompt, images ou références image/vidéo/audio.
EntréePrompt, images ou références image/vidéo/audio
Idéal pourPrévisualisations publicitaires rapides depuis des prompts ou des frames de storyboard
Vidéo
Seedance 1.5 Pro
Un modèle vidéo Seedance pour le texte vers vidéo et l'image vers vidéo, avec synchronisation audiovisuelle native. Il prend en charge les sorties de 480p à 1080p, les clips de 4 à 12 secondes, six formats, le contrôle de caméra dynamique ou fixe, la génération audio facultative et la synchronisation labiale.
Pourquoi l'envisager
Envisagez-le lorsque votre prochaine tâche a besoin de Prompt + images optionnelles.