Usa OmniHuman 1.5 cuando una persona, una mascota o un personaje ilustrado deban actuar a partir de una pista de voz terminada mientras el retrato de origen se mantiene como referencia visual principal. En esta página no están disponibles la identificación de personas, la detección de sujetos ni la selección mediante máscara.
Exactamente una imagen de retrato y una pista de audio mantienen el flujo bien definidoFunciona con personas, mascotas y sujetos ilustrados o de estilo anime
Salida seleccionable a 720p y 1080p
Entrada
1 imagen + 1 audio
Salida
Generador de video con IA
Créditos
per_input_second · default=27 · ⌈total⌉
Mejor para
Vídeos de presentadores guiados por una pista de voz terminada
Comprueba entrada, salida, créditos y resultado de ejemplo, y luego prueba este modelo directamente en la página. Pasa a Studio cuando necesites historial guardado, activos o una iteración más larga.
Salida de ejemplo
OmniHuman 1.5
Mejor para
Vídeos de presentadores guiados por una pista de voz terminadaActuaciones breves de personajes a partir de un retrato aprobadoClips de mascotas o personajes ilustrados que hablanVídeos sociales y explicativos guiados por narración
Admite
Imagen + audio a video
Prueba en línea
Prueba OmniHuman 1.5
Sube un retrato y un clip de audio de menos de 60 segundos y elige la resolución de salida, el modo de procesamiento y la semilla opcional.
Resultados
OmniHuman 1.5
ByteDanceAI.generator.modes.image-audio-to-video
Usa OmniHuman 1.5 cuando una persona, una mascota o un personaje ilustrado deban actuar a partir de una pista de voz terminada mientras el retrato de origen se mantiene como referencia visual principal. En esta página no están disponibles la identificación de personas, la detección de sujetos ni la selección mediante máscara.
OmniHuman 1.5
Aún no hay resultados. Envía un prompt para iniciar una ejecución.
Imagen + audio a video
Ajuste de decisión
Cuándo este modelo es la opción correcta
Ajuste de decisión
Señales de ajuste
Exactamente una imagen de retrato y una pista de audio mantienen el flujo bien definido
Funciona con personas, mascotas y sujetos ilustrados o de estilo anime
Salida seleccionable a 720p y 1080p
Modo de procesamiento más rápido opcional
Los créditos dependen de la duración verificada del audio
Tareas más adecuadas
Úsalo cuando la tarea se parezca a esto
Vídeos de presentadores guiados por una pista de voz terminadaActuaciones breves de personajes a partir de un retrato aprobadoClips de mascotas o personajes ilustrados que hablanVídeos sociales y explicativos guiados por narración
Datos concretos
Entradas, salida y créditos por confirmar
Proveedor
ByteDance
Categoría
Vídeo
Capacidades
Imagen + audio a video
Modelo de créditos
per_input_second · default=27 · ⌈total⌉
Ruta de entrada
1 imagen + 1 audio
Configuración del prompt
Hasta 300 caracteres
FAQ
FAQ de OmniHuman 1.5
¿Para qué se recomienda usar OmniHuman 1.5?
OmniHuman 1.5 está diseñado para un flujo específico de imagen y audio: un retrato aporta el sujeto y una pista de voz guía la actuación resultante. Encaja mejor con clips de presentadores, narración de personajes y vídeos cortos de sujetos que hablan que con una tarea general de prompt a vídeo.
¿Qué archivos de retrato y audio puedo subir?
Sube exactamente una imagen JPEG, PNG o WebP de hasta 10 MB y un archivo de audio MP3, M4A, WAV, AAC u OGG de hasta 10 MB. La duración verificada del audio debe ser mayor que cero y estrictamente inferior a 60 segundos.
¿Cómo se calculan los créditos de OmniHuman 1.5?
Rivya aplica una tarifa de 27 créditos por segundo de audio verificado. La duración decimal forma parte del cálculo completo y solo se redondea hacia arriba a un crédito entero el total de la reserva. Cuando se informa de un uso real válido que no supera la reserva, Rivya liquida conforme a ese valor; si el uso no está disponible, no es válido o supera la reserva, pasa a conciliación en lugar de generar un cargo adicional oculto.
¿Qué cambia el modo rápido?
El modo rápido prioriza un menor tiempo de procesamiento con una posible reducción de calidad. Déjalo desactivado para una generación centrada en la calidad y actívalo cuando la rapidez de entrega sea más importante en una prueba inicial.
¿Puedo añadir un prompt al retrato y al audio?
Sí, pero es opcional y está limitado a 300 caracteres en Rivya. La vía de prompt actual admite texto en chino, inglés, japonés, coreano, español o indonesio; el retrato y el audio siguen siendo las entradas obligatorias.
¿Qué puedo crear en esta página de OmniHuman 1.5?
Crea un vídeo de personaje guiado por audio a partir de exactamente una imagen de retrato y un clip de audio. El sujeto puede ser una persona, una mascota o un personaje ilustrado, y la salida puede ser de 720p o 1080p.
¿Qué debo preparar antes de generar?
Elige un retrato claro que ya represente al sujeto que quieres conservar y prepara la toma de voz final. El audio debe durar menos de 60 segundos y ambos archivos deben superar las comprobaciones de subida antes de generar.
¿Qué ajustes son más importantes?
Elige 720p o 1080p, decide si utilizarás la opción de procesamiento más rápido y deja la semilla en -1 para obtener un resultado aleatorio, salvo que necesites una comparación más repetible.
¿Necesito iniciar sesión y cómo funcionan los créditos?
La información es pública, pero para subir archivos y generar debes iniciar sesión. OmniHuman 1.5 cuesta 27 créditos por segundo de audio verificado, y solo se redondea hacia arriba el total final calculado.
¿Cuándo debería abrir Studio completo?
Quédate aquí para probar un retrato y una pista de voz. Abre Studio cuando necesites guardar tomas, trabajar con varios personajes, repetir versiones de voz o desarrollar un flujo de producción más largo.
Comparar alternativas
Otros modelos para considerar después
Vídeo
Seedance 2.0
Modelo completo de vídeo Seedance 2.0 de ByteDance con soporte explícito para generación solo con prompt, animación guiada por fotogramas y generación con referencia multimodal. Rivya mantiene explícita la división documentada de roles para que las entradas de fotograma y las referencias multimodales se mantengan mutuamente excluyentes en lugar de caer en un único contenedor ambiguo de subida.
Por qué considerarlo
Considéralo cuando tu próxima tarea necesite Prompt, fotogramas o referencias de imagen/video/audio.
EntradaPrompt, fotogramas o referencias de imagen/video/audio
Modelo de vídeo Seedance 2.0 más rápido de ByteDance, con enrutamiento completo de escenas para generación solo con prompt, animación de imagen guiada por fotogramas y generación de vídeo con referencia multimodal. Rivya mantiene explícita la división documentada de escenas para que las entradas de primer/último fotograma no se confundan con los roles de imagen, vídeo y audio de referencia.
Por qué considerarlo
Considéralo cuando tu próxima tarea necesite Prompt, fotogramas o referencias de imagen/video/audio.
EntradaPrompt, fotogramas o referencias de imagen/video/audio
Mejor paraPrevisualización rápida de anuncios desde prompts o fotogramas de storyboard
Vídeo
Seedance 1.5 Pro
Modelo de vídeo Seedance para texto a vídeo e imagen a vídeo con sincronización audiovisual nativa. Admite clips de 480p a 1080p y de 4 a 12 segundos, 6 relaciones de aspecto, control de lente dinámico o fijo, generación opcional de audio y sincronización labial.
Por qué considerarlo
Considéralo cuando tu próxima tarea necesite Prompt + imágenes opcionales.