Gunakan OmniHuman 1.5 apabila seseorang, haiwan peliharaan atau watak ilustrasi perlu membuat persembahan daripada trek suara siap, sementara potret sumber kekal sebagai asas visual. Pengenalpastian manusia, pengesanan subjek dan pemilihan berasaskan topeng tidak tersedia pada halaman ini.
Tepat satu imej potret dan satu trek audio mengekalkan aliran kerja yang terfokusBerfungsi dengan orang, haiwan peliharaan serta subjek ilustrasi atau gaya anime
Semak input, output, kredit dan contoh hasil, kemudian cuba model ini terus pada halaman. Beralih ke Studio apabila anda memerlukan sejarah tersimpan, aset atau iterasi lebih panjang.
Contoh output
OmniHuman 1.5
Terbaik untuk
Video penyampai yang dipandu oleh trek suara siapPersembahan watak pendek daripada satu potret yang diluluskanKlip haiwan peliharaan atau watak ilustrasi bercakapVideo sosial dan penerangan yang dipandu narasi
Menyokong
Imej + Audio ke Video
Percubaan dalam talian
Cuba OmniHuman 1.5
Muat naik satu potret dan satu klip audio kurang daripada 60 saat, kemudian pilih resolusi output, mod pemprosesan dan seed pilihan.
Hasil
OmniHuman 1.5
ByteDanceAI.generator.modes.image-audio-to-video
Gunakan OmniHuman 1.5 apabila seseorang, haiwan peliharaan atau watak ilustrasi perlu membuat persembahan daripada trek suara siap, sementara potret sumber kekal sebagai asas visual. Pengenalpastian manusia, pengesanan subjek dan pemilihan berasaskan topeng tidak tersedia pada halaman ini.
OmniHuman 1.5
Belum ada hasil. Hantar prompt untuk memulakan sesi.
Imej + Audio ke Video
Kesesuaian keputusan
Bila model ini pilihan yang tepat
Kesesuaian keputusan
Isyarat kesesuaian
Tepat satu imej potret dan satu trek audio mengekalkan aliran kerja yang terfokus
Berfungsi dengan orang, haiwan peliharaan serta subjek ilustrasi atau gaya anime
Output 720p dan 1080p yang boleh dipilih
Mod pemprosesan lebih pantas secara pilihan
Kredit mengikut tempoh audio yang disahkan
Tugasan paling sesuai
Gunakannya apabila tugasan kelihatan seperti ini
Video penyampai yang dipandu oleh trek suara siapPersembahan watak pendek daripada satu potret yang diluluskanKlip haiwan peliharaan atau watak ilustrasi bercakapVideo sosial dan penerangan yang dipandu narasi
Fakta ringkas
Input, output dan kredit untuk disahkan
Penyedia
ByteDance
Kategori
Video
Keupayaan
Imej + Audio ke Video
Model kredit
per_input_second · default=27 · ⌈total⌉
Laluan input
1 imej + 1 audio
Persediaan prompt
Sehingga 300 aksara
FAQ
FAQ OmniHuman 1.5
Apakah kegunaan terbaik OmniHuman 1.5?
OmniHuman 1.5 direka untuk aliran kerja imej dan audio yang terfokus: satu potret menyediakan subjek dan satu trek suara memacu persembahan yang terhasil. Ia lebih sesuai untuk klip penyampai, narasi watak dan video subjek bercakap yang pendek berbanding tugas prompt ke video umum.
Fail potret dan audio manakah yang boleh saya muat naik?
Muat naik tepat satu imej JPEG, PNG atau WebP sehingga 10 MB dan satu fail audio MP3, M4A, WAV, AAC atau OGG sehingga 10 MB. Tempoh audio yang disahkan mestilah lebih daripada sifar dan benar-benar kurang daripada 60 saat.
Bagaimanakah kredit OmniHuman 1.5 dikira?
Rivya menggunakan kadar 27 kredit bagi setiap saat audio yang disahkan. Tempoh perpuluhan kekal dalam pengiraan penuh dan hanya jumlah rizab dibundarkan ke atas kepada kredit penuh. Apabila penggunaan sebenar yang sah dan tidak melebihi rizab dilaporkan, Rivya menyelesaikan caj kepada jumlah itu; penggunaan yang tiada, tidak sah atau melebihi rizab kekal dalam rekonsiliasi dan tidak mencetuskan caj tambahan tersembunyi.
Apakah yang diubah oleh mod pantas?
Mod pantas mengutamakan masa pemprosesan yang lebih pendek dengan kemungkinan pertukaran kualiti. Biarkannya mati untuk larian yang mengutamakan kualiti, dan hidupkannya apabila kelajuan lebih penting untuk ujian awal.
Bolehkah saya menambah prompt kepada potret dan audio?
Ya, tetapi ia pilihan dan dihadkan kepada 300 aksara di Rivya. Laluan prompt semasa menerima teks bertulis dalam bahasa Cina, Inggeris, Jepun, Korea, Sepanyol atau Indonesia sahaja; potret dan audio kekal sebagai input wajib, dan penyegerakan bibir mutlak tidak dijamin.
Apakah yang boleh saya cipta di halaman OmniHuman 1.5 ini?
Cipta video watak berpandukan audio daripada tepat satu imej potret dan satu klip audio. Subjek boleh berupa orang, haiwan peliharaan atau watak ilustrasi, dan output boleh berupa 720p atau 1080p.
Apakah yang patut saya sediakan sebelum menjana?
Pilih potret jelas yang sudah menggambarkan subjek yang mahu anda kekalkan, kemudian sediakan rakaman suara akhir. Audio mesti kurang daripada 60 saat, dan kedua-dua fail mesti lulus semakan muat naik sebelum penjanaan.
Tetapan manakah yang paling penting?
Pilih 720p atau 1080p, tentukan sama ada mahu menggunakan pilihan pemprosesan lebih pantas, dan biarkan seed pada -1 untuk hasil rawak melainkan anda memerlukan perbandingan yang lebih boleh diulang.
Adakah saya perlu log masuk, dan bagaimanakah kredit berfungsi?
Butiran model adalah awam, tetapi muat naik dan penjanaan memerlukan log masuk. OmniHuman 1.5 berharga 27 kredit bagi setiap saat audio yang disahkan, dengan hanya jumlah akhir yang dikira dibundarkan ke atas.
Bilakah saya patut membuka Studio penuh?
Kekal di sini untuk menguji satu potret dan satu trek suara. Buka Studio apabila anda memerlukan rakaman tersimpan, beberapa watak, versi suara berulang atau aliran kerja produksi yang lebih panjang.
Bandingkan alternatif
Model lain untuk dipertimbangkan seterusnya
Video
Seedance 2.0
Model video Seedance 2.0 penuh ByteDance dengan sokongan eksplisit untuk penjanaan prompt sahaja, animasi berpandukan bingkai dan penjanaan rujukan multimodal. Rivya mengekalkan pemisahan peranan terdokumen secara eksplisit supaya input bingkai dan rujukan multimodal kekal saling eksklusif, bukan runtuh menjadi satu ruang muat naik yang kabur.
Sebab mempertimbangkannya
Pertimbangkannya apabila tugasan seterusnya memerlukan Prompt, bingkai atau rujukan imej/video/audio.
InputPrompt, bingkai atau rujukan imej/video/audio
Model video Seedance 2.0 ByteDance yang lebih pantas dengan penghalaan adegan penuh untuk penjanaan prompt sahaja, animasi imej berpandukan bingkai dan penjanaan video rujukan multimodal. Rivya mengekalkan pemisahan adegan terdokumen secara eksplisit supaya input bingkai pertama/terakhir tidak bercampur dengan peranan imej rujukan, video dan audio.
Sebab mempertimbangkannya
Pertimbangkannya apabila tugasan seterusnya memerlukan Prompt, bingkai atau rujukan imej/video/audio.
InputPrompt, bingkai atau rujukan imej/video/audio
Terbaik untukPra-visualisasi iklan pantas daripada prompt atau bingkai papan cerita
Video
Seedance 1.5 Pro
Model video Seedance untuk teks-ke-video dan imej-ke-video dengan penyegerakan audio-visual asli. Model ini menyokong 480p-1080p, klip 4-12s, 6 nisbah aspek, kawalan lensa dinamik atau tetap, penjanaan audio pilihan dan lip-sync.
Sebab mempertimbangkannya
Pertimbangkannya apabila tugasan seterusnya memerlukan Prompt + imej pilihan.