OmniHuman 1.5 का उपयोग तब करें जब किसी व्यक्ति, पालतू पशु या चित्रित पात्र को तैयार वॉइस ट्रैक के आधार पर प्रदर्शन करना हो और स्रोत पोर्ट्रेट दृश्य आधार बना रहे। इस पेज पर व्यक्ति की पहचान, विषय का पता लगाना और मास्क-आधारित चयन उपलब्ध नहीं हैं।
ठीक एक पोर्ट्रेट इमेज और एक ऑडियो ट्रैक कार्यप्रवाह को केंद्रित रखते हैंव्यक्तियों, पालतू पशुओं और चित्रित या ऐनिमे-शैली के विषयों के साथ काम करता है
इनपुट, आउटपुट, क्रेडिट और उदाहरण नतीजा जांचें, फिर इस मॉडल को सीधे पेज पर आज़माएं। सेव की गई हिस्ट्री, एसेट या लंबे सुधार चरण चाहिए हों तो Studio में जाएं।
उदाहरण आउटपुट
OmniHuman 1.5
इनके लिए उपयोगी
तैयार वॉइस ट्रैक से निर्देशित प्रस्तोता वीडियोएक स्वीकृत पोर्ट्रेट से छोटे पात्र प्रदर्शनपालतू पशु या चित्रित पात्र के बोलते हुए क्लिपवर्णन-आधारित सोशल वीडियो और व्याख्यात्मक सामग्री
समर्थित
इमेज + ऑडियो से वीडियो
ऑनलाइन परीक्षण
OmniHuman 1.5 आज़माएँ
एक पोर्ट्रेट और 60 सेकंड से छोटा एक ऑडियो क्लिप अपलोड करें, फिर आउटपुट रिज़ॉल्यूशन, प्रोसेसिंग मोड और वैकल्पिक सीड चुनें।
परिणाम
OmniHuman 1.5
ByteDanceAI.generator.modes.image-audio-to-video
OmniHuman 1.5 का उपयोग तब करें जब किसी व्यक्ति, पालतू पशु या चित्रित पात्र को तैयार वॉइस ट्रैक के आधार पर प्रदर्शन करना हो और स्रोत पोर्ट्रेट दृश्य आधार बना रहे। इस पेज पर व्यक्ति की पहचान, विषय का पता लगाना और मास्क-आधारित चयन उपलब्ध नहीं हैं।
OmniHuman 1.5
अभी कोई परिणाम नहीं है। रन शुरू करने के लिए प्रॉम्प्ट सबमिट करें।
इमेज + ऑडियो से वीडियो
चुनाव के लिए उपयुक्तता
यह मॉडल कब सही चुनाव है
चुनाव के लिए उपयुक्तता
उपयुक्तता संकेत
ठीक एक पोर्ट्रेट इमेज और एक ऑडियो ट्रैक कार्यप्रवाह को केंद्रित रखते हैं
व्यक्तियों, पालतू पशुओं और चित्रित या ऐनिमे-शैली के विषयों के साथ काम करता है
चुनने योग्य 720p और 1080p आउटपुट
वैकल्पिक तेज़ प्रोसेसिंग मोड
क्रेडिट सत्यापित ऑडियो अवधि का अनुसरण करते हैं
सबसे उपयुक्त टास्क
टास्क ऐसा हो तो इसका उपयोग करें
तैयार वॉइस ट्रैक से निर्देशित प्रस्तोता वीडियोएक स्वीकृत पोर्ट्रेट से छोटे पात्र प्रदर्शनपालतू पशु या चित्रित पात्र के बोलते हुए क्लिपवर्णन-आधारित सोशल वीडियो और व्याख्यात्मक सामग्री
स्पष्ट तथ्य
इनपुट, आउटपुट और क्रेडिट की पुष्टि करें
प्रदाता
ByteDance
श्रेणी
वीडियो
क्षमताएं
इमेज + ऑडियो से वीडियो
क्रेडिट मॉडल
per_input_second · default=27 · ⌈total⌉
इनपुट रास्ता
1 इमेज + 1 ऑडियो
प्रॉम्प्ट सेटअप
अधिकतम 300 अक्षर
अक्सर पूछे जाने वाले सवाल
OmniHuman 1.5 के अक्सर पूछे जाने वाले सवाल
OmniHuman 1.5 का सबसे अच्छा उपयोग किसके लिए है?
OmniHuman 1.5 केंद्रित इमेज-और-ऑडियो कार्यप्रवाह के लिए बनाया गया है: एक पोर्ट्रेट विषय देता है और एक वॉइस ट्रैक परिणामी प्रदर्शन को निर्देशित करता है। यह सामान्य प्रॉम्प्ट-टू-वीडियो कार्य की तुलना में प्रस्तोता क्लिप, पात्र वर्णन और छोटे बोलते-विषय वीडियो के लिए बेहतर है।
मैं कौन-सी पोर्ट्रेट और ऑडियो फ़ाइलें अपलोड कर सकता हूँ?
अधिकतम 10 MB की ठीक एक JPEG, PNG या WebP इमेज और अधिकतम 10 MB की एक MP3, M4A, WAV, AAC या OGG ऑडियो फ़ाइल अपलोड करें। सत्यापित ऑडियो अवधि शून्य से अधिक और पूरी तरह 60 सेकंड से कम होनी चाहिए।
OmniHuman 1.5 के क्रेडिट की गणना कैसे होती है?
Rivya सत्यापित ऑडियो के प्रति सेकंड 27 क्रेडिट की दर इस्तेमाल करता है। दशमलव अवधि पूरी गणना में बनी रहती है और केवल आरक्षण के कुल को ऊपर की ओर पूर्ण क्रेडिट में बदला जाता है। जब रिपोर्ट की गई वास्तविक खपत मान्य हो और आरक्षित राशि से अधिक न हो, तो Rivya उसी पर अंतिम निपटान करता है; अनुपलब्ध, अमान्य या आरक्षण से अधिक खपत छिपा हुआ अतिरिक्त शुल्क लगाने के बजाय मिलान प्रक्रिया में रहती है।
तेज़ मोड क्या बदलता है?
तेज़ मोड गुणवत्ता में संभावित समझौते के साथ कम प्रोसेसिंग समय को प्राथमिकता देता है। गुणवत्ता-प्रथम रन के लिए इसे बंद रखें और शुरुआती परीक्षण में समय अधिक महत्वपूर्ण हो तो चालू करें।
क्या मैं पोर्ट्रेट और ऑडियो के साथ प्रॉम्प्ट जोड़ सकता हूँ?
हाँ, लेकिन वह वैकल्पिक है और Rivya पर 300 वर्णों तक सीमित है। वर्तमान प्रॉम्प्ट तरीका केवल चीनी, अंग्रेज़ी, जापानी, कोरियाई, स्पेनी या इंडोनेशियाई लिखित टेक्स्ट स्वीकार करता है; पोर्ट्रेट और ऑडियो आवश्यक इनपुट बने रहते हैं। मुँह की समय-संगति एक दिशात्मक लक्ष्य है, पूर्ण लिप सिंक की गारंटी नहीं।
इस OmniHuman 1.5 पेज पर मैं क्या बना सकता हूँ?
ठीक एक पोर्ट्रेट इमेज और एक ऑडियो क्लिप से ऑडियो-निर्देशित पात्र वीडियो बनाएँ। विषय व्यक्ति, पालतू पशु या चित्रित पात्र हो सकता है और आउटपुट 720p या 1080p हो सकता है।
जनरेशन से पहले मुझे क्या तैयार करना चाहिए?
ऐसा स्पष्ट पोर्ट्रेट चुनें जो उस विषय को पहले से दर्शाता हो जिसे बनाए रखना है, फिर अंतिम वॉइस टेक तैयार करें। ऑडियो 60 सेकंड से छोटा होना चाहिए और जनरेशन से पहले दोनों फ़ाइलों को अपलोड जाँच पास करनी होगी।
कौन-सी सेटिंग सबसे अधिक मायने रखती हैं?
720p या 1080p चुनें, तय करें कि तेज़ प्रोसेसिंग विकल्प इस्तेमाल करना है या नहीं और यादृच्छिक परिणाम के लिए सीड -1 पर छोड़ें, जब तक अधिक दोहराई जा सकने वाली तुलना न चाहिए।
क्या साइन इन करना जरूरी है और क्रेडिट कैसे काम करते हैं?
विवरण सार्वजनिक हैं, लेकिन अपलोड और जनरेशन के लिए साइन इन जरूरी है। OmniHuman 1.5 की कीमत सत्यापित ऑडियो के प्रति सेकंड 27 क्रेडिट है और केवल अंतिम गणना किए गए कुल को ऊपर की ओर पूर्णांकित किया जाता है।
मुझे पूरा Studio कब खोलना चाहिए?
एक पोर्ट्रेट और एक वॉइस ट्रैक का परीक्षण करने के लिए यहीं रहें। सहेजे गए टेक, कई पात्र, बार-बार वॉइस संस्करण या लंबा उत्पादन कार्यप्रवाह चाहिए तो Studio खोलें।
विकल्पों की तुलना करें
आगे विचार करने के लिए अन्य मॉडल
वीडियो
Seedance 2.0
ByteDance का full Seedance 2.0 video model, जिसमें prompt-only generation, frame-driven animation और multimodal reference generation के लिए साफ support है। Rivya documented role split को explicit रखता है ताकि frame inputs और multimodal references एक ambiguous upload bucket में collapse न हों।
इस पर क्यों विचार करें
जब आपके अगले टास्क में प्रॉम्प्ट, फ्रेम या इमेज/वीडियो/ऑडियो संदर्भ चाहिए हो, तो इस पर विचार करें।
ByteDance का faster Seedance 2.0 video model, जो prompt-only generation, frame-driven image animation और multimodal reference video generation के लिए full scene routing देता है। Rivya documented scene split को explicit रखता है ताकि first/last-frame inputs reference image, video और audio roles से collide न करें।
इस पर क्यों विचार करें
जब आपके अगले टास्क में प्रॉम्प्ट, फ्रेम या इमेज/वीडियो/ऑडियो संदर्भ चाहिए हो, तो इस पर विचार करें।
इनके लिए उपयोगीPrompts या storyboard frames से fast ad previs
वीडियो
Seedance 1.5 Pro
टेक्स्ट-से-वीडियो और इमेज-से-वीडियो के लिए मूल ऑडियो-विजुअल तालमेल वाला Seedance वीडियो मॉडल। यह 480p–1080p, 4–12 सेकंड के क्लिप, 6 आस्पेक्ट रेशियो, गतिशील या स्थिर लेंस नियंत्रण, वैकल्पिक ऑडियो जनरेशन और लिप-सिंक का समर्थन करता है।
इस पर क्यों विचार करें
जब आपके अगले टास्क में प्रॉम्प्ट + वैकल्पिक इमेज चाहिए हो, तो इस पर विचार करें।