কোনো ব্যক্তি, পোষা প্রাণী বা অলংকৃত চরিত্রকে প্রস্তুত ভয়েস ট্র্যাক থেকে অভিনয় করাতে এবং উৎস পোর্ট্রেটকে ভিজ্যুয়াল ভিত্তি রাখতে হলে OmniHuman 1.5 ব্যবহার করুন। এই পৃষ্ঠায় মানুষ শনাক্তকরণ, বিষয় শনাক্তকরণ বা মাস্কভিত্তিক নির্বাচন পাওয়া যায় না।
ঠিক একটি পোর্ট্রেট ছবি ও একটি অডিও ট্র্যাক কর্মপ্রবাহকে কেন্দ্রীভূত রাখেব্যক্তি, পোষা প্রাণী এবং অলংকৃত বা অ্যানিমে-শৈলীর বিষয় নিয়ে কাজ করে
নির্বাচনযোগ্য 720p ও 1080p আউটপুট
Input
1টি image + 1টি audio
Output
AI Video Generator
Credits
per_input_second · default=27 · ⌈total⌉
Best for
প্রস্তুত ভয়েস ট্র্যাক দিয়ে পরিচালিত উপস্থাপক ভিডিও
Input, output, credits এবং example result দেখে নিন, তারপর page থেকেই সরাসরি এই model try করুন। Saved history, asset বা দীর্ঘ iteration দরকার হলে Studio-তে যান।
উদাহরণ আউটপুট
OmniHuman 1.5
যার জন্য সেরা
প্রস্তুত ভয়েস ট্র্যাক দিয়ে পরিচালিত উপস্থাপক ভিডিওঅনুমোদিত একটি পোর্ট্রেট থেকে ছোট চরিত্রের অভিনয়পোষা প্রাণী বা অলংকৃত চরিত্রের কথা বলার ক্লিপবর্ণনানির্ভর সামাজিক ভিডিও ও ব্যাখ্যামূলক ভিডিও
সমর্থন করে
ছবি + অডিও থেকে ভিডিও
Online trial
OmniHuman 1.5 চেষ্টা করুন
একটি পোর্ট্রেট ও 60 সেকেন্ডের কম একটি অডিও ক্লিপ আপলোড করুন, এরপর আউটপুট রেজোলিউশন, প্রক্রিয়াকরণ মোড ও ঐচ্ছিক সিড বেছে নিন।
ফলাফল
OmniHuman 1.5
ByteDanceAI.generator.modes.image-audio-to-video
কোনো ব্যক্তি, পোষা প্রাণী বা অলংকৃত চরিত্রকে প্রস্তুত ভয়েস ট্র্যাক থেকে অভিনয় করাতে এবং উৎস পোর্ট্রেটকে ভিজ্যুয়াল ভিত্তি রাখতে হলে OmniHuman 1.5 ব্যবহার করুন। এই পৃষ্ঠায় মানুষ শনাক্তকরণ, বিষয় শনাক্তকরণ বা মাস্কভিত্তিক নির্বাচন পাওয়া যায় না।
OmniHuman 1.5
এখনও কোনো ফলাফল নেই। রান শুরু করতে একটি প্রম্পট জমা দিন।
ছবি + অডিও থেকে ভিডিও
Decision fit
কখন এই model সঠিক পছন্দ
Decision fit
Fit signal
ঠিক একটি পোর্ট্রেট ছবি ও একটি অডিও ট্র্যাক কর্মপ্রবাহকে কেন্দ্রীভূত রাখে
ব্যক্তি, পোষা প্রাণী এবং অলংকৃত বা অ্যানিমে-শৈলীর বিষয় নিয়ে কাজ করে
নির্বাচনযোগ্য 720p ও 1080p আউটপুট
ঐচ্ছিক দ্রুত প্রক্রিয়াকরণ মোড
যাচাইকৃত অডিও মেয়াদ অনুযায়ী ক্রেডিট
Best-fit task
Task এমন হলে এটি ব্যবহার করুন
প্রস্তুত ভয়েস ট্র্যাক দিয়ে পরিচালিত উপস্থাপক ভিডিওঅনুমোদিত একটি পোর্ট্রেট থেকে ছোট চরিত্রের অভিনয়পোষা প্রাণী বা অলংকৃত চরিত্রের কথা বলার ক্লিপবর্ণনানির্ভর সামাজিক ভিডিও ও ব্যাখ্যামূলক ভিডিও
Quiet facts
Input, output এবং credits নিশ্চিত করুন
Provider
ByteDance
Category
ভিডিও
Capabilities
ছবি + অডিও থেকে ভিডিও
Credit model
per_input_second · default=27 · ⌈total⌉
Input path
1টি image + 1টি audio
প্রম্পট সেটআপ
সর্বোচ্চ 300 chars
FAQ
OmniHuman 1.5 FAQ
OmniHuman 1.5 কোন কাজে সবচেয়ে উপযোগী?
OmniHuman 1.5 একটি কেন্দ্রীভূত ছবি-ও-অডিও কর্মপ্রবাহের জন্য তৈরি: একটি পোর্ট্রেট বিষয়টি দেয় এবং একটি ভয়েস ট্র্যাক ফলাফলের অভিনয় পরিচালনা করে। সাধারণ প্রম্পট-টু-ভিডিও কাজের তুলনায় এটি উপস্থাপক ক্লিপ, চরিত্রের বর্ণনা ও ছোট কথা-বলা বিষয়ভিত্তিক ভিডিওর জন্য বেশি উপযোগী। এটি মুখের গতি পরিচালনা করে, তবে নিখুঁত লিপ-সিঙ্ক নিশ্চিত করে না।
কোন পোর্ট্রেট ও অডিও ফাইল আপলোড করা যায়?
সর্বোচ্চ 10 MB-এর ঠিক একটি JPEG, PNG বা WebP ছবি এবং সর্বোচ্চ 10 MB-এর একটি MP3, M4A, WAV, AAC বা OGG অডিও ফাইল আপলোড করুন। যাচাইকৃত অডিও মেয়াদ শূন্যের বেশি এবং কঠোরভাবে 60 সেকেন্ডের কম হতে হবে।
OmniHuman 1.5-এর ক্রেডিট কীভাবে হিসাব করা হয়?
Rivya যাচাইকৃত প্রতি অডিও সেকেন্ডে 27 ক্রেডিট হার ব্যবহার করে। দশমিক মেয়াদ সম্পূর্ণ হিসাবের অংশ থাকে এবং শুধু সংরক্ষণের মোটকে একটি পূর্ণ ক্রেডিটে ঊর্ধ্বমুখী করা হয়। বৈধ প্রকৃত ব্যবহার জানানো হলে এবং তা সংরক্ষিত পরিমাণের চেয়ে বেশি না হলে Rivya সেই পরিমাণে নিষ্পত্তি করে; প্রকৃত ব্যবহার অনুপস্থিত, অবৈধ বা সংরক্ষিত পরিমাণের বেশি হলে গোপনে অতিরিক্ত চার্জ না কেটে তা সমন্বয় প্রক্রিয়ায় রাখা হয়।
দ্রুত মোড কী পরিবর্তন করে?
দ্রুত মোড সম্ভাব্য গুণমানের বিনিময়ে কম প্রক্রিয়াকরণ সময়কে অগ্রাধিকার দেয়। গুণমান-প্রথম রানের জন্য এটি বন্ধ রাখুন এবং প্রাথমিক পরীক্ষায় দ্রুত ফল বেশি গুরুত্বপূর্ণ হলে চালু করুন।
পোর্ট্রেট ও অডিওর সঙ্গে প্রম্পট যোগ করতে পারি?
হ্যাঁ, তবে তা ঐচ্ছিক এবং Rivya-তে সর্বোচ্চ 300 অক্ষরের। বর্তমান প্রম্পট পথ শুধু চীনা, ইংরেজি, জাপানি, কোরীয়, স্প্যানিশ বা ইন্দোনেশীয় লিখিত টেক্সট গ্রহণ করে; পোর্ট্রেট ও অডিও আবশ্যিক ইনপুট হিসেবে থাকে।
এই OmniHuman 1.5 পৃষ্ঠায় কী তৈরি করতে পারি?
ঠিক একটি পোর্ট্রেট ছবি ও একটি অডিও ক্লিপ থেকে অডিও-চালিত চরিত্রের ভিডিও তৈরি করুন। বিষয়টি ব্যক্তি, পোষা প্রাণী বা অলংকৃত চরিত্র হতে পারে এবং আউটপুট 720p বা 1080p হতে পারে।
জেনারেশনের আগে কী প্রস্তুত করব?
যে বিষয়টিকে ধরে রাখতে চান তা স্পষ্টভাবে দেখায় এমন পোর্ট্রেট বেছে নিন, এরপর চূড়ান্ত ভয়েস টেক প্রস্তুত করুন। অডিও 60 সেকেন্ডের কম হতে হবে এবং জেনারেশনের আগে দুটি ফাইলকেই আপলোড পরীক্ষা পাস করতে হবে।
কোন সেটিং সবচেয়ে গুরুত্বপূর্ণ?
720p বা 1080p বেছে নিন, দ্রুত প্রক্রিয়াকরণ বিকল্প ব্যবহার করবেন কি না ঠিক করুন, এবং আরও পুনরাবৃত্তিযোগ্য তুলনা না চাইলে এলোমেলো ফলের জন্য সিড -1 রাখুন।
সাইন ইন করতে হবে কি, এবং ক্রেডিট কীভাবে কাজ করে?
বিস্তারিত তথ্য সর্বসাধারণের জন্য উন্মুক্ত, তবে আপলোড ও জেনারেশনের জন্য সাইন ইন প্রয়োজন। OmniHuman 1.5-এ যাচাইকৃত প্রতি অডিও সেকেন্ডে 27 ক্রেডিট লাগে, এবং শুধু চূড়ান্ত হিসাব করা মোটকে ঊর্ধ্বমুখী পূর্ণসংখ্যায় নেওয়া হয়।
কখন পূর্ণ Studio খুলব?
একটি পোর্ট্রেট ও একটি ভয়েস ট্র্যাক পরীক্ষা করতে এখানেই থাকুন। সংরক্ষিত টেক, একাধিক চরিত্র, বারবার ভয়েস সংস্করণ বা দীর্ঘ প্রোডাকশন কর্মপ্রবাহ প্রয়োজন হলে Studio খুলুন।
Alternative তুলনা করুন
এরপর বিবেচনার মতো অন্য model
ভিডিও
Seedance 2.0
ByteDance-এর full Seedance 2.0 video model, prompt-only generation, frame-driven animation এবং multimodal reference generation-এর explicit support সহ। Rivya documented role split explicit রাখে, যাতে frame input এবং multimodal reference এক অস্পষ্ট upload bucket-এ collapse না করে mutually exclusive থাকে।
কেন বিবেচনা করবেন
আপনার পরের task-এ Prompt, frame, অথবা image/video/audio reference দরকার হলে এটি বিবেচনা করুন।
InputPrompt, frame, অথবা image/video/audio reference
ByteDance-এর faster Seedance 2.0 video model, prompt-only generation, frame-driven image animation এবং multimodal reference video generation-এর জন্য full scene routing সহ। Rivya documented scene split explicit রাখে, যাতে first/last-frame input reference image, video এবং audio role-এর সঙ্গে collide না করে।
কেন বিবেচনা করবেন
আপনার পরের task-এ Prompt, frame, অথবা image/video/audio reference দরকার হলে এটি বিবেচনা করুন।
InputPrompt, frame, অথবা image/video/audio reference
Best forprompt বা storyboard frame থেকে fast ad previs
ভিডিও
Seedance 1.5 Pro
Text-to-video ও image-to-video-এর জন্য native audio-visual sync-সহ Seedance video model। এটি 480p–1080p, 4–12s clip, 6টি aspect ratio, dynamic বা fixed lens control, optional audio generation এবং lip-sync support করে।
কেন বিবেচনা করবেন
আপনার পরের task-এ Prompt + optional image দরকার হলে এটি বিবেচনা করুন।