المضيف A: أهلا بكم من جديد في Launch Notes، حيث نفكك أدوات AI الجديدة من دون ضجيج. المضيف B: وحيث نحول تلك الإطلاقات إلى سير عمل يمكنكم استخدامها فعليا هذا الأسبوع.
ElevenLabs Dialogue V3 هو مولد أصوات AI متعدد المتحدثين في Rivya للبودكاست والمقابلات ومشاهد تمثيل الأدوار والمحادثات المكتوبة. استخدمه عندما يكون التوقيت بين المتحدثين أهم من تحويل النص إلى كلام بسارد واحد.
مخرج مثال
مثال؛ لم يتم التحقق من النموذج الذي أنشأه · افتتاحية بصوتين مع ترحيب واثق وانتقال سريع.
حوار إلى صوت
مخرج مثال
مثال؛ لم يتم التحقق من النموذج الذي أنشأه · افتتاحية بصوتين مع ترحيب واثق وانتقال سريع.
أفضل لـ
يدعم
تجربة عبر الإنترنت
لا توجد نتيجة بعد. أرسل موجّهًا لبدء عملية إنشاء.
بدايات الموجّهات
إثبات النموذج
استخدم التجربة عبر الإنترنت أعلاه، ثم قارن نتائج الأمثلة هذه لتقييم جودة النتيجة والإيقاع وملاءمة المهمة قبل إنفاق المزيد من الأرصدة في Studio.
العينة الرئيسية
موجة صوتية وفن غلاف لمعاينة صوتية لمقدمة بودكاست بمضيفين.
المدخل
أسطر حوار + إعدادات الصوت
ما ينبغي ملاحظته
موجة صوتية وفن غلاف لمعاينة صوتية لمقدمة بودكاست بمضيفين.
الأرصدة لكل استخدام
per_1000_characters · dialogue_text=14 · ⌈total⌉
لماذا يعمل هذا النموذج
توليد حوار متعدد المتحدثين
تعيين صوت مستقل لكل شخصية
ثبات قابل للضبط لتقديم متسق
أفضل المهام المناسبة
إثبات النموذج
ملاءمة القرار
ملاءمة القرار
أفضل المهام المناسبة
استخدمه عندما تبدو المهمة هكذا
حقائق عملية
المزود
ElevenLabs
الفئة
صوت
القدرات
حوار إلى صوت
نموذج الأرصدة
per_1000_characters · dialogue_text=14 · ⌈total⌉
مسار المدخل
أسطر حوار + إعدادات الصوت
إعداد الموجّه
حوار يقوده النص
وصول المطورين
استدع ElevenLabs Dialogue V3 من Public API v1 بعد التحقق من حقول النموذج وقواعد الوسائط المرجعية وسلوك الأرصدة.
الأسئلة الشائعة حول ElevenLabs Dialogue V3
يكون ElevenLabs Dialogue V3 أقوى عندما يعتمد الصوت على التوقيت بين المتحدثين بدلا من سارد واحد يقرأ كل شيء بشكل مباشر. يناسب تبادلات البودكاست، ونصوص المقابلات، ومشاهد الشخصيات، ونماذج الدراما الصوتية، وأي عمل صوتي قائم على الأدوار يحتاج فيه عدة أشخاص إلى أن يبدوا متمايزين داخل تمريرة تصيير واحدة.
على Rivya، يعد ElevenLabs Dialogue V3 خيارا من الحوار إلى الصوت مع تعيين صوت لكل شخصية وعناصر تحكم في الأداء. يتم قياسه حاليا بنحو 14 رصيدا لكل 1,000 حرف مع التقريب إلى الأعلى، وعناصر التحكم العامة الرئيسية هي الصوت الافتراضي والثبات ورمز اللغة، ما يبقيه مركزا على إعداد النص والأداء بدلا من ما بعد الإنتاج.
السؤال الحقيقي هو هل تمييز أصوات المتحدثين واضح بما يكفي. يحدد اختيار الصوت هوية المتحدث، ويؤثر الثبات على مدى انتظام كل قراءة وقابليتها للتوقع، ويهم رمز اللغة عندما يحتاج النص إلى أداء متعدد اللغات. إذا كانت هذه الأجزاء الثلاثة تعمل، فعادة يخبرك النموذج بالفعل هل يمكن للمشهد أن يصمد كحوار لا كمقاطع صوتية أحادية منفصلة ومجمعة.
لأنه مقاس حاليا بنحو 14 رصيدا لكل 1,000 حرف مع التقريب إلى الأعلى، يسهل تبرير التكلفة عندما يحتاج تمرير واحد إلى إثبات كيمياء التبادل وإيقاعه وفصل الأصوات فيه. ينطبق ذلك خصوصا على مقدمات البودكاست وقراءات المقابلات والمشاهد القصصية حيث يكون سماع الطرفين معا أهم من فحص السطور واحدا واحدا.
اختر خيار ElevenLabs أحادي المتحدث عندما يحتاج النص إلى سارد واحد فقط أو تعليق صوتي نظيف واحد. اختر Dialogue V3 عندما يكون التبادل نفسه هو المنتج، ويحتاج المشهد إلى عدة متحدثين يبدون كمحادثة واحدة بدلا من مجموعة قراءات منفصلة.
ابدأ هنا عندما تحتاج النتيجة الأولى إلى إخبارك هل يعمل مشهد المحادثة فعلا كصوت. استخدمه للمزاح في البودكاست، وقراءات المقابلات، وحوار الشخصيات، واختبارات قراءة النص جماعيا حيث يكون السؤال الأساسي هل تبدو الأصوات والإيقاع وتبادل الأدوار مناسبة معا.
هذه الصفحة خيار من الحوار إلى الصوت، وليست صفحة عامة لتحويل النص إلى كلام. قبل النتيجة الأولى، يدور الإعداد العام حول تعيين صوت افتراضي، وضبط الثبات، وتحديد رمز اللغة، حتى يبقى التركيز على اختيار الأصوات والأداء بدلا من تجميع ملفات صوتية منفصلة لاحقا.
قبل التشغيل، تأكد أن أصوات المتحدثين متمايزة بوضوح، واستخدم الثبات لتحديد هل ينبغي أن تبدو القراءة مضبوطة أم أكثر تعبيرا، وحدد رمز اللغة عندما يكون النطق أو الأداء متعدد اللغات مهما. هذه الاختيارات غالبا تفيد النتيجة الأولى أكثر من صقل النص إلى ما لا نهاية قبل سماعه.
الصفحة عامة، لكن تصيير الحوار الأول الفعلي ما زال يتطلب تسجيل الدخول. يتم قياسه حاليا بنحو 14 رصيدا لكل 1,000 حرف مع التقريب إلى الأعلى، لذلك يمكنك تثبيت النص وفصل المتحدثين واتجاه الأداء أولا، ثم تسجيل الدخول عندما تكون جاهزا للتصيير.
ابق في هذه الصفحة ما دمت تختبر القراءة الأولى لمحادثة وتتحقق هل تعمل الأصوات والإيقاع. افتح Studio الكامل عندما يحتاج العمل إلى لقطات صوتية محفوظة، أو مراجعات نصية متكررة، أو مقاطع متعددة، أو مشروع صوت أطول حول المشهد أو العرض نفسه.
قارن البدائل
Suno Music هو نموذج Rivya للنص إلى موسيقى، يحول موجزا قصيرا واحدا إلى مسودة أغنية أولى مع غناء أو من دونه. يحافظ على نقطة الدخول الثابتة عند `12` رصيدا ويعرض `Extend Music` كخطوة تالية بعد نجاح المسار.
لماذا تفكر فيه
فكّر فيه عندما تحتاج مهمتك التالية إلى موجّه فقط.
Suno Sounds هو نموذج Rivya الخفيف لتحويل النص إلى صوت، مناسب لحلقات الأجواء وصوت الخلفية والمسودات الصوتية القصيرة. يحافظ على السعر الثابت الموثق عند `2.5` أرصدة لكل عملية توليد، ويتيح للنتائج الناجحة المتابعة إلى `Vocal Separation`.
لماذا تفكر فيه
فكّر فيه عندما تحتاج مهمتك التالية إلى موجّه فقط.
Suno Lyrics هو نموذج توليد كلمات الأغاني في Rivya لتحويل موضوع أو حالة مزاجية واحدة إلى كلمات أغنية بتكلفة ثابتة قدرها `1` رصيد لكل طلب.
لماذا تفكر فيه
فكّر فيه عندما تحتاج مهمتك التالية إلى موجّه فقط.