دليل نشر TTS Studio: دعم 322 صوتًا ذكياً لـ 75 لغة

TTS Studio هو أداة مفتوحة المصدر لتحويل النص إلى كلام، تحتوي على 322 صوتًا مدعومًا بالذكاء الاصطناعي وتدعم 75 لغة، تستخدم لتحويل ملفات الترجمة (SRT / VTT) أو النصوص العادية إلى مقاطع صوتية متعددة اللغات، مما يجعلها مناسبة لصانعي المحتوى الذين يحتاجون إلى إنتاج دبلجة متعددة اللغات. يمكن نشرها باستخدام Docker في حوالي عشر دقائق، ويمكن تشغيلها على VPS أو NAS أو الكمبيوتر الشخصي، وهي مجانية، بدون رسوم شهرية، وبدون تكاليف استدعاء API.

ما هو TTS Studio؟

TTS Studio هو أداة مفتوحة المصدر لتحويل النص إلى كلام، والغرض الرئيسي منها هو تحويل ملفات الترجمة الجاهزة (بصيغة SRT أو VTT) أو النصوص المدخلة مباشرة، إلى ملفات صوتية طبيعية (MP3) بواسطة الذكاء الاصطناعي. بالنسبة لصانعي المحتوى الذين يقومون بإنتاج مقاطع فيديو وبودكاست متعددة اللغات، يمكن أن توفر الكثير من الوقت في تسجيل الصوت جملة بجملة.

تحتوي الأداة على 322 صوتًا، تغطي 75 لغة، بما في ذلك الصينية (الماندرين / الكانتونية / اللغة الوطنية التايوانية وغيرها من اللهجات)، الإنجليزية (الأمريكية / البريطانية / الأسترالية وغيرها)، اليابانية، الكورية، الفرنسية، الألمانية، الإسبانية، وغيرها. يمكن للمستخدمين إدخال النص مباشرة في واجهة الويب للاستماع إلى النتائج، ثم ضبط سرعة الصوت ومستوى الصوت، مما يجعلها مناسبة لإنتاج محتوى بجودة نشر.

تدعم الأداة أيضًا محاذاة تلقائية للوقت – حيث يتم إدخال توقيت الترجمة مباشرة في الصوت الناتج، مما يتناسب مع طول الفيديو الأصلي، دون الحاجة لتعديل يدوي. كما تحتوي على ميزات مفيدة مثل مصادقة المستخدم، وتاريخ الإنتاج، وتبديل بين الوضعين الفاتح والداكن.

322 صوتًا + 75 لغة: أي نوع من المحتوى هو الأنسب للاستخدام؟

مكتبة الأصوات المكونة من 322 صوتًا في TTS Studio ليست موزعة بالتساوي – فكل لغة رئيسية (الإنجليزية، اليابانية، الكورية، الفرنسية، الألمانية، الإسبانية) تحتوي على عشرات من الخيارات من الأصوات الذكورية والأنثوية وأصوات الأطفال وأنماط خاصة، بينما اللغات الأقل شيوعًا (مثل الكانتونية، العربية، الفيتنامية، وغيرها) تحتوي على 3-5 أصوات على الأقل.

تشمل سيناريوهات الاستخدام الفعلية:

  • مقاطع تعليمية متعددة اللغات: يمكن لقناة تعليمية باللغة الماندرين أو الإنجليزية استخدام الأداة لتوليد دبلجة باللغة اليابانية أو الكورية أو التايلاندية بشكل جماعي، مع الاستفادة من ميزة المسارات الصوتية المتعددة.
  • بودكاست متعدد اللغات: يمكن لبودكاست باللغة الكانتونية أن ينتج نسخة باللغة الإنجليزية لجمهور خارجي باستخدام صوت إنجليزي.
  • محتوى التعلم الإلكتروني: يمكن للمدارس أو المؤسسات التدريبية إنتاج مواد تعليمية متعددة اللغات بشكل جماعي.
  • دبلجة عرض المنتجات: تحتاج شركات SaaS إلى إنتاج دبلجة سريعة لعرض المنتجات متعددة اللغات.
  • أتمتة YouTube Shorts: إنتاج دبلجة لمقاطع الفيديو بشكل جماعي.

قيود الأداة: على الرغم من أن الأصوات الناتجة طبيعية، إلا أنها قد لا تعيد إنتاج صوت علامة تجارية معينة (مثل محاولة تقليد أسلوب معين لشخصية مؤثرة) بدقة 100%؛ عادةً ما تحتاج دبلجة العلامات التجارية التجارية إلى تعديل يدوي. ولكن بالنسبة للإنتاج العام للمحتوى أو النسخ الأولية متعددة اللغات، فهي كافية.

تحضير نشر Docker: متطلبات الأجهزة + البرمجيات

TTS Studio يوفر صور Docker ثنائية المعمارية arm64 و x86، مما يعني أنه يمكن نشره على معظم المنصات التي تدعم Docker، مثل Windows وMac (Intel أو Apple Silicon) وLinux VPS وNAS (Synology / QNAP).

المتطلبات النظامية الدنيا:

  • المعالج: نواة واحدة كافية (لأن التركيب يعتمد بشكل رئيسي على GPU أو API سحابي ولا يحتاج إلى حساب محلي).
  • الذاكرة: يُفضل أن تكون 1 جيجابايت أو أكثر.
  • مساحة القرص: 500 ميجابايت (صورة Docker).
  • الشبكة: يتطلب النشر الأول تنزيل الصورة وملفات نموذج TTS، حوالي 200-500 ميجابايت.
  • نظام التشغيل: Linux / macOS / Windows 10+ (يدعم Docker Desktop / OrbStack / Rancher Desktop).

إذا تم النشر على VPS سحابي، فإن اختيار مواصفات 1 جيجابايت RAM و1 vCPU سيكون كافيًا. إذا كنت ترغب في تشغيله على الكمبيوتر المحلي، فإن Mac مع Apple Silicon سيكون أكثر كفاءة في استهلاك الطاقة (يدعم صورة arm64 بشكل أصلي)، بينما يجب استخدام صورة x86 على أجهزة Intel Mac أو Windows.

نشر Docker Compose بنقرة واحدة

ملف docker-compose.yml المقدم من قبل الشركة الرسمية بسيط جدًا، حيث يتطلب نشر الخدمة بالكامل:

“`yaml
version: ‘3’
services:
tts-studio:
image: ywsj/tts-studio:latest
container_name: tts-studio
ports:
– “5100:5100”
environment:
– ADMIN_USERNAME=admin
– ADMIN_PASSWORD=admin123
restart: unless-stopped
“`

الإعدادات الرئيسية:

  • Port 5100: يمكن تغييره إلى المنفذ الذي تفضله، تذكر تعديل كل من المضيف والحاوية.
  • اسم المستخدم الافتراضي admin / كلمة المرور admin123: يجب تغيير كلمة المرور على الفور بعد النشر (يمكن من خلال متغيرات البيئة أو إعدادات واجهة الويب).
  • restart: unless-stopped: استعادة الخدمة تلقائيًا بعد إعادة تشغيل VPS.

خطوات النشر (Linux / Mac / WSL):

“`bash
# 1. إنشاء دليل العمل
mkdir -p ~/tts-studio && cd ~/tts-studio

# 2. إنشاء docker-compose.yml (باستخدام محتوى yaml أعلاه)
# يمكن استخدام nano أو vim

# 3. بدء الحاوية
docker compose up -d

# 4. تحقق من الحالة
docker compose ps
“`

بعد بدء التشغيل بنجاح، أدخل عنوان IP الخاص بـ VPS مع المنفذ (الافتراضي 5100) في المتصفح لرؤية واجهة تسجيل الدخول. ⚠️ **تذكر فتح قواعد جدار الحماية الخاصة بالمنفذ المقابل في وحدة التحكم السحابية** (مثل مجموعة أمان AWS، Cloudflare Tunnel، nginx reverse proxy، إلخ)، وإلا فلن تتمكن الشبكة الخارجية من الوصول.

دليل الاستخدام: إنشاء الصوت متعدد اللغات للمرة الأولى

تتكون واجهة الويب بعد تسجيل الدخول من ثلاث خطوات:

**الخطوة الأولى: رفع الترجمة أو إدخال النص**

تدعم الأداة رفع ملفات الترجمة SRT أو VTT مباشرة، أو إدخال نص عادي في مربع النص. إذا كنت تقوم برفع ملف الترجمة، فسيتم محاذاة الصوت الناتج تلقائيًا مع طول المحور الزمني، مما يسهل عملية التحرير والمزامنة لاحقًا.

**الخطوة الثانية: اختيار اللغة والصوت**

تظهر قائمة اللغات 75 لغة مدعومة، ولكل لغة عدة خيارات من الأصوات. عادةً ما تشير تسميات الأصوات إلى الجنس والعمر والأسلوب (مثل “صوت ذكري – هادئ”، “صوت أنثوي – مبهج”، “صوت طفل”، إلخ). بعد الاختيار، يمكنك الاستماع إلى النتائج على الفور، والتأكد من أن الصوت وسرعة الكلام (بطيء / عادي / سريع) ومستوى الصوت مرضية قبل البدء في الإنتاج الرسمي.

**الخطوة الثالثة: إنشاء وتنزيل MP3**

عند الضغط على “ابدأ في الإنشاء”، سيبدأ المحرك في الخلفية في توليد الصوت. يعتمد وقت التوليد على طول النص وتعقيد الصوت، وعادةً ما يحتاج تسجيل صوتي يتراوح بين 1-3 دقائق إلى حوالي 30 ثانية إلى دقيقتين من وقت التوليد. بعد الانتهاء، يمكنك الاستماع إلى الصوت وتنزيل MP3 من واجهة الويب على الفور.

أفضل الممارسات بعد الاستخدام: سير عمل مقاطع الفيديو متعددة المسارات الصوتية

إذا كان هدفك النهائي هو تحميل مقاطع الفيديو إلى YouTube مع ميزة المسارات الصوتية المتعددة، فإليك سير عمل كامل:

1. في صفحة “الترجمة” في خلفية فيديو YouTube، تكون الترجمة الأصلية مضبوطة على اللغة الرئيسية. اضغط على “إضافة لغة” واختر اللغة المستهدفة (مثل اليابانية أو الكورية)، ثم قم برفع ملف الترجمة الخاص باللغة المعنية.

2. في صفحة “الصوت”، قم برفع ملفات الصوت الخاصة بكل لغة. تم محاذاة MP3 الذي تم إنشاؤه بواسطة TTS Studio تلقائيًا مع المحور الزمني، لذا يمكنك رفعه مباشرة.

3. قم بتعيين “المسار الصوتي الافتراضي” إلى النسخة الرئيسية للغتك. ستظهر اللغات الأخرى في إعدادات مشغل الفيديو ليختارها المشاهدون.

⚠️ **ملاحظة**: تتطلب ميزة المسارات الصوتية المتعددة في YouTube أن يتم الموافقة على الفيديو نفسه قبل تفعيلها، وعادةً ما تظهر تلقائيًا خلال 24-48 ساعة بعد التحميل. إذا لم تكن متأكدًا مما إذا كانت لديك هذه الميزة، يمكنك التحقق في صفحة “الترجمة” في خلفية YouTube لمعرفة ما إذا كان زر “إضافة لغة” قد ظهر.

ملاحظات + قيود

**تكون أصوات TTS طبيعية، ولكن قد لا تعيد إنتاج نغمة علامة تجارية معينة بدقة 100%.** إذا كان الجمهور معتادًا على صوت شخصية مؤثرة معينة أو علامة تجارية، فإن الصوت الناتج من TTS، على الرغم من طبيعته، غالبًا ما يتم التعرف عليه على أنه تم إنشاؤه بواسطة الذكاء الاصطناعي. عادةً ما تتطلب دبلجات العلامات التجارية التجارية تعديلات يدوية أو مزج.

**تتطلب ترجمة الترجمة أدوات أخرى.** TTS Studio مسؤول فقط عن توليد الصوت، ولا يشمل الترجمة. إذا كانت لغتك المصدر هي الصينية، ولكنك ترغب في إنتاج نسخة باللغة الإنجليزية، ستحتاج أولاً إلى استخدام أدوات أخرى (مثل Google Translate أو DeepL أو ChatGPT أو Claude) لترجمة الترجمة، ثم استخدام TTS Studio لإنشاء دبلجة باللغة الإنجليزية.

**يتطلب النشر الأول تنزيل ملفات نموذج بحجم 200-500 ميجابايت.** اعتمادًا على سرعة الشبكة في VPS، قد يستغرق ذلك من 5 إلى 15 دقيقة. بعد ذلك، يمكنك استخدام النموذج المحلي مباشرة دون الحاجة إلى تنزيله مرة أخرى.

**يجب تغيير اسم المستخدم الافتراضي admin / admin123 على الفور.** معلومات تسجيل الدخول الافتراضية للأداة هي معلومات عامة، وأي شخص يعرف عنوان IP الخاص بـ VPS والمنفذ يمكنه تسجيل الدخول. يجب أن تكون أول خطوة بعد النشر هي تغيير كلمة المرور، أو إضافة طبقة من المصادقة باستخدام Cloudflare Access أو Tailscale.

الاستنتاج: أداة دبلجة متعددة اللغات ذاتية البناء، من هو الأنسب للاستخدام؟

TTS Studio سهل النشر باستخدام Docker، ويحتوي على 322 صوتًا يدعم 75 لغة، بالإضافة إلى ميزات مثل محاذاة الترجمة التلقائية، ومصادقة المستخدم، والمواضيع الفاتحة والداكنة، مما يجعله خيارًا عالي القيمة لصانعي المحتوى الذين يرغبون في إنتاج محتوى متعدد اللغات.

**المستخدمون الأنسب:**

  • مبدعو محتوى YouTube الذين يرغبون في إنشاء قناة متعددة اللغات.
  • المؤسسات التعليمية / التدريبية التي تحتاج إلى إنتاج مواد تعليمية متعددة اللغات بشكل جماعي.
  • شركات SaaS التي تحتاج إلى إنتاج سريع لدبلجات منتجات متعددة اللغات.
  • مقدمو البودكاست الذين يرغبون في توسيع برامجهم أحادية اللغة إلى جمهور متعدد اللغات.
  • الشركات الصغيرة والمتوسطة التي تحتاج إلى إنتاج محتوى تعليمي أو بودكاست متعدد اللغات ولكن بميزانية محدودة.

**المستخدمون الذين قد لا يكونون مناسبين:**

  • الدبلجات التجارية التي تحتاج إلى تقليد دقيق لصوت شخصية مؤثرة معينة أو علامة تجارية.
  • تحتاج إلى دعم لغات غير تقليدية (مثل لغات الأقليات أو اللهجات).
  • المستخدمون الذين ليس لديهم خلفية في تكنولوجيا المعلومات (نشر Docker قد يتطلب منحنى تعلم للمبتدئين).

إذا كانت سيناريوهات استخدامك تناسب أيًا من النقاط المذكورة أعلاه، فإن TTS Studio يستحق قضاء ساعة في نشره واختباره. مقارنةً برسوم الاشتراك الشهرية لواجهات برمجة التطبيقات التجارية (بضع دولارات لكل ألف كلمة)، فإن تكلفة البناء الذاتي هي فقط رسوم VPS الشهرية لمرة واحدة (حوالي 5 دولارات أمريكية).


محتوى أصلي
هذا المقال هو النسخة العربية لمحتوى أصلي من TechRitual.
Stein Yep
Stein Yep