LYRICCAPTION
من الكلام إلى تعليقات عربية متزامنة، محليًا.
ارفع فيديو والصق كلمات عربية؛ يفرّغ faster-whisper الكلام بطوابع زمنية للكلمات، وتُطابَق الكلمات مطابقة تقريبية بعد التطبيع العربي، وتُدمج تعليقات الكاريوكي في الفيديو بـ FFmpeg + libass — مع التحقق من ترتيب الكلمات من اليمين إلى اليسار بقياس البكسل.
LyricCaption خدمة FastAPI مع تطبيق ويب RTL لا يحتاج إلى بناء. خط المعالجة: التحقق → استخراج الصوت وتنظيفه → تفريغ على مستوى الكلمة بـ faster-whisper موجَّه بالكلمات → التطبيع العربي (إزالة التشكيل، أ/إ/آ→ا، ة→ه، ى→ي) → محاذاة Needleman-Wunsch مع rapidfuzz → استرداد الفجوات → توليد ملف .ass مع إبراز كل كلمة → الدمج مع خطوط OFL مضمّنة. إذا كانت الكلمات فارغة يكتب الذكاء الاصطناعي التعليقات؛ وإذا كان الصوت غير واضح يتراجع التوقيت إلى توزيع تناسبي، فينتج التطبيق نتيجة دائمًا.
التفصيل الهندسي الأبرز هو إصلاح RTL: يرتّب libass المقاطع المفصولة بالوسوم بالترتيب المنطقي، فيُعرض سطر الكلمة المبرزة معكوسًا؛ لذا تُصدر pipeline._visual_order() المقاطع من الخلف إلى الأمام لأسطر RTL، ويعرض اختبار إطارات حقيقية ليتحقق من أن الإبراز يتحرك من اليمين → اليسار. ستة قوالب وسبعة مرشحات فيديو وأربع حركات للتعليقات يُعاد عرضها في ثوانٍ لأن توقيت الكلمات مخزّن مؤقتًا. ويضيف Claude التصحيح الإملائي والترجمة واختيار المقاطع القصيرة والعناوين — كلها مع بدائل محلية.
نظرة عامة
موجة صوتية → التعرف على الكلام → نص مفرّغ → توقيت التعليقات → فيديو معروض. كل خطوة تتراجع بسلاسة، وكل عرض يضمّن خطوطه.
خط المعالجة
قاعدة RTL
يرتّب libass المقاطع المفصولة بالوسوم بالترتيب المنطقي، فيُعرض السطر الذي تحمل فيه كل كلمة تجاوز لون معكوسًا. يُصدر الإصلاح مقاطع الكلمات من الخلف إلى الأمام لأسطر RTL بينما تحتفظ المقاطع اللاتينية بترتيبها الداخلي — والاختبار يثبت ذلك على البكسلات، لا بالعين.
المخرجات
الحالة بصدق
- 01لا مصادقة — يستطيع أي شخص على الشبكة فتح مشروع؛ صُنّفت الثغرة الأخطر
- 02حالة المهام في الذاكرة تُفقد عند إعادة التشغيل؛ ولا يوجد حد للتزامن
- 03العرض على المعالج فقط بطيء مع الفيديوهات الطويلة أو بدقة 4K
- 04فصل المصادر الصوتية (Demucs) لم يُدمج بعد، فتنخفض الدقة مع الموسيقى الصاخبة
