LyricCaption — subtítulos de karaoke incrustados en un video
08HERRAMIENTAS DE IA2026PROTOTIPO

LYRICCAPTION

De la voz a subtítulos en árabe sincronizados, en local.

Sube un video y pega la letra en árabe; faster-whisper transcribe con marcas de tiempo por palabra, las palabras se emparejan de forma difusa tras la normalización del árabe y los subtítulos de karaoke se incrustan con FFmpeg + libass, con el orden de palabras RTL verificado mediante medición de píxeles.

LyricCaption es un servicio FastAPI con una aplicación web RTL sin paso de build. La canalización: validar → extraer y limpiar el audio → transcripción por palabra con faster-whisper sesgada por la letra → normalización del árabe (diacríticos eliminados, أ/إ/آ→ا, ة→ه, ى→ي) → alineación Needleman-Wunsch con rapidfuzz → recuperación de huecos → generación de .ass con resaltado por palabra → incrustación con fuentes OFL integradas. Si la letra está vacía, la IA escribe los subtítulos; si el audio no es claro, la sincronización recurre a una distribución proporcional, de modo que la aplicación siempre produce un resultado.

El detalle de ingeniería más destacado es la corrección RTL: libass dispone las secuencias separadas por etiquetas en orden lógico, por lo que una línea con palabra resaltada se renderiza invertida; pipeline._visual_order() emite las secuencias de atrás hacia adelante en las líneas RTL y un test renderiza fotogramas reales para comprobar que el resaltado se mueve de derecha → izquierda. Seis plantillas, siete filtros de video y cuatro animaciones de subtítulos se vuelven a renderizar en segundos porque la sincronización de palabras está en caché. Claude añade corrección ortográfica, traducción, selección de reels y títulos, todo con alternativas locales.

01

Visión general

Forma de onda de audio → reconocimiento de voz → transcripción → sincronización de subtítulos → video renderizado. Cada paso se degrada con elegancia y cada renderizado incrusta sus fuentes.

02

Canalización

  1. 01
    AUDIO
    paso alto · reducción de ruido · sonoridad
  2. 02
    RECONOCIMIENTO DE VOZ
    faster-whisper large-v3-turbo · marcas de tiempo por palabra
  3. 03
    TRANSCRIPCIÓN
    normalización del árabe · rapidfuzz · Needleman-Wunsch
  4. 04
    SINCRONIZACIÓN DE SUBTÍTULOS
    recuperación de huecos · alternativa proporcional
  5. 05
    VIDEO RENDERIZADO
    karaoke .ass · FFmpeg + libass · libx264
03

La regla RTL

libass dispone las secuencias separadas por etiquetas en orden lógico, por lo que una línea en la que cada palabra lleva una anulación de color se renderiza invertida. La corrección emite las secuencias de palabras de atrás hacia adelante en las líneas RTL, mientras que las secuencias latinas conservan su orden interno; y el test lo demuestra sobre píxeles, no a ojo.

Fotograma 2 de la prueba del orden de palabras RTL
Fotograma 1 de la prueba del orden de palabras RTL
FOTOGRAMA AFOTOGRAMA B — EL RESALTADO SE MUEVE DE DERECHA → IZQUIERDA
04

Salida

05

Estado honesto

  • 01Sin autenticación: cualquiera en la red puede abrir un proyecto; calificado como el agujero más grave
  • 02El estado de los trabajos en memoria se pierde al reiniciar; sin límite de concurrencia
  • 03El renderizado solo por CPU es lento en videos largos o en 4K
  • 04La separación de fuentes (Demucs) aún no está integrada, por lo que la precisión baja con música alta
Siguiente proyecto
SANAD AI OPERATOR