IA local · Python 2025 Maqueta / estudio

Traductor de llamadas

Traducción de llamadas en vivo, todo local. Pipeline STT → LLM → clonación de voz con latencia sub-500 ms en GPU 6 GB.

Para qué se hizo

Un pipeline de traducción de llamadas en tiempo real, de extremo a extremo, corriendo completamente en una GPU local RTX 4050 de 6 GB — cero costo de inferencia en la nube, cero datos saliendo del equipo.

El flujo es Whisper (Speech-to-Text) → Ollama con Qwen2.5 (traducción) → XTTS con voz clonada del hablante original (Text-to-Speech), enrutado a la llamada vía VB-Cable. Latencia extremo-a-extremo menor a 500 ms.

Cómo se usa
  • Whisper para transcripción en vivo
  • Ollama + Qwen2.5 para traducción local
  • XTTS con clonación de voz del hablante
  • Enrutamiento de audio con VB-Cable
  • Latencia sub-500 ms extremo-a-extremo
  • GPU RTX 4050 6 GB — 100% local
Stack
Python Whisper Ollama Qwen2.5 XTTS VB-Cable
Notas

No es un proyecto web, pero sí una de las herramientas de IA local más ambiciosas del portafolio. Código abierto.