IA local · Python
2025
Maqueta / estudio
Traductor de llamadas
Traducción de llamadas en vivo, todo local. Pipeline STT → LLM → clonación de voz con latencia sub-500 ms en GPU 6 GB.
Para qué se hizo
Un pipeline de traducción de llamadas en tiempo real, de extremo a extremo, corriendo completamente en una GPU local RTX 4050 de 6 GB — cero costo de inferencia en la nube, cero datos saliendo del equipo.
El flujo es Whisper (Speech-to-Text) → Ollama con Qwen2.5 (traducción) → XTTS con voz clonada del hablante original (Text-to-Speech), enrutado a la llamada vía VB-Cable. Latencia extremo-a-extremo menor a 500 ms.
Cómo se usa
- Whisper para transcripción en vivo
- Ollama + Qwen2.5 para traducción local
- XTTS con clonación de voz del hablante
- Enrutamiento de audio con VB-Cable
- Latencia sub-500 ms extremo-a-extremo
- GPU RTX 4050 6 GB — 100% local
Stack
Python
Whisper
Ollama
Qwen2.5
XTTS
VB-Cable
Notas
No es un proyecto web, pero sí una de las herramientas de IA local más ambiciosas del portafolio. Código abierto.