Crearé un agente de voz AI usando elevenlabs, stt y llm en python


Acerca de este Servicio
Traducción automática
Despliega un agente de Voice AI inteligente que pueda escuchar, razonar y hablar en tiempo real.
Construyo arquitecturas personalizadas de Voice AI conversacional en Python, combinando transmisión de audio de baja latencia con LLMs y síntesis de voz.
Lo que entrego:
- Pipelines de voz de extremo a extremo: detección de actividad de voz (VAD) + Whisper (STT) + razonamiento con LLM + ElevenLabs (TTS)
- Enrutamiento de audio de ultra baja latencia mediante pipes asíncronos en Linux
- Integración de llamadas de voz en Telegram mediante Pyrogram
- Despliegue en GPU en la nube (trabajadores en contenedores RunPod, procesamiento paralelo en colas, escalado dinámico)
- Backend modular en Python con captura y síntesis de audio aisladas
Pila tecnológica: Python, asyncio, ElevenLabs, Whisper, GPU de RunPod, Pyrogram.
Por favor, contáctame antes de ordenar para revisar las credenciales de API y los requisitos de latencia de voz.
Conoce a Moddie
Fullstack web developer
- DeUcrania
- Miembro desdeoct 2024
- Responde aprox. en:1 hora
Idiomas
Ucraniano, Ruso, Inglés
Traducción automática
Mi porfolio
FAQ
Traducción automática
¿Cómo logras una baja latencia en la síntesis de voz?
Transmito fragmentos de audio mediante pipes asíncronos en Linux directamente al reproductor sin guardar archivos temporales en disco, reduciendo la latencia por debajo de 600 ms
¿Este agente de voz puede hacer llamadas telefónicas o en Telegram?
Sí, puedo integrar el agente con llamadas de voz en Telegram mediante Pyrogram o APIs de telefonía externas (Twilio/LiveKit)

