Desplegaré y gestionaré infraestructura de mlops, llm y gpu en aws y kubernetes
Ingeniero senior de DevOps en IA: AWS, Kubernetes, APIs de ComfyUI, DevSecOps
Acerca de este Servicio
Pongo modelos de IA en producción y los mantengo en funcionamiento. Un script de entrenamiento no es un producto. Un servicio monitoreado, versionado y con autoscaling sí lo es.
Herramientas:
Kubernetes
•
Docker
•
Amazon EKS
Marcos:
Terraform
•
Ansible
Lenguaje de programación:
Bash
•
Go
•
Python
Experiencia:
Instalación
•
Migración
•
Depuración de código
Otros servicios de Ingeniería de DevOps que ofrezco
FAQ
Traducción automática
¿Qué modelos puedes desplegar?
Cualquier modelo abierto en Hugging Face más Llama, Mistral, Qwen, DeepSeek y tus propios fine tunes. Para imágenes y videos también manejo Flux, SDXL y Wan. Dime el modelo y te confirmaré la GPU que necesita.
¿Necesito mi propia cuenta en la nube?
Sí, y eso es intencional. Todo se ejecuta en tu cuenta de AWS, GCP o RunPod para que seas dueño de la infraestructura y controles la facturación. Lo configuro y te lo entrego.
¿Cuánto costará ejecutarlo al mes?
Depende del tamaño del modelo y del tráfico. Antes de que hagas el pedido te doy una estimación de tamaño: tipo de GPU, utilización esperada y rango mensual. Las instancias spot y escalar a cero suelen reducir mucho el coste.
¿Obtengo el código fuente de Terraform y Helm?
Siempre. Recibes el repositorio completo, Dockerfiles, charts de Terraform o Helm y documentación de la API, para que tú o otro ingeniero puedan mantenerlo después.
¿Puedes arreglar una configuración existente en lugar de crear una nueva?
Sí. Despliegues fallidos, crashes por OOM, nodos GPU que no programan, facturas en la nube descontroladas y infraestructura sin documentación son gran parte de lo que hago.
¿Haces LLMs autohospedados en las instalaciones?
Sí. Ollama o vLLM con Open WebUI en tu propio servidor o estación de trabajo GPU, completamente offline, sin que los datos salgan de tu red.
¿Qué monitoreo obtengo?
Prometheus y Grafana con paneles para latencia, rendimiento, utilización de GPU, tasa de errores y coste por solicitud, además de alertas que te llegan antes de que tus usuarios lo noten.
¿Cual es su horario de trabajo?
Estoy disponible 24/7 y trabajo en horario de EE. UU., así que podemos hablar en tu zona horaria. Normalmente respondo en una hora.
