Resolveré problemas y optimizaré tu infraestructura de kubernetes
Líder técnico e ingeniero de infraestructura AI
Acerca de este Servicio
¿Tu carga de trabajo de AI/ML falla, funciona lentamente o no utiliza tus GPUs de manera eficiente?
Resolveré, configuraré y optimizaré tu infraestructura de GPU basada en Kubernetes para cargas de trabajo de AI/ML.
Puedo ayudarte con:
Cargas de trabajo y despliegues de GPU en Kubernetes
Configuración y solución de problemas de GPU NVIDIA
Trabajos de AI en Docker y contenedores
Programación de GPU y asignación de recursos
Cargas de trabajo distribuidas en múltiples nodos
Problemas de comunicación NCCL y GPU
InfiniBand y redes de alto rendimiento
Solución de problemas en pod, nodo y despliegues
Optimización del rendimiento y uso de GPU
Logs, monitoreo y depuración de infraestructura
Despliegue y fiabilidad de cargas de trabajo de AI/ML
Tengo experiencia profesional en construir y operar infraestructuras de AI a gran escala, incluyendo clústeres de GPU, plataformas de Kubernetes, entornos de entrenamiento distribuidos y cargas de trabajo de AI en producción.
Mi enfoque es práctico y se centra en identificar la causa raíz, implementar la solución y mejorar la fiabilidad y el rendimiento.
Por favor, contáctame antes de hacer un pedido si tu entorno implica infraestructura de GPU multi-nodo compleja, entrenamiento distribuido o cargas de trabajo en producción.
Herramientas:
Kubernetes
•
Docker
Marcos:
npm
•
Terraform
•
Ansible
Lenguaje de programación:
Bash
•
Go
•
Java
•
JavaScript
•
Python
•
Golang
Experiencia:
Depuración de código
•
Desarrollo
•
Configuración
