Configuraré, validaré y solucionaré problemas de tu clúster de GPU e infraestructura de IA
Ingeniero senior de infraestructura HPC y AI, GPU SLURM Linux
Acerca de este Servicio
Tienes GPUs. Necesitas que funcionen como una plataforma de cómputo confiable.
Construyo y gestiono infraestructura de GPU y HPC en producción: aprovisionamiento, validación de controladores y pila CUDA, programación, redes de alta velocidad y monitoreo. Trabajo en la capa de infraestructura. No soy ingeniero de ML y no pretendo serlo.
LO QUE HAGO
Arranque de nodos GPU: alineación de controladores NVIDIA, toolkit CUDA y tiempo de ejecución, modo persistente, MIG
Validación de salud: diagnósticos DCGM, triage de errores Xid y ECC, verificaciones térmicas y de energía
Comunicación entre múltiples nodos GPU: pruebas nccl-tests de all-reduce, ajuste de NCCL, validación de rutas de red
Programación: particiones GPU SLURM y GRES, cgroups y vinculación, o Kubernetes con el plugin de dispositivos NVIDIA y GPU Operator
Monitoreo: Prometheus, exportador DCGM, paneles de Grafana
Automatización: roles de Ansible para que la construcción sea repetible
ANTES DE PEDIR
Envíame un mensaje con el número de nodos, modelo de GPU, interconexión y lo que estás viendo. Si no es algo que pueda solucionar realmente, te lo diré.
Recibirás configuración funcional, resultados de benchmarks mostrando qué cambió y documentación escrita.
Servidor:
Servidor de base de datos
Sistema operativo:
Linux
Otros servicios de Soporte y IT que ofrezco
FAQ
Traducción automática
¿Escribes kernels de CUDA o entrenas modelos?
No. Trabajo en la infraestructura subyacente: aprovisionamiento, controladores, programación, redes y monitoreo. El código de modelos y scripts de entrenamiento están fuera de mi alcance, y prefiero decirlo así que aceptar trabajo que no puedo hacer bien.
¿Qué acceso necesitas para empezar?
Acceso SSH con sudo en los nodos y acceso a BMC o IPMI si se necesitan verificaciones a nivel de hardware. Para el diagnóstico básico, generalmente basta con acceso de solo lectura para comenzar.
¿Trabajas con GPUs en la nube o solo en instalaciones propias?
Ambos. Clústeres bare-metal en instalaciones propias y instancias GPU en AWS.
Nuestras GPUs apenas se utilizan. ¿Puedes averiguar por qué?
Generalmente sí. La baja utilización suele deberse a programación, carga de datos, NUMA y afinidad, o la interconexión. El diagnóstico básico está diseñado exactamente para esta pregunta, y obtienes las mediciones que respaldan la respuesta.
¿Soportas redes InfiniBand?
Mi experiencia en redes de alta velocidad es con Ethernet y RoCE, no con InfiniBand. Si tu red es InfiniBand, te lo diré antes de que hagas el pedido en lugar de aprender en tu clúster.
2 comentarios sobre este Servicio
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Desglose de calificaciones
- Nivel de comunicación del Freelancer
- Calidad de la entrega
- Valor de la entrega
Ordenar por
A apreda1

Estados Unidos
I hired him again he assisted me with my project very effectively. I definitely recommend him
USD 50-USD 100
Precio
1 día
Tiempo
Útil?A aimen39

Argelia
Best seller + communication + skills + knowledge
USD 50-USD 100
Precio
1 día
Tiempo
H 
Respuesta del Freelancer
Útil?
2 comentarios sobre este Servicio
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Desglose de calificaciones
- Nivel de comunicación del Freelancer
- Calidad de la entrega
- Valor de la entrega
Ordenar por
A apreda1

Estados Unidos
I hired him again he assisted me with my project very effectively. I definitely recommend him
USD 50-USD 100
Precio
1 día
Tiempo
Útil?A aimen39

Argelia
Best seller + communication + skills + knowledge
USD 50-USD 100
Precio
1 día
Tiempo
H 
Respuesta del Freelancer
Útil?
