Desplegaré tu llm para producción con vllm en tu GPU en la nube

I
ike_kolawole
I
ike_kolawole
Joshua
Parte de la información se ha traducido automáticamente.

Acerca de este Servicio

Traducción automática

Un modelo que funciona en un cuaderno y otro que soporta 1,000 usuarios concurrentes son dos proyectos diferentes. Yo hago el segundo.


Soy un ingeniero senior de infraestructura de ML, con 7 años de experiencia en confiabilidad en producción. Recientemente: infraestructura de servicio que maneja más de 50,000 tareas concurrentes en menos de 100 ms para más de 1,000 usuarios, construido con vLLM y SGLang con pools de nodos GPU en Kubernetes, con un 35% menos de costo en infraestructura que cuando empecé.


Lo que obtienes:

  • Tu modelo de peso abierto (Llama, Mistral, Qwen, DeepSeek) servido con vLLM
  • Desplegado en TU cuenta en la nube: tú conservas las llaves, datos y endpoint
  • Autoescalado de GPU y batching ajustados para inferencia, no para tráfico web
  • Resultados de pruebas de carga, para que conozcas la capacidad real antes de que la descubran tus usuarios
  • Tableros de monitoreo; manual de operaciones en Standard/Premium

Si tu presupuesto para GPU y tu objetivo de latencia no coinciden, te lo diré antes de que gastes un centavo en cómputo.


Básico: un modelo, un nodo GPU, probado en carga.

Estándar: añade autoescalado, ajuste, tableros.

Premium: multi-modelo, pase de costos, transferencia.


Envía los detalles de tu modelo y tráfico; el formulario de requisitos cubre el resto.

Conoce a Joshua

Joshua

Senior Platform Engineer

  • DeNigeria
  • Miembro desdejul 2026
  • Idiomas

    Inglés
Deployments on my platforms are boring, and that's the point. Seven years of production infrastructure: multi-cloud Kubernetes (EKS/AKS), Terraform at 20+ module scale, CI/CD with automatic rollback at 99.9% deploy success. One team went from 40% failed deploys to 5% after I rebuilt their pipelines; a fintech's PCI-DSS audits returned zero critical findings. I also build ML serving infrastructure: 50,000+ concurrent tasks at sub-100ms using vLLM on GPU node pools. Hand me a breaking pipeline, an untrusted cluster, or a cloud bill that grew quietly, and get it fixed properly.

Traducción automática

Mi porfolio