Optimizaré tu app de llm para menor latencia y costo

C
chlee9
C
chlee9
Cheolhee Lee
Parte de la información se ha traducido automáticamente.

Acerca de este Servicio

Traducción automática

Optimizó aplicaciones de LLM que son demasiado lentas o demasiado caras.


Lo que he logrado en producción:

- Reduje la latencia p95 en un 70 por ciento y el costo de servicio en un 38 por ciento con caché de contexto, salida estructurada y enrutamiento de modelos

- Disminuí los tokens de salida en un 49 por ciento sin perder calidad

- Aceleré los endpoints de listas 125 veces y una consulta de Threads de 411 ms a 1.6 ms

- Reubiqué tres modelos LLM y de embedding a un DGX en las instalaciones sin tiempo de inactividad


Cómo funciona:

1. Compartes tus prompts, trazas, configuración del modelo y tus números de latencia o costo

2. Hago un perfil del pipeline y envío un informe priorizado

3. Implemento las correcciones y muestro benchmarks antes y después


Pila: OpenAI, Anthropic, vLLM, LangChain, RAG, pgvector, Python, TypeScript, Rust, Go, AWS.


Cuéntame tu p95 actual y gasto mensual y te diré qué es realista.

Conoce a Cheolhee Lee

Cheolhee Lee

AI Full Stack Developer specializing in LLM and RAG optimization

  • DeCorea del Sur
  • Miembro desdeabr 2021
  • Responde aprox. en:1 hora
  • Idiomas

    Coreano, Inglés
I keep my employer and my clients unnamed here. I ship production AI systems end to end at an undisclosed B2B AI SaaS company - a sales-automation SaaS and a public-sector AI evaluation platform. Measured: LLM p95 latency -70%, serving cost -38%, output tokens -49% via context caching and structured output. 125x list speedup, threads query 411ms to 1.6ms, bundle 21.7MB to 2.3MB. Re-homed three LLM models to an on-prem DGX with zero downtime; passed TTA review for Korea's AI Verification program. TypeScript, Python, Rust, Go, React, PostgreSQL, AWS, RAG, vLLM, MCP.

Traducción automática

Mi porfolio

Otros servicios de Desarrollo de IA que ofrezco