Cuantizaré tu modelo de IA

K
kalebcadenhead
K
kalebcadenhead
Kaleb C
Parte de la información se ha traducido automáticamente.

Acerca de este Servicio

Traducción automática

¿Las facturas de tu GPU en la nube están fuera de control o tu modelo ajustado es demasiado pesado para correr en hardware de borde?


Soy ingeniero de sistemas de aprendizaje automático especializado en cuantización de bajo bit, optimización de inferencia y despliegue en edge. Tomo modelos grandes de lenguaje, visión y mezcla de expertos (MoE) y reduzco su huella de memoria entre un 50% y un 80% sin perder precisión.


Ya sea que necesites un modelo de 70B comprimido para GPUs de consumo, uno de 7B corriendo en un Mac/iPhone con Apple Silicon, o un archivo GGUF calibrado para cumplimiento corporativo local, construiré la pipeline de runtime exacta que necesitas.


En lo que me especializo:

* Formatos y runtimes: GGUF (llama.cpp), MLX (Apple Silicon Mac/iOS), EXL2, AWQ, GPTQ, bitsandbytes (NF4/FP8).

* Arquitecturas de modelos: Llama 3, Qwen 2.5 / 3.8, Mistral, Gemma, modelos MoE (OLMoE, Mixtral), y modelos de visión y lenguaje (VLMs).

* Hardware objetivo: GPUs NVIDIA individuales (L4, A10, RTX 4090), Apple Silicon (memoria unificada M-series, iOS), y inferencia en CPU.

* Precisión y calidad: Calibración avanzada (imatriz), cuantización consciente de activaciones y verificación de calidad determinista (Perplejidad y evaluaciones downstream).


Conoce a Kaleb C

Kaleb C

Senior Data AI Leader

  • DeEstados Unidos
  • Miembro desdemay 2024
  • Idiomas

    Inglés
I am a Senior Manager of Data & AI and Founding IT Leader with experience building data and IT functions from the ground up. I specialize in architecting scalable infrastructure, Snowflake data warehouses, and production AI agents that drive operational leverage. I thrive at the intersection of data engineering and applied AI to deliver reliable, HIPAA-compliant systems.

Traducción automática

Otros servicios de Desarrollo de IA que ofrezco