Cuantizaré tu modelo de IA


Acerca de este Servicio
Traducción automática
¿Las facturas de tu GPU en la nube están fuera de control o tu modelo ajustado es demasiado pesado para correr en hardware de borde?
Soy ingeniero de sistemas de aprendizaje automático especializado en cuantización de bajo bit, optimización de inferencia y despliegue en edge. Tomo modelos grandes de lenguaje, visión y mezcla de expertos (MoE) y reduzco su huella de memoria entre un 50% y un 80% sin perder precisión.
Ya sea que necesites un modelo de 70B comprimido para GPUs de consumo, uno de 7B corriendo en un Mac/iPhone con Apple Silicon, o un archivo GGUF calibrado para cumplimiento corporativo local, construiré la pipeline de runtime exacta que necesitas.
En lo que me especializo:
* Formatos y runtimes: GGUF (llama.cpp), MLX (Apple Silicon Mac/iOS), EXL2, AWQ, GPTQ, bitsandbytes (NF4/FP8).
* Arquitecturas de modelos: Llama 3, Qwen 2.5 / 3.8, Mistral, Gemma, modelos MoE (OLMoE, Mixtral), y modelos de visión y lenguaje (VLMs).
* Hardware objetivo: GPUs NVIDIA individuales (L4, A10, RTX 4090), Apple Silicon (memoria unificada M-series, iOS), y inferencia en CPU.
* Precisión y calidad: Calibración avanzada (imatriz), cuantización consciente de activaciones y verificación de calidad determinista (Perplejidad y evaluaciones downstream).
Conoce a Kaleb C
Senior Data AI Leader
- DeEstados Unidos
- Miembro desdemay 2024
Idiomas
Inglés
Traducción automática

