Ajustaré finamente modelos de lenguaje de código abierto con lora tuning completo y rl


Level 1
Acerca de este Servicio
Traducción automática
Puedo ayudarte a diseñar e implementar flujos de trabajo avanzados de entrenamiento y ajuste fino de LLM para asistentes específicos de dominio, modelos de razonamiento, chatbots, modelos que siguen instrucciones y sistemas de lenguaje optimizados para tareas.
Recolección de datos y preparación de conjuntos de datos
* Recolección de datos basada en web y documentos
* Creación de conjuntos de datos de instrucciones
* Generación de pares de prompt-respuesta
* Curación de conversaciones y conjuntos de datos de dominio
* Limpieza de datos, deduplicación, filtrado y formateo
* Preparación de datos de preferencias para modelado de recompensas o RL
Ajuste fino supervisado (SFT)
* Ajuste fino LoRA / QLoRA
* Ajuste fino en congelación
* Ajuste fino completo
* Ajuste de instrucciones
* Ajuste de modelos de chat
* Adaptación de dominio para finanzas, cripto, legal, soporte, técnico y conjuntos de datos privados
Métodos de aprendizaje por refuerzo
* Diseño de pipeline estilo RLHF
* Modelado de recompensas
* Optimización de preferencias
* Flujos de trabajo de entrenamiento DPO / ORPO / PPO
* Ajuste de alineación para calidad de respuesta, formato y comportamiento de tareas
Configuración del marco de entrenamiento
* Hugging Face Transformers
* TRL
* PEFT
* DeepSpeed
* Accelerate
* PyTorch
* bitsandbytes
* Integración de inferencia vLLM
* Configuración de entrenamiento multi-GPU y distribuido
Conoce a Djordje S
Level 1
- DeSerbia
- Miembro desdejul 2024
- Responde aprox. en:1 hora
- Última entrega3 semanas
Idiomas
Serbio, Inglés
Traducción automática
