Como ingeniero de aprendizaje automático especializado en NLP y AI simbólica, ofrezco evaluación, comparación y red-teaming integrales para tus Large Language Models (LLMs) y pipelines RAG. Ayudo a los equipos de ingeniería a identificar fallos en casos extremos, eliminar alucinaciones y aplicar estrictas medidas de seguridad.
Lo que ofrezco:
- Auditoría y benchmarking de LLM y rendimiento: Evaluación de precisión del modelo, latencia, uso de contexto y capacidades de razonamiento según rúbricas de prueba personalizadas.
- Detección de alucinaciones y casos extremos: Pruebas de estrés en prompts del sistema, precisión en recuperación RAG y coherencia factual bajo condiciones adversariales.
- Red Teaming y pruebas de seguridad: Identificación de vulnerabilidades como ataques de inyección de prompts, jailbreaks y filtraciones de prompts del sistema.
- Validación de esquema y salida: Verificación del cumplimiento estricto de estructura JSON/Pydantic, ejecución de llamadas a funciones y fiabilidad en integración API.
- Informe de auditoría detallado y plan de acción: Análisis completo de fallos con soluciones prácticas de ingeniería de prompts y recomendaciones de guardrails.