Crearé un marco de evaluación para llm

S
sushii_98
S
sushii_98
Sushma Sharma
Parte de la información se ha traducido automáticamente.

Acerca de este Servicio

Traducción automática

Tu sistema de IA se ve bien en las demos. Pero, ¿sigue funcionando correctamente en producción la próxima semana?


La mayoría de los equipos descubren que su IA se rompió cuando un usuario se queja.

Construyo infraestructura de evaluación que detecta fallos antes de que los usuarios lo hagan automáticamente.


Lo que construyo:

- Evaluación de recuperación (¿estás obteniendo el contenido correcto?)

- Puntuación de fidelidad (¿la respuesta está basada en hechos o es una alucinación?)

- Detección de regresiones (¿el cambio en tu último prompt rompió algo?)

- pipelines de LLM-as-judge sin necesidad de ground truth

- Panel de control en Streamlit que muestra tendencias de calidad a lo largo del tiempo


Si estás usando IA en producción sin evals, estás volando a ciegas. Envíame un mensaje y te diré dónde es más probable que tu sistema falle.

Conoce a Sushma Sharma

Sushma Sharma

AI Engineer

  • DeIndia
  • Miembro desdejun 2026
  • Responde aprox. en:3 horas
  • Idiomas

    Inglés
AI Engineer with 5+ years of experience designing and building AI systems: 🔹 Multi-agent & agentic AI: Built ReAct-based LLM workflows for automated proposal generation. A Multi-RAG framework I designed identified $0.8M in margin leakage in customer proposals. 🔹 RAG & retrieval optimization: Improved retrieval accuracy by 20% using semantic query enhancement. Built GenAI risk assessment workflows for safety documentation. 🔹 LLMOps: Evaluation pipelines, prompt testing, and model performance monitoring for enterprise AI. Communicate well with cross-functional teams.

Traducción automática

Mi porfolio

Otros servicios de Desarrollo de IA que ofrezco