Auditaré tus números de benchmark de IA o evaluación de LLM para validez estadística
Acerca de este Servicio
Obtendrás un veredicto claro sobre si tu número de benchmark o evaluación supera las verificaciones que omitió antes de publicarlo.
Tomo un resultado principal (una posición en la tabla, una tasa de victoria de LLM como juez, un "supera la línea base en X%", un exponente de ley de escalado) y lo pruebo de manera adversarial: corrección por comparaciones múltiples, potencia estadística, sesgo del juez y reproducción a partir de tus datos en bruto.
Recibes una de dos respuestas honestas: si sobrevive, aquí está la estadística corregida que puedes citar o si está dentro del ruido, aquí está el por qué y la corrección en una línea.
Lo que distingue esto es la prueba, no las promesas. Escribí el libro sobre este modo de fallo (Measured, Not Believed), construí la herramienta de código abierto que realiza las verificaciones (evalgate) y reproduje públicamente tres reclamaciones reales: MT-Bench, RewardBench y una ley de escalado publicada. Cada veredicto que doy es reproducible a partir de tus datos; muestro cómo. Y si tu número es real, lo certifico; un auditor que solo encuentra fallos es un cínico, no un auditor.
FAQ
Traducción automática
¿Y si mi número resulta estar bien?
Entonces lo certifico y obtienes un informe limpio y citables. Es un resultado válido y común, no un fallo en la evaluación. Un auditor que solo encuentra fallos es un cínico; si tu resultado se mantiene, te lo muestro y se mantiene.
¿Son confidenciales mis datos?
Sí. Los informes son privados y nada se publica. Una muestra redactada o anonimizada de tus datos suele ser suficiente para reproducir el número, por lo que rara vez necesitas compartir información sensible.
¿Solo ejecutas una herramienta sobre ello?
No. Las verificaciones individuales son estándar; el valor está en ejecutar todas de manera adversarial y tener el juicio para distinguir un verdadero confound de un artefacto en cómo se construyeron los datos. Obtienes razonamiento, no solo resultados.
¿Qué paquete necesito?
Si tienes un número que estás a punto de publicar, empieza con Basic o Standard. Si estás auditando un post de lanzamiento, una model card o varias reclamaciones a la vez, elige Premium. ¿No estás seguro? Envíame un mensaje con el número en el que tienes menos confianza.
¿Puedes integrar estas verificaciones en nuestro CI?
Sí, eso es un contrato mensual en curso en lugar de un proyecto único de Catalog. Envíame un mensaje con tu stack y la cadencia de evaluación y lo definiré por separado.

