Auditaré tus números de benchmark de IA o evaluación de LLM para validez estadística

Parte de la información se ha traducido automáticamente.

Finlandia

Hablo Finés, Inglés

Experto en bots comerciales

Soy un ingeniero cuantitativo que construye bots de trading personalizados y pipelines de API. No vendo scripts de "hacerse rico rápido". Construyo una arquitectura de trading sólida y confiable. Mi ...
Acerca de este Servicio

 Obtendrás un veredicto claro sobre si tu número de benchmark o evaluación supera las verificaciones que omitió antes de publicarlo.

 Tomo un resultado principal (una posición en la tabla, una tasa de victoria de LLM como juez, un "supera la línea base en X%", un exponente de ley de escalado) y lo pruebo de manera adversarial: corrección por comparaciones múltiples, potencia estadística, sesgo del juez y reproducción a partir de tus datos en bruto.


 Recibes una de dos respuestas honestas: si sobrevive, aquí está la estadística corregida que puedes citar o si está dentro del ruido, aquí está el por qué y la corrección en una línea.


 Lo que distingue esto es la prueba, no las promesas. Escribí el libro sobre este modo de fallo (Measured, Not Believed), construí la herramienta de código abierto que realiza las verificaciones (evalgate) y reproduje públicamente tres reclamaciones reales: MT-Bench, RewardBench y una ley de escalado publicada. Cada veredicto que doy es reproducible a partir de tus datos; muestro cómo. Y si tu número es real, lo certifico; un auditor que solo encuentra fallos es un cínico, no un auditor.