github.com Tecnologa

SlopCodeBench: Un Nuevo Hito en la Evaluación de Modelos de Programación

SlopCodeBench: Un Nuevo Hito en la Evaluación de Modelos de Programación

El laboratorio de UW Madison ha presentado SlopCodeBench, un nuevo benchmark para evaluar la calidad del código en modelos de programación, que se lanzó en marzo de 2026. Este sistema permite a los modelos enfrentar desafíos de programación sin conocer el problema completo desde el inicio, lo que simula mejor el trabajo real en ingeniería de software. En pruebas recientes, el modelo Opus 5 logró un 24% de tasa de aprobación en un subconjunto de desafíos, superando ligeramente a su predecesor, Opus 4.6, que alcanzó un 17%. Sin embargo, todos los modelos evaluados mostraron un aumento en la complejidad y defectos a medida que avanzaban en los checkpoints, lo que indica que aún no son confiables para operar sin supervisión.

Fuente: github.com Visita el sitio original para leer la nota completa y ampliar la información.