términos del glosario
F1 Score
- Categoría
- Evaluation, Safety & Governance
- Dificultad
- Intermedio
Definición
El F1 Score es la media armónica de la precisión y la recuperación, proporcionando una métrica única que equilibra el compromiso entre falsos positivos y falsos negativos en modelos de clasificación.
Cómo funciona y contexto
En el aprendizaje automático, evaluar un modelo basándose únicamente en la precisión puede ser engañoso, particularmente cuando las clases están desequilibradas. El F1 Score aborda esto calculando la media armónica de la precisión (la exactitud de las predicciones positivas) y la recuperación (la capacidad de encontrar todas las instancias positivas). Debido a que utiliza la media armónica en lugar de un promedio aritmético simple, el F1 Score penaliza los valores extremos; un modelo debe funcionar bien tanto en precisión como en recuperación para lograr una puntuación alta. Esto lo convierte en un indicador robusto del rendimiento en escenarios donde el coste de los falsos positivos y los falsos negativos es significativo, como el diagnóstico médico o la detección de fraudes. Aunque es altamente efectivo, asume una importancia igual para la precisión y la recuperación, lo que puede no alinearse siempre con requisitos específicos de negocio o seguridad.
Por qué es importante
En aplicaciones del mundo real, un modelo podría lograr una alta precisión simplemente prediciendo la clase mayoritaria, pero el F1 Score expone este fallo.
Ejemplo real
Considera un sistema de IA diseñado para detectar transacciones fraudulentas de tarjetas de crédito poco comunes. Si el 99% de las transacciones son legítimas, un modelo podría lograr un 99% de precisión prediciendo 'no fraude' para todo. Sin embargo, este modelo tendría una recuperación de cero para el fraude. Al usar el F1 Score, los desarrolladores pueden ver que el modelo no está logrando detectar el fraude, obligándoles a mejorar la capacidad del modelo para identificar la clase minoritaria de manera efectiva.
Errores frecuentes
- Asumir que el F1 Score es siempre la mejor métrica, ignorando que trata la precisión y la recuperación como igualmente importantes.
- Usar el F1 Score para clasificación multiclase sin especificar si usar promediado micro, macro o ponderado.
- Confundir el F1 Score con la precisión simple, que no tiene en cuenta los desequilibrios en la distribución de clases.
- No considerar el análisis de coste-beneficio de los falsos positivos frente a los falsos negativos, lo que podría requerir una métrica diferente como el F-beta score.
Preguntas frecuentes
¿En qué se diferencia el F1 Score de la precisión?
La precisión mide el porcentaje total de predicciones correctas, lo cual puede ser engañoso si una clase supera significativamente a la otra. El F1 Score se centra en el equilibrio entre la precisión y la recuperación, proporcionando una visión más matizada de cómo el modelo maneja la clase positiva.
¿Cuándo debería usar el F-beta score en lugar del F1 Score?
Usa el F-beta score cuando necesites ponderar la precisión y la recuperación de manera diferente. Si la recuperación es más importante que la precisión, usarías un valor beta mayor que 1; si la precisión es más crítica, usarías un valor beta menor que 1.
¿Se puede usar el F1 Score para modelos de regresión?
No, el F1 Score está diseñado específicamente para tareas de clasificación. Los modelos de regresión suelen evaluarse utilizando métricas como el error cuadrático medio (MSE) o R-cuadrado.