Saltar al contenido principal

términos del glosario

Similitud de coseno

Categoría
RAG, Embeddings & Search
Dificultad
Intermedio

Definición

Una métrica matemática utilizada para medir el coseno del ángulo entre dos vectores distintos de cero en un espacio multidimensional, determinando cuán similares son sus orientaciones independientemente de su magnitud.

Cómo funciona y contexto

En el contexto de la IA y el aprendizaje automático, los datos como texto, imágenes o audio se convierten en vectores numéricos (embeddings). La similitud de coseno evalúa la relación entre estos vectores calculando el coseno del ángulo entre ellos. Un valor de 1 indica que los vectores apuntan en la misma dirección exacta (similitud perfecta), 0 indica que son ortogonales (sin correlación) y -1 indica que son diametralmente opuestos. A diferencia de la distancia euclidiana, que mide la distancia en línea recta entre puntos, la similitud de coseno se centra exclusivamente en la orientación de los vectores. Esto la hace particularmente eficaz para datos de alta dimensión donde la magnitud absoluta del vector podría ser menos importante que el patrón semántico subyacente o la 'dirección' de la información.

Por qué es importante

Permite a los modelos de IA recuperar documentos o contextos relevantes comparando el vector de la consulta de un usuario con una base de datos de embeddings de documentos precalculados.

Ejemplo real

Imagina un sistema RAG para una base de datos legal. Cuando un usuario pregunta: '¿Cuáles son las sanciones por incumplimiento de contrato?', el sistema convierte esta consulta en un vector. Luego calcula la similitud de coseno entre este vector de consulta y miles de vectores de documentos legales. El sistema recupera los documentos con las puntuaciones de similitud de coseno más altas, asegurando que la IA reciba el texto legal semánticamente más relevante para generar una respuesta precisa y basada en evidencia.

Errores frecuentes

  • Confundir la similitud de coseno con la distancia euclidiana; la primera ignora la magnitud, mientras que la segunda es sensible a ella.
  • Asumir que una puntuación alta de similitud de coseno siempre implica corrección factual, en lugar de solo proximidad semántica.
  • Descuidar la normalización de vectores al usar otras métricas de distancia, lo que puede llevar a cálculos de similitud incorrectos.
  • Aplicar la similitud de coseno a datos dispersos sin considerar el impacto de la dimensionalidad en el ángulo resultante.

Preguntas frecuentes

¿Cuándo debería usar la similitud de coseno en lugar de la distancia euclidiana?

Usa la similitud de coseno cuando la orientación semántica de los datos sea más importante que la magnitud absoluta, como en la clasificación de texto o la recuperación de documentos. Usa la distancia euclidiana cuando la distancia real o el 'tamaño' de los puntos de datos sea una característica crítica.

¿La similitud de coseno funciona con valores negativos?

Sí, la similitud de coseno puede variar de -1 a 1. Un valor negativo indica que los vectores apuntan en direcciones opuestas, lo que puede ser útil en escenarios de recomendación específicos donde deseas identificar artículos que son lo 'opuesto' a la preferencia de un usuario.

¿Es la similitud de coseno computacionalmente costosa?

Generalmente es eficiente, especialmente cuando los vectores están normalizados a una longitud unitaria. En ese caso, la similitud de coseno es equivalente al producto escalar, que es una operación altamente optimizada en bibliotecas modernas de álgebra lineal y marcos acelerados por GPU.