La biblioteca Sentence Transformers añade soporte para codificador multivectorial
La biblioteca Sentence Transformers ha introducido un MultiVectorEncoder en su actualización v6.0, permitiendo el soporte para modelos de recuperación de interacción tardía estilo ColBERT.
Publicación de la fuente original: 18 de agosto de 2026
La biblioteca de Python Sentence Transformers ha lanzado la versión 6.0, que introduce un nuevo tipo de modelo llamado MultiVectorEncoder. Esta actualización permite a los usuarios cargar y utilizar modelos de recuperación de interacción tardía estilo ColBERT directamente a través de la API existente de la biblioteca. El nuevo codificador admite varios puntos de control, incluidos los de PyLate, Stanford-NLP ColBERT y los modelos de la familia ColPali para la recuperación de documentos visuales. A diferencia de los modelos de embedding densos tradicionales que comprimen el texto en un solo vector, los modelos multivectoriales conservan un vector por token. Este enfoque utiliza el operador MaxSim para comparar los tokens de la consulta y del documento, lo que puede mejorar la calidad de la recuperación para consultas complejas o datos fuera de dominio. Si bien este método ofrece una mayor precisión al preservar la información a nivel de token, requiere significativamente más espacio de almacenamiento para los índices en comparación con los modelos de vector único. La actualización tiene como objetivo agilizar la integración de estos modelos en las pilas de búsqueda, proporcionando una interfaz unificada para los desarrolladores que trabajan con arquitecturas de recuperación densa, dispersa y de interacción tardía.