Sentence Transformers v6.0 añade soporte para codificador multivectorial
La biblioteca Sentence Transformers ha introducido un MultiVectorEncoder para la recuperación de interacción tardía al estilo ColBERT, permitiendo a los usuarios entrenar y ajustar modelos multivectoriales personalizados.
Publicación de la fuente original: 26 de agosto de 2026
La biblioteca de Python Sentence Transformers ha lanzado su actualización v6.0, que introduce el MultiVectorEncoder. Este nuevo tipo de modelo admite la recuperación de interacción tardía al estilo ColBERT, un método que preserva las señales detalladas a nivel de token al puntuar consultas frente a documentos utilizando el operador MaxSim. Este enfoque tiene como objetivo mejorar el rendimiento de la recuperación en comparación con los modelos de embedding densos tradicionales que comprimen el texto en un solo vector. Los usuarios ahora pueden ajustar modelos multivectoriales existentes o construir otros nuevos a partir de transformadores base. La actualización permite configuraciones personalizadas, como ajustar los límites de longitud de los documentos e implementar listas de exclusión de puntuación para optimizar la indexación. Según la documentación, el ajuste fino específico del dominio puede ayudar a los modelos a adaptarse a vocabularios especializados y longitudes de documentos que los recuperadores de propósito general pueden no manejar de manera efectiva. La biblioteca proporciona un enfoque estructurado para el entrenamiento, incluidos componentes para conjuntos de datos, funciones de pérdida y evaluadores, lo que permite a los desarrolladores construir y refinar modelos con sus propios datos.