Sentence Transformers v6.0 introduces a MultiVectorEncoder that enables ColBERT-style late interaction retrieval, keeping one vector per token instead of compressing documents into a single vector. A MaxSim operator scores queries by finding each query token’s best match across document tokens and summing those similarities, producing stronger retrieval quality especially for multi-requirement queries and visual document retrieval. The approach requires substantially larger indexes than dense embeddings, but the resulting indexes can be compressed through token pooling and integrate with vector databases including Qdrant, Weaviate, and Vespa.
