TensorX
返回文献探索

Paper · arXiv 2501.00874

LUSIFER: Language Universal Space Integration for Enhanced Multilingual Embeddings with Large Language Models

Hieu Man, Nghia Trung Ngo, Viet Dac Lai, Ryan A. Rossi, Franck Dernoncourt, Thien Huu Nguyen

13 upvotesJanuary 1, 2025arXiv 预印本
AI 摘要

LUSIFER, a zero-shot approach using a multilingual encoder and LLM-based embedding model, enhances multilingual performance in text embedding tasks without multilingual supervision.

zero-shot approachmultilingual encoderLLM-based embedding modelmultilingual supervisionembedding-specific taskstrainable parametersmultilingual performancemedium and low-resource languages

Abstract

Recent advancements in large language models (LLMs) based embedding models have established new state-of-the-art benchmarks for text embedding tasks, particularly in dense vector-based retrieval. However, these models predominantly focus on English, leaving multilingual embedding capabilities largely unexplored. To address this limitation, we present LUSIFER, a novel zero-shot approach that adapts LLM-based embedding models for multilingual tasks without requiring multilingual supervision. LUSIFER's architecture combines a multilingual encoder, serving as a language-universal learner, with an LLM-based embedding model optimized for embedding-specific tasks. These components are seamlessly integrated through a minimal set of trainable parameters that act as a connector, effectively transferring the multilingual encoder's language understanding capabilities to the specialized embedding model. Additionally, to comprehensively evaluate multilingual embedding performance, we introduce a new benchmark encompassing 5 primary embedding tasks, 123 diverse datasets, and coverage across 14 languages. Extensive experimental results demonstrate that LUSIFER significantly enhances the multilingual performance across various embedding tasks, particularly for medium and low-resource languages, without requiring explicit multilingual training data.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号
LUSIFER: Language Universal Space Integration for Enhanced Multilingual Embeddings with Large Language Models | TensorX