TensorX
返回文献探索

Paper · arXiv 2411.17863

LongKey: Keyphrase Extraction for Long Documents

Jeovane Honorio Alves, Radu State, Cinthia Obladen de Almendra Freitas, Jean Paul Barddal

12 upvotesNovember 26, 2024arXiv 预印本
AI 摘要

LongKey, a novel framework using an encoder-based language model and max-pooling embedder, extracts keyphrases from lengthy documents, outperforming existing methods on comprehensive datasets.

encoder-based language modelmax-pooling embedderkeyphrase extractionLDKP datasets

Abstract

In an era of information overload, manually annotating the vast and growing corpus of documents and scholarly papers is increasingly impractical. Automated keyphrase extraction addresses this challenge by identifying representative terms within texts. However, most existing methods focus on short documents (up to 512 tokens), leaving a gap in processing long-context documents. In this paper, we introduce LongKey, a novel framework for extracting keyphrases from lengthy documents, which uses an encoder-based language model to capture extended text intricacies. LongKey uses a max-pooling embedder to enhance keyphrase candidate representation. Validated on the comprehensive LDKP datasets and six diverse, unseen datasets, LongKey consistently outperforms existing unsupervised and language model-based keyphrase extraction methods. Our findings demonstrate LongKey's versatility and superior performance, marking an advancement in keyphrase extraction for varied text lengths and domains.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号
LongKey: Keyphrase Extraction for Long Documents | TensorX