TensorX
返回文献探索

Paper · arXiv 2409.04269

Open Language Data Initiative: Advancing Low-Resource Machine Translation for Karakalpak

Mukhammadsaid Mamasaidov, Abror Shopulatov

11 upvotesSeptember 6, 2024arXiv 预印本
AI 摘要

The study provides datasets and neural models for Karakalpak language translation, demonstrating improvements over existing baselines.

neural modelstranslationparallel corporaOpen Language Data Initiative

Abstract

This study presents several contributions for the Karakalpak language: a FLORES+ devtest dataset translated to Karakalpak, parallel corpora for Uzbek-Karakalpak, Russian-Karakalpak and English-Karakalpak of 100,000 pairs each and open-sourced fine-tuned neural models for translation across these languages. Our experiments compare different model variants and training approaches, demonstrating improvements over existing baselines. This work, conducted as part of the Open Language Data Initiative (OLDI) shared task, aims to advance machine translation capabilities for Karakalpak and contribute to expanding linguistic diversity in NLP technologies.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号