Quality and Appropriateness of Large Text Datasets for Irish NLP

Abigail Walsh, Mark Andrade, Jane Lauren Adkins, Ornait O’Connell, Éanna O’Connor, Ellen Rushe, Brian Davis


Abstract
The value of high-quality datasets for training essential language tools has long been recognised for NLP research. Despite the importance of such datasets, most language data available for training consists of large, automatically curated corpora, often scraped from web content. The quality of such datasets is often an unknown factor. This presents a problem for already low-resourced languages (such as Irish), as existing datasets may not provide adequate, representative language data for training effective models. This paper examines existing monolingual and parallel Irish text corpora to evaluate the quality of the language data, through manual review, automatic metrics, and LLMs as judges.
Anthology ID:
2026.sigul-1.14
Volume:
Proceedings of the SIGUL 2026 Joint Workshop with ELE, EURALI, and DCLRL: Towards Inclusivity and Equality: Language Resources and Technologies for Under-Resourced and Endangered Languages
Month:
May
Year:
2026
Address:
Palma, Mallorca, Spain
Editors:
Atul Kr. Ojha, Sakriani Sakti, Claudia Soria, Maite Melero, John P. McCrae, Constantine Lignos, Chao-Hong Liu, German Rigau Claramunt, Georg Rehm
Venues:
SIGUL | EURALI | DCLRL | WS
SIG:
Publisher:
ELRA Language Resources Association (ELRA)
Note:
Pages:
126–142
Language:
External URL:
https://lrec.elra.info/lrec2026-ws-sigul-14
DOI:
10.63317/3sxe9j64u492
Bibkey:
Cite (ACL):
Abigail Walsh, Mark Andrade, Jane Lauren Adkins, Ornait O’Connell, Éanna O’Connor, Ellen Rushe, and Brian Davis. 2026. Quality and Appropriateness of Large Text Datasets for Irish NLP. In Proceedings of the SIGUL 2026 Joint Workshop with ELE, EURALI, and DCLRL: Towards Inclusivity and Equality: Language Resources and Technologies for Under-Resourced and Endangered Languages, pages 126–142, Palma, Mallorca, Spain. ELRA Language Resources Association (ELRA).
Cite (Informal):
Quality and Appropriateness of Large Text Datasets for Irish NLP (Walsh et al., SIGUL-EURALI-DCLRL 2026)
Copy Citation: