Comparative Analysis of Tokenizers in Tamil Text Classification in Low Resource Settings

Gokulan Sivakumaran, Randil Pushpananda, ERAD Bandara


Abstract
Tokenization is crucial in NLP, influencing performance for morphologically rich, low resource languages like Tamil. This study comprehensively analyzes WordPiece, SentencePiece, and Byte-Level Byte Pair Encoding (BBPE) for Tamil text classification. We assess tokenization efficiency using metrics including token count, fragmentation, OOV rate, and compression ratio. Additionally, we analyze downstream impact through Tamil news title classification using a custom lightweight BERT based Transformer architecture. Tokenizers were pretrained on a 5.45 GB Tamil Corpus and evaluated on a Kaggle Tamil News Dataset. Results indicate WordPiece and SentencePiece outperform BBPE in efficiency and accuracy. While BBPE eliminates OOV words, excessive fragmentation hinders model learning. Increasing vocabulary size improves WordPiece and SentencePiece but not BBPE. Misclassification analysis highlights overfragmentation challenges. This study contributes to Tamil NLP by comparing tokenizers, aiding researchers in selecting appropriate strategies for agglutinative languages.
Anthology ID:
2026.chipsal-1.19
Volume:
Proceedings of the Second workshop on Challenges in Processing South Asian Languages (CHiPSAL2026)
Month:
May
Year:
2026
Address:
Palma de Mallorca, Spain
Editors:
Kengatharaiyer Sarveswaran, Ashwini Vaidya
Venues:
CHiPSAL | WS
SIG:
Publisher:
ELRA Language Resources Association (ELRA)
Note:
Pages:
198–208
Language:
External URL:
https://lrec.elra.info/lrec2026-ws-chipsal-19
DOI:
10.63317/5p78kf96x2jw
Bibkey:
Cite (ACL):
Gokulan Sivakumaran, Randil Pushpananda, and ERAD Bandara. 2026. Comparative Analysis of Tokenizers in Tamil Text Classification in Low Resource Settings. In Proceedings of the Second workshop on Challenges in Processing South Asian Languages (CHiPSAL2026), pages 198–208, Palma de Mallorca, Spain. ELRA Language Resources Association (ELRA).
Cite (Informal):
Comparative Analysis of Tokenizers in Tamil Text Classification in Low Resource Settings (Sivakumaran et al., CHiPSAL 2026)
Copy Citation: