TR-TEB: Turkish Text Embedding Benchmark

Omer Arslan, Atalay Celik, Yusuf Aslan, Hasan Fatih Durkaya, Mustafa Furkan Zenginoglu, Musa Alperen Yilmaz, Merve Gul Kantarci, Mehmet Haklidir


Abstract
Text embeddings are central to modern natural language processing, enabling several downstream tasks. Despite their significance, existing evaluation frameworks primarily target English and other high-resource languages, leaving critical gaps for languages such as Turkish. To address this, we present TR-TEB (Turkish Text Embedding Benchmark), the first comprehensive, standardized, and reproducible benchmark for Turkish text embeddings. TR-TEB spans five core task categories: classification, pair classification, clustering, retrieval, and semantic textual similarity. It is supported by a diverse dataset portfolio that integrates 14 curated open-source resources, 26 high-quality translated datasets, and 7 newly constructed Turkish-specific datasets designed to capture the language’s unique characteristics. We test our framework by comparing 45 well-known open-source embedding models. As the first unified evaluation suite, TR-TEB serves as a core tool for the Turkish embedding research community, establishing a systematic basis for model comparison and improvement. Furthermore, its benchmarking methodology and dataset creation process provide a blueprint for extending robust embedding evaluation to other low-resource languages.
Anthology ID:
2026.lrec-1.862
Volume:
Proceedings of the Fifteenth Language Resources and Evaluation Conference
Month:
May
Year:
2026
Address:
Palma de Mallorca, Spain
Editors:
Stelios Piperidis, Núria Bel, Henk van den Heuvel, Nancy Ide, Simon Krek, Antonio Toral
Venue:
LREC
SIG:
Publisher:
ELRA Language Resource Association
Note:
Pages:
11028–11044
Language:
External URL:
https://lrec.elra.info/lrec2026-main-862
DOI:
10.63317/3qway8hn6y53
Bibkey:
Cite (ACL):
Omer Arslan, Atalay Celik, Yusuf Aslan, Hasan Fatih Durkaya, Mustafa Furkan Zenginoglu, Musa Alperen Yilmaz, Merve Gul Kantarci, and Mehmet Haklidir. 2026. TR-TEB: Turkish Text Embedding Benchmark. In Proceedings of the Fifteenth Language Resources and Evaluation Conference, pages 11028–11044, Palma de Mallorca, Spain. ELRA Language Resource Association.
Cite (Informal):
TR-TEB: Turkish Text Embedding Benchmark (Arslan et al., LREC 2026)
Copy Citation: