Compression-Based Linguistic Complexity Metrics in Automatic Essay Scoring

Felipe Ribas Serras, Igor Cataneo Silveira, Denis Deratani Mauá, Marcelo Finger


Abstract
Compression-based linguistic complexity metrics enable cross-linguistic comparison without prior annotation. Their sensitivity to variation across languages and Portuguese registers highlights their applicability in NLP tasks. This study investigates their use as readability proxies and complementary features in Automatic Essay Scoring. We analyze how these metrics capture variation in essay quality across traits, genres, and educational levels in Brazilian Portuguese. In addition, we evaluate their sensitivity to differences between humanand AI-generated essays. Our results suggest that complexity metrics are effective (i) in differentiating educational levels, (ii) in detecting whether they were written by humans and (iii) as predictors of essay quality.
Anthology ID:
2026.stil-1.32
Volume:
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Month:
October
Year:
2026
Address:
Cuiabá, Mato Grosso, Brazil
Editors:
Bryan Khelven da Silva Barbosa, Aline Paes, Ariani Di Felippo
Venue:
STIL
SIG:
Publisher:
Association for Computational Linguistics
Note:
Pages:
390–404
Language:
URL:
https://aclanthology.org/2026.stil-1.32/
DOI:
10.5753/stil.2026.26572
Bibkey:
Cite (ACL):
Felipe Ribas Serras, Igor Cataneo Silveira, Denis Deratani Mauá, and Marcelo Finger. 2026. Compression-Based Linguistic Complexity Metrics in Automatic Essay Scoring. In Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology, pages 390–404, Cuiabá, Mato Grosso, Brazil. Association for Computational Linguistics.
Cite (Informal):
Compression-Based Linguistic Complexity Metrics in Automatic Essay Scoring (Serras et al., STIL 2026)
Copy Citation:
PDF:
https://aclanthology.org/2026.stil-1.32.pdf