Examining LLM-Surprisal as an Indicator of Naturalness for Japanese Automated Essay Scoring

Akari Osumi, Jingying Hu, Yan Cong, Atsushi Fukada


Abstract
This study investigates Large Language Model (LLM) surprisal as an indicator of global linguistic naturalness in L2 Japanese automatic essay scoring. Results demonstrate that surprisal effectively distinguishes learner proficiency levels. Combining surprisal with feature-based indices achieves the highest classification accuracy, validating surprisal as a valuable metric for automated writing evaluation.
Anthology ID:
2026.aimecon-main.24
Volume:
Proceedings of the Artificial Intelligence in Measurement and Education Conference (AIME-Con): Full Papers
Month:
October
Year:
2026
Address:
Wyndham Grand Pittsburgh Downtown, Pittsburgh, Pennsylvania, United States
Editors:
Joshua Wilson, Christopher Ormerod, Magdalen Beiting-Parrish
Venue:
AIME-Con
SIG:
Publisher:
National Council on Measurement in Education (NCME)
Note:
Pages:
221–229
Language:
URL:
https://aclanthology.org/2026.aimecon-main.24/
DOI:
Bibkey:
Cite (ACL):
Akari Osumi, Jingying Hu, Yan Cong, and Atsushi Fukada. 2026. Examining LLM-Surprisal as an Indicator of Naturalness for Japanese Automated Essay Scoring. In Proceedings of the Artificial Intelligence in Measurement and Education Conference (AIME-Con): Full Papers, pages 221–229, Wyndham Grand Pittsburgh Downtown, Pittsburgh, Pennsylvania, United States. National Council on Measurement in Education (NCME).
Cite (Informal):
Examining LLM-Surprisal as an Indicator of Naturalness for Japanese Automated Essay Scoring (Osumi et al., AIME-Con 2026)
Copy Citation:
PDF:
https://aclanthology.org/2026.aimecon-main.24.pdf