Semantic Similarity is Not Enough for Comparing LLM and Human Rater Rationales

Julie Jongeun Jung, Max Lu, Dogus Darici, Emilia Brüegge


Abstract
Comparing LLM-human rater rationales using semantic similarity risks conflating textual proximity with evaluative agreement. We test whether embedding-based similarity reflects qualitative coding distinctions across rationale pairs in medical education. Similarity declined as rationale length differences grew and was less effective at distinguishing whether LLMs preserved the human’s central claim.
Anthology ID:
2026.aimecon-main.52
Volume:
Proceedings of the Artificial Intelligence in Measurement and Education Conference (AIME-Con): Full Papers
Month:
October
Year:
2026
Address:
Wyndham Grand Pittsburgh Downtown, Pittsburgh, Pennsylvania, United States
Editors:
Joshua Wilson, Christopher Ormerod, Magdalen Beiting-Parrish
Venue:
AIME-Con
SIG:
Publisher:
National Council on Measurement in Education (NCME)
Note:
Pages:
466–471
Language:
URL:
https://aclanthology.org/2026.aimecon-main.52/
DOI:
Bibkey:
Cite (ACL):
Julie Jongeun Jung, Max Lu, Dogus Darici, and Emilia Brüegge. 2026. Semantic Similarity is Not Enough for Comparing LLM and Human Rater Rationales. In Proceedings of the Artificial Intelligence in Measurement and Education Conference (AIME-Con): Full Papers, pages 466–471, Wyndham Grand Pittsburgh Downtown, Pittsburgh, Pennsylvania, United States. National Council on Measurement in Education (NCME).
Cite (Informal):
Semantic Similarity is Not Enough for Comparing LLM and Human Rater Rationales (Jung et al., AIME-Con 2026)
Copy Citation:
PDF:
https://aclanthology.org/2026.aimecon-main.52.pdf