Emilia Brüegge
Author directory2026
Semantic Similarity is Not Enough for Comparing LLM and Human Rater Rationales
Julie Jongeun Jung | Max Lu | Dogus Darici | Emilia Brüegge
Proceedings of the Artificial Intelligence in Measurement and Education Conference (AIME-Con): Full Papers
Julie Jongeun Jung | Max Lu | Dogus Darici | Emilia Brüegge
Proceedings of the Artificial Intelligence in Measurement and Education Conference (AIME-Con): Full Papers
Comparing LLM-human rater rationales using semantic similarity risks conflating textual proximity with evaluative agreement. We test whether embedding-based similarity reflects qualitative coding distinctions across rationale pairs in medical education. Similarity declined as rationale length differences grew and was less effective at distinguishing whether LLMs preserved the human’s central claim.