Assessing Large Language Model Performance in Post-Certification-Examination Comment Categorization

Huaping Sun, Kristin O’Brien, Colleen Burke Kave, David Shin, Qiao Lin, Jeffrey Marc Lyness


Abstract
This study evaluated an LLM for analyzing 1,406 Neurocritical Care examination comments coded for sentiment and thematic categories. Human raters showed high agreement, whereas LLM-human agreement was moderate. Thematic definitions reduced performance, but human-coded examples improved accuracy. LLMs may support preliminary coding, although human review remains necessary.
Anthology ID:
2026.aimecon-wip.8
Volume:
Proceedings of the Artificial Intelligence in Measurement and Education Conference (AIME-Con): Works in Progress
Month:
October
Year:
2026
Address:
Wyndham Grand Pittsburgh Downtown, Pittsburgh, Pennsylvania, United States
Editors:
Joshua Wilson, Christopher Ormerod, Magdalen Beiting-Parrish
Venue:
AIME-Con
SIG:
Publisher:
National Council on Measurement in Education (NCME)
Note:
Pages:
57–61
Language:
URL:
https://aclanthology.org/2026.aimecon-wip.8/
DOI:
Bibkey:
Cite (ACL):
Huaping Sun, Kristin O’Brien, Colleen Burke Kave, David Shin, Qiao Lin, and Jeffrey Marc Lyness. 2026. Assessing Large Language Model Performance in Post-Certification-Examination Comment Categorization. In Proceedings of the Artificial Intelligence in Measurement and Education Conference (AIME-Con): Works in Progress, pages 57–61, Wyndham Grand Pittsburgh Downtown, Pittsburgh, Pennsylvania, United States. National Council on Measurement in Education (NCME).
Cite (Informal):
Assessing Large Language Model Performance in Post-Certification-Examination Comment Categorization (Sun et al., AIME-Con 2026)
Copy Citation:
PDF:
https://aclanthology.org/2026.aimecon-wip.8.pdf