Does Including Images Improve Multimodal Language Models’ Accuracy on Item Discrimination Estimation

Jae Jun Jong, Miryeong Koo


Abstract
This study measures the effectiveness of including images to predict discrimination parameters of reading items. The results suggest that providing images to language models is beneficial. By using both image and text, Lasso regressions (Tibshirani, 1996) could explain data better and random forests (Breiman, 2001) showed higher accuracy.
Anthology ID:
2026.aimecon-main.71
Volume:
Proceedings of the Artificial Intelligence in Measurement and Education Conference (AIME-Con): Full Papers
Month:
October
Year:
2026
Address:
Wyndham Grand Pittsburgh Downtown, Pittsburgh, Pennsylvania, United States
Editors:
Joshua Wilson, Christopher Ormerod, Magdalen Beiting-Parrish
Venue:
AIME-Con
SIG:
Publisher:
National Council on Measurement in Education (NCME)
Note:
Pages:
631–638
Language:
URL:
https://aclanthology.org/2026.aimecon-main.71/
DOI:
Bibkey:
Cite (ACL):
Jae Jun Jong and Miryeong Koo. 2026. Does Including Images Improve Multimodal Language Models’ Accuracy on Item Discrimination Estimation. In Proceedings of the Artificial Intelligence in Measurement and Education Conference (AIME-Con): Full Papers, pages 631–638, Wyndham Grand Pittsburgh Downtown, Pittsburgh, Pennsylvania, United States. National Council on Measurement in Education (NCME).
Cite (Informal):
Does Including Images Improve Multimodal Language Models’ Accuracy on Item Discrimination Estimation (Jong & Koo, AIME-Con 2026)
Copy Citation:
PDF:
https://aclanthology.org/2026.aimecon-main.71.pdf