From Discrete to Continuous Classes: A Situational Analysis of Multilingual Web Registers with LLM Annotations

Erik Henriksson; Amanda Myntti; Saara Hellström; Selcen Erten-Johansson; Anni Eskelinen; Liina Repo; Veronika Laippala

doi:10.18653/v1/2024.nlp4dh-1.30

From Discrete to Continuous Classes: A Situational Analysis of Multilingual Web Registers with LLM Annotations

Erik Henriksson, Amanda Myntti, Saara Hellström, Selcen Erten-Johansson, Anni Eskelinen, Liina Repo, Veronika Laippala

Abstract

In corpus linguistics, registers–language varieties suited to different contexts–have traditionally been defined by their situations of use, yet recent studies reveal significant situational variation within registers. Previous quantitative studies, however, have been limited to English, leaving this variation in other languages largely unexplored. To address this gap, we apply a quantitative situational analysis to a large multilingual web register corpus, using large language models (LLMs) to annotate texts in English, Finnish, French, Swedish, and Turkish for 23 situational parameters. Using clustering techniques, we identify six situational text types, such as “Advice”, “Opinion” and “Marketing”, each characterized by distinct situational features. We explore the relationship between these text types and traditional register categories, finding partial alignment, though no register maps perfectly onto a single cluster. These results support the quantitative approach to situational analysis and are consistent with earlier findings for English. Cross-linguistic comparisons show that language accounts for only a small part of situational variation within registers, suggesting registers are situationally similar across languages. This study demonstrates the utility of LLMs in multilingual register analysis and deepens our understanding of situational variation within registers.

Anthology ID:: 2024.nlp4dh-1.30
Volume:: Proceedings of the 4th International Conference on Natural Language Processing for Digital Humanities
Month:: November
Year:: 2024
Address:: Miami, USA
Editors:: Mika Hämäläinen, Emily Öhman, So Miyagawa, Khalid Alnajjar, Yuri Bizzoni
Venues:: NLP4DH | WS
SIG:
Publisher:: Association for Computational Linguistics
Note:
Pages:: 308–318
Language:
URL:: https://aclanthology.org/2024.nlp4dh-1.30/
DOI:: 10.18653/v1/2024.nlp4dh-1.30
Bibkey:
Cite (ACL):: Erik Henriksson, Amanda Myntti, Saara Hellström, Selcen Erten-Johansson, Anni Eskelinen, Liina Repo, and Veronika Laippala. 2024. From Discrete to Continuous Classes: A Situational Analysis of Multilingual Web Registers with LLM Annotations. In Proceedings of the 4th International Conference on Natural Language Processing for Digital Humanities, pages 308–318, Miami, USA. Association for Computational Linguistics.
Cite (Informal):: From Discrete to Continuous Classes: A Situational Analysis of Multilingual Web Registers with LLM Annotations (Henriksson et al., NLP4DH 2024)
Copy Citation:
PDF:: https://aclanthology.org/2024.nlp4dh-1.30.pdf

PDF Cite Search Fix data