Classificação de Textos com Matrizes de Similaridade: Um Estudo de Caso em um Corpus com Nomes de Produtos

Antonio Ferreira de Castro Barbosa, Eduardo Corrêa Gonçalves


Abstract
Este trabalho aborda o problema da comparação semântica de pares de strings curtas em português. Mais especificamente, o trabalho avalia uma abordagem não supervisionada baseada em matrizes de similaridade para classificar nomes de produtos contendo diferentes tipos de especificações. As matrizes foram utilizadas de forma isolada e combinadas aos pares. Em experimentos realizados sobre um corpus composto por 1.000 instâncias, a melhor acurácia foi obtida através da combinação da matriz TF-IDF com matrizes de embeddings pré-treinados da família BERT.
Anthology ID:
2026.stil-1.45
Volume:
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Month:
October
Year:
2026
Address:
Cuiabá, Mato Grosso, Brazil
Editors:
Bryan Khelven da Silva Barbosa, Aline Paes, Ariani Di Felippo
Venue:
STIL
SIG:
Publisher:
Association for Computational Linguistics
Note:
Pages:
540–545
Language:
URL:
https://aclanthology.org/2026.stil-1.45/
DOI:
10.5753/stil.2026.29449
Bibkey:
Cite (ACL):
Antonio Ferreira de Castro Barbosa and Eduardo Corrêa Gonçalves. 2026. Classificação de Textos com Matrizes de Similaridade: Um Estudo de Caso em um Corpus com Nomes de Produtos. In Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology, pages 540–545, Cuiabá, Mato Grosso, Brazil. Association for Computational Linguistics.
Cite (Informal):
Classificação de Textos com Matrizes de Similaridade: Um Estudo de Caso em um Corpus com Nomes de Produtos (Barbosa & Gonçalves, STIL 2026)
Copy Citation:
PDF:
https://aclanthology.org/2026.stil-1.45.pdf