Eduardo Corrêa Gonçalves

Author directory

2026

Este trabalho aborda o problema da comparação semântica de pares de strings curtas em português. Mais especificamente, o trabalho avalia uma abordagem não supervisionada baseada em matrizes de similaridade para classificar nomes de produtos contendo diferentes tipos de especificações. As matrizes foram utilizadas de forma isolada e combinadas aos pares. Em experimentos realizados sobre um corpus composto por 1.000 instâncias, a melhor acurácia foi obtida através da combinação da matriz TF-IDF com matrizes de embeddings pré-treinados da família BERT.