@inproceedings{barbosa-goncalves-2026-classificacao,
title = "Classifica{\c{c}}{\~a}o de Textos com Matrizes de Similaridade: Um Estudo de Caso em um Corpus com Nomes de Produtos",
author = "Barbosa, Antonio Ferreira de Castro and
Gon{\c{c}}alves, Eduardo Corr{\^e}a",
editor = "Barbosa, Bryan Khelven da Silva and
Paes, Aline and
Felippo, Ariani Di",
booktitle = "Proceedings of the 17th {B}razilian Symposium in Information and Human Language Technology",
month = oct,
year = "2026",
address = "Cuiab{\'a}, Mato Grosso, Brazil",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2026.stil-1.45/",
doi = "10.5753/stil.2026.29449",
pages = "540--545",
abstract = "Este trabalho aborda o problema da compara{\c{c}}{\~a}o sem{\^a}ntica de pares de strings curtas em portugu{\^e}s. Mais especificamente, o trabalho avalia uma abordagem n{\~a}o supervisionada baseada em matrizes de similaridade para classificar nomes de produtos contendo diferentes tipos de especifica{\c{c}}{\~o}es. As matrizes foram utilizadas de forma isolada e combinadas aos pares. Em experimentos realizados sobre um corpus composto por 1.000 inst{\^a}ncias, a melhor acur{\'a}cia foi obtida atrav{\'e}s da combina{\c{c}}{\~a}o da matriz TF-IDF com matrizes de embeddings pr{\'e}-treinados da fam{\'i}lia BERT."
}<?xml version="1.0" encoding="UTF-8"?>
<modsCollection xmlns="http://www.loc.gov/mods/v3">
<mods ID="barbosa-goncalves-2026-classificacao">
<titleInfo>
<title>Classificação de Textos com Matrizes de Similaridade: Um Estudo de Caso em um Corpus com Nomes de Produtos</title>
</titleInfo>
<name type="personal">
<namePart type="given">Antonio</namePart>
<namePart type="given">Ferreira</namePart>
<namePart type="given">de</namePart>
<namePart type="given">Castro</namePart>
<namePart type="family">Barbosa</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Eduardo</namePart>
<namePart type="given">Corrêa</namePart>
<namePart type="family">Gonçalves</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<originInfo>
<dateIssued>2026-10</dateIssued>
</originInfo>
<typeOfResource>text</typeOfResource>
<relatedItem type="host">
<titleInfo>
<title>Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology</title>
</titleInfo>
<name type="personal">
<namePart type="given">Bryan</namePart>
<namePart type="given">Khelven</namePart>
<namePart type="given">da</namePart>
<namePart type="given">Silva</namePart>
<namePart type="family">Barbosa</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Aline</namePart>
<namePart type="family">Paes</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Ariani</namePart>
<namePart type="given">Di</namePart>
<namePart type="family">Felippo</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<originInfo>
<publisher>Association for Computational Linguistics</publisher>
<place>
<placeTerm type="text">Cuiabá, Mato Grosso, Brazil</placeTerm>
</place>
</originInfo>
<genre authority="marcgt">conference publication</genre>
</relatedItem>
<abstract>Este trabalho aborda o problema da comparação semântica de pares de strings curtas em português. Mais especificamente, o trabalho avalia uma abordagem não supervisionada baseada em matrizes de similaridade para classificar nomes de produtos contendo diferentes tipos de especificações. As matrizes foram utilizadas de forma isolada e combinadas aos pares. Em experimentos realizados sobre um corpus composto por 1.000 instâncias, a melhor acurácia foi obtida através da combinação da matriz TF-IDF com matrizes de embeddings pré-treinados da família BERT.</abstract>
<identifier type="citekey">barbosa-goncalves-2026-classificacao</identifier>
<identifier type="doi">10.5753/stil.2026.29449</identifier>
<location>
<url>https://aclanthology.org/2026.stil-1.45/</url>
</location>
<part>
<date>2026-10</date>
<extent unit="page">
<start>540</start>
<end>545</end>
</extent>
</part>
</mods>
</modsCollection>
%0 Conference Proceedings
%T Classificação de Textos com Matrizes de Similaridade: Um Estudo de Caso em um Corpus com Nomes de Produtos
%A Barbosa, Antonio Ferreira de Castro
%A Gonçalves, Eduardo Corrêa
%Y Barbosa, Bryan Khelven da Silva
%Y Paes, Aline
%Y Felippo, Ariani Di
%S Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
%D 2026
%8 October
%I Association for Computational Linguistics
%C Cuiabá, Mato Grosso, Brazil
%F barbosa-goncalves-2026-classificacao
%X Este trabalho aborda o problema da comparação semântica de pares de strings curtas em português. Mais especificamente, o trabalho avalia uma abordagem não supervisionada baseada em matrizes de similaridade para classificar nomes de produtos contendo diferentes tipos de especificações. As matrizes foram utilizadas de forma isolada e combinadas aos pares. Em experimentos realizados sobre um corpus composto por 1.000 instâncias, a melhor acurácia foi obtida através da combinação da matriz TF-IDF com matrizes de embeddings pré-treinados da família BERT.
%R 10.5753/stil.2026.29449
%U https://aclanthology.org/2026.stil-1.45/
%U https://doi.org/10.5753/stil.2026.29449
%P 540-545
Markdown (Informal)
[Classificação de Textos com Matrizes de Similaridade: Um Estudo de Caso em um Corpus com Nomes de Produtos](https://aclanthology.org/2026.stil-1.45/) (Barbosa & Gonçalves, STIL 2026)
ACL