@inproceedings{brandao-etal-2026-text,
title = "Text segmentation with mixed data: evaluating symbolic and neural approaches",
author = "Brand{\~a}o, Amanda Sammer do N. and
Sanches, Felipe Bomfim and
Sena, Alfredo and
Mota, Laila and
Claro, Daniela Barreiro and
Cavalcante, Rerisson",
editor = "Barbosa, Bryan Khelven da Silva and
Paes, Aline and
Felippo, Ariani Di",
booktitle = "Proceedings of the 17th {B}razilian Symposium in Information and Human Language Technology",
month = oct,
year = "2026",
address = "Cuiab{\'a}, Mato Grosso, Brazil",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2026.stil-1.5/",
doi = "10.5753/stil.2026.26577",
pages = "50--61",
abstract = "A segmenta{\c{c}}{\~a}o de texto vem sendo amplamente difundida e utilizada para extrair informa{\c{c}}{\~a}o relevante de documentos. Essas informa{\c{c}}{\~o}es est{\~a}o distribu{\'i}das em diversos tipos de estruturas, que incluem dados heterog{\^e}neos. A extra{\c{c}}{\~a}o desses dados tem sido ultimamente, utilizada por LLMs (Large Language Models). Por{\'e}m, os treinamentos dos modelos de linguagem n{\~a}o det{\'e}m caracter{\'i}sticas peculiares de dados mistos, tais como dados lexicais e dados fon{\'e}ticos. Assim, torna-se um desafio analisar a corretude das transcri{\c{c}}{\~o}es de maneira automatizada por LLMs. Neste estudo, a segmenta{\c{c}}{\~a}o textual e extra{\c{c}}{\~a}o de informa{\c{c}}{\~a}o foi paralelizada em duas principais abordagens com o intuito de avaliar a compara{\c{c}}{\~a}o de uma abordagem simb{\'o}lica e uma abordagem neural. Os resultados demonstram as vantagens e desvantagens em ambas as abordagens para os tipos de dados mistos."
}<?xml version="1.0" encoding="UTF-8"?>
<modsCollection xmlns="http://www.loc.gov/mods/v3">
<mods ID="brandao-etal-2026-text">
<titleInfo>
<title>Text segmentation with mixed data: evaluating symbolic and neural approaches</title>
</titleInfo>
<name type="personal">
<namePart type="given">Amanda</namePart>
<namePart type="given">Sammer</namePart>
<namePart type="given">do</namePart>
<namePart type="given">N</namePart>
<namePart type="family">Brandão</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Felipe</namePart>
<namePart type="given">Bomfim</namePart>
<namePart type="family">Sanches</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Alfredo</namePart>
<namePart type="family">Sena</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Laila</namePart>
<namePart type="family">Mota</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Daniela</namePart>
<namePart type="given">Barreiro</namePart>
<namePart type="family">Claro</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Rerisson</namePart>
<namePart type="family">Cavalcante</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<originInfo>
<dateIssued>2026-10</dateIssued>
</originInfo>
<typeOfResource>text</typeOfResource>
<relatedItem type="host">
<titleInfo>
<title>Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology</title>
</titleInfo>
<name type="personal">
<namePart type="given">Bryan</namePart>
<namePart type="given">Khelven</namePart>
<namePart type="given">da</namePart>
<namePart type="given">Silva</namePart>
<namePart type="family">Barbosa</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Aline</namePart>
<namePart type="family">Paes</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Ariani</namePart>
<namePart type="given">Di</namePart>
<namePart type="family">Felippo</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<originInfo>
<publisher>Association for Computational Linguistics</publisher>
<place>
<placeTerm type="text">Cuiabá, Mato Grosso, Brazil</placeTerm>
</place>
</originInfo>
<genre authority="marcgt">conference publication</genre>
</relatedItem>
<abstract>A segmentação de texto vem sendo amplamente difundida e utilizada para extrair informação relevante de documentos. Essas informações estão distribuídas em diversos tipos de estruturas, que incluem dados heterogêneos. A extração desses dados tem sido ultimamente, utilizada por LLMs (Large Language Models). Porém, os treinamentos dos modelos de linguagem não detém características peculiares de dados mistos, tais como dados lexicais e dados fonéticos. Assim, torna-se um desafio analisar a corretude das transcrições de maneira automatizada por LLMs. Neste estudo, a segmentação textual e extração de informação foi paralelizada em duas principais abordagens com o intuito de avaliar a comparação de uma abordagem simbólica e uma abordagem neural. Os resultados demonstram as vantagens e desvantagens em ambas as abordagens para os tipos de dados mistos.</abstract>
<identifier type="citekey">brandao-etal-2026-text</identifier>
<identifier type="doi">10.5753/stil.2026.26577</identifier>
<location>
<url>https://aclanthology.org/2026.stil-1.5/</url>
</location>
<part>
<date>2026-10</date>
<extent unit="page">
<start>50</start>
<end>61</end>
</extent>
</part>
</mods>
</modsCollection>
%0 Conference Proceedings
%T Text segmentation with mixed data: evaluating symbolic and neural approaches
%A Brandão, Amanda Sammer do N.
%A Sanches, Felipe Bomfim
%A Sena, Alfredo
%A Mota, Laila
%A Claro, Daniela Barreiro
%A Cavalcante, Rerisson
%Y Barbosa, Bryan Khelven da Silva
%Y Paes, Aline
%Y Felippo, Ariani Di
%S Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
%D 2026
%8 October
%I Association for Computational Linguistics
%C Cuiabá, Mato Grosso, Brazil
%F brandao-etal-2026-text
%X A segmentação de texto vem sendo amplamente difundida e utilizada para extrair informação relevante de documentos. Essas informações estão distribuídas em diversos tipos de estruturas, que incluem dados heterogêneos. A extração desses dados tem sido ultimamente, utilizada por LLMs (Large Language Models). Porém, os treinamentos dos modelos de linguagem não detém características peculiares de dados mistos, tais como dados lexicais e dados fonéticos. Assim, torna-se um desafio analisar a corretude das transcrições de maneira automatizada por LLMs. Neste estudo, a segmentação textual e extração de informação foi paralelizada em duas principais abordagens com o intuito de avaliar a comparação de uma abordagem simbólica e uma abordagem neural. Os resultados demonstram as vantagens e desvantagens em ambas as abordagens para os tipos de dados mistos.
%R 10.5753/stil.2026.26577
%U https://aclanthology.org/2026.stil-1.5/
%U https://doi.org/10.5753/stil.2026.26577
%P 50-61
Markdown (Informal)
[Text segmentation with mixed data: evaluating symbolic and neural approaches](https://aclanthology.org/2026.stil-1.5/) (Brandão et al., STIL 2026)
ACL
- Amanda Sammer do N. Brandão, Felipe Bomfim Sanches, Alfredo Sena, Laila Mota, Daniela Barreiro Claro, and Rerisson Cavalcante. 2026. Text segmentation with mixed data: evaluating symbolic and neural approaches. In Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology, pages 50–61, Cuiabá, Mato Grosso, Brazil. Association for Computational Linguistics.