Cid Ivan C. Carvalho
Author directory2026
Classificação automática de sentenças faladas com arquitetura híbrida: análise de estruturas topicalizadas, anti-topicalizadas e canônicas
Gerson Vitor P. Fernandes | Vitoria Maria A. Silva | Cid Ivan C. Carvalho
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
Gerson Vitor P. Fernandes | Vitoria Maria A. Silva | Cid Ivan C. Carvalho
Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
O presente artigo investiga o desempenho de um sistema de classificação automática de sentenças faladas do português brasileiro, considerando estruturas canônicas, topicalizadas e antitopicalizadas, por meio de uma arquitetura híbrida baseada em Redes Neurais Recorrentes (RNNs) e Redes Neurais Convolucionais (CNNs). A pesquisa articula contribuições sintáticas, prosódicas e computacionais com a finalidade de contextualizar o corpus e delimitar o tratamento das sentenças faladas, porém o estudo concentra-se na avaliação experimental de uma arquitetura híbrida de redes neurais aplicada à classificação automática dessas sentenças. O corpus analisado é composto por 612 sentenças declarativas gravadas em ambiente controlado, produzidas por 20 falantes do português brasileiro. A metodologia caracteriza-se como quantitativa e experimental, utilizando aprendizagem supervisionada e avaliação baseada em métricas como precisão, recall, f-score e acurácia, por meio da matriz de confusão. Foram realizados testes com diferentes configurações de hiperparâmetros, variando filtros convolucionais, unidades LSTM, taxas de Dropout e número de épocas de treinamento. Os resultados demonstraram que modelos mais robustos apresentaram maior capacidade de memorização dos dados de treino, mas também maior tendência ao overfitting. Em contrapartida, arquiteturas mais enxutas associadas a maiores taxas de regularização obtiveram melhor capacidade de generalização e maior estabilidade durante a validação. O melhor desempenho foi observado no cenário com 30% de Dropout, em que houve redução significativa do hiato de generalização entre treino e teste. Conclui-se que a combinação entre RNNs e CNNs mostra-se promissora para a classificação automática de sentenças faladas, embora ainda existam limitações relacionadas à generalização do modelo em dados não vistos.