@inproceedings{mota-etal-2026-oabench,
title = "{OAB}ench-Consumidor: Um benchmark para avalia{\c{c}}{\~a}o de modelos de linguagem em Direito do Consumidor",
author = "Mota, Lucas B. Bulc{\~a}o and
Athaydes, Aline and
Mane, Babacar and
Claro, Daniela Barreiro",
editor = "Barbosa, Bryan Khelven da Silva and
Paes, Aline and
Felippo, Ariani Di",
booktitle = "Proceedings of the 17th {B}razilian Symposium in Information and Human Language Technology",
month = oct,
year = "2026",
address = "Cuiab{\'a}, Mato Grosso, Brazil",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2026.stil-1.51/",
doi = "10.5753/stil.2026.29871",
pages = "573--577",
abstract = "Avaliar modelos de linguagem em dom{\'i}nios espec{\'i}ficos, como o Direito do Consumidor, {\'e} um desafio devido {\`a} escassez de recursos padronizados em portugu{\^e}s brasileiro. Para resolver esse problema, introduzimos o OABench-Consumidor, um benchmark composto exclusivamente por quest{\~o}es de Direito do Consumidor da primeira fase do Exame de Ordem Unificado (OAB), cobrindo as edi{\c{c}}{\~o}es de 2010.1 a 2025.2. Este artigo descreve a coleta e a estrutura{\c{c}}{\~a}o dos dados. Al{\'e}m disso, a utilidade do benchmark {\'e} demonstrada atrav{\'e}s da avalia{\c{c}}{\~a}o do modelo fundacional Qwen3-8B e de uma vers{\~a}o ajustada. O modelo especializado obteve 64,84{\%} de acur{\'a}cia (59/91), superando os 51,65{\%} (47/91) do modelo base. O benchmark oferece um recurso direto para avaliar sistemas de Intelig{\^e}ncia Artificial nessa sub{\'a}rea do Direito."
}<?xml version="1.0" encoding="UTF-8"?>
<modsCollection xmlns="http://www.loc.gov/mods/v3">
<mods ID="mota-etal-2026-oabench">
<titleInfo>
<title>OABench-Consumidor: Um benchmark para avaliação de modelos de linguagem em Direito do Consumidor</title>
</titleInfo>
<name type="personal">
<namePart type="given">Lucas</namePart>
<namePart type="given">B</namePart>
<namePart type="given">Bulcão</namePart>
<namePart type="family">Mota</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Aline</namePart>
<namePart type="family">Athaydes</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Babacar</namePart>
<namePart type="family">Mane</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Daniela</namePart>
<namePart type="given">Barreiro</namePart>
<namePart type="family">Claro</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<originInfo>
<dateIssued>2026-10</dateIssued>
</originInfo>
<typeOfResource>text</typeOfResource>
<relatedItem type="host">
<titleInfo>
<title>Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology</title>
</titleInfo>
<name type="personal">
<namePart type="given">Bryan</namePart>
<namePart type="given">Khelven</namePart>
<namePart type="given">da</namePart>
<namePart type="given">Silva</namePart>
<namePart type="family">Barbosa</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Aline</namePart>
<namePart type="family">Paes</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Ariani</namePart>
<namePart type="given">Di</namePart>
<namePart type="family">Felippo</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<originInfo>
<publisher>Association for Computational Linguistics</publisher>
<place>
<placeTerm type="text">Cuiabá, Mato Grosso, Brazil</placeTerm>
</place>
</originInfo>
<genre authority="marcgt">conference publication</genre>
</relatedItem>
<abstract>Avaliar modelos de linguagem em domínios específicos, como o Direito do Consumidor, é um desafio devido à escassez de recursos padronizados em português brasileiro. Para resolver esse problema, introduzimos o OABench-Consumidor, um benchmark composto exclusivamente por questões de Direito do Consumidor da primeira fase do Exame de Ordem Unificado (OAB), cobrindo as edições de 2010.1 a 2025.2. Este artigo descreve a coleta e a estruturação dos dados. Além disso, a utilidade do benchmark é demonstrada através da avaliação do modelo fundacional Qwen3-8B e de uma versão ajustada. O modelo especializado obteve 64,84% de acurácia (59/91), superando os 51,65% (47/91) do modelo base. O benchmark oferece um recurso direto para avaliar sistemas de Inteligência Artificial nessa subárea do Direito.</abstract>
<identifier type="citekey">mota-etal-2026-oabench</identifier>
<identifier type="doi">10.5753/stil.2026.29871</identifier>
<location>
<url>https://aclanthology.org/2026.stil-1.51/</url>
</location>
<part>
<date>2026-10</date>
<extent unit="page">
<start>573</start>
<end>577</end>
</extent>
</part>
</mods>
</modsCollection>
%0 Conference Proceedings
%T OABench-Consumidor: Um benchmark para avaliação de modelos de linguagem em Direito do Consumidor
%A Mota, Lucas B. Bulcão
%A Athaydes, Aline
%A Mane, Babacar
%A Claro, Daniela Barreiro
%Y Barbosa, Bryan Khelven da Silva
%Y Paes, Aline
%Y Felippo, Ariani Di
%S Proceedings of the 17th Brazilian Symposium in Information and Human Language Technology
%D 2026
%8 October
%I Association for Computational Linguistics
%C Cuiabá, Mato Grosso, Brazil
%F mota-etal-2026-oabench
%X Avaliar modelos de linguagem em domínios específicos, como o Direito do Consumidor, é um desafio devido à escassez de recursos padronizados em português brasileiro. Para resolver esse problema, introduzimos o OABench-Consumidor, um benchmark composto exclusivamente por questões de Direito do Consumidor da primeira fase do Exame de Ordem Unificado (OAB), cobrindo as edições de 2010.1 a 2025.2. Este artigo descreve a coleta e a estruturação dos dados. Além disso, a utilidade do benchmark é demonstrada através da avaliação do modelo fundacional Qwen3-8B e de uma versão ajustada. O modelo especializado obteve 64,84% de acurácia (59/91), superando os 51,65% (47/91) do modelo base. O benchmark oferece um recurso direto para avaliar sistemas de Inteligência Artificial nessa subárea do Direito.
%R 10.5753/stil.2026.29871
%U https://aclanthology.org/2026.stil-1.51/
%U https://doi.org/10.5753/stil.2026.29871
%P 573-577
Markdown (Informal)
[OABench-Consumidor: Um benchmark para avaliação de modelos de linguagem em Direito do Consumidor](https://aclanthology.org/2026.stil-1.51/) (Mota et al., STIL 2026)
ACL