@inproceedings{munoz-guillena-etal-2026-safewords,
title = "{SAFEWORD}s: un marco reproducible para anonimizaci{\'o}n conforme al {RGPD} y evaluaci{\'o}n de generaci{\'o}n en lenguas cooficiales",
author = "Mu{\~n}oz Guillena, Rafael and
Palomar, Manuel and
Lloret, Elena and
Fern{\'a}ndez, Nuria",
editor = "Claramunt, German Rigau and
Gamallo, Pablo and
Mu{\~n}oz Guillena, Rafael and
Chiruzzo, Luis and
Mart{\'i}nez C{\'a}mara, Eugenio",
booktitle = "Proceedings of {LANLP}: Bridging {I}bero and {L}atin {A}merican {NLP} Communities",
month = may,
year = "2026",
address = "Palma, Mallorca (Spain)",
publisher = "ELRA Language Resources Association (ELRA)",
url = "https://aclanthology.org/2026.lanlp-1.7/",
doi = "10.63317/2xng4qqke9oy",
pages = "46--54",
abstract = {Los Grandes Modelos de Lenguaje (LLMs) abren oportunidades para el Procesamiento del Lenguaje Natural (PLN) en contextos institucionales, si bien plantean riesgos cr{\'i}ticos en entornos regulados y multiling{\"u}es, especialmente en lo relativo a protecci{\'o}n de datos personales, trazabilidad de decisiones y equidad entre lenguas con distinta disponibilidad de recursos. Presentamos SAFEWORDs, proyecto que acaba de iniciarse en el marco del proyecto coordinado ``HumanAIze'' (Plan Nacional de Inteligencia Artificial 2025, Espa{\~n}a), que propone un marco reproducible de privacy-by-design y ethics-by-design para la evaluaci{\'o}n y alineaci{\'o}n de LLMs en las lenguas oficiales de la Pen{\'i}nsula Ib{\'e}rica (espa{\~n}ol, catal{\'a}n, valenciano, gallego y euskera). El marco integra: (i) anonimizaci{\'o}n autom{\'a}tica conforme al RGPD, con protocolos expl{\'i}citos de detecci{\'o}n de fuga residual y verificaci{\'o}n adversarial; (ii) transformaci{\'o}n orientada a la accesibilidad textual y al lenguaje claro; y (iii) evaluaci{\'o}n en el dominio biom{\'e}dico, donde la sensibilidad de los datos y la precisi{\'o}n terminol{\'o}gica exigen mecanismos adicionales de control generativo. Desde el punto de vista metodol{\'o}gico, se comparan configuraciones zero-shot y few-shot, y se documentan prompts, hiperpar{\'a}metros y recursos para facilitar la replicabilidad y la gobernanza de recursos. Adem{\'a}s de sintetizar resultados de referencia de la literatura para contextualizar m{\'e}tricas y {\'o}rdenes de magnitud esperables, el trabajo discute implicaciones {\'e}ticas y limitaciones del enfoque propuesto. La propuesta se alinea con las l{\'i}neas de trabajo de SEPLN y con los objetivos de LANLP, al establecer protocolos transferibles para el desarrollo de tecnolog{\'i}as ling{\"u}{\'i}sticas confiables en ecosistemas caracterizados por variaci{\'o}n dialectal y lenguas infrarepresentadas.}
}<?xml version="1.0" encoding="UTF-8"?>
<modsCollection xmlns="http://www.loc.gov/mods/v3">
<mods ID="munoz-guillena-etal-2026-safewords">
<titleInfo>
<title>SAFEWORDs: un marco reproducible para anonimización conforme al RGPD y evaluación de generación en lenguas cooficiales</title>
</titleInfo>
<name type="personal">
<namePart type="given">Rafael</namePart>
<namePart type="family">Muñoz Guillena</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Manuel</namePart>
<namePart type="family">Palomar</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Elena</namePart>
<namePart type="family">Lloret</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Nuria</namePart>
<namePart type="family">Fernández</namePart>
<role>
<roleTerm authority="marcrelator" type="text">author</roleTerm>
</role>
</name>
<originInfo>
<dateIssued>2026-05</dateIssued>
</originInfo>
<typeOfResource>text</typeOfResource>
<relatedItem type="host">
<titleInfo>
<title>Proceedings of LANLP: Bridging Ibero and Latin American NLP Communities</title>
</titleInfo>
<name type="personal">
<namePart type="given">German</namePart>
<namePart type="given">Rigau</namePart>
<namePart type="family">Claramunt</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Pablo</namePart>
<namePart type="family">Gamallo</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Rafael</namePart>
<namePart type="family">Muñoz Guillena</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Luis</namePart>
<namePart type="family">Chiruzzo</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<name type="personal">
<namePart type="given">Eugenio</namePart>
<namePart type="family">Martínez Cámara</namePart>
<role>
<roleTerm authority="marcrelator" type="text">editor</roleTerm>
</role>
</name>
<originInfo>
<publisher>ELRA Language Resources Association (ELRA)</publisher>
<place>
<placeTerm type="text">Palma, Mallorca (Spain)</placeTerm>
</place>
</originInfo>
<genre authority="marcgt">conference publication</genre>
</relatedItem>
<abstract>Los Grandes Modelos de Lenguaje (LLMs) abren oportunidades para el Procesamiento del Lenguaje Natural (PLN) en contextos institucionales, si bien plantean riesgos críticos en entornos regulados y multilingües, especialmente en lo relativo a protección de datos personales, trazabilidad de decisiones y equidad entre lenguas con distinta disponibilidad de recursos. Presentamos SAFEWORDs, proyecto que acaba de iniciarse en el marco del proyecto coordinado “HumanAIze” (Plan Nacional de Inteligencia Artificial 2025, España), que propone un marco reproducible de privacy-by-design y ethics-by-design para la evaluación y alineación de LLMs en las lenguas oficiales de la Península Ibérica (español, catalán, valenciano, gallego y euskera). El marco integra: (i) anonimización automática conforme al RGPD, con protocolos explícitos de detección de fuga residual y verificación adversarial; (ii) transformación orientada a la accesibilidad textual y al lenguaje claro; y (iii) evaluación en el dominio biomédico, donde la sensibilidad de los datos y la precisión terminológica exigen mecanismos adicionales de control generativo. Desde el punto de vista metodológico, se comparan configuraciones zero-shot y few-shot, y se documentan prompts, hiperparámetros y recursos para facilitar la replicabilidad y la gobernanza de recursos. Además de sintetizar resultados de referencia de la literatura para contextualizar métricas y órdenes de magnitud esperables, el trabajo discute implicaciones éticas y limitaciones del enfoque propuesto. La propuesta se alinea con las líneas de trabajo de SEPLN y con los objetivos de LANLP, al establecer protocolos transferibles para el desarrollo de tecnologías lingüísticas confiables en ecosistemas caracterizados por variación dialectal y lenguas infrarepresentadas.</abstract>
<identifier type="citekey">munoz-guillena-etal-2026-safewords</identifier>
<identifier type="doi">10.63317/2xng4qqke9oy</identifier>
<location>
<url>https://aclanthology.org/2026.lanlp-1.7/</url>
</location>
<part>
<date>2026-05</date>
<extent unit="page">
<start>46</start>
<end>54</end>
</extent>
</part>
</mods>
</modsCollection>
%0 Conference Proceedings
%T SAFEWORDs: un marco reproducible para anonimización conforme al RGPD y evaluación de generación en lenguas cooficiales
%A Muñoz Guillena, Rafael
%A Palomar, Manuel
%A Lloret, Elena
%A Fernández, Nuria
%Y Claramunt, German Rigau
%Y Gamallo, Pablo
%Y Muñoz Guillena, Rafael
%Y Chiruzzo, Luis
%Y Martínez Cámara, Eugenio
%S Proceedings of LANLP: Bridging Ibero and Latin American NLP Communities
%D 2026
%8 May
%I ELRA Language Resources Association (ELRA)
%C Palma, Mallorca (Spain)
%F munoz-guillena-etal-2026-safewords
%X Los Grandes Modelos de Lenguaje (LLMs) abren oportunidades para el Procesamiento del Lenguaje Natural (PLN) en contextos institucionales, si bien plantean riesgos críticos en entornos regulados y multilingües, especialmente en lo relativo a protección de datos personales, trazabilidad de decisiones y equidad entre lenguas con distinta disponibilidad de recursos. Presentamos SAFEWORDs, proyecto que acaba de iniciarse en el marco del proyecto coordinado “HumanAIze” (Plan Nacional de Inteligencia Artificial 2025, España), que propone un marco reproducible de privacy-by-design y ethics-by-design para la evaluación y alineación de LLMs en las lenguas oficiales de la Península Ibérica (español, catalán, valenciano, gallego y euskera). El marco integra: (i) anonimización automática conforme al RGPD, con protocolos explícitos de detección de fuga residual y verificación adversarial; (ii) transformación orientada a la accesibilidad textual y al lenguaje claro; y (iii) evaluación en el dominio biomédico, donde la sensibilidad de los datos y la precisión terminológica exigen mecanismos adicionales de control generativo. Desde el punto de vista metodológico, se comparan configuraciones zero-shot y few-shot, y se documentan prompts, hiperparámetros y recursos para facilitar la replicabilidad y la gobernanza de recursos. Además de sintetizar resultados de referencia de la literatura para contextualizar métricas y órdenes de magnitud esperables, el trabajo discute implicaciones éticas y limitaciones del enfoque propuesto. La propuesta se alinea con las líneas de trabajo de SEPLN y con los objetivos de LANLP, al establecer protocolos transferibles para el desarrollo de tecnologías lingüísticas confiables en ecosistemas caracterizados por variación dialectal y lenguas infrarepresentadas.
%R 10.63317/2xng4qqke9oy
%U https://aclanthology.org/2026.lanlp-1.7/
%U https://doi.org/10.63317/2xng4qqke9oy
%P 46-54
Markdown (Informal)
[SAFEWORDs: un marco reproducible para anonimización conforme al RGPD y evaluación de generación en lenguas cooficiales](https://aclanthology.org/2026.lanlp-1.7/) (Muñoz Guillena et al., LANLP 2026)
ACL