Extraction automatique de cadres de sous-catégorisation verbale pour le français à partir d’un corpus arboré

Anna Kupsc


Abstract
Nous présentons une expérience d’extraction automatique des cadres de souscatégorisation pour 1362 verbes français. Nous exploitons un corpus journalistique richement annoté de 15 000 phrases dont nous extrayons 12 510 occurrences verbales. Nous évaluons dans un premier temps l’extraction des cadres basée sur la fonction des arguments, ce qui nous fournit 39 cadres différents avec une moyenne de 1.54 cadres par lemme. Ensuite, nous adoptons une approche mixte (fonction et catégorie syntaxique) qui nous fournit dans un premier temps 925 cadres différents, avec une moyenne de 3.44 cadres par lemme. Plusieurs méthodes de factorisation, neutralisant en particulier les variantes de réalisation avec le passif ou les pronoms clitiques, sont ensuite appliquées et nous permettent d’aboutir à 235 cadres différents avec une moyenne de 1.94 cadres par verbe. Nous comparons brièvement nos résultats avec les travaux existants pour le français et pour l’anglais.
Anthology ID:
2007.jeptalnrecital-poster.15
Volume:
Actes de la 14ème conférence sur le Traitement Automatique des Langues Naturelles. Posters
Month:
June
Year:
2007
Address:
Toulouse, France
Editors:
Nabil Hathout, Philippe Muller
Venue:
JEP/TALN/RECITAL
SIG:
Publisher:
ATALA
Note:
Pages:
153–162
Language:
French
URL:
https://aclanthology.org/2007.jeptalnrecital-poster.15
DOI:
Bibkey:
Cite (ACL):
Anna Kupsc. 2007. Extraction automatique de cadres de sous-catégorisation verbale pour le français à partir d’un corpus arboré. In Actes de la 14ème conférence sur le Traitement Automatique des Langues Naturelles. Posters, pages 153–162, Toulouse, France. ATALA.
Cite (Informal):
Extraction automatique de cadres de sous-catégorisation verbale pour le français à partir d’un corpus arboré (Kupsc, JEP/TALN/RECITAL 2007)
Copy Citation:
PDF:
https://aclanthology.org/2007.jeptalnrecital-poster.15.pdf