Évaluation intrinsèque et extrinsèque du nettoyage de pages Web - Archive ouverte HAL Accéder directement au contenu
Communication Dans Un Congrès Année : 2015

Intrinsic and extrinsic evaluation of boilerplate removal tool

Évaluation intrinsèque et extrinsèque du nettoyage de pages Web

Résumé

In this article, we tackle the problem of evaluation of web page cleaning tools. This task is seldom studied in the literature although it has consequences on the linguistic processing performed on web-based corpora. We propose two types of evaluation : (I) an intrinsic (content-based) evaluation with measures on words, tags and characters ; (II) an extrinsic (task-based) evaluation on the same corpus by studying the effects of the cleaning step on the performances of an NLP pipeline. We show that the results are not consistent in both evaluations. We show as well that there are important differences in the results between the studied languages. We conclude that the choice of a web page cleaning tool should be made in view of the aimed task rather than on the performances of the tools in an intrinsic evaluation.
Le nettoyage de documents issus du web est une tâche importante pour le TAL en général et pour la constitution de corpus en particulier. Cette phase est peu traitée dans la littérature, pourtant elle n'est pas sans influence sur la qualité des informations extraites des corpus. Nous proposons deux types d'évaluation de cette tâche de détourage : (I) une évaluation intrinsèque fondée sur le contenu en mots, balises et caractères ; (II) une évaluation extrinsèque fondée sur la tâche, en examinant l'effet du détourage des documents sur le système placé en aval de la chaîne de traitement. Nous montrons que les résultats ne sont pas cohérents entre ces deux évaluations ainsi qu'entre les différentes langues. Ainsi, le choix d'un outil de détourage devrait être guidé par la tâche visée plutôt que par la simple évaluation intrinsèque.
Fichier principal
Vignette du fichier
article_court.pdf (202.48 Ko) Télécharger le fichier
Origine : Fichiers produits par l'(les) auteur(s)
Loading...

Dates et versions

hal-01170005 , version 1 (30-06-2015)

Identifiants

  • HAL Id : hal-01170005 , version 1

Citer

Gaël Lejeune, Romain Brixtel, Charlotte Lecluze. Évaluation intrinsèque et extrinsèque du nettoyage de pages Web. Traitement Automatique des Langues Naturelles 2015, Jun 2015, Caen, France. ⟨hal-01170005⟩
299 Consultations
487 Téléchargements

Partager

Gmail Facebook X LinkedIn More