Modèle probabiliste pour l'extraction de structures dans les documents Web

Résumé : Le développement des systèmes de gestion de contenu a profondément changé la nature du web : de plus en plus de documents sont créés automatiquement et leur mise en page reflète leur structure logique. Dans ce travail, nous montrons que l’information contenue dans la mise en page est suffisante pour inférer une structure sémantiquement riche, ce qui ouvre la voie à de nombreuses applications. Le passage d’une information de mise en page à une structure sémantique se heurte à deux principaux obstacles : l’hétérogénéité des données et le caractère implicite de la structure des documents web. Nous décrivons un modèle stochastique capable d’apprendre à transformer des documents semi-structurés vers un schéma défini a priori et présentons une instance particulière de ce modèle adaptée à la transformation de documents hétérogènes HTML en XML.
Document type :
Journal articles
Complete list of metadatas

https://hal.archives-ouvertes.fr/hal-01172407
Contributor : Lip6 Publications <>
Submitted on : Tuesday, July 7, 2015 - 1:37:44 PM
Last modification on : Thursday, March 21, 2019 - 1:12:12 PM

Links full text

Identifiers

Citation

Guillaume Wisniewski, Francis Maes, Ludovic Denoyer, Patrick Gallinari. Modèle probabiliste pour l'extraction de structures dans les documents Web. Revue des Sciences et Technologies de l'Information - Série Document Numérique, Lavoisier, 2007, 10 (1), pp.89-107. ⟨10.3166/dn.10.89-107⟩. ⟨hal-01172407⟩

Share

Metrics

Record views

167