Planification et apprentissage par renforcement avec modèles d'actions compacts

Boris Lesner 1, 2
2 Equipe Hultech - Laboratoire GREYC - UMR6072
GREYC - Groupe de Recherche en Informatique, Image, Automatique et Instrumentation de Caen
Résumé : Nous étudions les Processus de Décision Markoviens représentés de manière compacte via des langages de définition d'actions basés sur le langage STRIPS Probabiliste. Une première partie de ce travail traite de la résolution de ces processus de manière compacte. Pour cela nous proposons deux algorithmes. Un premier, basé sur la manipulation de formules propositionnelles, permet de résoudre de manière approchée les problèmes dans des fragments propositionnels traitables du type Horn ou 2-CNF. Le second algorithme quant à lui résout efficacement et de manière exacte les problèmes représentés en PDDL probabiliste via l'introduction d'une notion de fonction de valeur d'action étendue. La seconde partie concerne l'apprentissage de ces modèles d'actions. Nous proposons différentes méthodes pour résoudre le problème de l'ambiguïté des observations qui à lieu de lors de l'apprentissage. Une première méthode heuristique basée sur la programmation linéaire donne de bons résultats en pratique, mais sans garanties théoriques. Par la suite nous décrivons une méthode d'apprentissage dans le cadre "Knows What It Knows". Cette approche donne quant à elle des garanties théoriques sur la qualité des modèles d'actions appris ainsi que sur le nombre d'exemples requis pour obtenir un modèle d'actions correct. Ces deux approches sont ensuite incorporées dans un cadre d'apprentissage par renforcement pour une évaluation en pratique de leur performances
Type de document :
Thèse
Apprentissage [cs.LG]. université de caen, 2011. Français
Liste complète des métadonnées

Littérature citée [73 références]  Voir  Masquer  Télécharger

https://hal.archives-ouvertes.fr/tel-01076437
Contributeur : Greyc Référent <>
Soumis le : mercredi 22 octobre 2014 - 10:58:16
Dernière modification le : mardi 5 février 2019 - 12:12:40
Document(s) archivé(s) le : vendredi 23 janvier 2015 - 10:30:30

Identifiants

  • HAL Id : tel-01076437, version 1

Citation

Boris Lesner. Planification et apprentissage par renforcement avec modèles d'actions compacts. Apprentissage [cs.LG]. université de caen, 2011. Français. 〈tel-01076437〉

Partager

Métriques

Consultations de la notice

378

Téléchargements de fichiers

180