jeudi 6 octobre 2011

Présentation du 4 novembre 2011 Ranking binaire et agrégation pour le cas multi-classes

Lieu : ENGREF
Salle amphi 7 RdC
12h30-13h30
Vendredi 4 novembre 2011

Sylvain Robbiano
Télécom Paristech


"Ranking binaire et agrégation pour le cas multi-classes"

"Dans de nombreuses applications, il ne s’agit pas seulement de classer les observations (‘ pertinent’ vs. ‘ non
pertinent’), mais de les ranger/ordonner de façon adéquate (par degré de pertinence). Des travaux relatifs à la formulation et à la résolution du problème de scoring/ranking ont été réalisés sur le modèle des méthodes utilisées en Machine Learning pour résoudre les problèmes de classification (Arbres de décision, Support Vector Machines, Boosting).
Dans cet exposé, on se focalisera sur l'algorithme TreeRank, qui consiste à approcher la courbe ROC optimale via un algorithme récurcif, puis on mettra en oeuvre une méthode d'agrégation d'ordres, basée sur la distance du tau de Kendall, pour résoudre le problème du ranking multi-classes."



Article de Sylvain Robbiano

dimanche 15 mai 2011

Présentation du 10/06/2011 reinforcement learning et problème des bandits bornés

Date : vendredi 10/06/2011
Lieu :
ENGREF
19 avenue du Maine
75732 PARIS
Métro : Montparnasse, Falguière
Amphi 7



L'algorithme KL-UCB pour les bandits bornés, et au delà

par Aurélien Garivier (CNRS, Enst)

Résumé :
L'apprentissage par renforcement se distingue des autres théories
d'apprentissage statistique en qu'il place en son coeur la dimension
temporelle, mais aussi interactive, du phénomène d'apprentissage. Les
modèles les plus simples qui s'y rattachent sont communément appelés
"problèmes de bandits" : un agent, faisant face à une collection de
machines à sous plus ou moins avantageuses, doit à chaque instant
choisir l'une d'elle et reçoit une récompense en conséquence - avec pour
objectif de maximiser la somme des récompenses reçues. Derrière cette
mise en situation un peu baroque, on devine sans peine une grande
variété de motivations pratiques, des essais cliniques au routage de
paquets sur internet.
Parmi les stratégies proposées en apprentissage par renforcement, on
distingue les algorithmes optimistes : ils agissent à chaque instant
comme s'ils se trouvaient dans l'environnement le plus favorable pour
eux parmi tous ceux qui rendent les observations passées suffisamment
vraisemblables. Nous verrons comme le paradigme optimiste peut être mis
en oeuvre efficacement et simplement ici, et comment l'algorithme
KL-UCB, en introduisant une notion de divergence sur l'espace des
récompenses adaptée au problème, conduit à des résultats
significativement meilleurs que ses concurrents.

Basé sur l'article :
The KL-UCB Algorithm for Bounded Stochastic Bandits and Beyond
par Aurélien Garivier and Olivier Cappé
http://arxiv.org/abs/1102.2490


lundi 11 avril 2011

Présentations Jeudi 12 mai 2011 : Random Forests et conjoncture économique

Deux présentations pour le jeudi 12 mai :


Date : jeudi 12/05/2011
Lieu :
ENGREF
19 avenue du Maine
75732 PARIS
Métro : Montparnasse, Falguière
Salle 208

########################################
"Random forests / Forêts aléatoires"
Gérard Biau (Université Pierre et Marie Curie)


et


"Euro area GDP forecasting using large survey datasets: a Random Forest approach"
Olivier Biau (Commission Européenne)

#####Lieu


#####Résumés
Titre : Random forests / Forêts aléatoires

Résumé : Random forests are a scheme proposed by Leo Breiman in the 00's for building a predictor ensemble with a set of decision trees that grow in randomly selected subspaces of data. Despite growing interest and practical use, there has been little exploration of the statistical properties of random forests, and little is known about the mathematical forces driving the algorithm. In this talk, we will discuss an in-depth analysis of a random forests model suggested by Breiman in 2004, which is very close to the original algorithm. We show in particular that the procedure is consistent and adapts to sparsity, in the sense that its rate of convergence depends only on the number of strong features and not on how many noise variables are present.


"Euro area GDP forecasting using large survey datasets: a Random Forest approach"

Résumé: This paper investigates the potential of applying the Random Forests technique to modelling and forecasting macro-economic aggregates using large datasets of survey variables, in the same vein as Biau, Biau and Rouvière (2007). A specific application for short-term GDP forecasting in the euroarea is shown using the harmonised European Union Business and Consumer Survey dataset. The Random Forests technique is explored with two aims in mind: the first is to obtain (through a Monte Carlo exercise) a preliminary non-parametric forecast of GDP growth, and the second is to analyse a number of candidate explanatory variables to distinguish between those which significantly contribute to explaining and predicting the analysed phenomenon and those which mostly add random noise. The forecast performance of this survey-based model is assessed with an out-of-sample exercise (using vintage data): the results are compared both with the outputs from an auto-regressive model (taken as benchmark) and with the quarterly projections of the euro zone economic outlook (jointly released by three major European economic institutes: the German IFO, the French INSEE and the Italian ISAE), which are deemed to be among the most reliable forecasts. Evidence is found that a well-performing and parsimonious survey-based model can be specified to forecast GDP quarter-on-quarter growth in the euro area, and that Random Forests is therefore an effective tool for selecting the most relevant predictive variables.



lundi 7 mars 2011

Présentation du vendredi 08/04/2011, prédiction conforme parcimonieuse

Date : vendredi 08/04/2011
Lieu :
ENGREF
19 avenue du Maine
75732 PARIS
Métro : Montparnasse, Falguière
Salle 7


Prédiction conforme parcimonieuse

par Mohamed Hebiri (Université Marne la Vallée)



Résumé :
La prédiction conforme a été introduite par Vovk et al. (Vovk V.,
Gammerman A., et Shafer G. "Algorithmic learning in a random world".
Springer, New York, 2005.) dans le but de construire des intervalles de
confiance en utilisant la notion de conformité entre la nouvelle
observation et celles déjà observées.
Nous étendons ici cette méthode au modèle linéaire multivarié parcimonieux
(seul un petit nombre des variables a une réelle influence sur la variable
de sortie). Notre approche combine la méthodologie de la prédiction
conforme aux méthodes de régularisation parcimonieuse et plus
particulièrement à l'estimateur des moindres carrés pénalisé par la norme
$\ell_1$ des coefficients de régression (LASSO).

lundi 7 février 2011

Présentation du 04/03/2011 : prédiction avec experts, application à la qualité de l'air

Lieu :
ENGREF
19 avenue du Maine
75732 PARIS
Métro : Montparnasse, Falguière
Salle 7

Prédiction avec experts, statistiques déterministes appliquées à la prédiction de la qualité de l'air

par Gilles Stoltz (HEC, CNRS)


mardi 25 janvier 2011

Présentation du 04/02/2011 : prévision traffic passagers (ADP)



Daniel Sallier, Aéroports de Paris

A/ La méthode non économétrique Kenza d'estimation et de prévision à long terme de la demande finale des consommateurs (ici son papier sur le sujet).

Il s'agit de la méthode primaire de prévision du trafic annuel utilisée à ADP.

B/ la prévision probabilisée. Il s'agit de techniques dont partie des travaux de R&D ont été financés par la Commission Européenne qui permettent de déterminer les loi empirique de probabilité année après année des prévisions de trafic. Cette approche est en œuvre également à Aéroports de Paris depuis 2003.

Lieu :
ENGREF
19 avenue du Maine
75732 PARIS
Métro : Montparnasse, Falguière
Salle 7
Horaires : 12h30-14h00








jeudi 16 décembre 2010

Présentation du 21/01/2011 : Méthodes de validation et d'évaluation de prévision en loi

Lieu :
ENGREF
19 avenue du Maine
75732 PARIS
Métro : Montparnasse, Falguière
Salle 7

Méthodes de validation et d'évaluation de prévision en loi

par Jérome Collet (EDF R&D)

Abstract :

De plus en plus souvent, les prévisions sont fournies avec une indication de précision. Il existe même des méthodes permettant une prévision en loi, c'est à dire une estimation de la loi de la variable d'intérêt, conditionnellement au passé. On peut citer sur ce point la régression quantile (Koenker, 1978), les modèles ARCH (Engle, 1985), et plus récemment l'état de l'art de Tay et Wallis en 2000.


La validation et l'évaluation de ce type de prévision pose un certain nombre de problèmes de natures assez variées. En particulier, il ne semble pas y avoir actuellement de consensus sur les qualités que l'on attend d'une prévision en loi. Par ailleurs, certaines questions techniques semblent difficiles.

Télécharger la présentation