Algorithmes prédictifs, la nouvelle boule de cristal

Description du podcast :
durée : 00:59:21 - La méthode scientifique - par : Nicolas Martin - Comment passe-t-on des données aux modèles prédictifs ? Comment fonctionnent-ils ? Comment est mis en place le score de risque? Comment établit-on le type de données nécessaires pour la mise en place de ces algorithmes ? Sont-ils tous fiables ? - réalisé par : Elisabeth Miro

Transcription du podcast :
c'est l'heure de la méthode scientifique et c'est évidemment avec vos Nicolas Martin bonjour Matthieu Garrigou-Lagrange et à demain à demain si je vous dis que Google il y a une dizaine d'années arrive et après voir assez finement les épidémie de grippe et même de les anticiper légèrement en fonction des requêtes lancer dans son moteur de recherche c'est une chose si je vous dis maintenant que le même google vient de dévoiler un nouvel algorithme qui permet de définir avec précision les risques pour un patient hospitalisé de décéder que les algorithme prédictif sont largement utilisé par la justice américaine pour évaluer les risques de récidive d'un prisonnier ou encore qu'un pour nouvel algorithme arrive à anticiper ce que vous êtes sur le point de cuisiner juste en observant nouveau mouvement dans la cuisine alors peut-être les machines sont-elles en train d'apprendre à voir dans le futur Toulouse un algorithme prédictif la nouvelle boule de cristal c'est le sujet qui va nous occuper dans l'heure qui vient bienvenue sur la méthode scientifique pour hier dans sept boules de cristal informatique ne de Madame Irma du jour son claire Mathieu bonjour vous êtes directrice de recherche Cédric aiguilles Payet bonjour Nicolas vous êtes chercheur laboratoire analyse de données et intelligence des systèmes du CEA vous pouvez le suivre comme tous les jours sur les ongles de France Culture et en parallèle sur notre fille Twitter en vous abonnant compte est la méthode FC alors on va commencer par quelque chose de très simple finalement Cédric qu'est-ce que c'est qu'un algorithme prédictif qu'est-ce qu'on appelle un algorithme prédictif alors activement algorithme prédictif je pense que c'est important de définir qu'est-ce qu'on entend par prédiction parce que on trouve déjà une confusion entre l'anglais le français historiquement la prévision c'est pour le futur donc on fait une affaire à une opération un moment donné envie de prévoir ce qui va se passer à horizon un horizon certains ce qui rend les choses un petit peu complexe c'est que en anglais on appelle predict et par exemple même les modèles météo les autres météo qui sont les heures traduction en anglais donc on utilise le mot te dire aussi en anglais donc on va on va dire que la prévision c'est pour le futur la prédiction c'est pour un terme plus général pour le présent et tout ce qui pour le présent immédiat en quelques sortes comment est-ce que vous le dernier avec vos terme Klein Mathieu cet algorithme prédictif je pense que je vais le définir un exemple si c'est tous les jours je sors de chez moi pour aller prendre les transports pour aller travailler à 18h du matin et bien ma voisine c'est que demain elle s'attend me voir passer à cette heure-là donc elle a piqué son algorithme personnel et elle se prévoir quand je vais passer devant chez elles ont voté boule de cristal Madame Irma on va deviner le futur un peu Minority Report en imaginant que d'un seul coup les machines pour anticiper sur l'avenir se sont en fait des mécaniques assez simple que l'on retrouve partout dans nos pratiques numériques un algorithme prédictif c'est ce qui fait que quand je rentre des premières lettres dans un moteur de recherche et bien le moteur de recherche qui est l'Abbé devoir partir à 8h du matin pour aller au travail va dire ah bah il va plutôt chercher le bus que chercher un hélicoptère en fait c'est quelque chose comme ça c'est Google Play et voilà c'est ça qui rend aussi les choses un peu complexe et que sous aujourd'hui il est temps qu'on utilise couramment comme l'intelligence artificielle la prévision la prédiction les algorithmes c'est à chaque fois à peu près toujours les mêmes alors les modes récentes Val que le Deep learning est pris un petit peu le dessus sur tout un tas de la Floride parce que il résout des tâches qui sont proches de ce qu'on fait nous avec la vision leçon exetera donc cet algorithme on parle un petit peu plus aujourd'hui mais finalement il y a tout un tas de algorithme qui sont des algorithmes de machine learning qui sont une classe de méthode beaucoup plus large et puis en x et la princesse profond machine learning c'est l'apprentissage assister à l'apprentissage oui j'ai faim je voulais voir définir si vous voulez moi je dis planning une méthode pour faire du machine-learning donc il y a des méthodes qui existait pas il y a très longtemps il y a des métaux qui existait depuis très longtemps par exemple quand quant au 18e au 17e siècle les astronomes avez envie de comprendre les positions des désastres autour de autour de la Terre il prenait le il prenait ce qu'ils observé dans le dans l'histoire et diviser les séries de Fourier pour décomposer le mouvement et à partir de ça ils ont déduisez ce qui va se passer dans le futur donc ça c'est des prévisions c'est de l'algorithme enfin c'est une démarche algorithmique donc on a une démarche algorithme effectivement d'un point de vue mathématique on met en entrée à 62 variables alors suivant les domaines on appelle ça des variables des caractéristiques en anglais des features et cette fonction mathématique elle va elle va donner une sortie voilà dans conduit informatique on parle d'un gorille parce que comment on arrive de l'entrée à la sortie passer par une succession l'instruction qui passe de l'entrée à la sortie DCC cc algorithme prédictif se sont en fait on pourrait le dire d'une autre façon je parle évidemment sur votre contrôle à l'un à l'autre ce sont des algorithmes disons d'optimisation mais avec une visée particulière on essaye d'anticiper un peu de comprendre de de de Dédé d'assister de coller au plus proche d'eux en tête cependant il y a une partie des techniques qui se font indépendamment du résultat par exemple dans certaines méthodes avec des réseaux de neurones profonds on peut commencer par faire de la compression des données et cela peut être une aide indépendamment de ce qu'après on veut en faire ça se fait ça se fait quand il y a un enfant qui regarde un peu âgées qui fait un dessin il extrait naturellement des informations au complexe à quel doigt devant lui devant le VUL quelques informations synthétique qui représente qui est important dans ce qu'il voit donc le idéalement la première partie d'un tel réseau de neurones commencerai par prendre les données et en extraire ce qui est important faire de la traction sans même savoir a priori ce à quoi ça servira également pour avant de dogue de comprendre un peu ce qu'elle quel temps sont les usagers comment ils se sont répondu parce qu'encore une fois c'est algorithme prédictif on peut prendre fin si on peut prendre un exemple tu m'aimes avant de comprendre comment ça fonctionne un exemple dans l'actualité immédiate on en parle et il y a pas très très longtemps ici aujourd'hui on a effectué sur des centaines de milliers de simulation avec un certain nombre de paramètres statistiques qui nous donne par exemple aujourd'hui à je crois un peu plus de 17 % l'Espagne 18 % vainqueur de la de la de la Coupe du monde de football c'est un algorithme prédictif des facto Cédric tout à fait alarme dans l'exemple du football et de la Coupe du Monde effectivement ce qu'on va faire ce que vous faire les gens qui utilisent les algorithme prédictif pour avoir le vainqueur de la Coupe du monde sait que on va déjà se ramener à match par match qu'est-ce qui se passe donc on va prendre l'historique de ce qui s'est passé équipe contre équipe si par exemple dans la poule je me souviens plus des poules mais peu importe un peu importe équipe à contre équipe B on va prendre l'historique de des parties qu'on était jouer on va regarder d'abord statistiquement est-ce que il y a un billet c'est-à-dire le Brésil gagne toujours contre tes l'autre équipe donc ça c'est une première informations qui peut être qui peut être une entrée de l'algorithme ensuite on va chercher ajouter d'autres informations dans les algorithmes de manière à rendre les choses plus précise si par exemple quand on quand on s'aperçoit que quand il fait quand il fait 30 degrés finalement ce soir-là qui est le Brésil va toujours gagner il y a un petit peu il a un petit peu moins un petit peu moins vrai passer une variable qui peut être intéressantes à mettre dans le modèle donc on va petit à petit comme ça essayé d'ajouter des autres variable invariable sur le temps sur l'état de santé des joueurs des variables sur l'heure à laquelle le match de foot a été joué et au fur et à mesure comme ça on va on va agrémenter notre modèle on va lui ajouter des variables d'entrée et on va essayer d'entraîner l'algorithme de manière à ce que étant donné les variables de aujourd'hui à 16h est-ce qu'on est-ce qu'on est capable de donner les probabilités de tel ou tel équipe qui gagne ensuite on fait ça évidemment match par match en fait des centaines de simulation comme ça qu'on m'appelle des simulation Monte-Carlo en fait des centaines jeux simulation et on arrive à la fin avec certaines probabilité que va l'équipe as passé de l'ensemble des lances dans l'ensemble des stade de la compétition l'occurrence l'Espagne à 18 % devant l'Allemagne le Brésil la France pour cette coupe du monde selon un des modèles testé par uniassur sur un peu sur environ 100000 simulations look avec effectivement beaucoup de paramètres en fait si on résume un peu et c'est intéressant de voir ce que je me décrire Cédric Gouy pailler les briques de ces algorithme prédictif on a trois temps on a un temps où on accumule les donner les joueurs exetera exetera deuxième tour on modélise les relations statistiques en fonction de ses données et dans un troisième temps on exploite et on déduit de cela un modèle prédictif qui va du coup insérer la variable qu'on est en train d'essayer de chercher après dire cc est-ce que est-ce que je résume correctement les choses selon vous aucun métier à trouver les paramètres avoir suffisamment de données il est essentiel je me rappelle qu'il y a une une trentaine d'années j'avais une jeune collègue là où j'étais alors qu'il devait prédire elle était une partie son travail c'était pour prédire le niveau de pollution dans la ville à chaque jour pour le lendemain et elle a percé temps de donner en particulier les données météo mais elle a donné qu'elle n'avait pas c'était le le le taux d'émission des raffineries voisine et elle avait demandé et les raffineries avait répondu non vous n'avez pas besoin de ça parce que c'est pas une information pertinente et du coup et bien l'avait trouvée après des mois de recherches que la meilleure prédiction c'était de dire que le taux de pollution le lendemain du jour J c'était la même chose que je revis effectivement j'aimerais avoir examiné III à deux grands champs AOC Agon rythme prédictif sont déjà assez largement utilisée puis pose insert 32 questions va parler du champ judiciaire et du champ médical mais avant j'aimerais j'aimerais un peu votre réaction à cette annonce assez récente s'est présenté ça a été présenté son des Red Lake je te présente épargne équipe de l'équipe de liberté de Bonn en Allemagne le 13 juin dernier CD qui parle d'une machine voyante j'utilise le mot voyante parce que cet cet algorithme arrive d'eau arrive à anticiper à partir de l'analyse de quelques secondes des débuts d'une séquence vidéo ce qui va se produire par la suite et quand on montera cet algorithme une vidéo par exemple de quinté en train de faire des rédactions type préparer à manger préparer un petit déjeuner et bien avec un taux de réussite à s'élever jusqu'à 60,70 % cet algorithme arrive à inférer la suite de ce qui va se passer à partir demander quelque première seconde de l'analyse de la vidéo que que que faut-il en penser Cédric de payer plusieurs plusieurs remarques que ça veut dire qu'il faut que les séances les séquences vidéos soit assez déterministe c'est-à-dire que la machine elle a probablement du deep learning probablement ce qu'on appelle des modèles de séquence en fait ta dire dans lequel on va on va rentrer dans l'entrée du deep learning une séquence petit à petit et on va faire apprendre au réseau à prédire la suite donc cet aspect là c'est pas apparu avec le Deep learning quand on quand on prend les séries économique historique économétrique exemple en finance on a toujours chercher à faire ça te dire on a le cours de l'action jusqu'à aujourd'hui 16h on a envie de savoir entre 16h et 17h30 par exemple comment ça va se terminer comment on utilise des modèles qui sont beaucoup plus simple qui sont des modèles en finance pas toujours très simple pas toujours très simple mais qui sont pas du deep learning ils ont qu'ils sont un petit peu un petit peu moins riche en paramètre aujourd'hui ce qu'est un petit peu nouveau quand même c'est qu'avec le Deep learning on est capable de faire ça sur des images naturelles et c'est ça qui est nouveau c'est que l'entrée est devenue la richesse de l'entrée devenu gérable par des algorithmes qui sont dus deep learning et donc on est capable de quand on donne en entrée des images de savoir ce que la machine va s'attendre à voir dans la suite ce qui serait intéressant de savoir sur sur ça c'est combien de combien d'heures de film il a fallu utiliser pour qu'elle apprenne à faire ça ça ça je suis là je suis sur la publication là ça me dit pas combien d'heures de film elle dit pas combien il voit la finale va le dire que finalement aussi peut-être que dans les dans les selles films au cinéma il y a un certain déterminisme dans les dans les scènes et que c'est ce déterminisme qui a été utilisé par les machines votre opinion sur 7 sur ce cas très très particulier avec la Mathieu oui je suis d'accord qu'il y a une question de complexité de quantité de données d'entrée qui sont nécessaires pour calculer la bonne sortie en fait il y a un théorème d'approximation universelle qui dit que pour tout pour toute fonction continue si vous avez suffisamment de données d'entrée vous pourrez approximer avec juste une couche caché à Epsilon près n'importe quelle fonction de sortie mais le la taille de l'entrée dépend de la fonction de vous chercher à proximité donc peut-être qu'il si il arrive il se débrouille assez bien parce que ils ont une quantité énorme d'entrée

Commentaires

Posts les plus consultés de ce blog

Grand entretien avec le mathématicien Alain Connes

Femmes de science : marche à l’ombre

Univers multiples, rivages et réseaux sociaux