Aller au contenu
UFR Ingémedia
Retour à l’entraînement

Le devin du no-show : ce que l’IA ne doit pas utiliser

Un assistant IA trouve la variable qui « prédit » 82 % des no-shows. Elle n’existe qu’une fois le client arrivé. Vous apprenez à trier ce qu’un modèle a le droit de savoir.

Réf.
atl-09 · atelier 09 sur 18
Niveau
3 · Diagnostiquer
Durée
1 h 30
Format
Groupes de 3 · assistant IA et tableur
Copie jaune · Énoncé

Le devin du no-show : ce que l’IA ne doit pas utiliser

Vous demandez à un assistant IA ce qui annonce un no-show au Café de l’Homme. Il trouve des variables spectaculaires. Votre travail : séparer ce qu’on connaît au moment de la réservation de ce qu’on n’apprend qu’après, et écrire la liste des variables qu’un modèle a le droit d’utiliser.

La demande

Au Café de l’Homme, 93 tables attendues sur 100 viennent. Les autres représentent 12 334 couverts réservés en deux ans : un gisement que la direction veut récupérer (fiche du dossier Café de l’Homme). La direction voudrait un score qui signale, à la réservation, les tables à risque, pour demander une empreinte bancaire ou rappeler le client. Vous avez un extrait de 5 000 réservations anonymes, tirées par classes pour qu’aucune ne soit reconnaissable : reservations-anonymes-extrait.csv.

Colonnes : annee_service, type_jour, service, taille_table, zone_geographique (déduite de l’indicatif du téléphone), hotel, occasion, tranche_delai (entre la création de la réservation et le service), canal, espace (où la table a été placée), statut (honoree, annulee, no_show), prepayee, client_deja_venu, depense_ht.

Votre mission

  1. Le taux de no-show de l’extrait, sur deux dénominateurs : no-shows ÷ (honorées + no-shows), puis no-shows ÷ toutes les réservations. Lequel retenir, et pourquoi ?
  2. Faites calculer par l’assistant (carte-prompt ci-dessous) le taux de no-show selon chaque colonne.
  3. Classez chaque colonne : connue avant la venue (au moment où la réservation est prise), ou connue seulement après le résultat. Pour les colonnes « après », trouvez la preuve dans le fichier.
  4. Écrivez la liste des variables autorisées pour un score de risque, et la règle à donner à l’équipe qui le construira.
  5. Repérez deux pièges plus discrets : une modalité qui contient surtout des clients qui ne peuvent pas faire de no-show, et une variable dont le sens change selon l’issue.

La fuite d’information

Un modèle qui utilise une information connue seulement après le résultat semble excellent sur le passé et ne sert à rien demain. La question à poser à chaque colonne : au moment où le client réserve, est-ce que je la connais ?

Livrable

Un tableau des colonnes (avant ou après, preuve), la liste des variables autorisées avec leur taux de no-show, et un paragraphe de consignes pour l’équipe qui construira le score.

Données

  • reservations-anonymes-extrait.csv5 000 lignes · 683 Ko · CSV, séparateur virgule, point décimal

    Café de l’Homme. Une réservation anonyme par ligne, tirée par classes (k ≥ 10) : année, type de jour, service, taille de table, zone géographique, hôtel, occasion, délai, canal, espace, statut, prépaiement, client déjà venu, dépense HT.

    Données réelles confiées à l’agence Getup, usage pédagogique interne au cours ; ni rediffusion, ni tentative de ré-identification

    Tirage par classes : les proportions sont justes en moyenne, pas à l’unité près.

    Télécharger

Grille d’évaluation

CritèrePoints
Deux taux justes, dénominateur choisi et justifié3
Toutes les colonnes classées avant / après4
Preuves de fuite trouvées dans le fichier (espace, client déjà venu, dépense)5
Liste des variables autorisées, avec leurs taux4
Pièges discrets repérés (walk-ins et zone inconnue, prépaiement)4
Total20 points

Avec un assistant IA

Claude, ChatGPT, Gemini ou Copilot : peu importe l’outil. Copiez la carte, joignez le fichier, puis faites la vérification à la main avant de croire la réponse. N’y collez jamais de données personnelles de vrais clients.

  1. Faire calculer le no-show par colonne

    Je joins reservations-anonymes-extrait.csv : 5 000 réservations anonymes d’un restaurant. Colonnes : annee_service, type_jour, service, taille_table, zone_geographique, hotel, occasion, tranche_delai, canal, espace, statut (honoree, annulee, no_show), prepayee, client_deja_venu, depense_ht. Définition : taux de no-show = no_show / (honoree + no_show). Les annulations ne sont pas au dénominateur. Tâche : 1. Comptez les réservations par statut et donnez le taux de no-show global. 2. Pour chaque colonne sauf depense_ht, donnez par modalité : nombre de lignes, nombre de no-shows, taux de no-show. 3. Pour client_deja_venu et depense_ht, comptez les cases vides par statut. Format : un tableau par colonne, une décimale. Ne dites pas quelles variables sont « les meilleures ».

    Vérification à la main

    Contrôlez à la main deux nombres : 244 no-shows au total, et le nombre de réservations prépayées (597). Puis filtrez les no-shows : si l’assistant ne remarque pas que client_deja_venu et depense_ht sont vides pour tous, il n’a pas regardé les cases vides.

Correction sur le feuillet rose, réservée à l’enseignant. Elle sera commentée en séance.