Requêtes contrefactuelles sans graphe causal complet : bornes via la programmation linéaire

17 septembre 202614 vues

Les auteurs d'arXiv:2608.24427 proposent d'abandonner l'exigence d'un graphe causal entièrement connu : la requête contrefactuelle elle-même définit, en règle générale, un ordre topologique partiel des variables, et la tâche d'identification se transforme en un programme linéaire. L'approche généralise le cadre de contraintes de Tian et Pearl (2000) et fournit des bornes prouvablement exactes, y compris pour des requêtes contrefactuelles imbriquées, ce que confirme un réexamen d'études de cas connues.

Requêtes contrefactuelles sans graphe causal complet : bornes via la programmation linéaire

Pourquoi un graphe causal est nécessaire — et pourquoi il fait souvent défaut

Les questions contrefactuelles semblent simples : « qu'aurait-il se passé si le patient avait reçu un autre traitement », « comment la demande aurait-elle évolué si nous avions augmenté le prix ». La difficulté réside dans le fait que la réponse ne peut pas être déduite des seules corrélations observées. Il faut un modèle de la manière dont les variables s'influencent mutuellement — c'est-à-dire une structure causale.

La recette classique dans la littérature sur l'identification non paramétrique est la suivante : prenez un graphe causal entièrement spécifié, ajoutez des hypothèses sur la forme des mécanismes — et calculez la quantité d'intérêt ou son intervalle admissible. Cela fonctionne de manière fiable, mais repose sur un luxe que l'analyste ne possède presque jamais. Le domaine est partiellement étudié, certaines relations sont controversées, certaines variables ne sont même pas mesurées. Dans une telle situation, le graphe complet n'est pas un point de départ, mais un idéal inatteignable.

C'est précisément cet écart entre la théorie et la pratique que tentent de combler Eric Rossetto et Alessandro Antonucci dans l'article Partial Identification under Causal Orders by Linear Programming (arXiv:2608.24427). Leur démarche ne consiste pas à « compléter le graphe tant bien que mal », mais à renoncer purement et simplement à l'exigence de l'avoir en entrée.

La requête suggère elle-même la structure

L'observation clé des auteurs peut être formulée ainsi : une requête contrefactuelle n'est pas une question neutre, mais un objet doté d'une logique interne. Lorsque nous demandons « qu'aurait-il se passé si la variable X avait pris la valeur x », nous disposons déjà implicitement les variables dans une certaine relation : l'une précède l'autre, l'une dépend de l'autre, la troisième reste une condition de fond.

Cela se formalise par un ordre topologique. Dans un graphe causal ordinaire, cet ordre est entièrement et univoquement défini : s'il existe une flèche de A vers B, alors A vient avant. Mais pour l'identification, une orderedness complète n'est pas nécessaire. Un ordre partiel suffit — un ensemble de relations « avant » qui ne couvrent pas toutes les paires de variables. Les autres paires restent simplement non ordonnées, et cela ne gêne en rien.

Le résultat central du travail consiste en ce que toute requête contrefactuelle engendre précisément un tel ordre topologique — en général partiel — sur les variables qui y figurent. De plus, cet ordre n'a pas besoin d'être deviné ou introduit manuellement : il est extrait de la formulation même de la question. Le spécialiste du domaine n'a plus à répondre à la question inconfortable « dessinez tout le graphe » ; il suffit d'accepter ce qui découle de la formulation du problème.

De l'ordre à la programmation linéaire

Commence ensuite la partie technique pour laquelle tout cela a été entrepris. La présence d'un ordre permet d'écrire la requête sous une forme paramétrée explicite. Les paramètres ici ne sont pas arbitraires, mais soumis à la structure : ils décrivent les distributions et les mécanismes de manière à être compatibles à la fois avec les données observées et avec l'ordre déduit.

Après cette reparamétrisation, le problème d'identification cesse d'être un problème portant sur des fonctions et se transforme en un problème portant sur des nombres. À savoir — en un programme linéaire : il faut minimiser et maximiser une fonctionnelle linéaire sur un ensemble défini par des contraintes linéaires. Le minimum et le maximum donnent les bornes inférieure et supérieure de la quantité d'intérêt.

Cette transition est précieuse non seulement par son élégance. La programmation linéaire est un domaine bien étudié, doté de solveurs fiables, et la traduction du problème sous cette forme signifie que les bornes peuvent réellement être calculées, et non seulement leur existence démontrée. Le schéma fonctionne pour des requêtes contrefactuelles arbitraires, y compris imbriquées : celles où le scénario hypothétique contient lui-même un autre scénario hypothétique. L'imbrication a toujours été un casse-tête pour les méthodes existantes, car elle exige de faire appel simultanément à plusieurs « couches » du monde.

À quel point les bornes sont étroites

Obtenir certaines bornes n'est pas difficile — la question est de savoir si elles sont utiles. Si l'intervalle couvre presque toute la plage de valeurs imaginable, il n'apporte pas grand-chose.

Les auteurs répondent à cela par une preuve de précision. L'idée de la construction : pour chaque borne, on construit un modèle causal structurel qui l'atteint. Un tel modèle doit être compatible avec deux choses à la fois — avec la distribution observée des données et avec l'ordre que sous-entend la requête. Si le modèle existe, alors la borne n'est pas artificielle : on ne peut pas la déplacer vers l'intérieur sans perdre la cohérence avec l'information disponible. Donc, l'intervalle est aussi étroit qu'il est possible de l'être compte tenu des hypothèses posées.

C'est un changement important dans le statut du résultat. Il ne s'agit pas d'une « estimation grossière au doigt mouillé » ni du fait que « dans le pire des cas, tout est possible ». Il s'agit d'une description honnête de l'incertitude : voici tout ce que l'on peut affirmer, et pas un pas de plus.

Lien avec le cadre classique

Le travail se positionne comme une généralisation de l'approche de Tian et Pearl, proposée en 2000 pour les probabilités de causalité. Ce cadre aussi savait produire des intervalles au lieu d'estimations ponctuelles, mais il était lié à une classe spécifique de quantités et exigeait une structure connue. Le nouveau résultat élargit la classe des requêtes et lève l'exigence de connaître le graphe dans son intégralité. Il est utile de garder cette filiation à l'esprit : nous ne sommes pas face à une invention ex nihilo, mais à une extension soignée de ce qui a déjà été éprouvé par le temps.

Vérification sur des exemples familiers

Pour montrer que la méthode n'est pas exotique, les auteurs reviennent à plusieurs cas analysés dans la littérature antérieure et les font passer par leur procédure. La condition de l'expérience est stricte : le graphe causal n'est pas fourni du tout en entrée. À sa place — uniquement l'ordre qui découle de la formulation de la requête.

Le résultat rapporté par les chercheurs est que les intervalles obtenus restent informatifs. Autrement dit, le renoncement au graphe complet ne transforme pas la conclusion en un « tout est possible » vide de sens. C'est sans doute la conclusion la plus pratique de l'article : le coût de l'ignorance s'avère inférieur à ce que l'on pense généralement.

Ce que cela change pour la pratique

La valeur pratique se résume à quelques points.

  • Le seuil d'entrée s'abaisse. Il n'est pas nécessaire de décrire tout le système dans son intégralité — il suffit d'accepter l'ordre qui est de toute façon sous-entendu par la formulation du problème.
  • L'incertitude devient visible. Au lieu d'une estimation ponctuelle dissimulant des hypothèses arbitraires, l'analyste obtient un intervalle et comprend où passe précisément la limite de ses connaissances.
  • Une base instrumentale apparaît. La réduction à un programme linéaire signifie que le calcul peut être automatisé avec des moyens standards, plutôt que d'écrire un solveur dédié pour chaque classe de requêtes.
  • La classe des questions admissibles s'élargit. Les constructions contrefactuelles imbriquées, qui exigeaient auparavant une théorie séparée, entrent dans le schéma général.

Ce que la méthode ne promet pas

Il convient également de délimiter le cadre. Premièrement, l'ordre partiel doit tout de même être extrait correctement : si une relation de préséance erronée est déduite de la formulation de la requête, la validité des bornes est perdue. Deuxièmement, la largeur de l'intervalle dépend directement de la richesse des données observées et du nombre de relations que l'on a pu fixer : plus l'ordre est clairsemé, plus la réponse est large. La méthode ne remplace pas la connaissance du domaine — elle permet de travailler avec ses fragments au lieu d'un tout absent.

L'article compte 15 pages de texte principal, auxquelles s'ajoutent trois annexes, trois figures et trois tableaux, de sorte que les détails techniques des preuves sont placés hors du corps principal et disponibles séparément. Pour ceux qui pratiquent l'inférence causale sur des données réelles comportant des lacunes dans la description du système, c'est sans doute une nouvelle plus intéressante qu'une énième estimation ponctuelle assortie d'hypothèses non explicitées.

Foire aux questions

Matériaux connexes

Tous matériaux
Requêtes contrefactuelles sans graphe causal complet : bornes via la programmation linéaire