Ce qu'une comparaison de représentations établit, et ce qu'elle ne peut pas encore établir : preuve préenregistrée à degrés de liberté effectifs appariés
Le volet précédent de cette série se refermait sur un principe de design : avant d’attribuer un effet à un format, apparier la complexité, faute de quoi on appelle géométrie ce qui n’était que du lissage. Celui-ci exécute l’expérience que le principe exige, et l’expérience refuse de rendre la réponse confortable. À degrés de liberté effectifs appariés, les différences entre transformations représentationnelles ne disparaissent pas. Elles se réduisent, elles se réorganisent par régime, et elles subsistent.
Le résultat se comprime en une double non-implication. L’égalité des degrés de liberté effectifs n’implique ni l’égalité des classes fonctionnelles accessibles, ni l’égalité des biais. Deux pipelines dotés exactement du même budget de souplesse peuvent opérer sur des classes fonctionnelles différentes et conserver des performances différentes d’estimation du même estimand causal. La conséquence méthodologique est étroite et mérite d’être énoncée sans inflation : apparier la complexité globale élimine une explication concurrente, une différence de budget global de capacité, et celle-là seulement. Cela n’identifie pas ce qui reste.
Deux questions sont couramment confondues dans la littérature sur la comparaison de représentations, et cette confusion explique une bonne part des désaccords. Quel pipeline fonctionne le mieux ? appelle une comparaison à configuration optimale, où imposer une complexité égale serait un artefact. Quelle part de la différence vient de la représentation ? exige au contraire l’appariement. Ce travail traite la seconde. Ses conclusions ne se transposent pas à la première, et lire un classement comme une réponse aux deux revient à lire deux expériences dans un même tableau.
La question naïve oppose le temps porté comme axe au temps éclaté en colonnes. Elle est mal posée, et la formulation antérieure de ce programme de recherche, « à information d’entrée identique », était fausse au sens statistique. Les quatre transformations testées ne préservent pas la même information. La grille ordonnée réalise une compression plusieurs-vers-un. Le format large détruit une partie de la métrique continue. L’axe continu la conserve et ajoute une base quadratique. La forme hiérarchique injecte une structure absente des covariables sources.
Quatre opérations sont donc confondues sous un seul mot : agencement, encodage, ingénierie de variables, restriction de classe fonctionnelle. Ce banc ne les démêle pas, et le dire ne coûte qu’un titre. Ce qui est établi n’est pas que « la représentation compte », énoncé si accommodant qu’il ne discrimine rien, mais que la construction de l’espace de caractéristiques reste déterminante après égalisation d’un budget global de complexité. Moins spectaculaire, considérablement plus difficile à réfuter.
Le mot symétrie recouvre trois choses distinctes, et leur empilement est la principale faiblesse conceptuelle du domaine. Le premier niveau est la structure de l’espace d’entrée, ordre, métrique, voisinage, hiérarchie, que la transformation fixe. Le deuxième est l’hypothèse fonctionnelle, lissage, localité, additivité, que le couple transformation-modèle rend peu coûteuse ou non. Le troisième seulement est la symétrie au sens strict, l’invariance sous un groupe explicitement défini. En écrivant le modèle f = h ∘ φ, l’invariance effective dépend conjointement des deux termes ; la transformation fixe φ et ne détermine rien seule. Ces expériences testent le deuxième niveau. Le nom exact de ce qu’elles mesurent est adéquation structurelle, et symétrie reste réservé au cadre théorique.
Les données individuelles sont reconstruites depuis des courbes de Kaplan-Meier publiées par la méthode de Guyot et collègues, admise par le NICE et la HAS, et validées contre les rapports de risque publiés : 0,375 contre 0,359 reconstruit pour la survie sans événement dans TRANSFORM, 0,730 contre 0,729 pour la survie globale dans ZUMA-7. L’inversion porte sur une courbe agrégée et ne restitue pas les covariables. Ce qui suit est une simulation semi-synthétique calibrée sur des marges de covariables publiées, et le point mérite d’être posé sans détour, parce que la présence de noms de cohortes cliniques dans un article méthodologique fabrique spontanément une impression de validation empirique. Ce qui vient des cohortes, ce sont les distributions marginales et rien d’autre. Ce qui n’en vient pas, ce sont les corrélations, le mécanisme causal, la forme de l’hétérogénéité temporelle, les interactions et le régime de censure. Aucune conclusion sur le lymphome, sur l’efficacité des CAR-T ou sur la décision clinique ne suit de ce travail.
Une seule famille d’estimation est employée, un modèle de survie à temps discret ajusté par régression logistique pénalisée sur format personne-période, qui réduit les biais inductifs concurrents de celui qu’on étudie. Cette famille n’est pas sans opinion : elle impose une forme additive, une fonction de lien, une pénalisation quadratique et une approximation par intervalles. L’étude porte donc sur une tranche de l’espace des questions, R × DGP à M fixé. Savoir si les différences observées sont intrinsèques aux espaces fonctionnels ou tiennent à leur interaction avec cette pénalisation particulière demeure ouvert.
L’estimand est la différence marginale de survie moyenne restreinte à horizon fixe, obtenue par g-formule. Le choix n’est pas décoratif. Un coefficient conditionnel dépend des covariables incluses, si bien que deux transformations comparées sur leur propre coefficient ne visent pas la même cible et que la comparaison est nulle avant d’avoir commencé. La complexité est appariée sur la trace de l’opérateur de lissage, mesure standard des degrés de liberté effectifs d’un estimateur linéaire pénalisé, la pénalité de chaque transformation étant résolue par dichotomie pour atteindre la cible oracle avant toute lecture du biais. Le code, le protocole et le plan d’analyse ont été déposés et horodatés avant exécution, et le run confirmatoire vérifie l’empreinte du code au lancement et refuse de s’exécuter si elle diffère. C’est toute la différence entre une préinscription et une promesse : la seconde est une affirmation sur l’auteur, la première est une vérification qu’un tiers peut exécuter.
Soixante conditions, deux mille réplications, deux jeux de marges, quatre conditions écartées de l’analyse primaire et toutes à confusion cachée. Sur le biais absolu de ΔRMST, l’axe continu atteint 0,2147 contre 0,2318 pour le format large en confusion multiple, 0,9265 contre 1,0171 en confusion temporelle, 0,0223 contre 0,0241 en confusion non linéaire, pour une erreur type de Monte-Carlo voisine de 0,004. La forme hiérarchique se place entre les deux dans les deux premiers régimes et s’effondre à 0,0850 dans le troisième.
La décision se prend sur une marge d’équivalence de 0,033, dont l’origine doit être dite sans embellissement : c’est la différence minimale détectable observée en campagne exploratoire, ni grandeur cliniquement fondée, ni fraction déclarée de la RMST. Trois comparaisons sur sept la dépassent, toutes en régime temporel ou contre la forme hiérarchique en régime non linéaire. La correction de multiplicité rejette l’égalité dans douze conditions sur douze pour l’axe continu en régime multiple, où l’écart correspondant vaut la moitié de la marge ; la conclusion est prise sur la marge et non sur le rejet, parce qu’une différence réelle et sans portée reste sans portée. Une marge d’origine aussi opportuniste appelle l’objection évidente, alors l’objection a été exécutée : il faudrait δ ≈ 0,140, soit 4,2 fois la valeur retenue et 26,8 erreurs types de Monte-Carlo, pour renverser le verdict.
Une transformation échoue structurellement, et cet échec est un résultat plutôt qu’un accident. Le format large, l’axe continu et la forme hiérarchique atteignent la trace cible dans la totalité des soixante conditions. La grille ordonnée ne l’atteint dans aucune. Ayant réduit les covariables à un score unique, sa classe fonctionnelle plafonne sous l’oracle quelle que soit la pénalité. La description honnête de cette expérience est donc trois transformations appariées et une structurellement sous-paramétrée, dont l’incapacité était pré-spécifiée. La présenter comme quatre concurrentes appariées aurait été un petit mensonge à conséquence confortable.
La précision de Monte-Carlo est réelle et elle répond à la mauvaise question. Elle porte sur l’erreur conditionnelle à chaque monde et ne dit rien de la performance moyenne sur une distribution de mondes. Quatre cents mondes tirés d’une distribution déclarée, vingt-cinq réplications chacun, sept quantités que le plan confirmatoire traitait comme connues devenant aléatoires : 88,6 % de la variance du biais est entre mondes, et l’écart type de la performance entre mondes vaut environ 0,54, soit près de cent trente fois l’erreur type de Monte-Carlo du run confirmatoire. C’est la phrase que le domaine devrait emporter : deux mille réplications ne corrigent pas soixante mondes. C’est le même défaut d’attribution que l’on rencontre partout où l’on mesure une chaîne et où l’on crédite un composant.
Sous cette lecture, l’estimand adapté n’est plus un biais moyen mais une probabilité de supériorité. L’axe continu bat le format large dans 73,0 % des mondes pour une erreur type de 0,022, bat la forme hiérarchique dans 80,0 %, et n’est le meilleur des trois transformations appariées que dans 63,0 %. Le classement moyen est inchangé. L’interprétation ne l’est pas : dans plus d’un quart des mondes, une autre transformation fait mieux, si bien que la dominance est ici probabiliste et non universelle, exactement comme un benchmark mesure une performance relative sans gouverner sa provenance.
Trois tests de résistance refusent de dissoudre l’avantage. Sur des multiples de 0,5 à 1,5 fois la trace oracle, la probabilité de supériorité varie de 0,770 à 0,790 pour une erreur type de 0,024 : le classement ne dépend pas du niveau de complexité, sur un facteur trois. Une cible sélectionnée par validation croisée sur la déviance hors échantillon, sans information privilégiée, donne 0,760 ± 0,025 contre 0,770 ± 0,024 pour l’oracle, ce qui lève la réserve de l’oracle : dans ce banc, l’appariement n’exige pas d’information privilégiée. Sur six familles de copules déclarées avant exécution, l’écart entre les familles non gaussiennes et le témoin gaussien vaut +0,021 ± 0,050, nul dans le bruit, et le témoin gaussien se situe en dessous de trois des cinq familles irrégulières, ce qui rend moins plausible l’idée que la régularité du banc aurait été choisie pour avantager le gagnant. Clayton est la seule famille sous 0,60, à 0,589, et une dépendance de queue inférieure est précisément ce que l’axe continu exprime le moins bien. Ce n’est pas une note de bas de page, c’est une adresse : elle indique où chercher le contre-exemple.
La prémisse tient. Parmi les trois transformations réellement appariées, les traces concordent à 0,53 % près quand l’indice de concentration varie de 82 % : le format large dépense son budget sur 15,5 directions effectives pour un Gini de 0,181, l’axe continu sur 10,9 directions pour un Gini de 0,457, la forme hiérarchique sur 15,8 directions pour un Gini de 0,371. La mesure standard de complexité dit combien un modèle peut s’ajuster, jamais dans quelle direction.
La conclusion qui semblait suivre ne suit pas. La corrélation entre concentration spectrale et biais est nulle dans les trois régimes, à −0,07, −0,06 et +0,05. Une statistique scalaire de concentration ne remplace pas la trace. Un rattrapage était disponible et il a été tenté : ce n’est peut-être pas le nombre de directions qui compte, mais leur alignement avec le signal. Projeter le vrai effet confondant sur la base propre de l’opérateur sépare l’expressivité, part du vrai effet tombant dans l’espace du design, de la rétention, part de l’exprimable survivant au rétrécissement. L’expressivité porte les corrélations intra-régime avec le biais à −0,670 en confusion multiple et −0,556 en confusion temporelle, puis s’inverse à +0,515 en confusion non linéaire, régime que la variance domine par ailleurs à 93 %. Deux régimes sur trois, et un changement de signe dans le troisième.
Cela est rapporté comme une hypothèse testée et non retenue, ce qui est la seule manière utile de le rapporter. Un descripteur mieux fondé existe dans la littérature sur la régression à noyau, la distribution cumulée de puissance de Canatar et collègues, et il n’a pas été employé ici ; un test authentique de la conjecture devrait passer par elle et la préinscrire. Déclarer le mécanisme échoué vaut mieux que promouvoir la corrélation survivante, et la discipline est celle qui gouverne déjà un domaine d’applicabilité, lequel mesure une proximité et non une capacité.
Deux fois dans ce travail, une moyenne sur des familles hétérogènes a produit une conclusion que le détail contredit. La corrélation globale entre alignement et biais est positive alors que deux régimes sur trois donnent une corrélation négative. La probabilité de supériorité est plate sur l’effectif, 0,783 à n = 200 et 0,800 à n = 5 000 pour une pente contre log n de +0,002, alors que les trois régimes évoluent en dessous dans des directions opposées : l’avantage croît de 0,700 à 0,933 en confusion multiple, plafonne en temporelle, et décroît vers le hasard de 0,643 à 0,500 en non linéaire. Un agrégat plat n’est pas ici une stabilité, c’est une compensation.
La généralisation n’est pas une anecdote sur ce banc. Les performances agrégées sur des familles hétérogènes de mécanismes peuvent masquer précisément l’interaction que l’étude cherche à caractériser. Formellement, l’espérance de la perte sur la distribution des mécanismes ne suffit pas à caractériser cette perte lorsque l’interaction entre représentation et mécanisme est l’objet d’intérêt. Un benchmark global peut alors classer correctement les méthodes et expliquer faussement pourquoi elles l’emportent, ce qui est la plus coûteuse des deux erreurs puisque c’est celle qui se transporte. Cela concerne toute pratique de comparaison sur des collections hétérogènes de jeux de données, et c’est le visage statistique d’un résultat que le corpus a déjà rencontré cliniquement : une même performance au benchmark peut produire un soin opposé.
Les quatre conditions à confusion cachée sont écartées de l’analyse primaire parce que l’oracle lui-même n’y récupère pas la vérité, avec des biais moyens de −0,72 à −2,14. Dans ces conditions, aucune transformation ne fait utilement mieux qu’une autre. Toutes échouent, et l’uniformité de l’échec est le point.
Une transformation peut améliorer l’approximation fonctionnelle. Elle ne fabrique pas l’identifiabilité causale. Ce contrôle négatif gouverne la lecture de tout l’article, parce qu’il bloque l’extrapolation qu’on ferait sinon vers les représentations, les données synthétiques et les jumeaux numériques, où la tentation est de croire qu’une représentation suffisamment bonne récupère le bon mécanisme. Elle ne le fait pas, et la réserve opérationnelle est pire que la réserve statistique : dans le monde réel, l’analyste ignore de quel côté de cette frontière il se trouve. La même discipline vaut pour les cohortes synthétiques, où représenter n’est pas reproduire et où seul le domaine de substituabilité est défendable.
Une défaillance inférentielle est déclarée plutôt qu’enfouie. La variance est correctement estimée, avec un rapport de l’erreur type à l’écart type compris entre 1,01 et 1,03, mais la couverture suit le rapport du biais à la dispersion : 94,8 % en régime non linéaire, 70,8 % en confusion multiple, 7,6 % en confusion temporelle. La tension doit être nommée, puisque le régime temporel est celui qui porte la conclusion de la section confirmatoire et celui où la couverture se dégrade le plus. Le biais étant différentiel entre transformations, la comparaison des biais reste interprétable ; mais dans ce régime, aucune des quatre ne fournirait un intervalle utilisable en pratique.
Rien ici ne montre que certaines représentations sont intrinsèquement meilleures. Dans un cadre préenregistré, au sein d’une famille pénalisée de modèles de survie à temps discret, des transformations représentationnelles distinctes produisent des biais différents malgré une complexité globale appariée, et les dépassements de marge surviennent de manière structurée selon les régimes. Interpréter ces différences par l’expressivité de la classe fonctionnelle est une lecture soutenue et non isolée, et le mécanisme spectral d’abord proposé pour les expliquer a été testé puis abandonné. Sur une distribution de mondes, l’avantage est probabiliste, invariant sur un facteur trois de complexité, robuste à la perte d’information privilégiée et à la régularité de la structure de dépendance.
Une mesure est déclarée comme limite et non comme résultat, parce que l’alternative aurait été de laisser un nombre tenir lieu de ce qu’il ne mesure pas. Le protocole prévoyait de quantifier une incertitude générative par rééchantillonnage du générateur ; l’implémentation a rééchantillonné les réplications déjà produites et reproduit la variance de Monte-Carlo, rapport 1,01. C’est un instrument cassé, pas une trouvaille.
Le test indépendant prioritaire n’est pas davantage de simulation. Le rendement marginal d’un banc dont les auteurs définissent le support structurel est décroissant, et dix mille mondes supplémentaires ne changeraient rien à la seule dimension qui compte : l’espace des mécanismes admissibles n’a pas été randomisé, seulement les paramètres, les mondes, les structures de covariance, les effectifs et les budgets de complexité. L’expérience qui déplacerait la question est d’une autre nature. Un tiers spécifie les mécanismes, les paramètres, les distributions, les interactions et la dynamique temporelle, sans connaître les résultats obtenus par les représentations, et le pipeline est ensuite exécuté en aveugle. Aucune expérience isolée n’est décisive au sens strict, mais celle-là porterait sur la seule dimension que ces analyses ne peuvent pas atteindre, avec l’extension à d’autres familles d’estimation qu’exige la question R × M × DGP dont ce travail n’étudie qu’une tranche.
Ce qui survit au résultat local est une exigence, et c’est la même qui gouverne tous les autres instruments d’attribution de ce corpus, depuis la représentation comme préconditionnement de l’efficience en échantillons. Toute comparaison destinée à attribuer une performance à une représentation doit apparier ou caractériser la complexité effective, puis dire ce qui reste inexpliqué après l’appariement. L’appariement est une condition nécessaire de l’attribution. Il n’a jamais été une explication.
Notes doctrinales et explorations sur l’IA en systèmes régulés. Une à deux fois par mois. Désabonnement en un clic.