2 points par GN⁺ 2025-08-24 | 1 commentaires | Partager sur WhatsApp
  • En sciences sociales et en sciences du vivant, il existe un certain niveau de corrélation entre presque toutes les variables
  • Ce phénomène n’est pas un simple hasard ni une erreur statistique, mais un fait réel issu de facteurs génétiques et environnementaux étroitement imbriqués
  • Plus la taille de l’échantillon augmente, plus des corrélations significatives apparaissent pour la plupart des paires de variables, et les chercheurs en viennent à se concentrer davantage sur le motif global des corrélations que sur chaque corrélation prise isolément
  • Le « crud factor » signifie qu’une faible corrélation existe entre presque toutes les paires de variables, si bien qu’avec une théorie arbitraire et un choix arbitraire de variables, on obtient avec une forte probabilité un résultat significatif
  • Dans cette situation, la signification du seuil de significativité traditionnel (0,05) s’affaiblit, ce qui impose de la prudence dans l’interprétation statistique en sciences sociales

Vue d’ensemble et contexte

  • En psychologie et en sociologie, l’idée selon laquelle « tout est corrélé à tout dans une certaine mesure » est largement admise
  • Un trait donné est déterminé par plusieurs facteurs génétiques et environnementaux, qui présentent eux-mêmes des corrélations entre eux
  • En pratique, presque toutes les variables mesurables présentent donc un certain degré d’interdépendance

« Crud factor » et découvertes statistiques

  • Le « crud factor » désigne le phénomène selon lequel, dans les recherches en sciences sociales (et dans une partie des sciences du vivant), une faible corrélation existe toujours entre des paires de variables arbitraires
  • Dans un vaste jeu de données recueilli en 1966 auprès de 57 000 lycéens du Minnesota, l’analyse de 105 tableaux croisés (crosstabulations) portant sur des variables variées — famille, éducation, loisirs, projet professionnel, religion, etc. — a montré que tous les résultats étaient statistiquement significatifs
    • Pour 96 % d’entre eux, la probabilité que cela soit dû au hasard était écartée à un niveau extrêmement faible de p<10⁻⁶
  • En étendant le nombre de variables à 45, 92 % des 990 combinaisons au total étaient statistiquement significatives
    • La médiane (median) du nombre de relations significatives entre une variable et toutes les autres était de 41 sur 44

Exemples concrets entre variables

  • Des relations entre les scores au MCAT et le nombre de frères et sœurs, le rang de naissance, le sexe, le projet professionnel ou la préférence religieuse ont elles aussi montré une forte significativité statistique
    • Ex. : les étudiantes obtiennent de meilleurs scores que les étudiants ; plus le nombre de frères et sœurs augmente, plus les scores tendent à baisser ; les aînés ou enfants uniques seraient plus intelligents que les benjamins ; des différences nettes apparaissent selon les groupes religieux, etc.
  • Pour cinq grandes dénominations protestantes également, on a observé une forte significativité dans les relations avec diverses variables
    • Ex. : la probabilité qu’un enfant unique soit presbytérien est presque deux fois plus élevée que pour un baptiste ; des différences existent selon la dénomination dans l’appréciation de l’école et les aspirations professionnelles, entre autres corrélations

Cas des items du MMPI

  • Parmi les 550 items du MMPI (test de personnalité), 507 (92 %) présentent des différences significatives selon le sexe
    • Certains items permettent d’expliquer clairement des différences de tendance marquées, tandis que d’autres relèvent de causes multiples ou restent sans explication claire
  • Comme ces résultats apparaissent dans de très grandes études avec des échantillons massifs, il s’agit d’un phénomène réel et non d’une erreur statistique (erreur de type I)

Corrélations en sciences sociales et limites de la validation théorique

  • Même en associant au hasard une théorie quelconque et une paire de variables, si la corrélation moyenne (crud factor) est de l’ordre de 0,30, il devient concrètement possible de trouver une différence significative environ une fois sur trois
    • Ce phénomène survient bien plus souvent que ne le suggère le seuil de significativité de 0,05 généralement considéré comme important en sciences sociales
  • Comme des corrélations apparaissent facilement même entre des paires de variables non prévues par la théorie du chercheur, la seule significativité statistique suffit difficilement à étayer une causalité réelle
  • La combinaison de causes complexes (gènes/environnement) et de la richesse des données observées produit ce large éventail de corrélations

Conclusion pratique

  • Lors de l’interprétation des données en sciences sociales et de la validation des théories, il faut toujours garder à l’esprit le « crud factor », c’est-à-dire des « corrélations banales mais réellement présentes »
  • Plutôt que d’accorder une confiance aveugle aux statistiques de significativité (par ex. p<0.05), il faut davantage se concentrer sur la causalité réelle entre les variables et sur l’interprétation des motifs
  • Comme le dit l’aphorisme de Thorndike, « toutes les bonnes choses ont tendance à aller ensemble » : dans le monde réel, beaucoup trop de choses sont entremêlées

1 commentaires

 
GN⁺ 2025-08-24
Avis Hacker News
  • Il parle de l’un de mes plus gros agacements
    Les gens confondent souvent l’expression « statistically significant » avec « notable » ou « qui a du sens »
    Ils constatent une différence mesurée et en déduisent que les statistiques disent qu’elle est « importante », ce qui est une mauvaise manière de voir les choses
    En réalité, un test de significativité dit seulement quelle est la probabilité que la différence observée soit une « bonne mesure »
    Autrement dit, il permet de dire avec un certain niveau de confiance que « la différence existe réellement »
    Il faut juger séparément si la différence mesurée est aussi « significative » au sens de la valeur pratique, et cela dépend surtout de l’ampleur de la différence mesurée
    Cela paraît évident, mais c’est une erreur très courante dans l’industrie et dans de nombreux domaines scientifiques
    Par exemple : « cette mesure a modifié le [métrique] avec p<0.001, incroyable, c’est très significatif ! L’ampleur du changement est de 0.000001 % »
    Dans ce cas, il faut vraiment se demander si c’est « significatif » au sens utile du terme

    • Comme cela a été souligné, significatif ne veut pas forcément dire « meaningful »
      Cela dit, je voudrais nuancer un peu l’exemple
      Une p-value très faible n’implique pas toujours un effet « significatif » au sens pratique, mais elle n’est pas non plus indépendante de la taille de l’effet
      La p-value elle-même vient de (taille de l’effet)/(bruit/racine carrée de la taille d’échantillon)
      Donc, une statistique de test plus grande implique une p-value plus petite
      Une p-value très faible provient généralement soit d’un effet important, soit d’une taille d’échantillon (n) énorme
      Donc seul un N extrêmement grand peut faire apparaître p<0.001 avec un effet minuscule
      Mais dans la recherche réelle, quand on voit p<0.001, les contraintes sur la taille d’échantillon font que l’effet a aussi de bonnes chances d’être réellement grand
    • Using Effect Size—or Why the P Value Is Not Enough
      Cela explique que la significativité statistique est la partie la moins intéressante d’un résultat, et insiste sur le fait qu’il faut décrire les résultats par la taille de l’effet
      La vraie question n’est pas seulement de savoir si un traitement a un effet, mais de savoir « dans quelle mesure »
      – Gene V. Glass
    • Tout à fait d’accord
      Mais plutôt qu’un simple pet peeve, j’y vois une incompréhension pathologique des statistiques
      Cette confusion peut mener à des conclusions erronées, surtout dans les médias populaires sur la santé et le bien-être
      Des études sur la santé ou la nutrition sont présentées comme statistiquement significatives alors que l’effet réel est souvent minime
      Les gens changent alors profondément leur vie et leurs habitudes sur cette seule base, alors qu’en réalité rien ne le justifie
    • Si on augmente suffisamment N (la taille d’échantillon), on peut trouver partout ce type de « bonne mesure » ou de « différence statistiquement significative »
      Ce qui est pire encore, c’est quand on ne fixe pas d’hypothèse à tester à l’avance et qu’on fouille dans des données passées pour ne retenir que les corrélations « statistiquement significatives »
    • J’aime beaucoup cette vidéo de 3blue1brown
      Elle propose de penser la significativité comme une mise à jour de probabilité
      L’idée est qu’un seul test (ou une seule étude) ne met à jour la probabilité que de X %, si bien qu’un jugement vraiment « significatif » demande en général davantage d’expériences
  • C’est vraiment un texte de style « rationalist » très typique
    Il contient de bonnes observations sur les phénomènes statistiques, mais aussi, en passant, d’étranges formulations politiques
    Exemple : « des considérations théoriques et empiriques invitent à douter des inférences causales sur le “biais algorithmique” ou les “groupes protégés” : il peut être indésirable de ne pas exclure, voire impossible ou dénué de sens »
    C’est une phrase vraiment étrange, qui surgit sans explication de contexte
    On dirait qu’il soutient que, puisque des variables latentes cachées déterminent la criminalité, on pourrait utiliser is_black dans une black box (modèle de libération conditionnelle), ce qui me paraît absurde
    En réalité, l’intérêt pour le fonctionnement d’un modèle est un problème plus profond que la simple interprétation statistique
    S’il y a trop de degrés de liberté dans le processus de sélection du modèle, on peut le concevoir pour produire n’importe quel résultat
    Par exemple, si un modèle de libération conditionnelle inclut une variable comme likes_hiphop, il faut vérifier pourquoi elle est là et si c’était vraiment le « modèle optimal »
    Au final, le fait que les variables soient très corrélées dans les phénomènes sociaux rappelle que n’importe quel modèle peut, au moins en partie, être un produit politique

    • La phrase qui t’a semblé étrange n’est pas si décalée dans son contexte
      L’expression « considérations théoriques et empiriques » renvoie à la discussion précédente
      Autrement dit, comme tout est corrélé à tout, observer une corrélation ne permet pas d’affirmer avec certitude qu’elle a une signification essentielle
      Les chercheurs en sciences sociales construisent des modèles complexes, observent beaucoup de variables et trouvent des corrélations qui soutiennent leurs hypothèses, mais l’idée est que ces corrélations peuvent surgir partout et constituent donc des preuves faibles
      Et on ne peut pas non plus affirmer que le modèle utilisait vraiment une variable comme is_black
      Ce n’est pas parce qu’une black box produit des résultats défavorables aux personnes noires qu’elle contient réellement une variable is_black
    • Je trouve que les « rationalists » ont tendance à être obsédés par le classement des personnes ou des groupes
      On le voit souvent sur des sujets comme la génétique ou le QI, où ils tirent des conclusions à partir d’études et de données fragiles
    • À propos de cette citation
      Je pense que la modélisation en sciences sociales a absolument besoin d’un arrière-plan théorique, mais je me demande si le TFA adopterait la même position sur certains sujets politiques précis
      Par exemple, dirait-il la même chose si une organisation au service de groupes minoritaires utilisait une variable is_white dans ses recrutements ?
    • Je trouve que cette description de gwern est très juste
      Il donne une impression d’intelligence tout en lançant des suppositions sans fondement comme s’il s’agissait de faits
      Je trouve d’ailleurs curieux que la communauté scaling/IA apprécie autant gwern
  • Je suis déçu que le texte ne mentionne pas une citation du Guide du voyageur galactique
    Cela m’a rappelé l’idée selon laquelle, comme toute matière dans l’univers influe d’une manière ou d’une autre sur toute autre, on pourrait en théorie déduire l’univers entier, le Soleil, les planètes, les orbites ainsi que l’histoire sociale et économique à partir d’un simple morceau de gâteau aux fées

    • Pour que ce raisonnement tienne, ne faudrait-il pas connaître la configuration T_zero de l’univers ?
      Des configurations T_zero différentes peuvent mener à T_current, et même avec une configuration physique identique, l’état antérieur « univers-gâteau » peut être différent
      Et cela suppose en outre un système entièrement déterministe
    • Dans le bouddhisme, il existe le concept de « production interdépendante » (Pratītyasamutpāda)
      Lien explicatif
    • Les particules ne souffrent pas de fatalisme
  • Autrefois, on découvrait déjà la vérité sur le monde sans statistiques
    Les statistiques sont devenues un outil utile, mais avec leur apparition l’abus de ce type de méthode a aussi multiplié les cas où la bêtise se déguise en intelligence
    Donc cette observation sur le « bruit corrélationnel » mérite qu’on s’y attarde
    Avant tout, il faut de la logique et des connaissances de base sur le domaine
    Compter simplement des chiffres peut, à mon avis, induire en erreur

    • À l’affirmation « autrefois on vivait sans statistiques », j’aimerais répondre que c’était bien pire
      La logique seule ne permet pas d’acquérir de nouvelles connaissances
      La logique ne fait que reformuler ce qu’on sait déjà, et les connaissances de base exigent de l’expérience ou de l’expérimentation
      Comme l’observation du monde réel n’est jamais parfaite, l’interprétation statistique est indispensable
      Avant l’apparition des statistiques, c’était surtout : (a) des riches assis à réfléchir profondément au monde, (b) des figures charismatiques prêchant ce qu’elles voulaient, ou (c) des gens intelligents qui tombaient juste de temps à autre
      Avec les statistiques, n’importe qui peut désormais déterminer ce qui est correct ou non à partir des résultats, et ce n’est plus réservé aux seuls privilégiés
      Bien sûr, l’un des avantages de l’inférence statistique est l’« intercomparison », c’est-à-dire la possibilité de tirer des conclusions à partir des différences sans comprendre complètement le processus lui-même
      Mais c’est aussi ce qui facilite les manipulations et les contresens
    • George Lucas a dit un jour que lorsqu’une nouveauté apparaît dans la société, les gens ont toujours tendance à en abuser excessivement
      Vidéo associée
  • Rien à voir avec le sujet, mais je trouve ce blog vraiment magnifique
    Entre la lettrine, les commentaires en ligne visibles à droite et la barre de progression, on sent l’amour du projet

    • Le billet de gwern sur les lettrines pourrait t’intéresser
  • C’est vraiment un texte énorme
    Ça me donne envie de pouvoir écrire moi aussi des textes aussi solides
    Quand on regarde les autres articles de l’auteur, on dirait qu’il produit sans arrêt comme une machine

    • Si je me souviens bien, Gwern vivrait très simplement dans un endroit isolé, ce qui lui laisserait beaucoup de temps pour ses recherches personnelles
    • Beaucoup de temps, de répétition, une obsession pour les questions difficiles, de la recherche et une expertise en Haskell : voilà son secret
      Bien sûr, un soutien financier aiderait encore davantage
    • Moi, j’aimerais déjà pouvoir lire ce genre de texte
    • Je trouve vraiment que gwern est impressionnant
  • Ce débat existe depuis des décennies
    Il est important de ne pas perdre son esprit critique
    Mais personnellement, plus je me débats avec ce type de raisonnement dans mon travail, plus j’ai l’impression que c’est en réalité peu utile et assez creux
    Le « crud » est présent dans les motifs comme un fond diffus cosmologique statistique, et il n’est pas toujours juste de l’écarter comme dénué de sens : il peut parfois être important
    Il arrive que les relations entre variables soient difficiles à expliquer, mais elles peuvent aussi être essentielles pour comprendre les variables de confusion potentielles qu’il faut contrôler
    Tout n’est pas toujours corrélé, et il existe aussi de vrais cas où l’association est nulle
    Définir une « taille d’effet non nulle et significative » est lui aussi un choix très arbitraire et subjectif
    Il doit exister un cadre plus productif pour penser ce phénomène

  • Correlated. D’autres exemples ? <i>Everything Is Correlated</i> - discussion précédente

    • Correlated, c’est bien ça ?
  • C’est pour cela que la science expérimentale diffère des études observationnelles
    L’analyse statistique ne fournit que des raisons d’accorder davantage de confiance à une hypothèse, et elle doit être renforcée par une véritable démarche expérimentale
    Les exemples du blog viennent surtout de la médecine, des sciences sociales ou comportementales, c’est-à-dire de domaines où les expériences correctement contrôlées sont difficiles à réaliser, ou bien où le faible nombre d’échantillons rend difficile l’établissement clair de la causalité

    • La microéconomie a évolué, passant des grandes études observationnelles à des dispositifs expérimentaux et quasi expérimentaux
      Bien sûr, on ne peut pas réparer par l’analyse ce qu’on a raté dans la conception (You can’t fix by analysis what you bungled by design - source), mais cela va dans le sens d’une réduction des biais
  • À propos de la citation disant que « cela rend le sens des tests de significativité ambigu ; cela revient simplement à calculer très précisément la probabilité des données dans un scénario qu’on sait faux a priori »
    Je pense qu’il est courant, pour parvenir à des résultats utiles, d’admettre qu’un modèle est simplifié et, à strictement parler, faux
    Par exemple, les lois de Newton ou l’analyse des circuits électriques ne sont possibles que grâce à des simplifications, et dans le secteur bancaire on calculait aussi parfois l’année sur 360 jours
    Tout cela fonctionne bien en pratique, donc je me demande ce que je rate

    • Le problème, c’est qu’avec assez d’argent (c’est-à-dire avec un très grand N), on peut toujours produire un résultat « significatif »
      C’est un vrai dilemme si l’on considère la recherche comme une quête de vérité
    • J’ai déjà créé un calculateur d’amortissement, et il existait à lui seul 47 méthodes de « day count »
      (par exemple pour calculer les paiements sur des périodes de moins d’un mois)
    • L’erreur maximale produite par ce genre de simplification est toujours connue
      Autrement dit, Einstein est une version plus précise de Newton
      De la même manière que la relativité restreinte converge vers la mécanique newtonienne dans la limite des faibles vitesses
      En statistiques, en réalité, le « faux » n’existe pas ; il faut comprendre cela comme « faux avec une probabilité de x % »
      Si l’on veut réduire x, il faut « faire davantage de statistiques », et le moyen le plus sûr est d’augmenter la taille d’échantillon (N)
      Ce que le texte fait complètement de travers, c’est de supposer qu’avec un N suffisamment grand on peut traiter vrai/faux de manière absolue
      Parce qu’on atteint alors des niveaux de probabilité du genre « cela ne se produirait qu’une fois si l’univers était recréé un million de fois »
      Mais dans la réalité, la plupart des travaux en sciences sociales, en médecine ou en économie se font avec des N très petits, donc les problèmes statistiques y sont inévitablement importants
      On essaie donc de « faire davantage de statistiques », mais en pratique on n’augmente pas N ; on tripote les chiffres, ou on augmente N juste un peu puis on prétend que le problème est réglé
    • En fin de compte, tout se joue sur l’ampleur quantitative réelle de l’erreur introduite par la simplification