- Le manuel de statistiques du projet OpenIntro, Introduction to Modern Statistics, 2e édition, est disponible gratuitement sur le web
- Le contenu du manuel peut toujours être consulté gratuitement en ligne, et le PDF peut être obtenu sur Leanpub gratuitement ou contre un montant de contribution au choix
- Le paperback en noir et blanc est vendu 25 dollars, la mention de copyright est de 2024 et la date de version est le 31 mars 2026
- Des ressources complémentaires, dont des diapositives, exercices pratiques et tutoriels interactifs, sont également téléchargeables gratuitement sur openintro.org/book/ims
- Ce manuel est une œuvre dérivée des précédents manuels de statistiques d’OpenIntro et est proposé sous licence CC BY-SA 3.0 Unported United States License
Manuel gratuit de statistiques d’OpenIntro
- Introduction to Modern Statistics, Second Edition, est un manuel de statistiques de Mine Çetinkaya-Rundel et Johanna Hardin
- Le manuel est désigné par IMS et fait partie du projet OpenIntro
- Le site est hébergé sur Netlify
Formats disponibles et prix
- Le contenu du manuel est toujours gratuit sur le web
- Le PDF peut être obtenu sur Leanpub via Download PDF
- Le PDF est proposé gratuitement ou contre un montant de contribution choisi par l’utilisateur
- Le paperback en noir et blanc peut être acheté pour 25 dollars
- La mention de copyright est 2024 et la date de version est 31 mars 2026
Ressources complémentaires et licence
- Le manuel et ses ressources complémentaires peuvent être téléchargés gratuitement sur openintro.org/book/ims
- Les ressources complémentaires comprennent des diapositives, exercices pratiques et tutoriels interactifs
- Ce manuel est une œuvre dérivée de OpenIntro Statistics 4th Edition et de Introduction to Statistics with Randomization and Simulation 1st Edition
- La licence est la Creative Commons Attribution-ShareAlike 3.0 Unported United States License
- Les détails de la licence sont disponibles sur creativecommons.org
- Les fichiers source se trouvent sur GitHub : github.com/openintrostat/ims
1 commentaires
Avis de Hacker News
Je pense que l’accessibilité de l’informatique est en train de transformer assez profondément l’enseignement des statistiques
Par exemple, on introduit les tests d’hypothèse par randomisation[1] et on utilise des tests de permutation aléatoire[2]
Quand j’ai appris les statistiques de manière traditionnelle, on nous donnait seulement une liste de recettes du genre « dans cette situation, test t ; dans celle-là, test du khi carré », sans comprendre pourquoi il fallait utiliser tel test ni d’où il venait
Pour voir une approche similaire dans un contexte un peu différent, voir aussi [3]
[1]: https://openintro-ims2.netlify.app/11-foundations-randomizat...
[2]: https://en.wikipedia.org/wiki/Permutation_test
[3]: https://inferentialthinking.com/chapters/11/1/Assessing_a_Mo...
Gosset a créé le test t et en a prouvé la validité, mais on apprend souvent aux étudiants à l’appliquer comme une boîte noire, sans compréhension fondamentale de ce qui le justifie, ce qui n’est pas très bon pédagogiquement
Sur ce point, je trouve les statistiques bayésiennes bien meilleures. Le lien logique et l’isomorphisme de Curry-Howard qui s’ensuit sont très profonds, et on peut aussi les introduire avec des distributions conjuguées ayant des solutions analytiques sous forme fermée
Pour ce qui est plus complexe, c’est le travail de l’ordinateur ; avec des outils comme STAN, on peut traiter des distributions complexes bien plus sophistiquées qu’avec les méthodes fréquentistes
Les tests de permutation m’ont semblé satisfaisants parce qu’ils mettaient en ordre ce que je savais déjà de la théorie des distributions, mais je ne sais pas s’ils auraient eu le même effet si je n’avais rien connu à cette théorie
Quand on étudie la statistique mathématique, on ne l’apprend pas comme un livre de recettes. Au niveau de base, on étudie la théorie des probabilités, la théorie des distributions et plusieurs distributions, puis les tests d’hypothèse, la régression, l’analyse de variance, etc., en découlent
À l’inverse, les chercheurs scientifiques suivent souvent de courts cours propres à leur domaine, par exemple des statistiques pour biologistes, et semblent donc aborder les statistiques comme un ensemble de recettes
La loi binomiale est assez concrète, ce qui aide les étudiants à saisir la notion de valeur p, mais ensuite, en passant à la loi normale, à la loi t, etc., on devient de plus en plus abstrait et on glisse vers une approche « quand utiliser quoi » façon livre de recettes
J’apprécie et j’estime beaucoup les initiatives pédagogiques dans ce domaine, surtout sous forme de manuels ouverts, mais je n’aime vraiment pas cette manière générale d’enseigner les statistiques d’introduction
J’espère qu’avec le temps, on s’éloignera des tests de significativité de l’hypothèse nulle bricolés au cas par cas, pour aller vers un enseignement centré sur les modèles linéaires et, par défaut, une approche bayésienne
Je pense que c’est possible dès les cours d’introduction ; le lien ci-dessous est une référence utile : https://lindeloev.github.io/tests-as-linear/#:~:text=Most%20...
En revanche, l’approche « bayésienne par défaut » me semble aller vers quelque chose d’un peu plus incertain
Les ingénieurs logiciel ont généralement cette capacité, mais ce n’est pas le cas de la plupart des utilisateurs des statistiques
Si l’on essaie d’expliquer à des spécialistes des sciences sociales qui n’aiment pas particulièrement les nombres ou les formules la similarité entre ces méthodes linéaires et l’idée que « tout ne fait qu’un », cela risque surtout de les embrouiller davantage
Cela dit, si quelqu’un mène une expérience randomisée pour estimer l’effet des deux méthodes avec un modèle linéaire approprié, j’aimerais vraiment être tenu au courant. Ce serait une expérience 10/10
[1]: https://lindeloev.github.io/tests-as-linear/#41_one_sample_t...
Content de voir Mine Çetinkaya-Rundel parmi les auteurs
Beaucoup de gens la connaissent sans doute pour sa contribution à « R for Data Science » (https://r4ds.had.co.nz/), mais elle a aussi publié de nombreux excellents articles sur l’enseignement de la data science
C’est de loin l’une des meilleures enseignantes que j’aie vues jusqu’ici
L’un de mes livres préférés sur les statistiques et les probabilités est Regression and Other Stories d’Andrew Gelman, Jennifer Hill et Aki Vehtari
Il est consultable gratuitement ici : https://users.aalto.fi/~ave/ROS.pdf
Je me demande s’il existe un livre pré-statistique qui enseigne l’état d’esprit et les concepts nécessaires pour comprendre les statistiques
Avec une solide compréhension des outils fondamentaux des probabilités, les statistiques s’apprennent assez facilement
Sans cette compréhension, les statistiques risquent fort de ressembler à un ensemble de recettes
À l’inverse, si l’on est à l’aise avec les probabilités, on peut formuler mathématiquement le problème que l’on a réellement, puis trouver, avec quelques recherches, les outils statistiques nécessaires
Il ne faut pas beaucoup plus que du calcul de base
Beaucoup de gens ont développé très tôt une barrière mentale du type « je suis nul en maths », souvent à cause de mauvais enseignants
Lancez-vous, vous ne le regretterez pas
Ronald Fisher n’a peut-être pas utilisé le bootstrap pour calculer des intervalles de confiance, mais la majeure partie du reste du programme semble presque avoir été inventée par lui au début des années 1900 :-)
J’ai préparé une antisèche complète pour étudier les statistiques : https://github.com/mavam/stat-cookbook
J’aime le fait qu’il inclue la randomisation et le bootstrap
En revanche, je trouve dommage que le cadre d’hypothèses reste celui des tests NHST. On peut difficilement qualifier cela de « moderne » dans quelque sens que ce soit
Passer au bayésien impliquerait de réécrire entièrement le cours
J’ai aussi vu des intervalles de confiance proposés comme alternative, mais ils suscitent également des objections
J’ai même vu des arguments selon lesquels il ne faudrait pas utiliser du tout les tests d’hypothèses
Dans une situation où les NHST restent largement utilisés et où il n’existe pas d’alternative claire, je pense qu’il serait plutôt dommageable de ne pas les présenter aux étudiants
Je me demande quels bons livres de statistiques conviendraient à l’autoformation
Le livre lié est une introduction de première année, et il remplit bien ce rôle
Si vous voulez aller plus loin, il y a beaucoup d’options
Statistical Inference de Casella et Berger a une excellente réputation comme ouvrage qui reconstruit les statistiques à partir des premiers principes. Je ne mettrai pas de lien, mais une recherche rapide permet de trouver un scan PDF complet. Avis Amazon : https://www.amazon.com/Statistical-Inference-Roger-Berger/dp...
Statistics de Freedman, Pisani et Purves est aussi très bien noté et se trouve facilement en ligne. Avis Amazon : https://www.amazon.com/Statistics-Fourth-David-Freedman-eboo...
La plupart des livres du tronc commun de science des données de Berkeley sont aussi en ligne. Ce n’est pas uniquement de la statistique pure, mais ils enseignent selon une approche moderne qui s’appuie sur le calcul et la randomisation, avec des outils utiles à maîtriser
Data 8 : https://inferentialthinking.com/chapters/intro.html, Data 100 : https://learningds.org/intro.html, Data 140 : http://prob140.org/textbook/content/README.html, Data 102 : https://data102.org/fa23/resources/#textbooks-from-previous-...
Le cursus de Berkeley n’est pas le seul ; il existe des dizaines, voire peut-être des centaines de cours en ligne. Mais le périmètre est assez large, et lorsque j’ai étudié récemment l’enseignement de la data science, c’est du côté de Berkeley que j’ai le plus lu
Il s’adresse à des doctorants dans les sciences et se concentre sur la question : « comment utiliser les statistiques pour tester des hypothèses scientifiques et identifier la causalité »
Il ne va pas très loin mathématiquement, mais suppose que le lecteur a un certain sens mathématique et l’habitude d’analyser des données même sans statistiques
En pratique, il ne traite quasiment que des modèles bayésiens et de la manière de les ajuster par ordinateur, donc il couvre très peu l’approche fréquentiste
Il existe aussi une série de vidéos associée : https://www.statlearning.com/
Introduction to Probability de Joseph K. Blitzstein et Jessica Hwang vaut aussi le détour. Il est disponible gratuitement : http://probabilitybook.net (redirige vers Drive)
Si vous l’appréciez, Think Bayes, dans le même esprit, mérite aussi le détour
Il y a aussi https://nostarch.com/learnbayes
Si vous avez déjà les bases des statistiques et voulez réapprendre le sujet sous un angle très différent, plus causal et bayésien, je peux aussi recommander Statistical Rethinking