- Parmi 22 articles évalués à NeurIPS, WACV et ECCV TerraBytes, 15 (68 %) contenaient des citations truquées, des listes d’auteurs falsifiées ou des phrases manifestement générées par un LLM, et deux articles signalés pour faux auteurs ont tout de même été acceptés en présentation orale sous condition de corriger la bibliographie
- On estime qu’en 2025, la littérature scientifique a compté environ 146 900 citations hallucinées ; en suivant ces citations hallucinées de bioRxiv jusqu’aux versions publiées, 85,3 % sont restées présentes même après l’évaluation par les pairs
- Le problème dépasse les soumissions et touche aussi l’évaluation : 21 % des reviews d’ICLR 2026 ont été jugées entièrement générées par IA, et à ICML 2026, l’usage d’un LLM a été détecté dans environ 795 reviews rédigées par des reviewers pour lesquels cet usage était interdit
- Le problème n’est pas tant l’usage des LLM que la soumission de résultats non vérifiés ; erreurs bibliographiques, écarts entre les chiffres du texte et ceux des tableaux, promotion excessive des performances et sections de discussion qui ne font que répéter les métriques sont autant de signaux qu’un manuscrit n’a pas été suffisamment relu
bib-audit, qui compare les références à plusieurs registres, a été publié, mais comme il envoie une partie de soumissions non publiques à un LLM hébergé, les reviewers doivent d’abord vérifier les règles de confidentialité et les politiques LLM propres à chaque conférence
L’ampleur constatée en évaluant 22 articles
- Deux reviewers ont évalué pendant l’été un total de 22 articles pour l’atelier géospatial TerraBytes de NeurIPS, WACV et ECCV
- Dans 15 articles (68 %), ils ont trouvé des traces manifestes de génération par LLM : citations entièrement inventées, listes d’auteurs altérées pour de vrais articles, jargon halluciné, phrases absurdes ou citations sans rapport
- L’un des reviewers a relevé ces problèmes dans 6 articles sur 11 (55 %), l’autre dans 9 sur 11 (82 %)
- Répartition par conférence :
- piste NeurIPS Datasets and Benchmarks : 2 sur 5
- piste NeurIPS Position Paper : 2 sur 2
- TerraBytes : 1 sur 2 et 4 sur 5 selon les affectations
- WACV : 3 sur 4 pour chacun des deux reviewers
- Rien qu’à cause des problèmes de citation, 5 articles pour l’un et 9 pour l’autre méritaient un desk reject
- Deux articles WACV avaient remplacé dès la première entrée de la bibliographie les vrais auteurs par de faux noms
- Un article NeurIPS contenait sur 53 pages un jargon halluciné ou vide de sens, rendant la vérification des références elle-même inutile
- Les deux NeurIPS Position Papers ont été jugés générés par LLM, et 4 des 5 articles attribués à TerraBytes contenaient eux aussi de fausses citations ou de faux auteurs
Les citations hallucinées se diffusent dans toute la littérature scientifique
- En avril 2026, une analyse de Nature a confirmé que des dizaines de milliers de publications au moins en 2025 pourraient contenir des références erronées générées par IA
- L’audit de Zhao et al. sur arXiv, bioRxiv, SSRN et PubMed Central estime à environ 146 900 le nombre de citations hallucinées rien qu’en 2025
- Elles n’étaient pas concentrées chez quelques acteurs malveillants, mais disséminées dans de nombreux articles
- Elles apparaissaient le plus souvent chez des chercheurs en début de carrière et de petites équipes
- En suivant les prépublications bioRxiv contenant des citations hallucinées jusqu’à leurs versions publiées, 85,3 % étaient toujours présentes
- Dans l’audit de The Lancet sur 2,5 millions d’articles biomédicaux, la part des articles contenant au moins une fausse référence a été multipliée par 6 en deux ans
- on est passé de 1 article sur 2 828 en 2023 à 1 sur 458 en 2025
- début 2026, le ratio avait atteint 1 sur 277
- Une analyse de 100 citations hallucinées dans des articles publiés à NeurIPS 2025 montre que toutes avaient passé entre 3 et 5 expert reviews
- Les articles concernés étaient au nombre de 53, soit environ 1 % des acceptations, et ces citations figurent encore dans les proceedings
L’IA qui rédige l’évaluation par les pairs et le risque de manipulation
- L’analyse d’ICLR 2026 par Pangram estime que 21 % des 15 899 reviews ont été entièrement générées par IA
- Plus de la moitié des reviews ont impliqué l’IA d’une manière ou d’une autre
- Organization Science a vu ses soumissions augmenter de 42 % depuis l’arrivée de ChatGPT, et il a été mesuré qu’un certain niveau d’IA est désormais utilisé dans plus de 30 % des évaluations par les pairs
- La détection par prompt injection à ICML 2026 a révélé l’usage d’un LLM dans environ 795 reviews rédigées par 506 reviewers relevant de la Policy A, qui interdit cet usage
- Cela représente environ 1 % de l’ensemble des reviews
- À NeurIPS aussi, des reviews éthiques clairement générées par IA et plusieurs réponses aux reviews générées par IA ont été observées
- Des reviews IA peuvent réécrire de manière adversariale le résumé d’un article pour en améliorer l’évaluation sans en changer le contenu scientifique
- Dans l’expérience de Li et al., l’attaque la plus puissante a atteint un taux de succès d’environ 38 %
- Sur une échelle de 10 points, la note d’acceptation d’un reviewer Gemini 3 Flash augmentait de 1,31 point, et celle d’un reviewer GPT 5.4 Mini de 0,88 point
- L’attaquant n’avait même pas besoin de connaître le modèle de review utilisé
Manipulations et signaux observés en conditions réelles d’évaluation
- Les cas les plus graves étaient deux soumissions qui conservaient la conférence, le titre et les autres auteurs d’articles réels, tout en remplaçant uniquement des auteurs personnellement connus par des noms fictifs proches
- Le reviewer a recommandé le rejet et signalé directement les cas aux organisateurs, mais les deux articles ont tout de même été acceptés en présentation orale sous condition de correction des références
- Un article WACV citant SatMAE indiquait comme auteurs « Yuyang Cong, Saurabh Khanna, Chen Meng, et al. »
- La vraie liste d’auteurs commence par Yezhen Cong, Samar Khanna et Chenlin Meng
- Deux articles NeurIPS de 53 et 40 pages contenaient du jargon halluciné et des références manipulées, et l’un d’eux avait même laissé des notes internes du LLM à côté de plusieurs citations
- De faux auteurs et des références entièrement inventées montrent tous deux qu’un manuscrit n’a pas été suffisamment relu
- Il devient impossible de savoir si les travaux cités ont réellement été lus, s’ils sont cités dans le bon contexte, ou si l’on peut faire confiance aux autres parties de l’article, du code ou du jeu de données
- La position défendue est qu’un article contenant des références hallucinées n’est pas prêt à être accepté et devrait faire l’objet d’un desk reject
-
Signaux suggérant fortement une rédaction par LLM
- Parmi les signaux stylistiques fréquents : les tournures contrastives du type « It’s not X, it’s Y » ou « The real X is Y », un usage excessif du gras et des tirets cadratins, des phrases très denses difficiles à interpréter, et une surpromotion des résultats
- Un signal plus subtil apparaît lorsque les chiffres ou métriques du texte ne correspondent pas à ceux des tableaux
- Ces incohérences surviennent quand des expériences sont relancées sans demander à l’agent de mettre à jour ou de vérifier l’ensemble des résultats
- Claude tend à compresser dans le corps du texte des chiffres qui devraient aller en annexe ou dans le code, et à répéter dans la discussion les métriques déjà présentes dans les tableaux
- Sont aussi des signaux d’alerte : des modèles sur mesure qualifiés de SOTA pour moins de 1 % d’amélioration sans moyenne ni écart-type, des formules complexes là où une citation suffirait, ou des ablations qui devraient être reléguées en annexe
Ce qui a changé dans le travail d’évaluation
- La procédure d’évaluation a changé : juste après avoir lu le résumé, on parcourt d’abord la bibliographie pour vérifier rapidement si l’article entier est une sortie de LLM
- Le temps passé à traquer les traces de LLM augmente, et l’hypothèse qu’un article a été soumis de bonne foi s’affaiblit
- Il y a le sentiment que le nombre d’articles intéressants, lisibles et réellement écrits par des humains a nettement baissé
- En dehors des références hallucinées, beaucoup de problèmes ressemblent toutefois à ceux des mauvais articles déjà rédigés par des humains auparavant
- Le simple fait d’utiliser un LLM n’est pas en soi un critère d’évaluation
- Si un LLM a aidé à la rédaction mais que la recherche est intéressante, les expériences valides et la reproductibilité assurée, ce n’est pas un problème
- Le problème est de soumettre telle quelle une sortie de LLM non revue et de demander aux reviewers d’en faire le retour critique
- Les conférences imposant désormais 4 à 5 reviews par auteur, la charge d’évaluation non rémunérée augmente aussi
- Les reviewers y consacrent leurs soirées ou leurs week-ends, et découvrir tardivement des hallucinations bibliographiques revient à gaspiller ce temps
- Pour apprendre d’une review, les chercheurs doivent d’abord lire et examiner sérieusement leur propre travail
Comment utiliser les LLM dans la recherche et l’écriture
- Claude et d’autres LLM sont utilisés au quotidien, mais leurs sorties sont toujours vérifiées, éditées et réécrites
- Claude sert à rédiger une première version d’une revue de littérature, puis les articles et billets d’origine sont lus directement
- Les billets de blog sont remplacés par la recherche source citée, les matériaux sont réorganisés et les détails inutiles retirés
- Avant de soumettre un article, l’intégralité du manuscrit est relue avec soin et les références vérifiées manuellement
- Claude est utilisé pour repérer les passages ambigus, puis pour mener un entretien sous forme de questions à choix multiples afin d’aligner l’intention
- Même après avoir lancé
bib-audit, chaque entrée est vérifiée dans des bases comme Google Scholar, IEEE ou CVF - De vrais fichiers BibTeX accumulés au fil des années dans Zotero sont aussi réutilisés
- Des retours externes sont demandés tôt, et si nécessaire la structure complète du texte est revue même pendant la phase de brouillon
- Le travail précipité juste avant la deadline est vu comme une cause des mauvais articles produits avec LLM
- Le sens de la recherche acquis avant l’ère des LLM reste essentiel, et il y a une inquiétude face à un environnement où de jeunes chercheurs génèrent des travaux sans direction claire
-
Comment contrôler le style de Claude
- Les phrases produites par l’agent sont trop denses et fluides de façon médiocre, d’où une limitation des tirets cadratins et des points-virgules
- Fable 5 tend à abuser des deux-points à la place des tirets cadratins et à produire un style marketing B2B SaaS
- L’objectif est d’obtenir des phrases ni inutilement agressives ni fades, mais lisibles aussi par des lecteurs extérieurs au domaine
- Un skill fondé sur des règles entre écriture scientifique et ASD-STE100 Simplified Technical English a donné de bons résultats
- Il faut d’abord définir le but du texte et son public, puis adapter la forme à ce lectorat
- Le style par défaut de Claude ne convient pas aux lecteurs scientifiques
- Si le gras excessif, les listes à puces et les formules marketing subsistent, cela peut faire douter jusqu’à la provenance et à la vérification du contenu
Pourquoi il faut filtrer dès la soumission plutôt que simplement exiger une déclaration publique
- L’obligation de déclarer l’usage d’un LLM peut être utile aux chercheurs de bonne foi, mais ne devrait pas changer fortement les comportements en pratique
- TorchGeo a ajouté une politique IA avec les niveaux « sans LLM », « assisté par LLM » et « entièrement rédigé par LLM », mais il est peu probable que le dernier soit choisi volontairement
- Même rédigé avec un LLM, un bon article peut être accepté si ses résultats sont vérifiés et reproductibles
- Il faut des mécanismes de desk reject ou des outils de signalement capables de repérer les erreurs LLM courantes et de déterminer si un manuscrit est en état d’être évalué
- Aujourd’hui, les reviewers assument de fait une part du travail de desk reject, ce qui n’est pas équitable pour les reviewers de bonne foi
- À partir de 2027, ICLR affichera les noms des auteurs dans OpenReview
- La responsabilité incombe aux auteurs, encadrants, area chairs, organisateurs et conférences
- Les auteurs ne devraient pas soumettre en masse des articles à faible effort pour remplir leur CV
- Les encadrants et mentors devraient empêcher les soumissions étudiantes à faible effort
- Les organisateurs doivent mettre en place des moyens de filtrage adaptés au volume massif de soumissions
- Le problème des incitations à publier existait avant les LLM, et Lipton et Steinhardt avaient déjà en 2018 documenté l’apparat mathématique, le mauvais usage du langage et les incitations mal alignées
- Même si les LLM permettent de transformer un projet de cours ou un résultat de recherche automatisé en article au format NeurIPS, il ne faut pas le soumettre s’il n’apporte pas une vraie contribution scientifique
- Avec Opus 4.6 et le dépôt autoresearch de Karpathy, il était possible de produire sur LandCoverAI des résultats ayant l’apparence du SOTA et l’article correspondant, mais cela n’a pas été soumis faute de contribution scientifique
- Pour AAAI 2027, 48 000 résumés ont été soumis, ce qui accroît encore l’ampleur du problème du filtrage automatique
Audit automatique des références avec bib-audit
bib-auditest un skill Claude Code sous licence MIT qui compare le titre, l’année et la liste complète des auteurs d’une référence avec les enregistrements des registres- Il peut prendre en entrée des fichiers
.bib,.bblou des PDF- Pour les
.bblet les PDF, Claude reconstruit les références rendues en champs structurés - Un script vérifie ensuite chaque entrée auprès de Crossref, arXiv, DataCite et Semantic Scholar
- Pour les
- Les résultats sont classés par gravité décroissante
- article inexistant
- identifiants truqués et faux auteurs
- métadonnées erronées pour un vrai article, liste d’auteurs tronquée, différences d’année entre prépublication et version publiée
- erreurs de format comme un simple tiret dans un intervalle de pages, un DOI enregistré comme URL ou des initiales au format
J.D.
- Comme l’outil ne se contente pas de vérifier l’existence du titre mais compare la liste complète des auteurs, il peut détecter des remplacements d’auteurs comme dans le cas SatMAE
- Quand une entrée n’est reliée que par recherche sur le titre, sans DOI ni identifiant arXiv, l’outil ne conclut pas de manière définitive et renvoie une recommandation de vérification manuelle
- Dans une review, il ne faut pas spéculer sur les intentions mais seulement rapporter les faits observés, par exemple : « le premier auteur de l’enregistrement arXiv n’est pas Yuyang Cong mais Yezhen Cong »
- La vérification de
.bibest en lecture seule et ne nécessite aucune dépendance externe ; elle peut être configurée pour échouer uniquement sur les incohérences concernant des entrées fixées par identifiant, ce qui permet de l’utiliser comme garde-fou CI avant soumission - En plus de Claude, l’outil peut être installé sur Codex, Copilot, Cursor et d’autres agents via
npx skills add isaaccorley/skills
Confidentialité et règles des conférences que les reviewers doivent vérifier
- Le processus d’audit envoie une partie des références d’une soumission non publique à un LLM hébergé, ce qui peut violer les règles d’une conférence même sans utiliser le LLM pour rédiger la review
- La politique ECCV 2026 interdit de rédiger reviews et meta-reviews avec un LLM local ou via API, et interdit séparément de partager avec un LLM une portion substantielle d’une soumission
- Les consignes reviewers de WACV qualifient les reviews générées par LLM de conduite très irresponsable
- En cas d’infraction, les propres articles du reviewer peuvent faire l’objet d’un desk reject
- Il est également interdit de montrer des documents confidentiels à des personnes extérieures à l’évaluation, et un LLM hébergé n’est pas un reviewer
- La politique LLM de NeurIPS limite ce que les reviewers peuvent partager avec des services LLM
- L’expérimentation officielle d’évaluation assistée par IA constitue la voie d’usage autorisée
- Les auteurs peuvent exécuter
bib-auditeux-mêmes avant soumission, mais les reviewers doivent impérativement vérifier la politique LLM et de confidentialité de la conférence concernée avant de l’utiliser
1 commentaires
Commentaires sur Hacker News
Dans le processus actuel de publication de la recherche en IA, l’IA se charge de la rédaction des articles, de leur évaluation, ainsi que de leur lecture et de leur synthèse.
NeurIPS mène aussi une expérimentation d’évaluation assistée par IA, et il y a trop d’articles dans les grandes conférences pour que des humains puissent tous les lire.
Dans le processus de publication scientifique, les humains sont très rapidement poussés vers l’automatisation.
J’ai vécu quelque chose de similaire lors de l’évaluation récente d’EMNLP, et l’IA est encore loin d’être capable de juger la qualité d’une recherche.
Le bien commun qu’est l’évaluation honnête par les pairs est abusé, mais à part restreindre l’accès au système d’évaluation par un système extrême de score social, il ne semble pas y avoir de solution évidente.
Comme la grande majorité des chercheurs utilisent activement l’IA, ils ne veulent pas la sanctionner ni créer un environnement qui pourrait aussi leur nuire ; l’ambiance générale est plutôt ne vous inquiétez pas, acceptez-le.
Au final, cela révèle une réalité cruelle : presque personne ne prenait vraiment la science elle-même au sérieux dès le départ.
Ce sont des espaces où, pour des raisons de calcul économique, on fournit des substituts qui ressemblent en surface aux vrais éléments nécessaires à la santé et à l’épanouissement humains, sans les contenir réellement.
Si c’est l’état général de l’université, je peux comprendre ceux qui plaident pour une réduction des financements de la recherche.
C’est la conséquence logique du système publier ou périr.
Si l’on supprimait ce système, la plupart du problème disparaîtrait aussi ; même si les administrateurs veulent des métriques simples, il n’en existe pas pour la recherche.
La dette technique est la même : il y a une quantité innombrable d’articles, mais la plupart ne seront probablement pas reproductibles, et on ne sait pas lesquels.
Les publications et les citations peuvent être manipulées, mais elles sont concrètes, et les articles très cités sont en général utiles, ce qui récompense leurs auteurs.
Si on les supprime sans meilleure alternative, on risque de dépendre encore davantage des réseaux et de l’éloquence.
Soumettre telles quelles des erreurs générées par l’IA devrait être traité comme une infraction assimilable au plagiat, avec des sanctions similaires.
La non-déclaration et l’usage excessif sont deux choses différentes, mais si l’on n’a même pas vérifié les hallucinations et les erreurs, le vrai problème relève davantage de l’incompétence et de la paresse que de l’IA.
Les statistiques mensuelles de soumission d’arXiv gagneraient sans doute à passer en échelle logarithmique.
Le monde académique pourrait ressembler à Moltbook en 2027.
Les articles de mauvaise qualité se concentrent sur des sujets tape-à-l’œil et très larges, et le machine learning est particulièrement touché, mais il reste beaucoup de sujets importants et de niche que ce type d’auteurs n’a pas encore abordés.
Ces domaines restent dominés par des chercheurs sérieux, mais il est difficile d’en connaître l’existence sans les étudier directement.
C’est un effet secondaire du fait que le monde académique n’a pas pris au sérieux l’accès ouvert aux articles et aux revues.
Si les articles n’étaient pas bloqués par les restrictions d’accès des revues, il serait facile de vérifier au moins l’existence des articles cités et des citations.
L’évaluation par les pairs ressemble au rôle des modérateurs de Reddit : on reçoit surtout de la réputation sans rémunération, tandis que les plateformes et les éditeurs captent les bénéfices.
Les auteurs paient des frais de publication et d’autres auteurs relisent gratuitement ; il est donc naturel que les chercheurs mettent des prépublications ou des articles populaires sur leur site personnel.
En revanche, vérifier si le contenu cité correspond réellement à l’affirmation nécessite de lire et d’interpréter l’article, donc l’accès ouvert ne rend pas cela simple à lui seul ; même avec une première vérification par IA, c’est un travail très pénible.
Je me demande s’il est vrai que soumettre un article à une conférence oblige à évaluer 4 à 5 articles.
Même les bons articles se retrouvent donc évalués de force par des personnes dont on ne connaît ni les sources ni l’expertise.
On m’a forcé à en évaluer 7 ; j’avais candidaté pour 30 articles qui m’intéressaient parmi 30 000, mais on ne m’en a attribué aucun et je me suis retrouvé avec 7 articles sur lesquels je n’avais pas assez d’expertise.
Mais comme le nombre de soumissions continue d’augmenter et que les évaluateurs bénévoles manquent, l’évaluation obligatoire est effectivement mise en œuvre : critères d’incitation à l’évaluation
Il vaut la peine de consulter le paradoxe de Chavda : https://zencapital.substack.com/p/chavdas-paradox
Au début, je pensais que Caleb et Isaac étaient les noms de deux algorithmes détectant l’usage de l’IA dans les articles publiés, mais il s’agissait en fait des noms de deux auteurs ayant écrit avec l’aide de l’IA.
Si les deux ont rendu des verdicts différents, je me demande dans quelle mesure les articles qu’ils ont signalés comme problématiques se recoupaient.
Je développe une application de vérification des citations encore en phase alpha, avec l’objectif de la présenter dans quelques semaines sur Show HN : https://veruscite-data.com/
Les personnes à l’aise avec les outils d’IA générative peuvent utiliser directement les fonctionnalités fournies par Caleb et Isaac dans l’article, mais cet outil est plus efficace en tokens et offre une GUI qui facilite l’examen et la correction des références extraites.