Interdisciplinaire · Science / pratique scientifique · Robustesse et convergence
Quand plusieurs méthodes arrivent à la même conclusion, est-ce une bonne raison d’y croire davantage ?
La convergence peut augmenter la confiance, mais seulement si les lignes de preuve mettent réellement à l’épreuve des vulnérabilités différentes.
Le dossier distingue reproduction computationnelle, réplication, triangulation, robustesse de modèle, validation externe, convergence instrumentale, discordance et pseudo-convergence.
Fonction et portée
Convergence ≠ vérité.
Le dossier ne propose ni une théorie générale de la science, ni une hiérarchie des disciplines, ni un score de scientificité. Il demande comment plusieurs lignes de preuve modifient raisonnablement le degré de confiance dans une proposition.
Convergence ≠ vérité. Réplication ≠ triangulation. Méthodes différentes ≠ biais indépendants. Nombre de modèles ≠ nombre de preuves indépendantes. Discordance ≠ réfutation automatique. Robustesse ≠ certitude.
National Academies 2019
Reproductibilité et réplicabilité ne contrôlent pas la même chose.
Dans le vocabulaire adopté par le rapport NASEM pour harmoniser des usages disciplinaires variables, la reproductibilité vise l’obtention de résultats computationnels cohérents à partir des mêmes données et conditions d’analyse ; la réplicabilité examine la stabilité d’un résultat à travers de nouvelles études obtenant leurs propres données.
Une réplication réussie ne garantit pas que le résultat original était correct. Un échec de réplication unique ne réfute pas automatiquement et définitivement la proposition initiale.
Cas · Many Labs 2
Une réplication distribuée rend visible l’hétérogénéité.
Many Labs 2 a ciblé 28 findings psychologiques publiés à travers 125 échantillons, pour 15 305 participants dans 36 pays et territoires. Chaque protocole a été administré à environ la moitié des échantillons.
Au seuil p < .05, 15 des 28 findings produisaient un effet significatif dans la même direction que l’original ; 14 sur 28 au seuil p < .0001. Vingt-et-une des 28 tailles d’effet répliquées étaient inférieures aux tailles originales.
Ces nombres décrivent cet ensemble précis. Le chiffre 54 % n’est ni un taux de vérité de la psychologie ni un taux général de réplication de la discipline.
Réplication
Recommencer le même type d’épreuve peut reproduire le même biais.
Munafò et Davey Smith soutiennent dans un commentaire méthodologique de 2018 que la réplication est essentielle mais insuffisante. Plusieurs études peuvent répéter une même mesure inadéquate, un même proxy, une même hypothèse analytique ou une même erreur systématique.
La réplication informe surtout sur la stabilité d’un résultat lorsque la stratégie est recommencée ; elle n’épuise pas la question de sa résistance à des vulnérabilités méthodologiques différentes.
Triangulation
Varier les sources de biais, pas seulement les étiquettes méthodologiques.
Lawlor, Tilling et Davey Smith définissent la triangulation, en épidémiologie étiologique, par l’intégration d’approches dont les principales sources potentielles de biais diffèrent et sont supposées largement non liées.
La convergence devient particulièrement informative lorsque des biais plausibles devraient pousser différentes méthodes dans des directions différentes. La triangulation n’est donc pas un vote majoritaire entre études.
Cette procédure appartient à un domaine précis ; sa logique peut inspirer d’autres sciences, mais elle ne doit pas être transposée mécaniquement partout.
Indépendance épistémique
Méthodes différentes ≠ preuves indépendantes.
Stegenga et Menon distinguent notamment indépendance ontique et indépendance probabiliste. Leur critique rappelle qu’une diversité apparente des matériaux, hypothèses ou théories ne garantit pas à elle seule une confirmation accrue.
Le diagnostic doit remonter aux dépendances concrètes : données chevauchantes, instrument ou calibration commune, population source, hypothèse causale, proxy, code, modèle structurel, procédure de validation, base documentaire ou mécanisme de sélection.
Le dossier ne transforme pas cette architecture qualitative en nombre exact de « preuves indépendantes ».
Construction analytique
Pseudo-convergence : plusieurs sorties peuvent répéter la même vulnérabilité.
Le dossier appelle « pseudo-convergence », comme terme analytique non standardisé, une situation où plusieurs résultats paraissent indépendants mais héritent d’une vulnérabilité commune capable d’expliquer leur accord.
Exemples pédagogiques : plusieurs équipes réanalysant la même base avec des variantes d’un même modèle ; plusieurs capteurs calibrés sur une même référence défectueuse ; plusieurs modèles prédictifs entraînés sur un même corpus biaisé.
Pseudo-convergence ≠ résultats nécessairement faux. Elle interdit seulement de compter mécaniquement chaque sortie comme confirmation indépendante.
Robustesse de modèle
Un résultat peut résister à plusieurs modèles sans établir la vérité d’un mécanisme.
L’intuition classique associée à Levins est qu’un résultat persistant sous plusieurs simplifications de modélisation est robuste relativement à ces choix.
Mais plusieurs modèles peuvent partager données, noyau théorique, paramétrisations ou erreurs de représentation. Robustesse de modèle ≠ confirmation empirique automatique.
Philosophie des sciences
Lloyd propose des conditions pour un rôle confirmatoire.
Elisabeth Lloyd défend, dans le cas de la science du climat, des conditions sous lesquelles une forme de robustesse de modèle peut contribuer à la confirmation : constructions variées, hypothèses soutenues indépendamment, succès de prédiction ou rétrodiction et noyau causal partagé soutenu par une variété de preuves.
Il s’agit d’une thèse philosophique argumentée, non d’une règle consensuelle de la science.
Cas · Ensembles climatiques
Le nombre de modèles n’est pas le nombre de votes indépendants.
Abramowitz et ses collègues soulignent que des modèles climatiques peuvent partager littérature, idées sur la représentation des processus, paramétrisations, jeux de données d’évaluation et parfois portions de code.
Traiter chaque modèle comme observation indépendante peut alors surpondérer certaines familles méthodologiques. Ce cas sert ici uniquement à illustrer la dépendance entre modèles, non à juger globalement la climatologie ou les politiques climatiques.
Convergence instrumentale
Deux appareils qui s’accordent ne suffisent pas si leur chaîne d’erreur est commune.
Des instruments fondés sur des principes différents peuvent accroître la confiance lorsque leurs erreurs systématiques dominantes sont réellement distinctes. Il faut néanmoins examiner grandeur directement mesurée, transformations, calibration, échantillons, standards et incertitudes.
La diversité matérielle peut être informative ; elle n’est pas un certificat automatique d’indépendance.
Validation externe
Robustesse ≠ universalité.
Un résultat retrouvé dans des populations, contextes ou systèmes différents peut soutenir une portée plus large, mais certains phénomènes sont réellement contextuels. Un échec de transport peut conduire à restreindre le domaine de validité plutôt qu’à rejeter entièrement la proposition.
Une conclusion peut donc être robuste localement sans être universelle.
Discordance
Une divergence est une information à expliquer.
Hey insiste sur l’intérêt méthodologique des preuves multimodales discordantes. Le dossier distingue, comme synthèse analytique et non taxonomie de Hey, plusieurs sorties possibles : erreur ou biais identifié, véritable hétérogénéité, questions seulement partiellement équivalentes, ou incertitude encore non résolue.
Discordance ≠ réfutation automatique. Discordance ≠ détail à ignorer.
Dépendances
Éviter le double comptage épistémique.
Plusieurs publications d’une même cohorte, plusieurs méta-analyses chevauchantes, une étude primaire recomptée via une revue, des modèles dérivés d’un même code ou des sous-échantillons chevauchants peuvent donner une impression artificielle d’abondance.
« Double comptage épistémique » est ici une expression pédagogique. Nombre de résultats, d’études, de jeux de données, d’équipes, de méthodes et de sources réellement distinctes d’erreur ne sont pas interchangeables.
Pratiques de recherche
Préenregistrement, ouverture et Registered Reports répondent à des vulnérabilités spécifiques.
Munafò et ses collègues présentent des réformes portant sur méthodes, documentation, transparence, partage, préenregistrement, reporting, évaluation et incitations.
Ces propositions sont traitées comme perspectives méthodologiques, non comme preuve expérimentale qu’un paquet de réformes garantit une science fiable. Préenregistrement ≠ bonne question. Données ouvertes ≠ données non biaisées. Registered Report ≠ mesure valide par définition.
Synthèse pédagogique
Neuf configurations pour décrire les relations entre lignes de preuve.
Reproduction
Mêmes données et même analyse recomputées.
Réplication
Nouvelles données pour une question comparable.
Multi-sites
Même principe dans plusieurs contextes.
Validation externe
Conclusion examinée sur données ou situations distinctes.
Triangulation
Approches aux vulnérabilités principales différentes.
Robustesse de modèle
Résultat stable sous variations de modélisation.
Convergence instrumentale
Mesures différentes d’un même phénomène.
Discordance informative
Résultats incompatibles nécessitant diagnostic.
Pseudo-convergence
Accord apparent entre lignes dépendantes.
PROPOSITION PÉDAGOGIQUE — NON TAXONOMIE DISCIPLINAIRE STANDARDISÉE. Cette liste n’est ni officielle ni exhaustive.
Niveaux de preuve
Ce qui structure le dossier et ce qui reste à établir cas par cas.
Structurant
Reproductibilité et réplicabilité distinctes dans le vocabulaire NASEM ; nouvelles données pour tester la stabilité ; méthodes nominalement différentes pouvant partager des biais ; valeur de la triangulation liée à la diversité pertinente des vulnérabilités ; dépendance possible entre modèles ; utilité diagnostique des discordances.
Cas par cas
Indépendance suffisante de deux lignes particulières ; force confirmatoire d’une convergence ; cause réelle d’une discordance ; couverture suffisante des hypothèses par un ensemble de modèles ; portée d’une validation externe.
À ne pas généraliser
Trois méthodes donc vérité ; réplication réussie donc preuve ; échec de réplication donc réfutation ; plus de modèles donc plus de certitude ; étude ouverte donc correcte.
Laboratoire
Une grille à dix-huit dimensions, sans score de vérité.
Formulation de la proposition ; type de résultat ; nombre de lignes ; données ; populations ou systèmes ; instruments ; modèles ou hypothèses ; choix analytiques ; biais principaux ; direction attendue des biais ; dépendances ; réplications ; discordances ; validation externe ; sensibilité aux modèles ; transparence ; incertitude résiduelle ; conditions de révision.
PROPOSITION PÉDAGOGIQUE / OUTIL CANDIDAT, NON INSTRUMENT VALIDÉ. Aucun score global de vérité, scientificité ou robustesse. La grille ne fournit aucune probabilité d’indépendance et ne remplace ni expertise disciplinaire ni analyse statistique adaptée.
Matrice qualitative
Rendre visibles les dépendances entre lignes de preuve.
Pour chaque paire, le dossier propose d’examiner données communes, population ou système, instruments et calibrations, code ou pipeline, hypothèses causales, sources documentaires, équipes, mécanismes de sélection, validations externes et incertitudes dominantes.
Cette matrice ne calcule pas combien de « preuves indépendantes » valent les résultats. Elle sert à repérer les dépendances manifestes.
Écriture des résultats
Quand les preuves convergent, préciser le domaine de robustesse.
Une conclusion responsable décrit ce vers quoi convergent les lignes de preuve, leurs dimensions d’indépendance relative, leurs hypothèses communes, les variations auxquelles le résultat résiste, les discordances restantes et les incertitudes résiduelles.
La convergence ne justifie pas automatiquement « affaire réglée ».
Écriture des résultats
Quand les preuves divergent, diagnostiquer avant de moyenner.
Il faut vérifier si les études répondent à la même question, examinent des populations comparables, opérationnalisent le même construit, partagent la même intervention ou exposition, présentent des biais orientés différemment, interagissent avec le contexte ou le temps, ou restent compatibles avec l’incertitude statistique.
Une synthèse peut légitimement conclure que les preuves sont actuellement incompatibles.
Confrontation noosophique
Répétition ≠ indépendance ; intégration ≠ fusion.
Cartographie candidate : proposition → premières observations → méthodes, instruments et modèles → résultats → comparaison des biais et dépendances → convergence / discordance → révision du degré de confiance → nouvelles épreuves → maintien, restriction, reformulation ou abandon provisoire.
La littérature sur réplication, triangulation et robustesse ne valide pas empiriquement la Noosophie.
ANALOGIE STRUCTURÉE / OUTIL DE CARTOGRAPHIE — NON THÉORIE GÉNÉRALE DE LA SCIENCE ET NON VALIDATION EMPIRIQUE DE LA NOOSOPHIE.
Limites
Les mêmes mots ne recouvrent pas les mêmes opérations dans tous les champs.
Robustesse statistique, robustesse de modèle, robustesse causale, réplicabilité et triangulation ne sont pas synonymes. Lawlor travaille dans l’épidémiologie étiologique ; Many Labs 2 cible un ensemble sélectionné d’effets psychologiques ; Stegenga & Menon et Lloyd illustrent un débat philosophique ; les ensembles climatiques servent seulement de cas de dépendance entre modèles.
La taxonomie, la matrice et le protocole sont des constructions pédagogiques du dossier et non des instruments validés.
Bibliographie structurante
Dix références principales.
- National Academies of Sciences, Engineering, and Medicine (2019), Reproducibility and Replicability in Science. DOI 10.17226/25303.
- Lawlor, D. A., Tilling, K. & Davey Smith, G. (2016), Triangulation in aetiological epidemiology, International Journal of Epidemiology, 45(6), 1866–1886. DOI 10.1093/ije/dyw314.
- Munafò, M. R., Nosek, B. A., Bishop, D. V. M. et al. (2017), A manifesto for reproducible science, Nature Human Behaviour, 1, 0021. DOI 10.1038/s41562-016-0021.
- Munafò, M. R. & Davey Smith, G. (2018), Robust research needs many lines of evidence, Nature, 553, 399–401. DOI 10.1038/d41586-018-01023-3.
- Klein, R. A. et al. (2018), Many Labs 2, Advances in Methods and Practices in Psychological Science, 1(4), 443–490. DOI 10.1177/2515245918810225.
- Stegenga, J. & Menon, T. (2017), Robustness and Independent Evidence, Philosophy of Science, 84(3), 414–435. DOI 10.1086/692141.
- Hey, S. P. (2015), Robust and Discordant Evidence, Philosophy of Science, 82(1), 55–75. DOI 10.1086/678978.
- Lloyd, E. A. (2015), Model robustness as a confirmatory virtue, Studies in History and Philosophy of Science Part A, 49, 58–68. DOI 10.1016/j.shpsa.2014.12.002.
- Abramowitz, G. et al. (2019), Model dependence in multi-model climate ensembles, Earth System Dynamics, 10, 91–105. DOI 10.5194/esd-10-91-2019.
- Levins, R. (1966), The strategy of model building in population biology, American Scientist, 54(4), 421–431.