Die Replikationskrise hat eine Reihe methodischer Reformen ausgelöst. Im Rahmen der Open Science sollen die Zuverlässigkeit empirischer Befunde erhöht werden. Inwiefern diese Reformen greifen, ist jedoch umstritten. Dieser Beitrag ordnet die wichtigsten Werkzeuge ein, und zeigt, weshalb darüber hinaus Initiativen benötigt werden, die strukturelle Probleme im Forschungssystem lösen.
A ls die Open Science Collaboration im Jahr 2015 versuchte, 100 publizierte Studien aus drei führenden Journals zu wiederholen, fiel das Ergebnis ernüchternd aus: Nur 36 Prozent der Replikationen erreichten erneut statistische Signifikanz. Auch die Effektstärken der Wiederholungen lagen im Mittel bei etwa der Hälfte der ursprünglich berichteten Werte (Open Science Collaboration, 2015). Dieser Befund gilt als ein zentraler Auslöser dessen, was heute als Replikationskrise bezeichnet wird. In den darauffolgenden Jahren entstanden Reformen mit dem Ziel, dass unzuverlässige Resultate gar nicht erst in die Literatur gelangen. Zu diesem Zweck wurden mehrere Open Science Werkzeuge eingeführt.
Fragwürdige Forschungspraktiken
- Publication Bias: Studien ohne signifikanten Effekt werden seltener eingereicht und seltener angenommen, sie verschwinden in der Schublade. Rosenthal (1979) nannte dies das file drawer problem (dt. Schubladenproblematik).
- p-Hacking: Daten werden so lange unterschiedlich ausgewertet, bis der p-Wert unter .05 fällt, etwa durch andere Ausschlusskriterien, zusätzliche Kovariaten oder wiederholtes Testen während der Datenerhebung. Berichtet wird am Ende nur die signifikante Variante.
- HARKing: Kurz für hypothesizing after the results are known. Eine Hypothese wird erst nach Sichtung der Ergebnisse formuliert, im Artikel aber als von Beginn an geplante Vorhersage präsentiert (Kerr, 1998).
- Selektives Berichten: Von mehreren erhobenen Bedingungen, Messzeitpunkten oder abhängigen Variablen erscheinen nur die signifikanten im Artikel.
Wie schwer diese Praktiken in der Summe wiegen, beschreibt Ioannidis (2005) in «Why Most Published Research Findings Are False». Bei kleinen Stichproben, kleinen Effekten und flexiblen Analysen ist ein publizierter Befund unter Umständen häufiger falsch als wahr.
Wo die Probleme entstehen
Um die Reformen einordnen zu können, lohnt sich ein Blick auf die Mechanismen, die zu Verzerrungen oder unzuverlässigen Ergebnissen führen können. Begriffe wie p-Hacking, Publication Bias oder HARKing sind vielen Forschenden mittlerweile geläufig (siehe Kästchen «Fragwürdige Forschungspraktiken»). Weniger sichtbar ist ein Problem, das entsteht, wenn Analysecode und Auswertungsschritte nicht offengelegt werden: die sogenannten researcher degrees of freedom (dt. Freiheitsgrade). Simmons et al. (2011) bezeichneten damit die vielen Entscheidungen, die auf dem Weg von den Rohdaten zum publizierten Ergebnis getroffen werden. Wie viele Versuchspersonen werden getestet? Welche Datenpunkte gelten als Ausreisser? Welche Bedingungen werden verglichen und welche Kovariaten ins Modell aufgenommen? Freiheitsgrade bezeichnen also den Spielraum an methodischen Entscheidungen, den eine Analyse offenlässt. In Feldern mit besonders reichhaltigen Daten ist dieser Spielraum entsprechend gross, weil Daten über viele Schritte hinweg aufbereitet werden.
Viele Analyseentscheidungen lassen sich wissenschaftlich haltbar begründen, aber es gibt mehrere vertretbare Optionen. Die Festlegung der Analyse sollte bestenfalls vor der Sichtung der Daten geschehen. Werden Analyseschritte jedoch erst danach festgelegt, steigt die Wahrscheinlichkeit, zufällig ein signifikantes Ergebnis zu finden, weit über die üblichen fünf Prozent (α = .05) hinaus (Simmons et al., 2011). Freiheitsgrade sind grundsätzlich nicht problematisch, jedoch führen sie zu irreführenden Schlussfolgerungen, wenn sie unbemerkt bleiben und nur ein einziger von vielen möglichen Analysepfaden berichtet wird.
Gelman und Loken (2014) beschrieben dieses Problem als «garden of forking paths» (dt. Garten der gabelnden Pfade; kann man sich gut als Baumdiagramm vorstellen). Auch ohne bewusste Manipulation wählen Forschende während der Datenanalyse an jeder Weggabelung eine plausible Option, und schon die Menge möglicher Pfade macht signifikante Zufallsbefunde wahrscheinlich.
Zusammen mit dem Publication Bias (siehe Kästchen «Fragwürdige Forschungspraktiken») führt das dazu, dass die publizierte Literatur keine repräsentative Stichprobe der tatsächlich durchgeführten Forschung ist, sondern eine nach Signifikanz gefilterte Auswahl, die Effekte systematisch überschätzt.
«In fact, it is unacceptably easy to publish ‹statistically significant› evidence consistent with any hypothesis.»

Präregistrierung und Registered Reports
Die direkteste Antwort auf die Forschungsfreiheitsgrade ist die Präregistrierung. Dabei legen Forschende Hypothesen, Design und Analyseplan öffentlich fest, bevor die Daten erhoben, bzw. analysiert werden (Nosek et al., 2018). Das trennt konfirmatorische von explorativen Analysen und macht nachträgliche Anpassungen sichtbar. Die Wirkung ist messbar, denn präregistrierte Studien berichten im Schnitt deutlich kleinere Effekte (Schäfer & Schwarz, 2019). Allerdings variiert die Qualität der Präregistrierungen stark. Vage Präregistrierungen lassen weiterhin fast jede spätere Entscheidung zu.
Registered Reports gehen einen Schritt weiter und setzen bei den Anreizen an. In diesem Format begutachten Journals oder eigens dafür geschaffene Plattformen wie die Peer Community in Registered Reports die Fragestellung und Methoden, bevor die Daten erhoben werden, und sagen die Publikation unabhängig vom Ausgang zu (Chambers & Tzavella, 2022). In einem zweiten Schritt wird nach Datenerhebung und -analyse nur noch geprüft, ob die konfirmatorischen Analysen wie registriert durchgeführt wurden und ob die explorativen Analysen angemessen sind. Damit wird die Entscheidung über die Veröffentlichung vom Ergebnis entkoppelt. Der Unterschied ist drastisch: 96 Prozent der regulären Artikel berichten ein signifikantes Ergebnis, hingegen nur 44 Prozent der Registered Reports (Scheel et al., 2021). Diese Halbierung der signifikanten Ergebnisse unter Registered Reports legt nahe, dass nicht-signifikante Befunde in konventionellen Publikationswegen überdurchschnittlich häufig in der berüchtigten Schublade verschwinden.
Registered Reports zählen zu den wenigen Reformen, die nicht das Verhalten, sondern die Anreizstruktur selbst verändern. Belohnt werden damit gute Forschungsideen und solide Methoden statt signifikanter Resultate.
Multiversums-Analysen
Bei vielen Entscheidungen in der Datenanalyse lassen sich jedoch, gestützt auf die bisherige Literatur, mehrere Analysepfade gleichermassen gut begründen. Daher verfolgt die Multiversums-Analyse den umgekehrten Ansatz zur Präregistrierung: Anstatt sich vorab auf einen Weg festzulegen, wird die Analyse systematisch über alle Kombinationen plausibler Entscheidungen hinweg wiederholt. Berichtet wird die Verteilung der Ergebnisse über diesen Raum (Steegen et al., 2016).
Das Resultat ist kein einzelner p-Wert, sondern ein Bild davon, wie robust ein Befund gegenüber analytischen Variationen ist. Zeigt sich der gesuchte Effekt über den grössten Teil des Multiversums hinweg, scheint er stabil zu sein. Hängt er von wenigen spezifischen Entscheidungen ab, ist die Veränderung des Ergebnisses in Abhängigkeit von einzelnen Analyseschritten selbst ein berichtenswertes Ergebnis.
FAIR-Daten und offene Reviews
Damit Resultate überhaupt überprüfbar sind, müssen Daten und Analysecode zugänglich sein. Die FAIR-Prinzipien fordern, dass Forschungsdaten findable, accessible, interoperable und reusable sind, also auffindbar, zugänglich, kombinierbar und wiederverwendbar (Wilkinson et al., 2016). Erst dann lassen sich publizierte Analysen unabhängig nachvollziehen. Ergänzend verändert sich die Begutachtung selbst: Unter dem Begriff open peer review werden verschiedene Formen offener Reviews zusammengefasst, etwa die Offenlegung der Identität der Reviewer oder die Veröffentlichung der Reviews neben dem Artikel (Ross-Hellauer, 2017). Ziel ist, auch den bislang verborgenen Teil des Publikationsprozesses nachvollziehbar und transparent zu machen.
Forensische Metawissenschaft
Während Präregistrierung und Multiversums-Analysen vor oder während der Studie ansetzen, prüft die forensische Metawissenschaft (engl. forensic metascience) bereits publizierte Arbeiten im Nachhinein. Automatisierte Werkzeuge durchsuchen Artikel auf statistische Ungereimtheiten. Das Programm statcheck etwa gleicht berichtete p-Werte mit den zugehörigen Teststatistiken ab. Eine Analyse von mehr als 250’000 p-Werten ergab, dass rund die Hälfte der untersuchten Artikel mindestens eine inkonsistente Angabe enthielt und etwa jeder achte Artikel einen Fehler, der die statistische Schlussfolgerung verändern konnte (Nuijten et al., 2016). Der GRIM-Test wiederum prüft, ob berichtete Mittelwerte bei gegebener Stichprobengrösse überhaupt möglich sind (Brown & Heathers, 2017). Solche Verfahren belegen keinen Betrug, aber sie machen Fehler und unplausible Angaben sichtbar, die sonst unbemerkt bleiben. Voraussetzung für diese Prüfungen und für unabhängige Re-Analysen ist natürlich, dass Daten und Code offen zugänglich sind (siehe Kästchen «FAIR-Daten und offene Reviews»).
Big Team Science
Big Team Science bezeichnet gross angelegte, kollaborative Forschungsinitiativen, bei denen Forschende aus vielen Laboren gemeinsam Studien durchführen oder die Reproduzierbarkeit publizierter Befunde überprüfen. Dabei werden bestehende Experimente möglichst originalgetreu repliziert, Datensätze unabhängig erneut analysiert oder neue, an verschiedenen Standorten angelegte Studien mit grossen und diversen Stichproben realisiert. Ziel ist es, die Robustheit und Generalisierbarkeit wissenschaftlicher Befunde zu testen, offene und transparente Forschung zu fördern, Replikations- und Grossstudien effizient zu koordinieren und Nachwuchsforschende in Open Science Praktiken auszubilden. Je nach Format arbeiten Teams über mehrere Tage bis Monate oder in dauerhaften Netzwerken zusammen und veröffentlichen die Ergebnisse gemeinsam. Beispiele sind die Many Labs Projekte, der Psychological Science Accelerator sowie die Replication Games des Institute for Replication (I4R), die beispielweise im Januar 2026 auch am Psychologischen Institut stattgefunden haben: www.i4replication.org/games.
Reform und Anreize
Zusammengenommen bilden diese Methoden einen Open Science Werkzeugkasten für den Umgang mit Unsicherheit in wissenschaftlichen Publikationen. Ein einzelnes Verfahren genügt selten, ihr Wert liegt in der Kombination (Munafò et al., 2017). Präregistrierung begrenzt nachträgliche Flexibilität, Registered Reports koppeln die Publikation vom Ergebnis ab, Multiversums-Analysen machen analytische Abhängigkeiten sichtbar, und forensische Methoden prüfen Ergebnisse im Nachhinein.
Offen bleibt jedoch der Kern des Problems. Die Anreize des Wissenschaftssystems haben sich kaum verändert. Akademische Karrieren hängen weiterhin von der Zahl der Publikationen und Zitationskennzahlen ab, und auffällige signifikante Befunde lassen sich nach wie vor leichter veröffentlichen als sorgfältige Nullergebnisse oder aufwändige Replikationen. Solange das so bleibt, besteht die Gefahr, dass Transparenz zur blossen Form wird, während die alten Muster darunter weiterlaufen. Das eigentlich Unausgesprochene ist deshalb nicht, dass fragwürdige Forschungspraktiken auftreten, sondern dass die Anreizstrukturen, die sie begünstigen, in der Wissenschaft selten offen benannt werden. Werden Open Science Praktiken konsequenter vorangetrieben und Initiativen wie Big Team Science gestärkt (siehe Kästchen «Big Team Science»), können sich diese Anreize verändern. Die Aufgabe der Open Science Praktiken bleibt dabei: die Unsicherheit nicht zu verbergen, sondern sichtbar zu machen.























