Every reference list carries retrieval dates, and almost nobody is told why. The reason is that a web source is not a book: it can be edited, moved or deleted after you cite it, and then your citation points at something that no longer supports your sentence. I checked 150 sources from real reference lists to see how bad it is.
In jedem Literaturverzeichnis stehen Abrufdaten, und kaum jemandem wird gesagt, wozu. Der Grund: Eine Webquelle ist kein Buch. Sie kann nach dem Zitieren geändert, verschoben oder gelöscht werden — und dann zeigt der Beleg auf etwas, das den eigenen Satz nicht mehr trägt. Ich habe 150 Quellen aus echten Literaturverzeichnissen geprüft.
This is not a new problem, and it is well measured. Three findings are worth knowing before your own reference list gets long.
One in five scholarly articles is affected. Klein and colleagues examined more than a million web references from roughly 3.5 million articles published between 1997 and 2012. One in five articles suffered from what they named reference rot. Among articles that contain web references at all, seven in ten were affected.
The link often survives while the content does not. This is the part that catches people out. Jones and colleagues compared archived snapshots against the live page for 241,091 references: for 76.35 % the content had drifted away from what was originally referenced. The link still resolves, returns HTTP 200, looks perfectly healthy — and no longer contains the sentence you cited. A broken link announces itself. Content drift does not.
And the web keeps shedding pages. Pew Research Center found in 2024 that 38 % of the pages that existed in 2013 were no longer accessible ten years later. In their sample, 54 % of Wikipedia articles contained at least one dead link in the references section.
Those studies stop between 2015 and 2023. I wanted current numbers on the question that actually decides whether a lost source is recoverable: is there a copy anywhere?
I took the external links from the reference and further-reading sections of German-language Wikipedia articles in five categories of economics and social policy — the kind of source students cite most: agencies, associations, ministries, press. One link per host, so a single much-linked government page could not dominate the result. 150 sources, checked on 2 August 2026 for two things: does the server still answer, and does the Internet Archive hold a snapshot.
| Result | Count | Share |
|---|---|---|
| Reachable | 95 | 63.3 % |
| Gone (HTTP 404 or 410) | 29 | 19.3 % |
| Unresolved (bot defence, misconfiguration, outage) | 26 | 17.3 % |
| No archived snapshot at all | 13 | 8.7 % |
| Gone and never archived | 3 | 2.0 % |
The last row is the one that matters. Those sources cannot be recovered by anyone. If a thesis rested on one of them, the evidence for that passage is simply not there any more.
The second number in the box above deserves as much attention. Where a snapshot does exist, the newest one is a median of 603 days old — about 1.7 years. For the oldest quarter it is 2773 days, roughly 7.6 years. So even when the Internet Archive has your source, what it has is often not the version you read. Combined with the 76 % content-drift finding above, "it is in the Wayback Machine" is a weaker safety net than it feels like.
Where I got this wrong first. My initial run reported 38.7 % gone and
57.3 % unarchived. Both were wrong, and wrong in the direction that would have made the
article more dramatic. Two mistakes: I counted every non-answer as a dead link, although
HTTP 403 usually means bot defence on a page that opens fine in a browser; and I counted
a non-responding archive service as "not archived", which put dejure.org and
bgbl.de in that column — both archived for years. The archive API was simply
rate-limiting my parallel requests. The script now separates "the server says it is gone"
from "I could not find out", retries, and reports the unresolved cases as their own row.
A measurement that mistakes its own failures for findings measures nothing.
The retrieval date is not decoration. It is the statement this is what stood there on this day, and it is the only part of a web citation that stays true. But a date alone does not let anyone check your claim. That takes a copy.
Secure the source at the moment you cite it, not at the end. This is the whole advice in one sentence. At the end of a thesis, some of the sources will already have moved. While writing, every one of them is still in front of you.
A page saved as PDF is a picture of what a browser displayed. It carries no qualified signature, no trusted timestamp, no chain of custody, and it does not prove that a page ever existed — someone could have edited it. For scholarly work that is fine: your copy documents what you read, and the retrieval date and archive permalink do the public part. Where legal proof is at stake, that is a different task and needs a service built for it.
Copyright law in the German-speaking countries provides exceptions for private study and for scientific use, which is the ground on which keeping a working copy usually stands. What exactly they permit differs by country and by case, and redistributing or publishing such copies is a separate question. This article does not determine any of that: for your specific situation, your university library or legal advice service is the right place to ask. Nothing here is legal advice.
The script and the raw data are public. Every checked URL is in the JSON with its status, verdict, archive timestamp and snapshot age, so you can recount any number here.
python3 messung-quellen-archiv.py --stichprobe 150 --saat 20260802
Raw data (JSON, CC BY 4.0) · Script
Limits. This is not a random sample of everything students cite. Wikipedia references are maintained better than average — dead links get noticed and fixed there — so the true figures for an unmaintained reference list are more likely worse than these, not better. The categories are German-language economics and social policy; other fields will differ. Single run, one day.
Scope of these statements. The figures from the three cited studies are quoted from the published articles, linked in full below. My own measurement was taken on 2 August 2026 and reflects that day; run the script again and the numbers will differ. Statements about the Internet Archive and Perma.cc describe what those services publish about themselves, with the retrieval date given — no claim is made about how they will behave in future. Citation rules are set by your institution, not by this page. Corrections via GitHub issues are taken up.
Das Problem ist nicht neu und gut vermessen. Drei Befunde sollte man kennen, bevor das eigene Literaturverzeichnis lang wird.
Jeder fünfte Fachartikel ist betroffen. Klein und Kollegen untersuchten über eine Million Weblinks aus rund 3,5 Millionen Artikeln der Jahre 1997 bis 2012. Jeder fünfte Artikel litt unter dem, was sie reference rot nannten. Unter den Artikeln, die überhaupt Weblinks enthalten, waren sieben von zehn betroffen.
Oft überlebt der Link, nicht aber der Inhalt. Das ist die Falle, die die wenigsten auf dem Schirm haben. Jones und Kollegen verglichen für 241.091 Belege den archivierten Stand mit der heutigen Seite: Bei 76,35 % hatte sich der Inhalt von dem entfernt, worauf ursprünglich verwiesen wurde. Der Link funktioniert weiterhin, liefert HTTP 200, wirkt völlig gesund — und enthält den zitierten Satz nicht mehr. Ein toter Link meldet sich. Ein veränderter Inhalt nicht.
Und das Netz verliert laufend Seiten. Das Pew Research Center stellte 2024 fest, dass 38 % der 2013 vorhandenen Seiten zehn Jahre später nicht mehr erreichbar waren. In deren Stichprobe enthielten 54 % der Wikipedia-Artikel mindestens einen toten Link im Belegabschnitt.
Diese Studien enden zwischen 2015 und 2023. Mich interessierten aktuelle Zahlen zu der Frage, die tatsächlich darüber entscheidet, ob eine verlorene Quelle wiederherstellbar ist: Gibt es irgendwo eine Kopie?
Ich habe die externen Links aus den Beleg- und Weblink-Abschnitten deutschsprachiger Wikipedia-Artikel aus fünf Kategorien der Wirtschafts- und Sozialwissenschaften genommen — genau die Sorte Quelle, die Studierende am häufigsten zitieren: Behörden, Verbände, Ministerien, Presse. Je Host nur ein Link, damit nicht eine einzelne, oft verlinkte Behördenseite das Ergebnis bestimmt. 150 Quellen, geprüft am 2. August 2026 auf zwei Dinge: Antwortet der Server noch, und liegt im Internet Archive ein Schnappschuss?
| Ergebnis | Anzahl | Anteil |
|---|---|---|
| Erreichbar | 95 | 63.3 % |
| Verschwunden (HTTP 404 oder 410) | 29 | 19.3 % |
| Ungeklärt (Bot-Abwehr, Fehlkonfiguration, Störung) | 26 | 17.3 % |
| Überhaupt kein Archiv-Schnappschuss | 13 | 8.7 % |
| Verschwunden und nie archiviert | 3 | 2.0 % |
Die letzte Zeile ist die entscheidende. Diese Quellen kann niemand mehr beschaffen. Stünde eine Arbeit auf einer davon, wäre der Beleg für diese Passage schlicht nicht mehr da.
Die zweite Zahl im Kasten oben verdient genauso viel Aufmerksamkeit. Wo es einen Schnappschuss gibt, ist der jüngste im Median 603 Tage alt — rund 1,7 Jahre. Beim ältesten Viertel sind es 2773 Tage, also etwa 7,6 Jahre. Selbst wenn das Internet Archive Ihre Quelle hat, hat es also oft nicht die Fassung, die Sie gelesen haben. Zusammen mit den 76 % veränderter Inhalte von oben heißt das: „Steht doch in der Wayback Machine" trägt weniger weit, als es sich anfühlt.
Wo ich zuerst danebenlag. Mein erster Durchlauf meldete 38,7 %
verschwunden und 57,3 % ohne Archiv. Beides war falsch — und zwar in die Richtung, die den
Artikel dramatischer gemacht hätte. Zwei Fehler: Ich zählte jede Nichtantwort als toten
Link, obwohl HTTP 403 meist Bot-Abwehr einer Seite ist, die im Browser einwandfrei lädt.
Und ich zählte einen nicht antwortenden Archivdienst als „nicht archiviert", wodurch
dejure.org und bgbl.de in dieser Spalte landeten — beide seit
Jahren archiviert. Der Dienst hatte lediglich meine parallelen Anfragen gedrosselt. Das
Skript trennt jetzt „der Server sagt, es ist weg" von „ich konnte es nicht klären", fasst
nach und weist die ungeklärten Fälle als eigene Zeile aus. Eine Messung, die eigene Pannen
für Befunde hält, misst nichts.
Das Abrufdatum ist kein Zierrat. Es ist die Aussage so stand es an diesem Tag dort, und es ist der einzige Teil einer Webquellenangabe, der dauerhaft wahr bleibt. Nur: Ein Datum allein erlaubt niemandem, Ihre Aussage zu prüfen. Dafür braucht es eine Kopie.
Sichern Sie die Quelle in dem Moment, in dem Sie sie zitieren — nicht am Schluss. Das ist der ganze Rat in einem Satz. Am Ende einer Arbeit sind einige der Quellen bereits umgezogen. Während des Schreibens liegt jede einzelne noch vor Ihnen.
Eine als PDF gesicherte Seite ist ein Bild dessen, was ein Browser angezeigt hat. Sie trägt keine qualifizierte Signatur, keinen vertrauenswürdigen Zeitstempel, keine lückenlose Nachweiskette, und sie beweist nicht, dass eine Seite je so existiert hat — verändern ließe sie sich ebenso. Für wissenschaftliches Arbeiten genügt das: Ihre Kopie dokumentiert, was Sie gelesen haben, und Abrufdatum samt Archiv-Dauerlink erledigen den öffentlichen Teil. Wo es auf Beweiskraft ankommt, ist das eine andere Aufgabe und braucht einen dafür gebauten Dienst.
Das Urheberrecht im deutschsprachigen Raum kennt Schranken für den eigenen Gebrauch und für wissenschaftliche Zwecke — auf diesem Boden steht das Anlegen einer Arbeitskopie üblicherweise. Was genau sie erlauben, unterscheidet sich nach Land und Einzelfall, und die Weitergabe oder Veröffentlichung solcher Kopien ist eine eigene Frage. Dieser Artikel entscheidet nichts davon: Für Ihren konkreten Fall sind Ihre Hochschulbibliothek oder eine Rechtsberatung die richtige Adresse. Nichts hiervon ist Rechtsberatung.
Skript und Rohdaten sind öffentlich. Jede geprüfte URL steht mit Status, Urteil, Archivzeitstempel und Alter des Schnappschusses in der JSON-Datei, sodass sich jede Zahl hier nachrechnen lässt.
python3 messung-quellen-archiv.py --stichprobe 150 --saat 20260802
Rohdaten (JSON, CC BY 4.0) · Skript
Grenzen. Das ist keine Zufallsstichprobe aus allem, was Studierende zitieren. Wikipedia-Belege werden besser gepflegt als der Durchschnitt — tote Links fallen dort auf und werden ersetzt —, die echten Werte für ein ungepflegtes Literaturverzeichnis dürften also eher schlechter ausfallen als diese, nicht besser. Die Kategorien stammen aus den deutschsprachigen Wirtschafts- und Sozialwissenschaften; andere Fächer sehen anders aus. Ein Durchlauf, ein Tag.
Reichweite dieser Angaben. Die Zahlen der drei zitierten Studien sind den veröffentlichten Aufsätzen entnommen, die unten vollständig verlinkt sind. Meine eigene Messung stammt vom 2. August 2026 und gibt diesen Tag wieder; ein erneuter Lauf liefert andere Werte. Aussagen über das Internet Archive und Perma.cc geben wieder, was diese Dienste selbst veröffentlichen, mit Abrufdatum — über ihr künftiges Verhalten wird nichts behauptet. Die Zitierregeln setzt Ihre Hochschule, nicht diese Seite. Korrekturen über GitHub-Issues werden übernommen.