Web citations that vanish

Quellen, die verschwinden

Every reference list carries retrieval dates, and almost nobody is told why. The reason is that a web source is not a book: it can be edited, moved or deleted after you cite it, and then your citation points at something that no longer supports your sentence. I checked 150 sources from real reference lists to see how bad it is.

In jedem Literaturverzeichnis stehen Abrufdaten, und kaum jemandem wird gesagt, wozu. Der Grund: Eine Webquelle ist kein Buch. Sie kann nach dem Zitieren geändert, verschoben oder gelöscht werden — und dann zeigt der Beleg auf etwas, das den eigenen Satz nicht mehr trägt. Ich habe 150 Quellen aus echten Literaturverzeichnissen geprüft.

2 August 2026 · 150 sources · raw data (CC BY 4.0) and method included 2. August 2026 · 150 Quellen · Rohdaten (CC BY 4.0) und Methode dabei

A personal report. Ein persönlicher Bericht. This is a private, non-commercial account by an individual — not advice from an institution, and not legal advice. The measurement is a single run on a stated date; the practical suggestions are the author's own opinion. Citation rules differ between universities and style guides: what your department requires always wins over what is written here. The author develops Full Page PDF Snap, one of several ways to keep a copy of a source; the alternatives below are named without it. Corrections: GitHub issues. Dies ist ein privater, nicht kommerzieller Bericht einer Einzelperson — keine Auskunft einer Institution und keine Rechtsberatung. Die Messung ist ein einzelner Durchlauf zu einem genannten Datum; die praktischen Vorschläge sind die Meinung des Autors. Zitierregeln unterscheiden sich zwischen Hochschulen und Zitierweisen: Was Ihr Institut vorschreibt, geht dem hier Geschriebenen immer vor. Der Autor entwickelt Full Page PDF Snap, eines von mehreren Mitteln, eine Quelle zu sichern; die Alternativen unten stehen ohne dieses Mittel. Korrekturen: GitHub-Issues.
19.3 %
of the sources are gone — the server itself says soder Quellen sind weg — der Server sagt es selbst
603
days: median age of the newest archived copyTage: mittleres Alter der jüngsten Archivkopie
2.0 %
gone and never archived — unrecoverableweg und nie archiviert — unwiederbringlich

What the research already established

This is not a new problem, and it is well measured. Three findings are worth knowing before your own reference list gets long.

One in five scholarly articles is affected. Klein and colleagues examined more than a million web references from roughly 3.5 million articles published between 1997 and 2012. One in five articles suffered from what they named reference rot. Among articles that contain web references at all, seven in ten were affected.

The link often survives while the content does not. This is the part that catches people out. Jones and colleagues compared archived snapshots against the live page for 241,091 references: for 76.35 % the content had drifted away from what was originally referenced. The link still resolves, returns HTTP 200, looks perfectly healthy — and no longer contains the sentence you cited. A broken link announces itself. Content drift does not.

And the web keeps shedding pages. Pew Research Center found in 2024 that 38 % of the pages that existed in 2013 were no longer accessible ten years later. In their sample, 54 % of Wikipedia articles contained at least one dead link in the references section.

What I measured

Those studies stop between 2015 and 2023. I wanted current numbers on the question that actually decides whether a lost source is recoverable: is there a copy anywhere?

I took the external links from the reference and further-reading sections of German-language Wikipedia articles in five categories of economics and social policy — the kind of source students cite most: agencies, associations, ministries, press. One link per host, so a single much-linked government page could not dominate the result. 150 sources, checked on 2 August 2026 for two things: does the server still answer, and does the Internet Archive hold a snapshot.

ResultCountShare
Reachable9563.3 %
Gone (HTTP 404 or 410)2919.3 %
Unresolved (bot defence, misconfiguration, outage)2617.3 %
No archived snapshot at all138.7 %
Gone and never archived32.0 %

The last row is the one that matters. Those sources cannot be recovered by anyone. If a thesis rested on one of them, the evidence for that passage is simply not there any more.

The second number in the box above deserves as much attention. Where a snapshot does exist, the newest one is a median of 603 days old — about 1.7 years. For the oldest quarter it is 2773 days, roughly 7.6 years. So even when the Internet Archive has your source, what it has is often not the version you read. Combined with the 76 % content-drift finding above, "it is in the Wayback Machine" is a weaker safety net than it feels like.

Where I got this wrong first. My initial run reported 38.7 % gone and 57.3 % unarchived. Both were wrong, and wrong in the direction that would have made the article more dramatic. Two mistakes: I counted every non-answer as a dead link, although HTTP 403 usually means bot defence on a page that opens fine in a browser; and I counted a non-responding archive service as "not archived", which put dejure.org and bgbl.de in that column — both archived for years. The archive API was simply rate-limiting my parallel requests. The script now separates "the server says it is gone" from "I could not find out", retries, and reports the unresolved cases as their own row. A measurement that mistakes its own failures for findings measures nothing.

What follows for your reference list

The retrieval date is not decoration. It is the statement this is what stood there on this day, and it is the only part of a web citation that stays true. But a date alone does not let anyone check your claim. That takes a copy.

Secure the source at the moment you cite it, not at the end. This is the whole advice in one sentence. At the end of a thesis, some of the sources will already have moved. While writing, every one of them is still in front of you.

  1. Public archive, when the page is public. Save Page Now at the Internet Archive stores a copy in seconds and gives you a dated permalink that anyone can open — the strongest option for a reference list, because your reader verifies it without your help. Perma.cc is a comparable service; ask your library whether your institution provides access. Two limits worth knowing: a crawler without your credentials cannot reach a page behind a login or a paywall, and archived copies are not permanent by decree — the Internet Archive states that site owners may request exclusion („send us a request to [email protected]“, help.archive.org, retrieved 2 August 2026).
  2. Your own copy, always. Behind a login, behind a paywall, or on a page that refuses archiving, the public route ends. A local copy — a PDF of the full page — still works, because it is made in your own browser. Keep it in the same folder as the chapter it belongs to, named so you can find it again: source, date, topic.
  3. Both, for anything load-bearing. If your argument stands or falls with a source, spend the extra thirty seconds. The permalink proves it publicly; your copy survives even if the archive is asked to remove it.
  4. Note what you actually used. Not just the URL: the retrieval date, the exact page (not the homepage), the author or issuing body, and — if it is a document — the version or date printed on it. Your citation style prescribes the form; these are the parts you cannot reconstruct later.

What a saved copy is not

A page saved as PDF is a picture of what a browser displayed. It carries no qualified signature, no trusted timestamp, no chain of custody, and it does not prove that a page ever existed — someone could have edited it. For scholarly work that is fine: your copy documents what you read, and the retrieval date and archive permalink do the public part. Where legal proof is at stake, that is a different task and needs a service built for it.

Copyright law in the German-speaking countries provides exceptions for private study and for scientific use, which is the ground on which keeping a working copy usually stands. What exactly they permit differs by country and by case, and redistributing or publishing such copies is a separate question. This article does not determine any of that: for your specific situation, your university library or legal advice service is the right place to ask. Nothing here is legal advice.

Reproduce it

The script and the raw data are public. Every checked URL is in the JSON with its status, verdict, archive timestamp and snapshot age, so you can recount any number here.

python3 messung-quellen-archiv.py --stichprobe 150 --saat 20260802

Raw data (JSON, CC BY 4.0) · Script

Limits. This is not a random sample of everything students cite. Wikipedia references are maintained better than average — dead links get noticed and fixed there — so the true figures for an unmaintained reference list are more likely worse than these, not better. The categories are German-language economics and social policy; other fields will differ. Single run, one day.

Scope of these statements. The figures from the three cited studies are quoted from the published articles, linked in full below. My own measurement was taken on 2 August 2026 and reflects that day; run the script again and the numbers will differ. Statements about the Internet Archive and Perma.cc describe what those services publish about themselves, with the retrieval date given — no claim is made about how they will behave in future. Citation rules are set by your institution, not by this page. Corrections via GitHub issues are taken up.

Sources

Klein, M., Van de Sompel, H., Sanderson, R., Shankar, H., Balakireva, L., Zhou, K., & Tobin, R. (2014). Scholarly Context Not Found: One in Five Articles Suffers from Reference Rot. PLoS ONE, 9(12), e115253. https://doi.org/10.1371/journal.pone.0115253
Jones, S. M., Van de Sompel, H., Shankar, H., Klein, M., Tobin, R., & Grover, C. (2016). Scholarly Context Adrift: Three out of Four URI References Lead to Changed Content. PLoS ONE, 11(12), e0167475. https://doi.org/10.1371/journal.pone.0167475
Chapekis, A., Bestvater, S., Remy, E., & Rivero, G. (2024, 17 May). When Online Content Disappears. Pew Research Center. pewresearch.org (retrieved 2 August 2026)

Was die Forschung bereits gezeigt hat

Das Problem ist nicht neu und gut vermessen. Drei Befunde sollte man kennen, bevor das eigene Literaturverzeichnis lang wird.

Jeder fünfte Fachartikel ist betroffen. Klein und Kollegen untersuchten über eine Million Weblinks aus rund 3,5 Millionen Artikeln der Jahre 1997 bis 2012. Jeder fünfte Artikel litt unter dem, was sie reference rot nannten. Unter den Artikeln, die überhaupt Weblinks enthalten, waren sieben von zehn betroffen.

Oft überlebt der Link, nicht aber der Inhalt. Das ist die Falle, die die wenigsten auf dem Schirm haben. Jones und Kollegen verglichen für 241.091 Belege den archivierten Stand mit der heutigen Seite: Bei 76,35 % hatte sich der Inhalt von dem entfernt, worauf ursprünglich verwiesen wurde. Der Link funktioniert weiterhin, liefert HTTP 200, wirkt völlig gesund — und enthält den zitierten Satz nicht mehr. Ein toter Link meldet sich. Ein veränderter Inhalt nicht.

Und das Netz verliert laufend Seiten. Das Pew Research Center stellte 2024 fest, dass 38 % der 2013 vorhandenen Seiten zehn Jahre später nicht mehr erreichbar waren. In deren Stichprobe enthielten 54 % der Wikipedia-Artikel mindestens einen toten Link im Belegabschnitt.

Was ich gemessen habe

Diese Studien enden zwischen 2015 und 2023. Mich interessierten aktuelle Zahlen zu der Frage, die tatsächlich darüber entscheidet, ob eine verlorene Quelle wiederherstellbar ist: Gibt es irgendwo eine Kopie?

Ich habe die externen Links aus den Beleg- und Weblink-Abschnitten deutschsprachiger Wikipedia-Artikel aus fünf Kategorien der Wirtschafts- und Sozialwissenschaften genommen — genau die Sorte Quelle, die Studierende am häufigsten zitieren: Behörden, Verbände, Ministerien, Presse. Je Host nur ein Link, damit nicht eine einzelne, oft verlinkte Behördenseite das Ergebnis bestimmt. 150 Quellen, geprüft am 2. August 2026 auf zwei Dinge: Antwortet der Server noch, und liegt im Internet Archive ein Schnappschuss?

ErgebnisAnzahlAnteil
Erreichbar9563.3 %
Verschwunden (HTTP 404 oder 410)2919.3 %
Ungeklärt (Bot-Abwehr, Fehlkonfiguration, Störung)2617.3 %
Überhaupt kein Archiv-Schnappschuss138.7 %
Verschwunden und nie archiviert32.0 %

Die letzte Zeile ist die entscheidende. Diese Quellen kann niemand mehr beschaffen. Stünde eine Arbeit auf einer davon, wäre der Beleg für diese Passage schlicht nicht mehr da.

Die zweite Zahl im Kasten oben verdient genauso viel Aufmerksamkeit. Wo es einen Schnappschuss gibt, ist der jüngste im Median 603 Tage alt — rund 1,7 Jahre. Beim ältesten Viertel sind es 2773 Tage, also etwa 7,6 Jahre. Selbst wenn das Internet Archive Ihre Quelle hat, hat es also oft nicht die Fassung, die Sie gelesen haben. Zusammen mit den 76 % veränderter Inhalte von oben heißt das: „Steht doch in der Wayback Machine" trägt weniger weit, als es sich anfühlt.

Wo ich zuerst danebenlag. Mein erster Durchlauf meldete 38,7 % verschwunden und 57,3 % ohne Archiv. Beides war falsch — und zwar in die Richtung, die den Artikel dramatischer gemacht hätte. Zwei Fehler: Ich zählte jede Nichtantwort als toten Link, obwohl HTTP 403 meist Bot-Abwehr einer Seite ist, die im Browser einwandfrei lädt. Und ich zählte einen nicht antwortenden Archivdienst als „nicht archiviert", wodurch dejure.org und bgbl.de in dieser Spalte landeten — beide seit Jahren archiviert. Der Dienst hatte lediglich meine parallelen Anfragen gedrosselt. Das Skript trennt jetzt „der Server sagt, es ist weg" von „ich konnte es nicht klären", fasst nach und weist die ungeklärten Fälle als eigene Zeile aus. Eine Messung, die eigene Pannen für Befunde hält, misst nichts.

Was daraus für Ihr Literaturverzeichnis folgt

Das Abrufdatum ist kein Zierrat. Es ist die Aussage so stand es an diesem Tag dort, und es ist der einzige Teil einer Webquellenangabe, der dauerhaft wahr bleibt. Nur: Ein Datum allein erlaubt niemandem, Ihre Aussage zu prüfen. Dafür braucht es eine Kopie.

Sichern Sie die Quelle in dem Moment, in dem Sie sie zitieren — nicht am Schluss. Das ist der ganze Rat in einem Satz. Am Ende einer Arbeit sind einige der Quellen bereits umgezogen. Während des Schreibens liegt jede einzelne noch vor Ihnen.

  1. Öffentliches Archiv, solange die Seite öffentlich ist. Save Page Now beim Internet Archive legt in Sekunden eine Kopie an und liefert einen datierten Dauerlink, den jede und jeder öffnen kann — für ein Literaturverzeichnis die stärkste Variante, weil Ihre Leserschaft es ohne Ihr Zutun nachprüfen kann. Perma.cc leistet dasselbe und ist ein vergleichbarer Dienst; fragen Sie Ihre Bibliothek, ob Ihre Hochschule Zugang bereitstellt. Zwei Grenzen sollte man kennen: Ein Crawler ohne Ihre Zugangsdaten kommt nicht hinter einen Login oder eine Bezahlschranke, und archivierte Kopien sind nicht per Dekret dauerhaft — das Internet Archive gibt an, dass Seitenbetreiber einen Ausschluss beantragen können („send us a request to [email protected]“, help.archive.org, abgerufen am 2. August 2026).
  2. Eine eigene Kopie, immer. Hinter einem Login, hinter einer Bezahlschranke oder bei einer Seite, die Archivierung ablehnt, endet der öffentliche Weg. Eine lokale Kopie — ein PDF der vollständigen Seite — funktioniert weiterhin, weil sie im eigenen Browser entsteht. Legen Sie sie in denselben Ordner wie das Kapitel, zu dem sie gehört, und benennen Sie sie so, dass Sie sie wiederfinden: Quelle, Datum, Thema.
  3. Beides, wenn etwas tragend ist. Steht und fällt Ihr Argument mit einer Quelle, investieren Sie die zusätzlichen dreißig Sekunden. Der Dauerlink belegt öffentlich, Ihre Kopie überlebt auch dann, wenn das Archiv die Aufnahme entfernen muss.
  4. Notieren Sie, was Sie tatsächlich benutzt haben. Nicht nur die URL: Abrufdatum, die genaue Seite (nicht die Startseite), Urheber oder herausgebende Stelle und — bei einem Dokument — die darauf gedruckte Fassung oder das Datum. Die Form gibt Ihre Zitierweise vor; das sind die Angaben, die sich später nicht mehr rekonstruieren lassen.

Was eine gesicherte Kopie nicht ist

Eine als PDF gesicherte Seite ist ein Bild dessen, was ein Browser angezeigt hat. Sie trägt keine qualifizierte Signatur, keinen vertrauenswürdigen Zeitstempel, keine lückenlose Nachweiskette, und sie beweist nicht, dass eine Seite je so existiert hat — verändern ließe sie sich ebenso. Für wissenschaftliches Arbeiten genügt das: Ihre Kopie dokumentiert, was Sie gelesen haben, und Abrufdatum samt Archiv-Dauerlink erledigen den öffentlichen Teil. Wo es auf Beweiskraft ankommt, ist das eine andere Aufgabe und braucht einen dafür gebauten Dienst.

Das Urheberrecht im deutschsprachigen Raum kennt Schranken für den eigenen Gebrauch und für wissenschaftliche Zwecke — auf diesem Boden steht das Anlegen einer Arbeitskopie üblicherweise. Was genau sie erlauben, unterscheidet sich nach Land und Einzelfall, und die Weitergabe oder Veröffentlichung solcher Kopien ist eine eigene Frage. Dieser Artikel entscheidet nichts davon: Für Ihren konkreten Fall sind Ihre Hochschulbibliothek oder eine Rechtsberatung die richtige Adresse. Nichts hiervon ist Rechtsberatung.

Selbst nachmessen

Skript und Rohdaten sind öffentlich. Jede geprüfte URL steht mit Status, Urteil, Archivzeitstempel und Alter des Schnappschusses in der JSON-Datei, sodass sich jede Zahl hier nachrechnen lässt.

python3 messung-quellen-archiv.py --stichprobe 150 --saat 20260802

Rohdaten (JSON, CC BY 4.0) · Skript

Grenzen. Das ist keine Zufallsstichprobe aus allem, was Studierende zitieren. Wikipedia-Belege werden besser gepflegt als der Durchschnitt — tote Links fallen dort auf und werden ersetzt —, die echten Werte für ein ungepflegtes Literaturverzeichnis dürften also eher schlechter ausfallen als diese, nicht besser. Die Kategorien stammen aus den deutschsprachigen Wirtschafts- und Sozialwissenschaften; andere Fächer sehen anders aus. Ein Durchlauf, ein Tag.

Reichweite dieser Angaben. Die Zahlen der drei zitierten Studien sind den veröffentlichten Aufsätzen entnommen, die unten vollständig verlinkt sind. Meine eigene Messung stammt vom 2. August 2026 und gibt diesen Tag wieder; ein erneuter Lauf liefert andere Werte. Aussagen über das Internet Archive und Perma.cc geben wieder, was diese Dienste selbst veröffentlichen, mit Abrufdatum — über ihr künftiges Verhalten wird nichts behauptet. Die Zitierregeln setzt Ihre Hochschule, nicht diese Seite. Korrekturen über GitHub-Issues werden übernommen.

Quellen

Klein, M., Van de Sompel, H., Sanderson, R., Shankar, H., Balakireva, L., Zhou, K. & Tobin, R. (2014). Scholarly Context Not Found: One in Five Articles Suffers from Reference Rot. PLoS ONE, 9(12), e115253. https://doi.org/10.1371/journal.pone.0115253
Jones, S. M., Van de Sompel, H., Shankar, H., Klein, M., Tobin, R. & Grover, C. (2016). Scholarly Context Adrift: Three out of Four URI References Lead to Changed Content. PLoS ONE, 11(12), e0167475. https://doi.org/10.1371/journal.pone.0167475
Chapekis, A., Bestvater, S., Remy, E. & Rivero, G. (2024, 17. Mai). When Online Content Disappears. Pew Research Center. pewresearch.org (abgerufen am 2. August 2026)