Where citation data actually lives: 18 scholarly platforms measured

Wo Zitationsdaten tatsächlich stehen: 18 wissenschaftliche Plattformen gemessen

A reference is only as good as the data behind it. Eighteen platforms a researcher would plausibly use were asked what they declare about their own articles. Eleven answered; the most complete answer did not come from an article page at all.

Ein Quellennachweis ist nur so gut wie die Daten dahinter. Achtzehn Plattformen, die Forschende realistischerweise nutzen, wurden gefragt, was sie über ihre eigenen Artikel ausweisen. Elf antworteten — und die vollständigste Antwort kam gar nicht von einer Artikelseite.

3 August 2026 · 18 platforms, one pass · raw data3. August 2026 · 18 Plattformen, ein Durchlauf · Rohdaten

11/18
returned a record
10
with authors and year
8
titles confirmed by Crossref

What each platform declares

PlatformAuthorsYearDOIPagesISSNs
PubMed220170.52
PMC420200.46
Europe PMCRemote end closed connection w55.49
Springer520131.01
PLOS220231.45
BMC620230.91
Nature1320230.98
FrontiersThe server answered 404 Not Found.0.68
arXiv820170.21
bioRxivThe only title the page declares i0.71
Zenodo120230.51
SSOARThe page looks like an error messa0.33
DOAJThe server answered 403 Forbidden.0.14
Wiley020220.41
MDPIThe server answered 403 Forbidden.0.19
ScienceDirectThe server answered 403 Forbidden.0.24
DOI-Resolver220160.41
Wikipedia120060.18

The finding worth acting on

Resolving the DOI beat visiting the article page. The same work that Wiley's own page serves without page numbers came back complete through doi.org — authors, year, journal, volume, pages and ISSN — in 0.4 seconds, from a publisher whose article pages refuse server-side readers outright.

So the practical rule for anyone assembling a bibliography: if you have the DOI, use https://doi.org/…, not the link your search engine gave you. It is faster, more complete, and it works where the publisher's own page does not.

What this is good for

Keeping a source that will not survive the term

Web pages cited in student work vanish — we have measured how often. A capture keeps the page as it looked, with the retrieval time down to the second and its time zone, a checksum of the image data, and the citation record beside it. When the marker asks what the page said in August, the answer is a file rather than a memory.

Turning a reading list into records

Given a list of addresses, the endpoint returns RIS entries that import into Citavi, Zotero or EndNote without retyping — and names the ones it cannot reach, so those can be opened in a browser instead of being silently dropped.

Sources behind a login

A university licence, a library proxy, a paywalled journal: no server-side reader can follow you there, and three of the publishers measured here refuse them outright. A capture extension runs in your own session with your own access, which is why the two approaches belong together rather than competing.

Feeding a long page to a language model

One continuous sheet with real, selectable text — taken from the document rather than recognised from pixels — and page breaks that fall between lines instead of through them. What the model reads is what the page said.

What it is not good for

Limits of this measurement

11/18
gaben einen Nachweis zurück
10
mit Autoren und Jahr
8
Titel von Crossref bestätigt

Was jede Plattform ausweist

PlattformAutorenJahrDOISeitenISSNs
PubMed220170.52
PMC420200.46
Europe PMCRemote end closed connection w55.49
Springer520131.01
PLOS220231.45
BMC620230.91
Nature1320230.98
FrontiersThe server answered 404 Not Found.0.68
arXiv820170.21
bioRxivThe only title the page declares i0.71
Zenodo120230.51
SSOARThe page looks like an error messa0.33
DOAJThe server answered 403 Forbidden.0.14
Wiley020220.41
MDPIThe server answered 403 Forbidden.0.19
ScienceDirectThe server answered 403 Forbidden.0.24
DOI-Resolver220160.41
Wikipedia120060.18

Der Befund, den man umsetzen sollte

Den DOI aufzulösen schlug den Besuch der Artikelseite. Derselbe Beitrag, den die eigene Seite von Wiley ohne Seitenzahlen ausliefert, kam über doi.org vollständig zurück — Autoren, Jahr, Zeitschrift, Band, Seiten und ISSN — in 0,4 Sekunden, von einem Verlag, dessen Artikelseiten serverseitige Leser kategorisch abweisen.

Die praktische Regel für alle, die ein Literaturverzeichnis zusammenstellen: Wer den DOI hat, nutzt https://doi.org/…, nicht den Link aus der Suchmaschine. Das ist schneller, vollständiger und funktioniert dort, wo die eigene Seite des Verlags versagt.

Wofür das gut ist

Eine Quelle sichern, die das Semester nicht überlebt

Webseiten, die in studentischen Arbeiten zitiert werden, verschwinden — wie oft, haben wir gemessen. Eine Aufnahme bewahrt die Seite, wie sie aussah: mit Abrufzeitpunkt auf die Sekunde samt Zeitzone, einer Prüfsumme der Bilddaten und dem Zitationsnachweis daneben. Fragt die prüfende Person, was im August auf der Seite stand, ist die Antwort eine Datei statt einer Erinnerung.

Eine Leseliste in Nachweise verwandeln

Mit einer Liste von Adressen liefert der Endpunkt RIS-Einträge, die sich ohne Abtippen in Citavi, Zotero oder EndNote importieren lassen — und er nennt die Adressen, die er nicht erreicht, sodass diese im Browser geöffnet werden können, statt still unterzugehen.

Quellen hinter einem Login

Eine Hochschullizenz, ein Bibliotheks-Proxy, eine Fachzeitschrift hinter der Bezahlschranke: Kein serverseitiger Leser kann Ihnen dorthin folgen, und drei der hier gemessenen Verlage weisen sie kategorisch ab. Eine Aufnahme-Erweiterung läuft in Ihrer eigenen Sitzung mit Ihrem eigenen Zugang — darum gehören beide Wege zusammen, statt miteinander zu konkurrieren.

Eine lange Seite an ein Sprachmodell geben

Ein durchgehendes Blatt mit echtem, markierbarem Text — aus dem Dokument entnommen statt aus Pixeln erkannt — und Seitenumbrüche, die zwischen den Zeilen fallen statt durch sie hindurch. Was das Modell liest, ist das, was die Seite sagte.

Wofür es nicht gut ist

Grenzen dieser Messung