>
Our own measurement had the capture at 6.7 MB against 1.1 MB for the browser's print export — noted on the comparison page and left there without comment. Looking into it turned up something better than a compression setting: for a page of text, dropping the colour costs nothing that matters and saves almost everything.
| Mode | File | Share | Words read back |
|---|---|---|---|
| Full colour | 416 kB | 100 % | 987 |
| Greyscale | 243 kB | 58 % | 989 |
| Black and white | 113 kB | 27 % | 989 |
Against the 1327 kB the current build produces as JPEG, the last row is 8.5 %. And the text recognition does not suffer — it reads back two words more than from the colour version, at 99.9 % agreement. That is not a coincidence: OCR binarises the image anyway. Handing it colour means handing it work it immediately throws away.
The same setting on a page of photographs produces a structural similarity of 0.199 — the image is gone. No single value is right for both, which is why this belongs in the hands of whoever knows what they are capturing. A statute, a repository record, a page of tables: black and white. A figure, a map, a photograph: colour.
The setting exists in 2.28.0, in both branches, and both browsers load that build. Alongside it the capture stopped always embedding JPEG: each tile is now compared and the smaller of lossless FlateDecode and DCTDecode is used.
It is not in either store yet. What is measured is the encoding and the recognition; what is not measured is a full capture in a real browser, because that needs a genuine input event the test setup cannot produce. No date is promised here — the stores currently serve 2.26.0 and 2.17.0, and this site does not make claims about when that changes.
MRC, the standard behind small scanned PDFs, reaches a factor of eight to ten. It relies on JBIG2, which replaces similar glyphs with one shared pattern and has documented digit substitution. For a tool whose output is meant to serve as evidence, a file in which a year could quietly change is worth nothing — the saving does not enter into it. WebP and AVIF are not part of PDF at all.
The source details are untouched by any of this. Text layer, metadata and image are separate objects in the file; the RIS record and the checksum sit beside it. Changing how the image is stored does not change what the capture says about where it came from.
Which setting for which purpose: recommend_settings on the endpoint answers by purpose — citation, figure, archive or ocr — and carries the measurement behind each value, or an explicit note that none exists.
Die eigene Messung hatte die Aufnahme bei 6,7 MB gegen 1,1 MB für den Druckexport des Browsers — auf der Vergleichsseite vermerkt und dort unkommentiert stehen geblieben. Beim Nachgehen kam etwas Besseres heraus als eine Kompressionseinstellung: Bei einer Textseite kostet der Verzicht auf Farbe nichts, worauf es ankommt, und spart fast alles.
| Modus | Datei | Anteil | Zurückgelesene Wörter |
|---|---|---|---|
| Vollfarbe | 416 kB | 100 % | 987 |
| Graustufen | 243 kB | 58 % | 989 |
| Schwarzweiß | 113 kB | 27 % | 989 |
Gegen die 1327 kB, die der aktuelle Bau als JPEG erzeugt, sind es in der letzten Zeile 8,5 %. Und die Texterkennung leidet nicht — sie liest zwei Wörter mehr zurück als aus der Farbfassung, bei 99,9 % Übereinstimmung. Das ist kein Zufall: OCR binarisiert das Bild ohnehin. Ihm Farbe zu geben heißt, ihm Arbeit zu geben, die es sofort wegwirft.
Dieselbe Einstellung auf einer Fotoseite ergibt eine strukturelle Ähnlichkeit von 0,199 — das Bild ist weg. Kein einzelner Wert passt für beides, und darum gehört das in die Hand dessen, der weiß, was er aufnimmt. Ein Gesetzestext, ein Repositoriums-Eintrag, eine Tabellenseite: Schwarzweiß. Eine Abbildung, eine Karte, ein Foto: Farbe.
Die Einstellung gibt es in 2.28.0, in beiden Zweigen, und beide Browser laden diesen Bau. Daneben bettet die Aufnahme nicht mehr immer JPEG ein: Jede Kachel wird jetzt verglichen, und es wird die kleinere von verlustfreiem FlateDecode und DCTDecode genommen.
In keinem der beiden Stores ist es bisher. Gemessen sind die Kodierung und die Erkennung; nicht gemessen ist eine vollständige Aufnahme in einem echten Browser, denn dafür braucht es ein echtes Eingabeereignis, das der Prüfaufbau nicht erzeugen kann. Ein Datum wird hier nicht versprochen — die Stores liefern derzeit 2.26.0 und 2.17.0 aus, und diese Seite behauptet nicht, wann sich das ändert.
MRC, der Standard hinter kleinen gescannten PDFs, erreicht Faktor acht bis zehn. Es beruht auf JBIG2, das ähnliche Zeichen durch ein gemeinsames Muster ersetzt und dokumentierte Ziffernverwechslungen hat. Für ein Werkzeug, dessen Ausgabe als Beleg dienen soll, ist eine Datei, in der sich eine Jahreszahl still ändern kann, nichts wert — die Ersparnis spielt dabei keine Rolle. WebP und AVIF sind gar nicht Teil von PDF.
Die Herkunftsangaben bleiben von alldem unberührt. Textebene, Metadaten und Bild sind getrennte Objekte in der Datei; der RIS-Datensatz und die Prüfsumme liegen daneben. Zu ändern, wie das Bild gespeichert wird, ändert nicht, was die Aufnahme über ihre Herkunft sagt.
Welche Einstellung wofür: recommend_settings an der Schnittstelle antwortet nach Zweck — Zitat, Abbildung, Archiv oder OCR — und trägt die Messung hinter jedem Wert mit sich, oder den ausdrücklichen Hinweis, dass es keine gibt.
Nuestra propia medición situaba la captura en 6,7 MB frente a 1,1 MB de la exportación de impresión del navegador — anotado en la página de comparación y dejado allí sin comentario. Al investigarlo apareció algo mejor que un ajuste de compresión: en una página de texto, renunciar al color no cuesta nada que importe y ahorra casi todo.
| Modo | Archivo | Proporción | Palabras releídas |
|---|---|---|---|
| Color completo | 416 kB | 100 % | 987 |
| Escala de grises | 243 kB | 58 % | 989 |
| Blanco y negro | 113 kB | 27 % | 989 |
Frente a los 1327 kB que la compilación actual produce como JPEG, la última fila es el 8,5 %. Y el reconocimiento de texto no se resiente: relee dos palabras más que en la versión en color, con un 99,9 % de coincidencia. No es casualidad: el OCR binariza la imagen de todos modos. Darle color es darle trabajo que descarta de inmediato.
El mismo ajuste en una página de fotografías da una similitud estructural de 0,199 — la imagen desaparece. Ningún valor único sirve para ambos casos, y por eso esto corresponde a quien sabe qué está capturando. Una ley, un registro de repositorio, una página de tablas: blanco y negro. Una figura, un mapa, una fotografía: color.
El ajuste existe en la 2.28.0, en ambas ramas, y los dos navegadores cargan esa compilación. Junto a ello, la captura dejó de incrustar siempre JPEG: ahora se compara cada mosaico y se usa el menor entre FlateDecode sin pérdida y DCTDecode.
Todavía no está en ninguna de las dos tiendas. Lo medido es la codificación y el reconocimiento; lo no medido es una captura completa en un navegador real, porque eso exige un evento de entrada genuino que el montaje de prueba no puede producir. Aquí no se promete ninguna fecha: las tiendas sirven actualmente 2.26.0 y 2.17.0, y este sitio no afirma cuándo cambiará eso.
MRC, el estándar detrás de los PDF escaneados pequeños, alcanza un factor de ocho a diez. Se apoya en JBIG2, que sustituye glifos parecidos por un patrón común y tiene sustituciones de dígitos documentadas. Para una herramienta cuya salida debe servir como prueba, un archivo en el que un año podría cambiar en silencio no vale nada — el ahorro no entra en la cuenta. WebP y AVIF ni siquiera forman parte de PDF.
Los datos de procedencia quedan intactos en todo esto. Capa de texto, metadatos e imagen son objetos separados dentro del archivo; el registro RIS y la suma de verificación están al lado. Cambiar cómo se almacena la imagen no cambia lo que la captura dice sobre su origen.
Qué ajuste para qué fin: recommend_settings en el endpoint responde por propósito — cita, figura, archivo u ocr — y lleva consigo la medición que respalda cada valor, o la indicación explícita de que no existe ninguna.
Notre propre mesure donnait la capture à 6,7 Mo contre 1,1 Mo pour l’export d’impression du navigateur — noté sur la page de comparaison et laissé là sans commentaire. En y regardant de plus près, il est ressorti mieux qu’un réglage de compression : pour une page de texte, renoncer à la couleur ne coûte rien qui compte et fait presque tout gagner.
| Mode | Fichier | Part | Mots relus |
|---|---|---|---|
| Couleur | 416 kB | 100 % | 987 |
| Niveaux de gris | 243 kB | 58 % | 989 |
| Noir et blanc | 113 kB | 27 % | 989 |
Face aux 1327 ko que la version actuelle produit en JPEG, la dernière ligne représente 8,5 %. Et la reconnaissance de texte n’en souffre pas : elle relit deux mots de plus que sur la version en couleur, avec 99,9 % de concordance. Ce n’est pas un hasard : l’OCR binarise l’image de toute façon. Lui donner de la couleur, c’est lui donner un travail qu’il jette aussitôt.
Le même réglage sur une page de photographies donne une similarité structurelle de 0,199 — l’image a disparu. Aucune valeur unique ne convient aux deux, et c’est pourquoi cela revient à celui qui sait ce qu’il capture. Un texte de loi, une notice de dépôt, une page de tableaux : noir et blanc. Une figure, une carte, une photographie : couleur.
Le réglage existe en 2.28.0, dans les deux branches, et les deux navigateurs chargent cette version. En même temps, la capture n’intègre plus systématiquement du JPEG : chaque tuile est désormais comparée et l’on retient le plus petit entre FlateDecode sans perte et DCTDecode.
Ce n’est encore dans aucune des deux boutiques. Ce qui est mesuré, c’est l’encodage et la reconnaissance ; ce qui ne l’est pas, c’est une capture complète dans un vrai navigateur, car cela demande un véritable événement d’entrée que le montage de test ne peut pas produire. Aucune date n’est promise ici — les boutiques servent actuellement 2.26.0 et 2.17.0, et ce site n’avance rien sur le moment où cela changera.
MRC, la norme derrière les PDF numérisés de petite taille, atteint un facteur de huit à dix. Elle repose sur JBIG2, qui remplace les glyphes semblables par un motif commun et présente des substitutions de chiffres documentées. Pour un outil dont la sortie doit servir de preuve, un fichier dans lequel une année pourrait changer en silence ne vaut rien — l’économie n’entre pas en ligne de compte. WebP et AVIF ne font pas du tout partie de PDF.
Les indications de provenance ne sont en rien touchées. Couche de texte, métadonnées et image sont des objets distincts dans le fichier ; la notice RIS et la somme de contrôle se trouvent à côté. Changer la manière dont l’image est stockée ne change pas ce que la capture dit de son origine.
Quel réglage pour quel usage : recommend_settings sur le point de terminaison répond par finalité — citation, figure, archive ou ocr — et porte avec lui la mesure derrière chaque valeur, ou la mention explicite qu’il n’en existe aucune.
La nostra misurazione dava la cattura a 6,7 MB contro 1,1 MB dell’esportazione di stampa del browser — annotato nella pagina di confronto e lasciato lì senza commento. Approfondendo è emerso qualcosa di meglio di un’impostazione di compressione: per una pagina di testo, rinunciare al colore non costa nulla che conti e fa risparmiare quasi tutto.
| Modalità | File | Quota | Parole rilette |
|---|---|---|---|
| Colore pieno | 416 kB | 100 % | 987 |
| Scala di grigi | 243 kB | 58 % | 989 |
| Bianco e nero | 113 kB | 27 % | 989 |
Rispetto ai 1327 kB che la build attuale produce in JPEG, l’ultima riga è l’8,5 %. E il riconoscimento del testo non ne risente: rilegge due parole in più rispetto alla versione a colori, con il 99,9 % di concordanza. Non è un caso: l’OCR binarizza comunque l’immagine. Dargli il colore significa dargli un lavoro che scarta subito.
La stessa impostazione su una pagina di fotografie dà una somiglianza strutturale di 0,199 — l’immagine è sparita. Nessun valore singolo va bene per entrambi i casi, ed è per questo che la scelta spetta a chi sa che cosa sta catturando. Un testo di legge, una scheda di archivio, una pagina di tabelle: bianco e nero. Una figura, una mappa, una fotografia: colore.
L’impostazione esiste nella 2.28.0, in entrambi i rami, ed entrambi i browser caricano quella build. Accanto a ciò, la cattura ha smesso di incorporare sempre JPEG: ogni tassello viene ora confrontato e si usa il minore tra FlateDecode senza perdita e DCTDecode.
Non è ancora in nessuno dei due store. Ciò che è misurato sono la codifica e il riconoscimento; ciò che non è misurato è una cattura completa in un browser reale, perché richiede un vero evento di input che l’ambiente di prova non può produrre. Qui non si promette alcuna data — gli store servono attualmente 2.26.0 e 2.17.0, e questo sito non afferma quando ciò cambierà.
MRC, lo standard dietro i PDF scansionati di piccole dimensioni, raggiunge un fattore da otto a dieci. Si basa su JBIG2, che sostituisce glifi simili con un unico modello condiviso e presenta sostituzioni di cifre documentate. Per uno strumento il cui esito deve valere come prova, un file in cui un anno potrebbe cambiare in silenzio non vale nulla — il risparmio non entra nel conto. WebP e AVIF non fanno affatto parte del PDF.
I dati di provenienza restano del tutto intatti. Livello di testo, metadati e immagine sono oggetti distinti nel file; il record RIS e la somma di controllo stanno accanto. Cambiare il modo in cui l’immagine è memorizzata non cambia ciò che la cattura dice sulla propria origine.
Quale impostazione per quale scopo: recommend_settings sull’endpoint risponde per finalità — citazione, figura, archivio od ocr — e porta con sé la misurazione dietro ogni valore, oppure l’indicazione esplicita che non ne esiste nessuna.
自分たちの計測では、キャプチャが 6.7 MB、ブラウザーの印刷書き出しが 1.1 MB だった。比較ページに記したまま、注釈もつけずに置いてあった。調べてみると、圧縮設定より良いものが出てきた。テキストのページなら、色を捨てても大事なものは何も失われず、ほとんどすべてが節約できる。
| モード | ファイル | 割合 | 読み戻せた語数 |
|---|---|---|---|
| フルカラー | 416 kB | 100 % | 987 |
| グレースケール | 243 kB | 58 % | 989 |
| 白黒 | 113 kB | 27 % | 989 |
現行ビルドが JPEG として生成する 1327 kB に対し、最終行は 8.5 % である。しかも文字認識は劣化しない。カラー版より 2 語多く 読み戻し、一致率は 99.9 % だった。偶然ではない。OCR はどのみち画像を二値化する。色を渡すことは、すぐ捨てられる仕事を渡すことに等しい。
同じ設定を写真のページに使うと、構造的類似度は 0.199 になる。画像は失われている。どちらにも合う単一の値は存在しない。だからこれは、何を取り込もうとしているかを知っている人の手に委ねられる。法令、リポジトリの書誌、表のページなら白黒。図、地図、写真ならカラー。
この設定は 2.28.0 に、両方のブランチに存在し、両ブラウザーともそのビルドを読み込む。あわせて、キャプチャは常に JPEG を埋め込むのをやめた。各タイルを比較し、可逆の FlateDecode と DCTDecode のうち小さいほうを用いる。
どちらのストアにもまだ出ていない。計測したのは符号化と認識であり、計測していないのは実際のブラウザーでの完全なキャプチャである。それには本物の入力イベントが要るが、試験環境では作れない。ここで期日は約束しない。ストアは現在 2.26.0 と 2.17.0 を配信しており、本サイトはそれがいつ変わるかについて主張しない。
小さなスキャン PDF の背後にある標準 MRC は 8〜10 倍に達する。これは JBIG2 に依存しており、似た字形をひとつの共通パターンに置き換えるため、数字の取り違えが文書化されている。出力が証拠として使われる道具にとって、年号が黙って変わりうるファイルには何の価値もない。節約は勘定に入らない。WebP と AVIF はそもそも PDF の一部ではない。
出典の記載はこれらの影響を受けない。テキスト層、メタデータ、画像はファイル内の別々のオブジェクトであり、RIS レコードとチェックサムはその傍らにある。画像の保存方法を変えても、そのキャプチャが自らの出所について述べる内容は変わらない。
用途ごとの設定: エンドポイント の recommend_settings が用途別に答える — 引用、図版、保存、または ocr。各値の根拠となる計測を伴い、根拠がない場合はその旨を明示する。
Nossa própria medição colocava a captura em 6,7 MB contra 1,1 MB da exportação de impressão do navegador — anotado na página de comparação e deixado ali sem comentário. Ao investigar, apareceu algo melhor do que um ajuste de compressão: numa página de texto, abrir mão da cor não custa nada que importe e economiza quase tudo.
| Modo | Arquivo | Proporção | Palavras relidas |
|---|---|---|---|
| Cor total | 416 kB | 100 % | 987 |
| Escala de cinza | 243 kB | 58 % | 989 |
| Preto e branco | 113 kB | 27 % | 989 |
Contra os 1327 kB que a compilação atual produz como JPEG, a última linha é 8,5 %. E o reconhecimento de texto não piora: ele relê duas palavras a mais do que na versão colorida, com 99,9 % de concordância. Não é coincidência: o OCR binariza a imagem de qualquer modo. Entregar cor a ele é entregar um trabalho que ele descarta na hora.
O mesmo ajuste numa página de fotografias produz uma similaridade estrutural de 0,199 — a imagem se perdeu. Nenhum valor único serve para os dois casos, e por isso isso cabe a quem sabe o que está capturando. Uma lei, um registro de repositório, uma página de tabelas: preto e branco. Uma figura, um mapa, uma fotografia: cor.
O ajuste existe na 2.28.0, nos dois ramos, e ambos os navegadores carregam essa compilação. Junto com isso, a captura deixou de incorporar sempre JPEG: cada bloco agora é comparado e usa-se o menor entre FlateDecode sem perdas e DCTDecode.
Ainda não está em nenhuma das duas lojas. O que está medido é a codificação e o reconhecimento; o que não está medido é uma captura completa num navegador real, porque isso exige um evento de entrada genuíno que o ambiente de teste não consegue produzir. Nenhuma data é prometida aqui — as lojas servem atualmente 2.26.0 e 2.17.0, e este site não afirma quando isso vai mudar.
MRC, o padrão por trás dos PDFs digitalizados pequenos, alcança um fator de oito a dez. Ele se apoia em JBIG2, que substitui glifos parecidos por um padrão comum e tem substituições de dígitos documentadas. Para uma ferramenta cuja saída deve servir de prova, um arquivo em que um ano poderia mudar em silêncio não vale nada — a economia não entra na conta. WebP e AVIF nem fazem parte do PDF.
Os dados de procedência ficam intocados por tudo isso. Camada de texto, metadados e imagem são objetos separados no arquivo; o registro RIS e a soma de verificação ficam ao lado. Mudar como a imagem é armazenada não muda o que a captura diz sobre sua origem.
Qual ajuste para qual finalidade: recommend_settings no endpoint responde por finalidade — citação, figura, arquivo ou ocr — e carrega consigo a medição por trás de cada valor, ou a observação explícita de que não existe nenhuma.
Наше собственное измерение давало снимок в 6,7 МБ против 1,1 МБ у экспорта на печать из браузера — отмечено на странице сравнения и оставлено там без комментария. При разборе нашлось кое-что получше настройки сжатия: для текстовой страницы отказ от цвета не стоит ничего существенного и экономит почти всё.
| Режим | Файл | Доля | Слов прочитано обратно |
|---|---|---|---|
| Полный цвет | 416 kB | 100 % | 987 |
| Оттенки серого | 243 kB | 58 % | 989 |
| Чёрно-белый | 113 kB | 27 % | 989 |
Против 1327 кБ, которые текущая сборка выдаёт в JPEG, последняя строка — это 8,5 %. И распознавание текста не страдает: оно вычитывает на два слова больше, чем из цветного варианта, при совпадении 99,9 %. Это не случайность: OCR всё равно бинаризует изображение. Отдать ему цвет — значит отдать работу, которую он тут же выбрасывает.
Та же настройка на странице с фотографиями даёт структурное сходство 0,199 — изображения больше нет. Ни одно значение не подходит для обоих случаев, и потому выбор остаётся за тем, кто знает, что именно снимает. Закон, запись репозитория, страница таблиц — чёрно-белый. Рисунок, карта, фотография — цвет.
Настройка есть в 2.28.0, в обеих ветках, и оба браузера загружают эту сборку. Вместе с этим снимок перестал всегда встраивать JPEG: каждый фрагмент теперь сравнивается, и берётся меньший из FlateDecode без потерь и DCTDecode.
Ни в одном из магазинов этого пока нет. Измерены кодирование и распознавание; не измерен полный снимок в настоящем браузере, потому что для него нужно подлинное событие ввода, которого испытательный стенд создать не может. Сроков здесь не обещают: магазины сейчас отдают 2.26.0 и 2.17.0, и этот сайт не утверждает, когда это изменится.
MRC, стандарт за малыми сканированными PDF, достигает восьми- — десятикратного выигрыша. Он опирается на JBIG2, который заменяет похожие начертания одним общим образцом и имеет задокументированные подмены цифр. Для инструмента, вывод которого должен служить доказательством, файл, в котором год может незаметно измениться, не стоит ничего — экономия тут не в счёт. WebP и AVIF вообще не входят в PDF.
Сведения о происхождении всё это не затрагивает. Текстовый слой, метаданные и изображение — отдельные объекты в файле; запись RIS и контрольная сумма лежат рядом. Изменить способ хранения изображения не значит изменить то, что снимок говорит о своём источнике.
Какая настройка для какой цели: recommend_settings на конечной точке отвечает по назначению — цитата, рисунок, архив или ocr — и несёт с собой измерение, стоящее за каждым значением, либо прямое указание, что такого измерения нет.
我们自己的测量结果是:抓取 6.7 MB,浏览器的打印导出 1.1 MB。这条记录写在对比页上,一直没有加注。深究之后,找到了比压缩设置更好的东西:对一页文字而言,放弃颜色不会损失任何要紧的内容,却几乎省下了全部体积。
| 模式 | 文件 | 占比 | 回读词数 |
|---|---|---|---|
| 全彩 | 416 kB | 100 % | 987 |
| 灰度 | 243 kB | 58 % | 989 |
| 黑白 | 113 kB | 27 % | 989 |
相对于当前版本以 JPEG 生成的 1327 kB,最后一行是 8.5 %。而且文字识别并未变差——它比彩色版本多读回 两个词,一致率 99.9 %。这不是巧合:OCR 本来就会把图像二值化。给它颜色,等于交给它一份随即丢弃的工作。
同样的设置用在照片页上,结构相似度是 0.199——图像已经没了。没有哪一个取值能同时适用于两者,所以这件事应当交给知道自己在抓取什么的人。法条、仓储条目、表格页:黑白。插图、地图、照片:彩色。
该设置存在于 2.28.0,两个分支都有,两种浏览器都加载这一版本。与此同时,抓取不再总是嵌入 JPEG:现在会逐块比较,取无损 FlateDecode 与 DCTDecode 中较小的一个。
两个商店都还没有上架。已测量的是编码与识别;未测量的是在真实浏览器中的完整抓取,因为那需要一个真实的输入事件,而测试环境无法产生。这里不承诺日期——商店目前提供 2.26.0 和 2.17.0,本站不就何时改变作出任何说法。
MRC 是小体积扫描 PDF 背后的标准,可以达到八到十倍。它依赖 JBIG2,后者把相似字形替换为同一个共用图样,并且有记录在案的数字混淆。对于一件输出要用作凭证的工具来说,一个年份可能悄悄改变的文件毫无价值——省下的体积不在考虑之列。WebP 和 AVIF 根本不属于 PDF。
出处信息不受这些改动影响。文本层、元数据和图像在文件中是各自独立的对象;RIS 记录和校验和另置一旁。改变图像的存储方式,并不改变这份抓取关于自身来源所说的内容。
什么用途配什么设置:端点 上的 recommend_settings 按用途作答——引用、插图、存档或 ocr——并附上每个取值背后的测量;若没有测量,则明确说明。