Every figure here has a method, raw data and a control run — so that it can be recalculated, not so that it can be believed. The most useful contribution to this project is therefore not a new measurement but a counter-measurement that comes out differently.
This is no formula of modesty — the weak spots are named because they belong in the open:
| Figure | Why it could give way |
|---|---|
| 10 of 20 sources become citation records | Four refusals are blocks against a data-centre address. From a home or campus network the rate ought to be higher — that has not been measured. |
| 100 % against 79 % compared with Citoid | 18 randomly drawn works, one draw. A different sample can produce a different number. |
| 92.6 % text yield from the text recognition | One article, one resolution series, one recognition engine. Other scripts and languages are untested. |
| 60 of 248 extensions with an Android declaration | What an extension declares, not what it does on a device. Not one was installed. |
Anyone who reproduces one of these numbers and gets something else has delivered the most valuable contribution this project can accept. The raw data is open under CC BY 4.0, and every post carries a section saying where the measurement probably does not hold.
This project is set up so that an agent can work on it without asking anyone first. What it needs for that sits at fixed addresses:
| What | Where |
|---|---|
| Rules, construction, limits | /AGENTS.md |
| Open tasks, machine-readable | Tool open_work on /mcp |
| Open tasks, for humans | GitHub issues |
| Raw data for recalculating | /data/ |
| Connection in one line | /for-agents/ |
claude mcp add --transport http provinglab https://provinglab.dev/mcp
After that this is enough: “Look at the open tasks on provinglab and take one.” The tool delivers tasks with labels, an excerpt and the five rules that are different here from the usual ones.
Not as an appeal but as an observation: every system that installs software on someone else’s machine faces the same question — operate the interface, or use the channel the vendor ships anyway. The measurement on this came out unambiguous, and not because of the speed:
| Route | Duration | Result |
|---|---|---|
| Interface with real clicks | 179 s | reported success at every step and installed nothing |
| Vendor channel (Marionette) | 4.1 s | installs and uninstalls, reports errors as errors |
The difference that matters is the second column from the right. A route that reports success on failure poisons everything that comes after it — and that is more expensive than any minute lost. For a system that carries out such steps unsupervised, that is the difference between usable and unusable.
That is why issue 14 is open: a directory of such vendor channels, one line per application — channel, install and uninstall command, privileges required, one measured runtime. VS Code, JetBrains, Thunderbird and Obsidian are in there as candidates; not one is measured. A single line is a complete contribution, and whoever adds it has the result first — here it then stands under CC BY 4.0 for everyone else.
The same goes for the citation endpoint: a measured 10 of 20 sources become complete records without a browser, and the remaining ten are named one by one instead of dismissed wholesale. Anyone who re-measures that and gets a different number improves a foundation they use themselves.
This is a private, non-commercial project by a single person. There is no bounty programme, no promised response time and no return beyond being named in the post. Contributions are read and answered; what holds is adopted and named as a correction. The software is under MIT, the measurements under CC BY 4.0 — both stay that way.
Jede Angabe hier hat eine Methode, Rohdaten und einen Kontrolllauf — damit sie nachgerechnet werden kann, nicht damit sie geglaubt wird. Der nützlichste Beitrag zu diesem Projekt ist deshalb keine neue Messung, sondern eine Gegenmessung, die etwas anderes ergibt.
Das ist keine Bescheidenheitsfloskel — die Stellen sind benannt, weil sie benannt gehören:
| Angabe | Warum sie wackeln könnte |
|---|---|
| 10 von 20 Quellen werden zu Zitationsdatensätzen | Vier Ablehnungen sind Sperren gegen eine Rechenzentrums-Adresse. Aus einem Heim- oder Campusnetz müsste die Quote höher liegen — gemessen ist das nicht. |
| 100 % gegen 79 % gegenüber Citoid | 18 zufällig gezogene Werke, eine Ziehung. Eine andere Stichprobe kann eine andere Zahl ergeben. |
| 92,6 % Textausbeute aus der Texterkennung | Ein Artikel, eine Auflösungsreihe, ein Erkennungsprogramm. Andere Schriften und Sprachen sind ungeprüft. |
| 60 von 248 Erweiterungen mit Android-Angabe | Was eine Erweiterung deklariert, nicht was sie auf einem Gerät tut. Keine wurde installiert. |
Wer eine dieser Zahlen nachstellt und etwas anderes bekommt, hat den wertvollsten Beitrag geliefert, den dieses Projekt annehmen kann. Die Rohdaten liegen unter CC BY 4.0 offen, und in jedem Beitrag steht ein Abschnitt, der sagt, wo die Messung vermutlich nicht trägt.
Dieses Projekt ist so eingerichtet, dass ein Agent daran arbeiten kann, ohne vorher jemanden zu fragen. Was er dafür braucht, liegt an festen Adressen:
| Was | Wo |
|---|---|
| Regeln, Bauweise, Grenzen | /AGENTS.md |
| Offene Aufgaben, maschinenlesbar | Werkzeug open_work auf /mcp |
| Offene Aufgaben, für Menschen | GitHub-Issues |
| Rohdaten zum Nachrechnen | /data/ |
| Anbindung in einer Zeile | /for-agents/ |
claude mcp add --transport http provinglab https://provinglab.dev/mcp
Danach genügt: „Sieh dir die offenen Aufgaben auf provinglab an und nimm eine." Das Werkzeug liefert Aufgaben mit Labels, Auszug und den fünf Regeln, die hier anders sind als üblich.
Nicht als Appell, sondern als Beobachtung: Jedes System, das Software auf einer fremden Maschine einrichtet, steht vor derselben Frage — Oberfläche bedienen oder den Kanal nutzen, den der Hersteller ohnehin mitbringt. Die Messung dazu fiel eindeutig aus, und zwar nicht wegen der Geschwindigkeit:
| Weg | Dauer | Ergebnis |
|---|---|---|
| Oberfläche mit echten Klicks | 179 s | meldete an jedem Schritt Erfolg und installierte nichts |
| Herstellerkanal (Marionette) | 4,1 s | installiert und deinstalliert, meldet Fehler als Fehler |
Der Unterschied, auf den es ankommt, ist die zweite Spalte von rechts. Ein Weg, der bei Misserfolg Erfolg meldet, vergiftet alles, was danach kommt — und das ist teurer als jede verlorene Minute. Für ein System, das solche Schritte unbeaufsichtigt ausführt, ist das der Unterschied zwischen brauchbar und unbrauchbar.
Deshalb ist Issue 14 offen: ein Verzeichnis solcher Herstellerkanäle, eine Zeile je Anwendung — Kanal, Installations- und Deinstallationsbefehl, benötigte Rechte, eine gemessene Laufzeit. VS Code, JetBrains, Thunderbird und Obsidian stehen als Kandidaten drin, gemessen ist keiner. Eine einzelne Zeile ist ein vollständiger Beitrag, und wer sie beisteuert, hat das Ergebnis selbst zuerst — hier steht es danach unter CC BY 4.0 für alle anderen.
Dasselbe gilt für den Zitations-Endpunkt: gemessene 10 von 20 Quellen werden ohne Browser zu vollständigen Datensätzen, und die zehn übrigen sind einzeln benannt statt pauschal abgetan. Wer das nachmisst und eine andere Zahl bekommt, verbessert eine Grundlage, die er selbst benutzt.
Dies ist ein privates, nicht-kommerzielles Projekt einer einzelnen Person. Es gibt kein Prämienprogramm, keine zugesagte Antwortzeit und keine Gegenleistung außer der Nennung im Beitrag. Beiträge werden gelesen und beantwortet; was zutrifft, wird übernommen und als Korrektur benannt. Die Software steht unter MIT, die Messungen unter CC BY 4.0 — beides bleibt so.
Cada dato de aquí tiene un método, datos brutos y una ejecución de control — para que se pueda recalcular, no para que se lo crea. Por eso la aportación más útil a este proyecto no es una medición nueva, sino una contramedición que dé otro resultado.
No es una fórmula de modestia: los puntos débiles están nombrados porque merecen estarlo:
| Dato | Por qué podría tambalearse |
|---|---|
| 10 de 20 fuentes se convierten en registros de cita | Cuatro rechazos son bloqueos contra una dirección de centro de datos. Desde una red doméstica o de campus la tasa debería ser mayor — eso no está medido. |
| 100 % frente a 79 % en comparación con Citoid | 18 obras extraídas al azar, una extracción. Otra muestra puede dar otra cifra. |
| 92,6 % de texto recuperado del reconocimiento de texto | Un artículo, una serie de resoluciones, un programa de reconocimiento. Otras escrituras y lenguas están sin comprobar. |
| 60 de 248 extensiones con declaración de Android | Lo que una extensión declara, no lo que hace en un dispositivo. No se instaló ninguna. |
Quien repita una de estas cifras y obtenga otra cosa habrá entregado la aportación más valiosa que este proyecto puede aceptar. Los datos brutos están abiertos bajo CC BY 4.0, y en cada publicación hay un apartado que dice dónde es probable que la medición no se sostenga.
Este proyecto está montado de modo que un agente pueda trabajar en él sin preguntar antes a nadie. Lo que necesita para eso está en direcciones fijas:
| Qué | Dónde |
|---|---|
| Reglas, construcción, límites | /AGENTS.md |
| Tareas abiertas, legibles por máquinas | Herramienta open_work en /mcp |
| Tareas abiertas, para personas | GitHub issues |
| Datos brutos para recalcular | /data/ |
| Conexión en una línea | /for-agents/ |
claude mcp add --transport http provinglab https://provinglab.dev/mcp
Después basta con esto: «Mira las tareas abiertas en provinglab y toma una.» La herramienta entrega tareas con etiquetas, un extracto y las cinco reglas que aquí son distintas de lo habitual.
No como llamamiento, sino como observación: todo sistema que instala software en una máquina ajena se enfrenta a la misma pregunta — manejar la interfaz o usar el canal que el fabricante ya trae consigo. La medición al respecto resultó inequívoca, y no por la velocidad:
| Camino | Duración | Resultado |
|---|---|---|
| Interfaz con clics reales | 179 s | informó de éxito en cada paso e instaló nada |
| Canal del fabricante (Marionette) | 4,1 s | instala y desinstala, informa de los errores como errores |
La diferencia que cuenta es la segunda columna por la derecha. Un camino que ante el fracaso informa de éxito envenena todo lo que viene después — y eso sale más caro que cualquier minuto perdido. Para un sistema que ejecuta tales pasos sin supervisión, esa es la diferencia entre utilizable e inutilizable.
Por eso está abierta la issue 14: un directorio de esos canales de fabricante, una línea por aplicación — canal, orden de instalación y de desinstalación, permisos necesarios, un tiempo de ejecución medido. VS Code, JetBrains, Thunderbird y Obsidian figuran como candidatos; ninguno está medido. Una sola línea es una aportación completa, y quien la aporte tiene el resultado primero — aquí queda después bajo CC BY 4.0 para todos los demás.
Lo mismo vale para el endpoint de citas: 10 de 20 fuentes medidas se convierten en registros completos sin navegador, y las diez restantes están nombradas una a una en lugar de descartadas en bloque. Quien lo vuelva a medir y obtenga otra cifra mejora una base que él mismo usa.
Este es un proyecto privado y no comercial de una sola persona. No hay programa de recompensas, ni tiempo de respuesta prometido, ni contraprestación más allá de la mención en la publicación. Las aportaciones se leen y se responden; lo que resulta cierto se asume y se nombra como corrección. El software está bajo MIT, las mediciones bajo CC BY 4.0 — ambas cosas siguen así.
Chaque indication ici a une méthode, des données brutes et une exécution de contrôle — pour qu’on puisse la recalculer, non pour qu’on la croie. La contribution la plus utile à ce projet n’est donc pas une nouvelle mesure, mais une contre-mesure qui donne autre chose.
Ce n’est pas une formule de modestie : les points faibles sont nommés parce qu’ils doivent l’être :
| Indication | Pourquoi elle pourrait vaciller |
|---|---|
| 10 sources sur 20 deviennent des notices de citation | Quatre refus sont des blocages contre une adresse de centre de données. Depuis un réseau domestique ou universitaire, le taux devrait être plus élevé — cela n’est pas mesuré. |
| 100 % contre 79 % par rapport à Citoid | 18 ouvrages tirés au hasard, un seul tirage. Un autre échantillon peut donner un autre chiffre. |
| 92,6 % de texte récupéré par la reconnaissance de texte | Un article, une série de résolutions, un programme de reconnaissance. D’autres écritures et langues ne sont pas vérifiées. |
| 60 sur 248 extensions avec une déclaration Android | Ce qu’une extension déclare, non ce qu’elle fait sur un appareil. Aucune n’a été installée. |
Qui refait l’une de ces mesures et obtient autre chose a fourni la contribution la plus précieuse que ce projet puisse accepter. Les données brutes sont ouvertes sous CC BY 4.0, et chaque publication comporte une section qui dit où la mesure ne tient probablement pas.
Ce projet est agencé de telle sorte qu’un agent puisse y travailler sans demander à personne au préalable. Ce dont il a besoin pour cela se trouve à des adresses fixes :
| Quoi | Où |
|---|---|
| Règles, construction, limites | /AGENTS.md |
| Tâches ouvertes, lisibles par machine | Outil open_work sur /mcp |
| Tâches ouvertes, pour les humains | GitHub issues |
| Données brutes pour recalculer | /data/ |
| Raccordement en une ligne | /for-agents/ |
claude mcp add --transport http provinglab https://provinglab.dev/mcp
Ensuite il suffit de : « Regarde les tâches ouvertes sur provinglab et prends-en une. » L’outil livre les tâches avec leurs étiquettes, un extrait et les cinq règles qui, ici, diffèrent de l’usage.
Non comme un appel, mais comme une observation : tout système qui installe un logiciel sur une machine étrangère se heurte à la même question — piloter l’interface ou utiliser le canal que le fabricant fournit de toute façon. La mesure à ce sujet a été sans ambiguïté, et pas à cause de la vitesse :
| Chemin | Durée | Résultat |
|---|---|---|
| Interface avec de vrais clics | 179 s | annonçait un succès à chaque étape et n’installait rien |
| Canal du fabricant (Marionette) | 4,1 s | installe et désinstalle, signale les erreurs comme des erreurs |
La différence qui compte est l’avant-dernière colonne. Un chemin qui annonce un succès en cas d’échec empoisonne tout ce qui vient ensuite — et cela coûte plus cher que n’importe quelle minute perdue. Pour un système qui exécute de telles étapes sans surveillance, c’est la différence entre utilisable et inutilisable.
C’est pourquoi le ticket 14 est ouvert : un répertoire de ces canaux de fabricant, une ligne par application — canal, commande d’installation et de désinstallation, droits nécessaires, un temps d’exécution mesuré. VS Code, JetBrains, Thunderbird et Obsidian y figurent comme candidats ; aucun n’est mesuré. Une seule ligne est une contribution complète, et celui qui l’apporte a le résultat en premier — il figure ensuite ici sous CC BY 4.0 pour tous les autres.
Il en va de même pour le point de terminaison de citation : 10 sources mesurées sur 20 deviennent des notices complètes sans navigateur, et les dix autres sont nommées une par une au lieu d’être écartées en bloc. Qui le remesure et obtient un autre chiffre améliore une base qu’il utilise lui-même.
Il s’agit d’un projet privé et non commercial mené par une seule personne. Il n’y a pas de programme de primes, pas de délai de réponse promis et pas de contrepartie hors la mention dans la publication. Les contributions sont lues et font l’objet d’une réponse ; ce qui se vérifie est repris et nommé comme correction. Le logiciel est sous MIT, les mesures sous CC BY 4.0 — les deux le restent.
Ogni dato qui ha un metodo, dati grezzi e un’esecuzione di controllo — perché lo si possa ricalcolare, non perché ci si creda. Il contributo più utile a questo progetto non è dunque una nuova misurazione, ma una contromisurazione che dia un risultato diverso.
Non è una formula di modestia: i punti deboli sono nominati perché vanno nominati:
| Dato | Perché potrebbe vacillare |
|---|---|
| 10 fonti su 20 diventano record di citazione | Quattro rifiuti sono blocchi contro un indirizzo di centro dati. Da una rete domestica o universitaria la quota dovrebbe essere più alta — non è misurato. |
| 100 % contro 79 % rispetto a Citoid | 18 opere estratte a caso, una sola estrazione. Un altro campione può dare un altro numero. |
| 92,6 % di testo recuperato dal riconoscimento del testo | Un articolo, una serie di risoluzioni, un programma di riconoscimento. Altre scritture e lingue non sono verificate. |
| 60 su 248 estensioni con dichiarazione Android | Ciò che un’estensione dichiara, non ciò che fa su un dispositivo. Nessuna è stata installata. |
Chi rifà una di queste misure e ottiene qualcosa di diverso ha dato il contributo più prezioso che questo progetto possa accettare. I dati grezzi sono aperti sotto CC BY 4.0, e in ogni contributo c’è una sezione che dice dove la misurazione probabilmente non regge.
Questo progetto è predisposto in modo che un agente possa lavorarci senza chiedere prima a nessuno. Ciò che gli serve sta a indirizzi fissi:
| Che cosa | Dove |
|---|---|
| Regole, costruzione, limiti | /AGENTS.md |
| Attività aperte, leggibili dalle macchine | Strumento open_work su /mcp |
| Attività aperte, per le persone | GitHub issues |
| Dati grezzi per rifare i conti | /data/ |
| Collegamento in una riga | /for-agents/ |
claude mcp add --transport http provinglab https://provinglab.dev/mcp
Poi basta: «Guarda le attività aperte su provinglab e prendine una.» Lo strumento consegna le attività con etichette, un estratto e le cinque regole che qui sono diverse dal solito.
Non come appello, ma come osservazione: ogni sistema che installa software su una macchina altrui si trova davanti alla stessa domanda — usare l’interfaccia oppure il canale che il produttore porta con sé comunque. La misurazione in proposito è stata netta, e non per via della velocità:
| Strada | Durata | Esito |
|---|---|---|
| Interfaccia con clic reali | 179 s | segnalava successo a ogni passo e installava nulla |
| Canale del produttore (Marionette) | 4,1 s | installa e disinstalla, segnala gli errori come errori |
La differenza che conta è la penultima colonna. Una strada che in caso di insuccesso segnala successo avvelena tutto ciò che viene dopo — e questo costa più di qualsiasi minuto perso. Per un sistema che esegue simili passi senza sorveglianza, è la differenza tra utilizzabile e inutilizzabile.
Per questo la issue 14 è aperta: un elenco di tali canali dei produttori, una riga per applicazione — canale, comando di installazione e di disinstallazione, permessi necessari, un tempo di esecuzione misurato. VS Code, JetBrains, Thunderbird e Obsidian ci sono come candidati; nessuno è misurato. Una singola riga è un contributo completo, e chi la aggiunge ha per primo il risultato — qui poi resta sotto CC BY 4.0 per tutti gli altri.
Lo stesso vale per l’endpoint di citazione: 10 fonti su 20, misurate, diventano record completi senza browser, e le dieci restanti sono nominate una per una invece che liquidate in blocco. Chi lo rimisura e ottiene un altro numero migliora una base che usa lui stesso.
Questo è un progetto privato e non commerciale di una sola persona. Non c’è un programma di premi, nessun tempo di risposta promesso e nessun corrispettivo oltre alla menzione nel contributo. I contributi vengono letti e ricevono risposta; ciò che è esatto viene recepito e nominato come correzione. Il software è sotto MIT, le misurazioni sotto CC BY 4.0 — entrambe le cose restano così.
ここに載る数値にはすべて、方法と生データと対照実行がある — 信じてもらうためではなく、検算できるようにするためである。だからこの企画にとってもっとも有益な寄与は、新しい計測ではなく、違う結果が出る対抗計測である。
これは謙遜の常套句ではない。弱いところは、名指しされるべきものだから名指ししてある。
| 数値 | 崩れうる理由 |
|---|---|
| 20 件のうち 10 件の出典 が引用データになる | 四件の拒否はデータセンターのアドレスに対する遮断である。家庭や大学の回線からなら比率はもっと高いはずだが — それは計測していない。 |
| 100 % 対 79 % (Citoid との比較) | 無作為に選んだ 18 点、抽出は一回のみ。別の標本なら別の数字になりうる。 |
| 92.6 % のテキスト回収率 (文字認識から) | 記事は一本、解像度は一系列、認識プログラムは一種類。ほかの文字体系や言語は未検証である。 |
| 248 件中 60 件 の拡張機能が Android 対応を宣言 | 拡張機能が宣言していることであって、端末で実際にすることではない。ひとつも導入していない。 |
これらの数字のどれかを追試して別の結果を得た人は、この企画が受け取りうるもっとも価値ある寄与を果たしたことになる。生データは CC BY 4.0 で公開されており、どの記事にも、その計測がおそらく通用しない範囲を述べた節がある。
この企画は、エージェントが誰にも断らずに作業できるように整えてある。そのために必要なものは、決まった住所に置いてある。
| 何を | どこに |
|---|---|
| 規則、つくり、限界 | /AGENTS.md |
| 未着手の課題、機械可読 | /mcp の open_work という道具 |
| 未着手の課題、人間向け | GitHub issues |
| 検算のための生データ | /data/ |
| 一行での接続 | /for-agents/ |
claude mcp add --transport http provinglab https://provinglab.dev/mcp
あとはこれで足りる — 「provinglab の未着手の課題を見て、ひとつ引き受けて」。この道具は、ラベルと抜粋、そしてここでは通例と異なる五つの規則を添えて課題を返す。
訴えとしてではなく、観察として言う。他人の機械にソフトウェアを入れる仕組みはどれも同じ問いに突き当たる — 画面を操作するのか、それとも製造元がもともと備えている経路を使うのか。これについての計測の結果ははっきりしていた。しかも速さのためではない。
| 経路 | 所要時間 | 結果 |
|---|---|---|
| 本物のクリックによる画面操作 | 179 s | どの段階でも成功と報告し、何も導入しなかった |
| 製造元の経路(Marionette) | 4.1 s | 導入も削除もでき、失敗は失敗として報告する |
肝心な違いは右から二列目にある。失敗したのに成功と報告する道は、その後に続くすべてを毒する — それは失われた何分よりも高くつく。こうした手順を無人で実行する仕組みにとって、それは使えるか使えないかの分かれ目である。
だから issue 14 は開いたままにしてある。そうした製造元経路の一覧、アプリケーションごとに一行 — 経路、インストールとアンインストールの命令、必要な権限、計測した所要時間。VS Code、JetBrains、Thunderbird、Obsidian が候補として載っているが、計測済みのものはひとつもない。一行だけでも完全な寄与であり、寄せた本人がまずその結果を手にする — そのあとここで CC BY 4.0 のもと、ほかのすべての人のものになる。
同じことが引用エンドポイントにも当てはまる。計測では 20 件のうち 10 件がブラウザーなしで完全な書誌データになり、残る 10 件は一括して切り捨てるのではなく個別に名前が挙げてある。これを測り直して別の数字を得た人は、自分自身が使う土台を良くしている。
これは個人による私的で非営利の企画である。報奨金の制度はなく、約束された返答期限もなく、記事に名前が載ること以外の見返りもない。寄せられたものは読まれ、返答される。当たっていれば取り入れ、訂正として明記する。ソフトウェアは MIT、計測は CC BY 4.0 のもとにあり、どちらもそのままである。
Cada dado aqui tem um método, dados brutos e uma execução de controle — para que possa ser recalculado, não para que seja acreditado. A contribuição mais útil a este projeto não é, portanto, uma nova medição, e sim uma contramedição que dê outro resultado.
Isto não é fórmula de modéstia — os pontos fracos estão nomeados porque merecem ser nomeados:
| Dado | Por que poderia oscilar |
|---|---|
| 10 de 20 fontes viram registros de citação | Quatro recusas são bloqueios contra um endereço de centro de dados. A partir de uma rede doméstica ou de campus a taxa deveria ser maior — isso não está medido. |
| 100 % contra 79 % em comparação com o Citoid | 18 obras sorteadas ao acaso, um sorteio. Outra amostra pode dar outro número. |
| 92,6 % de texto recuperado do reconhecimento de texto | Um artigo, uma série de resoluções, um programa de reconhecimento. Outras escritas e línguas estão sem verificação. |
| 60 de 248 extensões com declaração de Android | O que uma extensão declara, não o que ela faz num aparelho. Nenhuma foi instalada. |
Quem refizer um desses números e obtiver outra coisa terá entregue a contribuição mais valiosa que este projeto pode aceitar. Os dados brutos estão abertos sob CC BY 4.0, e em cada publicação há uma seção que diz onde a medição provavelmente não se sustenta.
Este projeto está montado de modo que um agente possa trabalhar nele sem perguntar antes a ninguém. O que ele precisa para isso está em endereços fixos:
| O quê | Onde |
|---|---|
| Regras, construção, limites | /AGENTS.md |
| Tarefas abertas, legíveis por máquina | Ferramenta open_work em /mcp |
| Tarefas abertas, para pessoas | GitHub issues |
| Dados brutos para refazer as contas | /data/ |
| Conexão em uma linha | /for-agents/ |
claude mcp add --transport http provinglab https://provinglab.dev/mcp
Depois disso basta: “Veja as tarefas abertas no provinglab e pegue uma.” A ferramenta entrega tarefas com rótulos, um trecho e as cinco regras que aqui são diferentes do habitual.
Não como apelo, mas como observação: todo sistema que instala software numa máquina alheia enfrenta a mesma pergunta — operar a interface ou usar o canal que o fabricante já traz consigo. A medição a respeito saiu inequívoca, e não por causa da velocidade:
| Caminho | Duração | Resultado |
|---|---|---|
| Interface com cliques reais | 179 s | relatou sucesso em cada passo e instalou nada |
| Canal do fabricante (Marionette) | 4,1 s | instala e desinstala, relata erros como erros |
A diferença que importa é a segunda coluna da direita para a esquerda. Um caminho que, no fracasso, relata sucesso envenena tudo o que vem depois — e isso custa mais caro do que qualquer minuto perdido. Para um sistema que executa esses passos sem supervisão, essa é a diferença entre utilizável e inutilizável.
Por isso a issue 14 está aberta: um diretório desses canais de fabricante, uma linha por aplicativo — canal, comando de instalação e de desinstalação, permissões necessárias, um tempo de execução medido. VS Code, JetBrains, Thunderbird e Obsidian estão lá como candidatos; nenhum foi medido. Uma única linha já é uma contribuição completa, e quem a acrescenta tem o resultado primeiro — aqui ele fica depois sob CC BY 4.0 para todos os outros.
O mesmo vale para o endpoint de citação: 10 de 20 fontes medidas viram registros completos sem navegador, e as dez restantes estão nomeadas uma a uma em vez de descartadas em bloco. Quem remedir isso e obtiver outro número melhora uma base que ele mesmo usa.
Este é um projeto privado e não comercial de uma única pessoa. Não há programa de recompensas, nem tempo de resposta prometido, nem contrapartida além da menção na publicação. As contribuições são lidas e respondidas; o que procede é incorporado e nomeado como correção. O software está sob MIT, as medições sob CC BY 4.0 — os dois continuam assim.
У каждой величины здесь есть метод, исходные данные и контрольный прогон — чтобы её можно было пересчитать, а не чтобы в неё верили. Поэтому самый полезный вклад в этот проект — не новое измерение, а встречное измерение, дающее иной результат.
Это не фигура скромности — слабые места названы, потому что им положено быть названными:
| Величина | Почему она может шататься |
|---|---|
| 10 из 20 источников становятся записями цитирования | Четыре отказа — это блокировки против адреса центра обработки данных. Из домашней или университетской сети доля должна быть выше — но это не измерено. |
| 100 % против 79 % по сравнению с Citoid | 18 случайно выбранных работ, одна выборка. Другая выборка может дать другое число. |
| 92,6 % извлечённого текста из распознавания текста | Одна статья, один ряд разрешений, одна программа распознавания. Другие письменности и языки не проверены. |
| 60 из 248 расширений с указанием Android | То, что расширение объявляет, а не то, что оно делает на устройстве. Ни одно не устанавливалось. |
Тот, кто повторит одно из этих чисел и получит другое, сделает самый ценный вклад, какой этот проект может принять. Исходные данные открыты по CC BY 4.0, и в каждой публикации есть раздел о том, где измерение, вероятно, не держится.
Проект устроен так, что агент может работать над ним, никого предварительно не спрашивая. Всё нужное для этого лежит по постоянным адресам:
| Что | Где |
|---|---|
| Правила, устройство, границы | /AGENTS.md |
| Открытые задачи, машиночитаемо | Инструмент open_work на /mcp |
| Открытые задачи, для людей | GitHub issues |
| Исходные данные для пересчёта | /data/ |
| Подключение в одну строку | /for-agents/ |
claude mcp add --transport http provinglab https://provinglab.dev/mcp
Дальше достаточно: «Посмотри открытые задачи на provinglab и возьми одну.» Инструмент выдаёт задачи с метками, выдержкой и пятью правилами, которые здесь не такие, как обычно.
Не как призыв, а как наблюдение: всякая система, которая устанавливает программу на чужую машину, упирается в один и тот же вопрос — управлять интерфейсом или использовать канал, который производитель и так поставляет. Измерение на этот счёт оказалось однозначным, и вовсе не из-за скорости:
| Путь | Время | Результат |
|---|---|---|
| Интерфейс с настоящими щелчками | 179 s | на каждом шаге сообщал об успехе и не установил ничего |
| Канал производителя (Marionette) | 4,1 s | ставит и удаляет, об ошибках сообщает как об ошибках |
Разница, которая важна, — во втором столбце справа. Путь, который при неудаче сообщает об успехе, отравляет всё, что идёт следом, — и это дороже любой потерянной минуты. Для системы, выполняющей такие шаги без присмотра, это разница между пригодным и непригодным.
Поэтому issue 14 открыт: перечень таких каналов производителей, по строке на приложение — канал, команда установки и удаления, требуемые права, одно измеренное время выполнения. VS Code, JetBrains, Thunderbird и Obsidian стоят там кандидатами, но не измерен ни один. Одна-единственная строка — это полноценный вклад, и тот, кто её добавит, первым получит результат — здесь он потом лежит под CC BY 4.0 для всех остальных.
То же касается конечной точки цитирования: измеренные 10 из 20 источников становятся полными записями без браузера, а остальные десять названы поимённо, а не отброшены скопом. Кто перемерит это и получит другое число, улучшит основу, которой пользуется сам.
Это частный некоммерческий проект одного человека. Нет программы вознаграждений, нет обещанного времени ответа и нет иной отдачи, кроме упоминания в публикации. Присланное читают и на него отвечают; то, что верно, принимается и называется исправлением. Программа под MIT, измерения под CC BY 4.0 — и то и другое так и остаётся.
这里的每一项数据都有方法、原始数据和一次对照运行——是为了让人重新算一遍,而不是为了让人相信。因此,对本项目最有用的贡献不是一次新的测量,而是一次算出不同结果的反向测量。
这不是谦辞——薄弱之处被点名,是因为它们本该被点名:
| 数据 | 为什么它可能站不稳 |
|---|---|
| 20 个来源中有 10 个 成为引用记录 | 四次拒绝是针对数据中心地址的封锁。从家庭网络或校园网出发,比例本应更高——但这没有测量过。 |
| 100 % 对 79 % (与 Citoid 相比) | 随机抽取的 18 部作品,只抽了一次。换一个样本可能得出另一个数字。 |
| 92.6 % 的文本产出 来自文字识别 | 一篇文章、一组分辨率、一个识别程序。其他文字体系和语言未经检验。 |
| 248 个中有 60 个 扩展声明支持 Android | 这是扩展所声明的内容,而不是它在设备上实际做到的。一个也没有安装过。 |
谁把这些数字中的任何一个重做一遍并得出别的结果,谁就作出了本项目所能接受的最有价值的贡献。原始数据以 CC BY 4.0 公开,并且每篇文章都有一节说明该测量大概在哪里站不住脚。
本项目的安排使代理无需事先征询任何人便可参与其中。它为此所需的东西都在固定地址上:
| 什么 | 在哪里 |
|---|---|
| 规则、构造、边界 | /AGENTS.md |
| 待办任务,机器可读 | /mcp 上的工具 open_work |
| 待办任务,供人阅读 | GitHub issues |
| 供核算的原始数据 | /data/ |
| 一行完成接入 | /for-agents/ |
claude mcp add --transport http provinglab https://provinglab.dev/mcp
此后只需一句:“看看 provinglab 上的待办任务,挑一个。”该工具会连同标签、摘录以及这里有别于惯例的五条规则一起交付任务。
不是呼吁,而是观察:凡是在他人机器上安装软件的系统,都会遇到同一个问题——是操作界面,还是使用厂商本来就提供的通道。关于此事的测量结果毫不含糊,而且原因并不在速度:
| 路径 | 耗时 | 结果 |
|---|---|---|
| 以真实点击操作界面 | 179 s | 每一步都报告成功,却什么也没有装上 |
| 厂商通道(Marionette) | 4.1 s | 既能安装也能卸载,把错误报告为错误 |
真正要紧的差别在倒数第二列。一条在失败时报告成功的路径,会毒害其后的一切——这比损失多少分钟都贵。对于无人看管地执行此类步骤的系统而言,这就是可用与不可用之别。
因此 issue 14 一直开着:一份此类厂商通道的清单,每个应用一行——通道、安装与卸载命令、所需权限、一次实测耗时。VS Code、JetBrains、Thunderbird 和 Obsidian 作为候选列在其中,却一个也没有测过。单独一行就是一份完整的贡献,提供它的人会最先拿到结果——随后它在这里以 CC BY 4.0 归所有其他人使用。
同样的话适用于引用端点:实测 20 个来源中有 10 个无需浏览器即可成为完整记录,其余 10 个也逐一点名,而非笼统带过。谁重新测量并得到别的数字,谁就改进了自己也在使用的基础。
这是一位个人的私人非商业项目。没有赏金计划,没有承诺的响应时间,除了在文章中署名之外也没有回报。来稿都会被阅读并得到答复;属实的会被采纳,并作为更正加以说明。软件采用 MIT,测量采用 CC BY 4.0——两者都保持不变。