+Moteur / DataAuthority

INTERROGER LES DONNÉES. GARDER LA SOURCE.

Le moteur DataAuthority est en cours de finalisation. Sa priorité actuelle : rapprocher et contrôler des données structurées, puis restituer des résultats qui restent accompagnés de leur origine, de leurs transformations, de leur couverture et de leurs limites.

Bientôt disponibleVoir la méthode →

01 / Le principe

DES DONNÉES STRUCTURÉES JUSQU’AUX FAITS TRAÇABLES.

Le moteur travaille d’abord là où nous pouvons contrôler précisément les entrées, les transformations et les sorties. Dans notre architecture, un atom est une unité de fait reliée à une source, une version, un contexte et aux conditions qui limitent son usage. Le terme décrit notre modèle interne ; ce n’est pas un standard officiel.

01

FORMATS STRUCTURÉS

CSV, Parquet, DuckDB et NDJSON sont les entrées prioritaires du moteur.

02

ATOMS

Le moteur est conçu pour décomposer les résultats en unités de faits plutôt qu’en un verdict global opaque.

03

PROVENANCE + QA

Sources, versions, transformations et contrôles restent attachés au parcours de la donnée.

04

LIMITES

Inconnu, conflit, couverture insuffisante et conclusions interdites restent explicites.

02 / Du fichier au résultat

STRUCTURER, ATOMISER, CONTRÔLER, PUIS CONCLURE.

CSV / ParquetDuckDBNDJSON
↓Atoms + provenance + QA↓Résultat + preuves + limites

03 / Ce que nous refusons

« ON NE SAIT PAS » NE DOIT PAS DEVENIR « ZÉRO ».

Quand une information est absente, le moteur doit pouvoir la laisser absente. Il ne doit pas transformer un manque de donnée en certitude, ni inventer une valeur pour remplir une case.

  • Une source absente reste absente.
  • Une contradiction entre sources reste visible.
  • Une limite de couverture n’est pas masquée.
  • Une réponse ne doit pas affirmer davantage que les données disponibles.

04 / Tester le moteur

DONNEZ-NOUS UN JEU DE DONNÉES. NOUS VOUS MONTRONS CE QUE LE MOTEUR EN FAIT.

Le moteur n’est pas encore ouvert en libre-service. Nous pouvons toutefois sélectionner des cas exploratoires sur demande : un échantillon CSV, Parquet, DuckDB ou NDJSON, un problème concret, puis une restitution de ce que les données permettent réellement d’affirmer — et de ce qu’elles ne permettent pas d’affirmer.

Limite actuelle : les PDF et documents sont étudiés au cas par cas lorsqu’ils sont nativement textuels et vérifiables. Ils ne sont pas notre promesse principale, et l’OCR de documents arbitraires n’est pas présenté comme une capacité garantie.