FORMATS STRUCTURÉS
CSV, Parquet, DuckDB et NDJSON sont les entrées prioritaires du moteur.
+Moteur / DataAuthority
Le moteur DataAuthority est en cours de finalisation. Sa priorité actuelle : rapprocher et contrôler des données structurées, puis restituer des résultats qui restent accompagnés de leur origine, de leurs transformations, de leur couverture et de leurs limites.
01 / Le principe
Le moteur travaille d’abord là où nous pouvons contrôler précisément les entrées, les transformations et les sorties. Dans notre architecture, un atom est une unité de fait reliée à une source, une version, un contexte et aux conditions qui limitent son usage. Le terme décrit notre modèle interne ; ce n’est pas un standard officiel.
CSV, Parquet, DuckDB et NDJSON sont les entrées prioritaires du moteur.
Le moteur est conçu pour décomposer les résultats en unités de faits plutôt qu’en un verdict global opaque.
Sources, versions, transformations et contrôles restent attachés au parcours de la donnée.
Inconnu, conflit, couverture insuffisante et conclusions interdites restent explicites.
02 / Du fichier au résultat
03 / Ce que nous refusons
Quand une information est absente, le moteur doit pouvoir la laisser absente. Il ne doit pas transformer un manque de donnée en certitude, ni inventer une valeur pour remplir une case.
04 / Tester le moteur
Le moteur n’est pas encore ouvert en libre-service. Nous pouvons toutefois sélectionner des cas exploratoires sur demande : un échantillon CSV, Parquet, DuckDB ou NDJSON, un problème concret, puis une restitution de ce que les données permettent réellement d’affirmer — et de ce qu’elles ne permettent pas d’affirmer.
Limite actuelle : les PDF et documents sont étudiés au cas par cas lorsqu’ils sont nativement textuels et vérifiables. Ils ne sont pas notre promesse principale, et l’OCR de documents arbitraires n’est pas présenté comme une capacité garantie.