VRAIMENT ABSENT
L’objet n’est pas couvert par la seconde source, ou pas à ce millésime.
+Rapprochement / Dédoublonnage
Deux fichiers décrivent rarement le même objet de la même façon. Rapprocher des données, c’est décider — et pouvoir justifier — quelles lignes désignent réellement la même chose, et lesquelles ne le désignent pas.
01 / Le problème
Une commune peut être décrite par son nom, son code INSEE ou son code postal. Une entreprise peut apparaître avec sa raison sociale, son enseignement commercial ou son numéro SIREN. Une même adresse peut s’écrire de plusieurs façons selon la source.
Rapprocher, ce n’est donc pas seulement comparer des colonnes. C’est décider, à partir de plusieurs indices, quand deux lignes parlent du même objet — et savoir ce que cette décision permet d’affirmer.
02 / Clés exactes
Un identifiant officiel est la meilleure base de rapprochement lorsqu’il est présent et à jour. Il reste néanmoins soumis à des limites : il peut manquer, avoir changé, ou désigner un niveau différent de celui attendu.
03 / Clés imparfaites
Quand aucun identifiant n’est disponible, le rapprochement s’appuie sur des champs comme le nom, l’adresse ou la localisation. Ces indices sont utiles mais fragiles : une abréviation, une faute de frappe ou une variante d’écriture suffit à faire échouer une comparaison exacte.
Assouplir la comparaison augmente le nombre de correspondances trouvées, mais aussi le risque de correspondances fausses. La bonne question n’est pas « combien de correspondances ? » mais « quelles correspondances sont assez solides pour être utilisées ? ».
04 / Correspondances
Un rapprochement ne se réduit pas à « trouvé » ou « pas trouvé ». Il produit au moins trois situations, qui ne se traitent pas de la même manière.
05 / Pas trouvé
Quand une ligne de la source A n’a pas de correspondance dans la source B, deux explications sont possibles : l’objet n’existe pas dans B, ou bien il y existe sous une autre forme qui n’a pas été reconnue.
Conclure trop vite transforme une limite de rapprochement en affirmation sur le réel. Une correspondance non trouvée est d’abord une information sur la méthode, pas sur l’objet.
L’objet n’est pas couvert par la seconde source, ou pas à ce millésime.
L’objet existe mais sous une forme que la clé n’a pas réussi à relier.
Les indices disponibles ne permettent pas de trancher entre les deux cas.
06 / Doublons
Tout ce qui se ressemble n’est pas un doublon. Deux points de vente peuvent partager un même identifiant d’entreprise tout en étant deux lieux distincts. À l’inverse, deux écritures différentes peuvent désigner un seul et même lieu.
Notre règle distingue quatre cas et ne corrige pas ce qui n’est pas prouvé :
07 / Preuve
Une fois les correspondances établies, elles doivent rester vérifiables. Pour chaque lien, on devrait pouvoir savoir sur quoi il repose : identifiant, adresse normalisée, correspondance probable, ou décision manuelle.
Sans cette trace, un résultat fusionné redevient une boîte noire : impossible de savoir quelles lignes ont été rapprochées, et pourquoi.
08 / Cas public
Notre étude publique sur les seniors territoriaux doit rapprocher des sources publiques sur des territoires précis. Elle illustre deux difficultés courantes de correspondance.
L’étude publie ces deux lectures séparément et ne reconstruit pas d’agrégat communal à partir d’arrondissements. Ce choix évite de faire passer une correspondance de périmètre pour une correspondance d’objet.
09 / Questions fréquentes
Cela dépend de ce que les deux sources ont en commun et de ce que cette clé permet de prouver. Un identifiant officiel comme un SIREN ou un code INSEE est plus solide qu’un nom ou une adresse, mais il n’est pas toujours présent ni toujours à jour. Le choix se documente.
Non. Le rapprochement établit une correspondance entre des lignes qui désignent le même objet, éventuellement dans des fichiers différents. Le dédoublonnage retire les répétitions à l’intérieur d’un même ensemble. Les deux s’appuient souvent sur la même décision : considérer deux lignes comme une seule.
Seulement les doublons stricts, quand deux lignes sont identiques sur les champs qui identifient l’objet. Les cas ambigus ne doivent pas être tranchés automatiquement : une correction automatique risque d’effacer une entité réelle ou de fusionner deux objets distincts.
Non. Un taux élevé peut inclure des correspondances fausses. Ce qui compte n’est pas seulement le nombre de lignes rapprochées, mais la qualité de la clé, la part de cas incertains et la possibilité de vérifier une correspondance donnée.
10 / Passer à l’action
Envoyez les deux sources et décrivez l’objet commun que vous cherchez à relier. Nous vous dirons quelles correspondances les données permettent d’établir — et lesquelles restent incertaines.