+Rapprochement / Dédoublonnage

RAPPROCHEMENT ET DÉDOUBLONNAGE DE DONNÉES : SAVOIR QUAND DEUX LIGNES PARLENT DE LA MÊME CHOSE

Deux fichiers décrivent rarement le même objet de la même façon. Rapprocher des données, c’est décider — et pouvoir justifier — quelles lignes désignent réellement la même chose, et lesquelles ne le désignent pas.

01 / Le problème

LE MÊME OBJET PEUT PORTER DES NOMS DIFFÉRENTS.

Une commune peut être décrite par son nom, son code INSEE ou son code postal. Une entreprise peut apparaître avec sa raison sociale, son enseignement commercial ou son numéro SIREN. Une même adresse peut s’écrire de plusieurs façons selon la source.

Rapprocher, ce n’est donc pas seulement comparer des colonnes. C’est décider, à partir de plusieurs indices, quand deux lignes parlent du même objet — et savoir ce que cette décision permet d’affirmer.

Fichier AFichier B
Clé + règles de correspondance Correspondances + preuve

02 / Clés exactes

SIREN, SIRET, CODES : PRÉCIEUX QUAND ILS SONT LÀ.

Un identifiant officiel est la meilleure base de rapprochement lorsqu’il est présent et à jour. Il reste néanmoins soumis à des limites : il peut manquer, avoir changé, ou désigner un niveau différent de celui attendu.

  • SIREN / SIRET : identifiants d’entreprise ; le SIREN désigne l’unité légale, le SIRET un établissement.
  • Code INSEE : identifiant d’une commune, mais qui peut évoluer avec les fusions de communes.
  • Code postal : utile mais ambigu : il ne correspond pas toujours à une seule commune.
  • Identifiant interne : propre à une source ; il n’a de sens qu’à l’intérieur de cette source.
Attention : un identifiant n’est pas une preuve d’unicité à lui seul. Deux lignes peuvent partager le même identifiant sans décrire le même objet, et il faut alors le signaler plutôt que de supprimer l’une des deux.

03 / Clés imparfaites

NOMS ET ADRESSES RESTENT DES INDICES.

Quand aucun identifiant n’est disponible, le rapprochement s’appuie sur des champs comme le nom, l’adresse ou la localisation. Ces indices sont utiles mais fragiles : une abréviation, une faute de frappe ou une variante d’écriture suffit à faire échouer une comparaison exacte.

Assouplir la comparaison augmente le nombre de correspondances trouvées, mais aussi le risque de correspondances fausses. La bonne question n’est pas « combien de correspondances ? » mais « quelles correspondances sont assez solides pour être utilisées ? ».

04 / Correspondances

EXACTE, PROBABLE, ABSENTE : TROIS RÉSULTATS DIFFÉRENTS.

Un rapprochement ne se réduit pas à « trouvé » ou « pas trouvé ». Il produit au moins trois situations, qui ne se traitent pas de la même manière.

  • Correspondance exacte : la clé est identique et fiable ; le lien est établi.
  • Correspondance probable : plusieurs indices concordent sans certitude ; le lien reste à confirmer.
  • Correspondance absente : aucune ligne ne correspond dans l’autre source.
Point clé : une correspondance probable ne doit pas être présentée comme exacte. La différence entre les deux change la confiance que l’on peut accorder au résultat final.

05 / Pas trouvé

« PAS TROUVÉ » N’EST PAS « ABSENT ».

Quand une ligne de la source A n’a pas de correspondance dans la source B, deux explications sont possibles : l’objet n’existe pas dans B, ou bien il y existe sous une autre forme qui n’a pas été reconnue.

Conclure trop vite transforme une limite de rapprochement en affirmation sur le réel. Une correspondance non trouvée est d’abord une information sur la méthode, pas sur l’objet.

A

VRAIMENT ABSENT

L’objet n’est pas couvert par la seconde source, ou pas à ce millésime.

B

NON RECONNU

L’objet existe mais sous une forme que la clé n’a pas réussi à relier.

C

INDÉCIDABLE

Les indices disponibles ne permettent pas de trancher entre les deux cas.

06 / Doublons

DOUBLONS VRAIS ET ENTITÉS DISTINCTES.

Tout ce qui se ressemble n’est pas un doublon. Deux points de vente peuvent partager un même identifiant d’entreprise tout en étant deux lieux distincts. À l’inverse, deux écritures différentes peuvent désigner un seul et même lieu.

Notre règle distingue quatre cas et ne corrige pas ce qui n’est pas prouvé :

  • Identifiant unique et cohérent : utilisé tel quel.
  • Identifiant partagé par des objets distincts : désambiguïsé, jamais supprimé.
  • Lignes strictement identiques : dédoublonnées.
  • Ambiguïté non tranchable : conservée et documentée, pas corrigée automatiquement.
Pourquoi : une correction automatique agressive peut supprimer une entité réelle. Quand deux lignes ne peuvent pas être départagées de façon certaine, les garder tout en signalant l’ambiguïté est plus honnête que de trancher au hasard.

07 / Preuve

GARDER LA PREUVE DU RAPPROCHEMENT.

Une fois les correspondances établies, elles doivent rester vérifiables. Pour chaque lien, on devrait pouvoir savoir sur quoi il repose : identifiant, adresse normalisée, correspondance probable, ou décision manuelle.

Sans cette trace, un résultat fusionné redevient une boîte noire : impossible de savoir quelles lignes ont été rapprochées, et pourquoi.

08 / Cas public

UN CAS PUBLIC : CODES INSEE ET NIVEAUX DE PÉRIMÈTRE.

Notre étude publique sur les seniors territoriaux doit rapprocher des sources publiques sur des territoires précis. Elle illustre deux difficultés courantes de correspondance.

  • Codes communaux : le rattachement passe par l’identifiant de la commune, pas par le nom, pour éviter les homonymies.
  • Niveaux différents : des communes d’un côté et des arrondissements municipaux de l’autre ne sont pas des mailles comparables.

L’étude publie ces deux lectures séparément et ne reconstruit pas d’agrégat communal à partir d’arrondissements. Ce choix évite de faire passer une correspondance de périmètre pour une correspondance d’objet.

09 / Questions fréquentes

EN CLAIR.

Quelle clé utiliser pour rapprocher deux fichiers ?

Cela dépend de ce que les deux sources ont en commun et de ce que cette clé permet de prouver. Un identifiant officiel comme un SIREN ou un code INSEE est plus solide qu’un nom ou une adresse, mais il n’est pas toujours présent ni toujours à jour. Le choix se documente.

Dédoublonnage et rapprochement, est-ce la même chose ?

Non. Le rapprochement établit une correspondance entre des lignes qui désignent le même objet, éventuellement dans des fichiers différents. Le dédoublonnage retire les répétitions à l’intérieur d’un même ensemble. Les deux s’appuient souvent sur la même décision : considérer deux lignes comme une seule.

Peut-on supprimer automatiquement les doublons ?

Seulement les doublons stricts, quand deux lignes sont identiques sur les champs qui identifient l’objet. Les cas ambigus ne doivent pas être tranchés automatiquement : une correction automatique risque d’effacer une entité réelle ou de fusionner deux objets distincts.

Un taux de correspondance élevé suffit-il ?

Non. Un taux élevé peut inclure des correspondances fausses. Ce qui compte n’est pas seulement le nombre de lignes rapprochées, mais la qualité de la clé, la part de cas incertains et la possibilité de vérifier une correspondance donnée.

10 / Passer à l’action

DEUX FICHIERS À RAPPROCHER ?

Envoyez les deux sources et décrivez l’objet commun que vous cherchez à relier. Nous vous dirons quelles correspondances les données permettent d’établir — et lesquelles restent incertaines.