Calculer des paires suspectes et écrire un échantillon dans Talend Data Stewardship - Cloud - 8.0

Rapprochement de données à l'aide des outils Talend

Version
Cloud
8.0
Language
Français
Product
Talend Big Data Platform
Talend Data Fabric
Talend Data Management Platform
Talend Data Services Platform
Talend MDM Platform
Talend Real-Time Big Data Platform
Module
Studio Talend
Content
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Last publication date
2024-02-07

Ce scénario s'applique uniquement aux produits Talend Platform avec Big Data nécessitant souscription et à Talend Data Fabric.

Trouver des enregistrements en doublon est difficile et prend beaucoup de temps, particulièrement lorsque vous traitez un grand volume de données. Dans cet exemple, le tMatchPairing utilise une clé de bloc pour calculer les paires de doublons suspects dans une longue liste de centres d'éducation de la petite enfance, à Chicago, provenant de dix sources différentes.

Il calcule également un échantillon de doublons suspects et les écrit sous forme de tâche dans une campagne Grouping dans Talend Data Stewardship. Des data stewards autorisé·e·s peuvent intervenir sur l'échantillon de données et décider si les paires suspectes sont des doublons.

Vous pouvez utiliser l'échantillon libellé afin de calculer un modèle de rapprochement et l'appliquer à tous les doublons suspects, dans le contexte de l'apprentissage automatique dans Spark.

Pour reproduire l'exemple décrit ci-après, téléchargez le fichier tmatchpairing_load_suspect_pairs_in_tds.zip.

Avant de configurer le Job, vérifiez que :
  • - dans Talend Administration Center, un rôle Campaign Owner doit vous avoir été assigné, ce qui vous permet d'accéder aux campagnes du serveur.

  • - vous avez créé la campagne Grouping dans Talend Data Stewardship et avez défini le schéma correspondant à la structure du fichier des centres d'éducation.