Principes de travail

Data matching

author
Talend Documentation Team
EnrichVersion
6.4
EnrichProdName
Talend Big Data Platform
Talend Data Services Platform
Talend Real-Time Big Data Platform
Talend Data Management Platform
Talend MDM Platform
Talend Data Fabric
task
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
EnrichPlatform
Studio Talend

Ce composant implémente l'algorithme MapReduce, selon les clés de blocs définies dans la table Blocking definition de la vue Basic settings.

Pour plus d'informations concernant les technologies supportées par Talend, consultez Composants Talend.

  1. Divise les lignes d'entrée en groupes d'une taille donnée.

  2. Implémente une classe Map créant un mapping entre chaque clé et une liste d'enregistrements.

  3. Mélange les enregistrements afin de regrouper ceux ayant la même clé.

  4. Applique, sur chaque clé, l'algorithme défini dans la table Key definition de la vue Basic settings.

    Ce composant lit les enregistrements, les compare aux enregistrements maître, regroupe les enregistrements similaires et classe les autres en tant qu'enregistrements maître.

  5. Le composant écrit en sortie les groupes d'enregistrements similaires avec leur ID de groupe, la taille de leur groupe, les distances et les scores de correspondance.