Principes de travail - 7.3

Rapprochement de données à l'aide des outils Talend

Version
7.3
Language
Français
Product
Talend Big Data Platform
Talend Data Fabric
Talend Data Management Platform
Talend Data Services Platform
Talend MDM Platform
Talend Real-Time Big Data Platform
Module
Studio Talend
Content
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Last publication date
2024-02-07

Ce composant implémente l'algorithme MapReduce, selon les clés de blocs définies dans la table Blocking definition de la vue Basic settings.

Cette implémentation se fait de la façon suivante :

  1. Divise les lignes d'entrée en groupes d'une taille donnée.

  2. Implémente une classe Map créant un mapping entre chaque clé et une liste d'enregistrements.

  3. Mélange les enregistrements afin de regrouper ceux ayant la même clé.

  4. Applique, sur chaque clé, l'algorithme défini dans la table Key definition de la vue Basic settings.

    Ce composant lit les enregistrements, les compare aux enregistrements maître, regroupe les enregistrements similaires et classe les autres en tant qu'enregistrements maître.

  5. Le composant écrit en sortie les groupes d'enregistrements similaires avec leur ID de groupe, la taille de leur groupe, les distances et les scores de correspondance.