Correspondance d'entrées utilisant les algorithmes Q-grams et Levenshtein - 7.0

Data matching

author
Talend Documentation Team
EnrichVersion
7.0
EnrichProdName
Talend Big Data Platform
Talend Data Fabric
Talend Data Management Platform
Talend Data Services Platform
Talend MDM Platform
Talend Real-Time Big Data Platform
task
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
EnrichPlatform
Studio Talend

Ce scénario s'applique uniquement aux solutions Talend Platform et Talend Data Fabric nécessitant souscription.

Pour plus d'informations concernant les technologies supportées par Talend, consultez .

Ce scénario décrit un Job utilisant une règle de rapprochement basée sur l'algorithme VSR. L'objectif de ce Job est de :

  • faire correspondre les entrées de la colonne name à celles du fichier d'entrée de référence en divisant les chaînes de caractères en blocs de longueur q, où q est de trois, afin de créer un certain nombre de q-grammes. Le résultat de correspondance est donné comme le nombre de correspondances entre les q-grammes d'entrée et de référence, divisé par le nombre de q-grammes possibles,

  • faire correspondre la distance d'édition entre les entrées de la colonne email du fichier d'entrée et celles du fichier d'entrée de référence.

Les sorties de ces deux types de correspondances sont écrites dans trois fichiers de sortie : le premier pour les valeurs de correspondance, le deuxième pour les valeurs de correspondance possible, et le troisième pour les valeurs n'ayant aucune correspondance dans le fichier de référence.

Dans ce scénario, vous avez déjà stocké les schémas principaux et de référence dans le Repository. Pour plus d'informations concernant le stockage des métadonnées de schémas dans le Repository, consultez le Guide utilisateur du Studio Talend .

La table d'entrée principale contient sept colonnes : code, name, address, zipcode, city, email et col7. Vous allez effectuer un rapprochement flou sur deux colonnes : name et email.