Correspondance floue entre deux colonnes et écriture en sortie des valeurs de correspondance, de correspondance possible et de non correspondance - Cloud

Correspondance floue entre deux colonnes et écriture en sortie des valeurs de correspondance, de correspondance possible et de non correspondance - Cloud - 8.0

Rapprochement flou (Fuzzy matching)

Version

Cloud

8.0

Language

Français

Product

Talend Big Data Platform

Talend Data Fabric

Talend Data Management Platform

Talend Data Services Platform

Talend MDM Platform

Talend Real-Time Big Data Platform

Module

Studio Talend

Content

Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou

Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou

Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou

Last publication date

2023-08-28

Déprécié·e

Déprécié·e : Le composant tBlockedFuzzyJoin est déprécié depuis la version 7.3 (GA, généralement disponible).

Pour plus de technologies supportées par Talend, consultez Composants Talend.

Ce composant est disponible dans Talend Data Management Platform, Talend Big Data Platform, Talend Real Time Big Data Platform, Talend Data Services Platform, Talend MDM Platform et Talend Data Fabric.

Ce scénario Java décrit un Job comprenant six composants, ayant pour but de :

faire correspondre chaque numéro de groupe de la colonne grp aux entrées ayant exactement les mêmes valeurs dans le fichier d'entrée de référence,
vérifier la distance d'édition entre les entrées de la colonne firstname d'un fichier d'entrée et du fichier d'entrée de référence.

Les sorties de ces deux types de correspondances sont écrites dans trois fichiers de sortie : le premier pour les valeurs de correspondance, le deuxième pour les valeurs de correspondance possible, et le troisième pour les valeurs n'ayant aucune correspondance dans le fichier de référence.

Dans ce scénario, vous avez déjà stocké les schémas principaux et de référence dans le Repository. Pour plus d'informations concernant le stockage des schémas de métadonnées dans la vue Repository, consultez Gestion des métadonnées dans le Studio.

Le fichier d'entrée contient quatre colonnes : grp, gender, firstname et count. Les données dans ce fichier d'entrée sont parfois en doublons, contiennent des noms écrits différemment, ou mal orthographiés, ou différentes informations sur un même client.