Effectuer un rapprochement continu à l'aide du tMatchIndexPredict - 7.1

Continuous matching

author
Talend Documentation Team
EnrichVersion
7.1
EnrichProdName
Talend Big Data Platform
Talend Data Fabric
Talend Data Management Platform
Talend Data Services Platform
Talend MDM Platform
Talend Real-Time Big Data Platform
task
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
EnrichPlatform
Studio Talend
Talend Data Stewardship

Ce scénario s'applique uniquement aux solutions Talend Platform avec Big Data et Talend Data Fabric nécessitant souscription.

Pour plus d'informations concernant les technologies supportées par Talend, consultez Composants Talend.

Après avoir indexé des données de référence dans Elasticsearch à l'aide du tMatchIndex, il n'est pas nécessaire de recommencer le processus de rapprochement depuis le début. Le composant tMatchIndexPredict compare de nouveaux enregistrements aux données indexées dans Elasticsearch.

Dans cet exemple, une liste de centres d'éducation centres d'éducation de la petite enfance, à Chicago, provenant de dix sources différentes, a été nettoyée, dédoublonnée et indexée dans Elasticsearch. Vous souhaitez effectuer un rapprochement entre de nouveaux enregistrements contenant des informations sur des centres d'éducation centres d'éducation de la petite enfance situés à Chicago, et le jeu de données de référence stocké dans Elasticsearch.

tMatchIndexPredict utilise un modèle permettant de constituer des paires d'enregistrements et un modèle de rapprochement afin de regrouper les enregistrements source et les enregistrements correspondants issus du jeu de données de référence indexé dans Elasticsearch, puis libeller ces paires suspectes.

tMatchIndexPredict écrit en sortie les doublons potentiels et les enregistrements uniques dans des fichiers séparés.

Prérequis :