Calcul de paires suspectes et d'un échantillon de paires suspectes à partir d'un jeu de données - 7.0

Matching with machine learning

author
Talend Documentation Team
EnrichVersion
7.0
EnrichProdName
Talend Big Data Platform
Talend Data Fabric
Talend Data Management Platform
Talend Data Services Platform
Talend MDM Platform
Talend Real-Time Big Data Platform
task
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
EnrichPlatform
Studio Talend
Talend Data Stewardship

Ce scénario s'applique uniquement aux solutions Talend Platform avec Big Data et Talend Data Fabric nécessitant souscription.

Pour plus d'informations concernant les technologies supportées par Talend, consultez .

Dans ce scénario, le tMatchPairing utilise une clé de bloc pour calculer les paires de doublons suspects dans une liste de centres d'éducation de la petite enfance à Chicago.

Le Job décrit ici utilise les composants suivants :

  • un composant tFileInputDelimited pour lire le fichier d'entrée, contenant une liste des centres d'éducation de la petite enfance de Chicago, provenant de dix sources différentes,

  • un composant tMatchPairing pour pré-analyser les données, calculer les paires de doublons suspects et générer un modèle permettant d'appairer les données, utilisé par le composant tMatchPredict,

  • trois composants tFileOutputDelimited pour écrire en sortie les doublons suspects, un échantillon des paires suspectes et les enregistrements uniques,

  • un composant tLogRow pour écrire en sortie les doublons exacts.