tMatchPairing - 7.0

Matching with machine learning

author
Talend Documentation Team
EnrichVersion
7.0
EnrichProdName
Talend Big Data Platform
Talend Data Fabric
Talend Data Management Platform
Talend Data Services Platform
Talend MDM Platform
Talend Real-Time Big Data Platform
task
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
EnrichPlatform
Studio Talend
Talend Data Stewardship

Ce composant vous permet de calculer des paires de doublons suspects de toute source de données, y compris dans de grands volumes dans le contexte de l'apprentissage automatique dans Spark.

Ce composant lit un jeu de données ligne par ligne, exclut les lignes uniques et les doublons exacts dans des fichiers séparés. Il calcule des paires d'enregistrements suspects selon la définition d'une clé de bloc. Il crée un échantillon d’enregistrements suspects représentatif du jeu de données.

Vous pouvez libeller des paires suspectes manuellement ou les charger dans une campagne de type Grouping déjà définie sur le serveur de Talend Data Stewardship .

Ce composant s'exécute uniquement avec les distributions Hadoop suivantes, avec Spark 1.6+ et Spark 2.0 :
  • Spark 1.6 : CDH5.7, CDH5.8, HDP2.4.0, HDP2.5.0, MapR5.2.0, EMR4.5.0, EMR4.6.0.

  • Spark 2.0 : EMR5.0.0.

Pour plus d'informations concernant les technologies supportées par Talend, consultez .