tMatchModel - 7.0

Matching with machine learning

author
Talend Documentation Team
EnrichVersion
7.0
EnrichProdName
Talend Big Data Platform
Talend Data Fabric
Talend Data Management Platform
Talend Data Services Platform
Talend MDM Platform
Talend Real-Time Big Data Platform
task
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
EnrichPlatform
Studio Talend
Talend Data Stewardship

Ce composant génère le modèle de rapprochement utilisé par le composant tMatchPredict pour prédire automatiquement les libellés pour les paires suspectes et de grouper les enregistrements qui correspondent au(x) libellé(s) configuré(s) dans les propriétés du composant.

Pour plus d'informations concernant les composants tMatchPairing et tMatchPredict, consultez tMatchPairing et tMatchPredict, respectivement.

Le tMatchModel lit l'échantillon de paires suspectes écrites en sortie par le tMatchPairing, après avoir libellé le second élément de chaque paire, puis analyse les données à l'aide de l'algorithme Random Forest et génère un modèle de rapprochement.

Vous pouvez utiliser l'échantillon des enregistrements suspects libellés dans une campagne Grouping définie sur le serveur de Talend Data Stewardship avec le tMatchModel.

Pour plus d'informations concernant les campagnes de type Grouping, consultez Ajout d'une campagne Grouping pour identifier les paires de doublons.

Ce composant s'exécute uniquement avec les distributions de Spark 1.6+ et 2.0 :
  • Spark 1.6 : CDH5.7, CDH5.8, HDP2.4.0, HDP2.5.0, MapR5.2.0, EMR4.5.0, EMR4.6.0.

  • Spark 2.0 : EMR5.0.0.

Pour plus d'informations concernant les technologies supportées par Talend, consultez .