Ce composant indexe un jeu de données nettoyé et dédoublonné dans ElasticSearch à des fins de rapprochement continu.
-
Vous avez généré un modèle permettant d'appairer les données et calculé les paires suspectes à l'aide du tMatchPairing.
-
Vous avez libellé un échantillon manuellement ou en utilisant Talend Data Stewardship afin de générer un modèle de rapprochement à l'aide du tMatchModel.
-
Vous avez prédit les libellés sur les paires suspectes selon le modèle de rapprochement et le modèle permettant d'appairer les données à l'aide du tMatchPredict.
-
Vous avez nettoyé et dédupliqué le jeu de données à l'aide du tRuleSurvivorship.
Vous n'avez pas besoin de répéter le processus de rapprochement depuis le début lorsque vous avez de nouveaux enregistrements de données ayant le même schéma. Vous pouvez indexer le jeu de données nettoyé dans Elasticsearch à l'aide du tMatchIndex à des fins de rapprochement continu.
Pour plus d'informations concernant le tMatchIndex, consultez tMatchIndex.
Ce composant s'exécute avec Spark 2.0+ et ElasticSearch 5+.
Pour plus d'informations concernant les technologies supportées par Talend, consultez Composants Talend.