tMatchIndex - Cloud - 8.0

Rapprochement de données à l'aide des outils Talend

Version
Cloud
8.0
Language
Français
Product
Talend Big Data Platform
Talend Data Fabric
Talend Data Management Platform
Talend Data Services Platform
Talend MDM Platform
Talend Real-Time Big Data Platform
Module
Studio Talend
Content
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou
Création et développement > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou
Gouvernance de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement continu
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement de données
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement flou
Qualité et préparation de données > Systèmes tiers > Composants Data Quality > Composants de rapprochement > Composants de rapprochement utilisant l'apprentissage automatique
Last publication date
2024-02-07

Ce composant indexe un jeu de données nettoyées et dédoublonnées dans ElasticSearch afin d'effectuer un rapprochement continu.

Avant d'indexer un jeu de données dans ElasticSearch à l'aide du composant tMatchIndex, vous devez avoir réalisé l'ensemble des opérations de rapprochement et de dédoublonnage :
  • Vous avez généré un modèle permettant d'appairer les données et calculé les paires suspectes à l'aide du tMatchPairing.
  • Vous avez libellé un échantillon manuellement ou en utilisant Talend Data Stewardship afin de générer un modèle de rapprochement à l'aide du tMatchModel.
  • Vous avez prédit les libellés sur les paires suspectes selon le modèle de rapprochement et le modèles permettant d'appairer les données à l'aide du tMatchPredict.
  • Vous avez nettoyé et dédupliqué le jeu de données à l'aide du tRuleSurvivorship.

Vous n'avez pas besoin de répéter le processus de rapprochement depuis le début lorsque vous avez de nouveaux enregistrement ayant le même schéma. Vous pouvez indexer le jeu de données nettoyées dans Elasticsearch à l'aide de tMatchIndex pour effectuer du rapprochement continu.

Le composant tMatchIndex supporte les versions d'Elasticsearch jusqu'à 6.4.2.

Comme ce composant ne supporte pas l'authentification Elasticsearch, il ne peut s'exécuter sur Databricks.

En mode local, la version 2.4 d'Apache Spark est supportée.

Ce composant n'est pas intégré par défaut à votre Studio Talend. Vous devez l'installer à l'aide du gestionnaire des fonctionnalités. Pour plus d'informations, consultez Installer les fonctionnalités à l'aide du Gestionnaire des fonctionnalités.