Ces propriétés sont utilisées pour configurer le tELTHiveMap s'exécutant dans le framework de Jobs Standard.
Le composant tELTHiveMap Standard appartient à la famille ELT.
Le composant de ce framework est disponible dans tous les produits Big Data de Talend.
Basic settings
-
Lorsque vous utilisez ce composant avec Google Dataproc :
Project identifier
Saisissez l'ID de votre projet Google Cloud Platform.
Si vous n'êtes pas certain de l'ID de votre projet, vérifiez dans la page Manage Resources de vos services Google Cloud Platform.
Cluster identifier
Saisissez l'ID de votre cluster Dataproc à utiliser.
Region Laissez la valeur global par défaut, puisqu'elle est la seule région supportée par le Studio pour la plateforme Google Cloud.
Google Storage staging bucket Comme un Job Talend nécessite ses fichiers .jar dépendants pour être exécuté, spécifiez le répertoire Google Storage dans lequel ces fichiers .jar sont transférés afin que votre Job accède à ces fichiers lors de l'exécution.
Le répertoire à saisir doit se terminer par une barre oblique (/). Si le répertoire n'existe pas, un répertoire est créé à la volée mais le bucket à utiliser doit déjà exister.
Database
Saisissez dans ce champ le nom de la base de données.
Provide Google Credentials in file
Lorsque vous lancez votre Job à partir d'une machine donnée sur laquelle Google Cloud SDK a été installé et vous a autorisé à utiliser vos identifiants de compte utilisateur pour accéder à Google Cloud Platform, ne cochez pas cette case. Dans cette situation, cette machine est souvent votre machine locale.
Lorsque vous lancez votre Job à partir d'une machine distante, comme un Jobserver, cochez cette case et dans le champ Path to Google Credentials file qui s'affiche, saisissez le répertoire dans lequel ce fichier JSON est stocké dans la machine du Jobserver.
Pour plus d'informations concernant le fichier Google Credentials, contactez l'administrateur de votre Google Cloud Platform ou consultez Google Cloud Platform Auth Guide (en anglais).
-
Lorsque vous utilisez ce composant avec HDInsight :
WebHCat configuration
Saisissez l'adresse et les informations d'authentification du cluster WebHCat service du Microsoft HD Insight à utiliser. Le Studio utilise ce service pour soumettre le Job au cluster HD Insight.
Dans le champ Job result folder, saisissez l'emplacement où vous souhaitez stocker les résultats d'exécution du Job dans Azure Storage.
HDInsight configuration
Saisissez les informations d'authentification du cluster HD Insight à utiliser.
Windows Azure Storage configuration
Saisissez l'adresse et les informations d'authentification du compte Azure Storage à utiliser.
Dans le champ Container, saisissez le nom du conteneur à utiliser.
Dans le champ Deployment Blob, saisissez l'emplacement où vous souhaitez stocker le Job et ses bibliothèques dépendantes dans le compte Azure Storage.
Database
Saisissez dans ce champ le nom de la base de données.
-
Lorsque vous utilisez d'autres distributions :
Connection mode
Sélectionnez un mode de connexion dans la liste. Les options varient en fonction de la distribution que vous utilisez.
Hive server
Sélectionnez le serveur Hive sur lequel vous souhaitez que le Job utilisant ce composant exécute des requêtes dans Hive.
La liste Hive server est disponible uniquement lorsque la distribution Hadoop à utiliser, par exemple HortonWorks Data Platform V1.2.0 (Bimota) supporte HiveServer2. Vous pouvez sélectionner HiveServer2 (Hive 2), le serveur supportant mieux les connexions simultanées de différents clients que HiveServer (Hive 1).
Pour plus d'informations concernant HiveServer2, consultez la page https://cwiki.apache.org/confluence/display/Hive/Setting+Up+HiveServer2 (en anglais).
Host
Adresse IP du serveur de base de données.
Port
Numéro du port d'écoute du serveur de base de données.
Database
Saisissez dans ce champ le nom de la base de données.
Remarque :Ce champ n'est pas disponible lorsque vous sélectionnez l'option Embedded dans la liste Connection mode.
Username et Password
Informations d'authentification de l'utilisateur de base de données.
Pour saisir le mot de passe, cliquez sur le bouton [...] à côté du champ Password, puis, dans la boîte de dialogue qui s'ouvre, saisissez le mot de passe entre guillemets doubles et cliquez sur OK afin de sauvegarder les paramètres.
Use kerberos authentication
Si vous accédez au Metastore de Hive avec une sécurité Kerberos, cochez cette case et saisissez ensuite les paramètres appropriés dans les champs qui s'affichent.-
Si ce cluster est un cluster MapR de version 5.0.0 ou postérieure, vous pouvez paramétrer la configuration de l'authentification par ticket MapR en plus ou comme une alternative, en suivant les explications dans Connexion sécurisée à MapR.
Gardez à l'esprit que cette configuration génère un nouveau ticket de sécurité MapR pour le nom d'utilisateur défini dans le Job dans chaque exécution. Si vous devez réutiliser un ticket existant provenant du même utilisateur, laissez décochées les cases Force MapR ticket authentication et Use Kerberos authentication. MapR devrait pouvoir trouver automatiquement ce ticket à la volée.
Les valeurs des paramètres suivants peuvent être trouvées dans le fichier hive-site.xml du système Hive utilisé.-
Hive principal utilise la valeur de hive.metastore.kerberos.principal. C'est le principal du service du Metastore de Hive.
-
HiveServer2 local user principal utilise la valeur de hive.server2.authentication.kerberos.principal.
-
HiveServer2 local user keytab utilise la valeur de hive.server2.authentication.kerberos.keytab
-
Metastore URL utilise la valeur de javax.jdo.option.ConnectionURL. C'est la chaîne JDBC de connexion au Metastore de Hive.
-
Driver class utilise la valeur de javax.jdo.option.ConnectionDriverName. C'est le nom du pilote de la connexion JDBC.
-
Username utilise la valeur de javax.jdo.option.ConnectionUserName. Ce paramètre, ainsi que le paramètre Password, sont utilisés pour les informations de connexion de l'utilisateur au Metastore de Hive.
-
Password utilise la valeur de javax.jdo.option.ConnectionPassword.
Cette case est disponible ou non selon la distribution Hadoop à laquelle vous vous connectez.
Use a keytab to authenticate Cochez la case Use a keytab to authenticate pour vous connecter à un système utilisant Kerberos à l'aide d'un fichier keytab. Un fichier Keytab contient les paires des Principaux et clés cryptées Kerberos. Vous devez saisir le principal à utiliser dans le champ Principal et le chemin d'accès au fichier keytab dans le champ Keytab. Ce fichier keytab doit être stocké sur la machine où s'exécute votre Job, par exemple, sur un serveur de Jobs Talend.
L'utilisateur exécutant un Job utilisant un fichier Keytab n'est pas nécessairement celui désigné par un Principal mais doit avoir le droit de lire le fichier Keytab utilisé. Par exemple, le nom d'utilisateur que vous utilisez pour exécuter le Job est user1 et le principal à utiliser est guest. Dans cette situation, assurez-vous que user1 a les droits de lecture pour le fichier keytab à utiliser.
Use SSL encryption
Cochez cette case pour activer la connexion chiffrée SSL ou TLS.
Les champs qui s'affichent ensuite fournissent les informations d'authentification :-
Dans le champ Trust store path, saisissez le chemin ou parcourez votre système jusqu'au fichier TrustStore à utiliser. Par défaut, les types TrustStore supportés sont JKS et PKCS 12.
-
Pour saisir le mot de passe, cliquez sur le bouton [...] à côté du champ Password, puis, dans la boîte de dialogue qui s'ouvre, saisissez le mot de passe entre guillemets doubles et cliquez sur OK afin de sauvegarder les paramètres.
Cette fonctionnalité n'est disponible que pour HiveServer2 en mode Standalone pour les distributions suivantes :-
Hortonworks Data Platform 2.0 +
-
Cloudera CDH4 +
-
Pivotal HD 2.0 +
-
Amazon EMR 4.0.0 +
Set Resource Manager
Cochez cette case et, dans le champ qui s'affiche, saisissez l'emplacement du ResourceManager de votre distribution. Par exemple tal-qa114.talend.lan:8050.
Vous pouvez continuer à configurer les paramètres suivants selon la configuration du cluster Hadoop à utiliser (si vous ne cochez pas la case d'un paramètre, alors la configuration de ce paramètre dans le cluster Hadoop à utiliser sera ignorée lors du de l'exécution) :-
Cochez la case Set resourcemanager scheduler address et saisissez l'adresse de l'ordonnanceur (Scheduler) dans le champ qui apparaît.
-
Cochez la case Set jobhistory address et saisissez l'emplacement du serveur JobHistory du cluster Hadoop à utiliser. Cela permet de stocker les métriques du Job courant sur le serveur de JobHistory.
-
Cochez la case Set staging directory et saisissez le chemin d'accès au répertoire défini dans votre cluster Hadoop pour les fichiers temporaires créés par l'exécution de programmes. Généralement, ce répertoire se trouve sous la propriété yarn.app.mapreduce.am.staging-dir dans les fichiers de configuration comme yarn-site.xml ou mapred-site.xml de votre distribution.
-
Allouez des volumes de mémoire aux calculs Map et Reduce et au service ApplicationMaster de YARN en cochant la case Set memory dans la vue Advanced settings.
-
Cochez la case Set Hadoop user et saisissez le nom de l'utilisateur avec lequel vous souhaitez exécuter le Job. Puisque les fichiers et répertoires dans Hadoop ont un auteur spécifique avec les droits appropriés de lecture ou d'écriture, ce champ vous permet d'exécuter le Job directement avec l'utilisateur ayant les droits d'accès appropriés au fichier ou répertoire à traiter.
-
Cochez la case Use datanode hostname pour permettre au Job d'accéder aux nœuds de données via leurs hébergeurs. Cela permet de configurer la propriété dfs.client.use.datanode.hostname à true. Lorsque vous vous connectez à un système de fichiers S3N, vous devez cocher cette case.
Pour plus d'informations concernant le framework Hadoop Map/Reduce, consultez le tutoriel Map/Reduce dans la documentation de Apache Hadoop : http://hadoop.apache.org (en anglais).
Set NameNode URI
Cochez cette case et, dans le champ qui s'affiche, saisissez l'URI du NameNode Hadoop, le nœud maître d'un système Hadoop. Par exemple, si vous avez choisi une machine nommée masternode comme NameNode, l'emplacement est hdfs://masternode:portnumber. Si ce WebHDFS est sécurisé via SSL, le schéma d'URI doit être swebhdfs et vous devez utiliser un tLibraryLoad dans le Job pour charger la bibliothèque requise par votre WebHDFS sécurisé.
Pour plus d'informations concernant le framework Hadoop Map/Reduce, consultez le tutoriel Map/Reduce dans la documentation de Apache Hadoop : http://hadoop.apache.org (en anglais).
-
Property type |
Peut être Built-In ou Repository. Built-In : aucune propriété n'est stockée de manière centrale. Repository : Sélectionnez le fichier dans lequel sont stockées les propriétés du composant. |
Use an existing connection |
Cochez cette case et sélectionnez le composant de connexion adéquat dans la liste Component list pour réutiliser les paramètres d'une connexion que vous avez déjà définie. Remarque : Notez que lorsqu'un Job contient un Job parent et un Job enfant, si vous devez partager une connexion existante entre ces deux niveaux, par exemple pour partager la connexion créée par le Job père au Job fils, vous devez :
Pour un exemple de partage d'une connexion à une base de données à travers différents niveaux de Jobs, consultez le Guide utilisateur du Studio Talend . |
ELT Hive Map editor |
L'éditeur ELT du Mapper vous permet de définir le schéma de sortie ainsi que de construire graphiquement la commande Hive QL à exécuter. Le nom des colonnes du schéma peut être différent du nom des colonnes dans la base de données. Si vous utilisez des variables de contexte dans la colonne Expression, dans l'éditeur de mapping pour mapper les schémas d'entrée et de sortie, ajoutez des guillemets simples autour de ces variables de contexte, par exemple, 'context.v_erpName'. |
Style link |
Sélectionnez le type d'affichage des liens. Auto : par défaut, les liens entre les schémas d'entrée et de sortie et les paramètres du service Web sont en forme de courbe. Bezier curve : les liens entre les schémas et les paramètres du service Web sont en forme de ligne. Line : les liens entre les schémas et les paramètres du service Web sont en forme de lignes droites. Cette option vous permettra d'optimiser les performances. |
Distribution |
Sélectionnez dans la liste le cluster que vous utilisez. Les options de la liste varient selon le composant que vous utilisez. Parmi ces options, les suivantes nécessitent une configuration spécifique :
|
Hive version |
Sélectionnez la version de la distribution Hadoop que vous utilisez. Les options disponibles dépendent du composant que vous utilisez. En plus de l'évolution de Hadoop, veuillez noter les changements suivants :
|
Execution engine |
Cochez cette case et, dans la liste déroulante, sélectionnez le framework à utiliser pour exécuter le Job. Cette liste est disponible lorsque vous utilisez le mode Embedded pour la connexion et distribution Hive avec laquelle vous
travaillez, parmi les suivantes :
Avant d'utiliser Tez, vérifiez que votre cluster Hadoop supporte Tez. Vous devez configurer l'accès aux bibliothèques Tez correspondantes via la vue Advanced settings de ce composant. Pour plus d'informations concernant Hive avec Tez, consultez la documentation Apache à l'adresse https://cwiki.apache.org/confluence/display/Hive/Hive+on+Tez (en anglais). Des exemples vous sont présentés afin d'expliquer comment Tez peut être utilisé pour optimiser les performances par rapport à MapReduce. |
Lorsque vous souhaitez permettre aux composants Hive d'accéder à HBase :
Ces paramètres sont disponibles uniquement lorsque la case Use an existing connection est décochée.
Store by HBase |
Cochez cette case afin d'afficher les paramètres à configurer pour permettre aux
composants Hive d'accéder aux tables HBase :
Pour plus d'informations à propos de cet accès concernant Hive et HBase, consultez la documentation de Apache Hive concernant l'intégration Hive/HBase. |
Zookeeper quorum |
Saisissez le nom ou l'URL du service Zookeeper utilisé pour coordonner les transactions entre votre Studio et votre base de données. Notez que, lorsque vous configurez Zookeeper, vous pouvez avoir besoin de configurer explicitement la propriété zookeeper.znode.parent pour définir le chemin vers le nœud znode racine contenant tous les znodes créés et utilisés par votre base de données. Cochez la case la case Set Zookeeper znode parent afin de définir cette propriété. |
Zookeeper client port |
Saisissez le numéro du port d'écoute client du service Zookeeper que vous utilisez. |
Define the jars to register for HBase |
Cochez cette case pour afficher la table Register jar for HBase, dans laquelle vous pouvez enregistrer tout fichier Jar manquant, requis pour HBase, par exemple, Hive Storage Handler, enregistré par défaut avec votre installation Hive. |
Register jar for HBase |
Cliquez sur le bouton [+] pour ajouter des lignes à la table, puis, dans la colonne Jar name, sélectionnez le(s) fichier(s) Jar à enregistrer. Dans la colonne Jar path, saisissez le chemin d'accès à ce(s) Jar(s). |
Advanced settings
Tez lib |
Choisissez comment accéder aux bibliothèques de Tez :
|
Temporary path |
Si vous ne souhaitez pas configurer le Jobtracker et le NameNode lorsque
vous exécutez la requête |
Hadoop properties |
Le Studio Talend utilise une configuration par défaut pour son moteur, afin d'effectuer des opérations dans une distribution Hadoop. Si vous devez utiliser une configuration personnalisée dans une situation spécifique, renseignez dans cette table la ou les propriété(s) à personnaliser. Lors de l'exécution, la ou les propriété(s) personnalisée(s) va (vont) écraser celle(s) par défaut.
Pour plus d'informations concernant les propriétés requises par Hadoop et ses systèmes associés, tels que HDFS et Hive, consultez la documentation de la distribution Hadoop utilisée ou consultez la documentation d'Apache Hadoop sur http://hadoop.apache.org/docs en sélectionnant la version de la documentation souhaitée. À titre d'exemple, les liens vers certaines propriétés sont listés ci-après :
|
Hive properties |
Le Studio Talend utilise une configuration par défaut pour que son
moteur effectue des opérations sur une base de données Hive. Si vous devez utiliser
une configuration personnalisée dans une situation spécifique, renseignez dans cette
table la ou les propriété(s) à personnaliser. Lors de l'exécution, la ou les
propriété(s) personnalisée(s) va (vont) écraser celle(s) par défaut. Pour plus
d'informations concernant les propriétés dédiées à Hive, consultez https://cwiki.apache.org/confluence/display/Hive/AdminManual+Configuration
(en anglais).
|
Mapred job map memory mb et Mapred job reduce memory mb |
Si le système Hadoop utilisé est Hortonworks Data Platform V1.2 ou Hortonworks Data Platform V1.3, vous devez définir des allocations de mémoire suffisantes pour que les opérations de map et reduce soient effectuées par le système Hadoop. Dans ce cas, vous devez saisir les valeurs que vous souhaitez utiliser pour la mémoire allouée aux opérations map et reduce dans les champs Mapred job map memory mb et Mapred job reduce memory mb, respectivement. Par défaut, les valeurs sont toutes les deux 1000, ce qui est normalement adapté pour l'exécution de ces opérations. |
Path separator in server |
Laissez le champ Path separator in server tel quel, sauf si vous changez le séparateur utilisé par la machine hôte de votre distribution Hadoop pour sa variable PATH ou, autrement dit, sauf si ce séparateur n'est pas deux-points (:). Dans ce cas, vous devez remplacer cette valeur par celle utilisée dans votre hôte. |
tStatCatcher Statistics |
Cochez cette case pour collecter les données de log au niveau du Job ainsi qu'au niveau du composant. |
Temporary path |
Si vous ne souhaitez pas configurer le Jobtracker et le NameNode lorsque
vous exécutez la requête |
Variables globales
Variables globales |
ERROR_MESSAGE : message d'erreur généré par le composant lorsqu'une erreur survient. Cette variable est une variable After et retourne une chaîne de caractères. Cette variable fonctionne uniquement si la case Die on error est décochée, lorsque le composant contient cette case. Une variable Flow fonctionne durant l'exécution d'un composant. Une variable After fonctionne après l'exécution d'un composant. Pour renseigner un champ ou une expression à l'aide d'une variable, appuyez sur les touches Ctrl+Espace pour accéder à la liste des variables. À partir de cette liste, vous pouvez choisir la variable que vous souhaitez utiliser. Pour plus d'informations concernant les variables, consultez le Guide utilisateur du Studio Talend . |
Utilisation
Règle d'utilisation |
Le tELTHiveMap est généralement utilisé avec d'autres composants, tels que le tELTHiveInput et le tELTHiveOutput. Notez que le lien de sortie (output) à utiliser avec ces deux composants doit respecter strictement la syntaxe du nom de la table. Si le Studio Talend utilisé pour vous connecter à une base de données Hive fonctionne sous Windows, vous devez créer manuellement un dossier appelé tmp à la racine du disque où le Studio Talend est installé. Remarque :
Les composants ELT ne traitent pas le flux de données lui-même mais uniquement les informations du schéma. |
Utilisation avec Dataproc |
Les composants ELT Hive nécessitent l'installation de Tez dans le cluster Google Cloud Dataproc à utiliser.
|
Dynamic settings |
Cliquez sur le bouton [+] pour ajouter une ligne à la table. Dans le champ Code, saisissez une variable de contexte afin de sélectionner dynamiquement votre connexion à la base de données parmi celles prévues dans votre Job. Cette fonctionnalité est utile si vous devez accéder à plusieurs tables de bases de données ayant la même structure mais se trouvant dans différentes bases de données, en particulier lorsque vous travaillez dans un environnement dans lequel vous ne pouvez pas changer les paramètres de votre Job, par exemple lorsque votre Job doit être déployé et exécuté dans un Studio Talend. La table Dynamic settings est disponible uniquement lorsque la case Use an existing connection est cochée dans la vue Basic settings. Lorsqu'un paramètre dynamique est configuré, la liste Component List de la vue Basic settings devient inutilisable. Pour des exemples relatifs à l'utilisation des paramètres dynamiques, consultez Lire des données dans des bases de données à l'aide de connexions dynamiques basées sur les variables de contexte et Lire des données à partir de différentes bases de données MySQL à l'aide de paramètres de connexion chargés dynamiquement. Pour plus d'informations concernant les paramètres dynamiques et les variables de contexte, consultez le Guide utilisateur du Studio Talend. |
Prérequis |
La distribution Hadoop doit être correctement installée afin de garantir les interactions avec le Studio Talend . La liste suivante présente des informations d'exemple relatives à MapR.
Pour plus d'informations concernant l'installation d'une distribution Hadoop, consultez le manuel correspondant à la distribution Hadoop que vous utilisez. |