Procédure
- Ajoutez un composant tModelEncoder à droite du tFileInputDelimited.
-
Reliez le tFileInputDelimited au tModelEncoder à l'aide d'un lien Main.
- Double-cliquez sur le tModelEncoder pour ouvrir sa vue Component.
- Cliquez sur Sync columns à droite de Schema.
- Cliquez sur le bouton [...] près de Edit Schema.
-
Ajoutez deux colonnes à la sortie : MyFeatures, de type Vector et MyLabels, de type Double.
- Cliquez sur OK.
- Cliquez sur la flèche verte dans l'onglet Basic settings de la vue Component pour ajouter une transformation.
- Dans Transformation, sélectionnez RFormula (Spark 1.5+).
-
Ajoutez le code suivant dans le champ Parameters.
featuresCol=MyFeatures;labelCol=MyLabels;formula=conversion ~ age + jobtype + maritalstatus + educationlevel + indefault + hasmortgage + haspersonalloan + numcampaigncalls + priorcampaignoutcome
Les deux colonnes ajoutées au schéma,
MyFeatures
etMyLabels
sont référencées ici. La formule est une syntaxe standard utilisée dans le langage de programmation R, utilisé pour le calcul de statistiques et les graphiques avancés. Pour plus d'informations, consultez The R Project (en anglais).Dans l'échantillonnage de données, il y a neuf attributs et une cible. Dans la formule R ci-dessus, la cible à prédire est la conversion et se situe à gauche du tilde. Toutes les colonnes à droite du caractère tilde sont les attributs. Les deux composants restant,
featuresCol
etlabelCol
, sont des valeurs factices pour les tuples et les libellés des attributs.