Accéder au contenu principal Passer au contenu complémentaire

Encoder les données d'apprentissage

Procédure

  1. Ajoutez un composant tModelEncoder à droite du tFileInputDelimited.
  2. Reliez le tFileInputDelimited au tModelEncoder à l'aide d'un lien Main.
  3. Double-cliquez sur le tModelEncoder pour ouvrir sa vue Component.
  4. Cliquez sur Sync columns à droite de Schema.
  5. Cliquez sur le bouton [...] près de Edit Schema.
  6. Ajoutez deux colonnes à la sortie : MyFeatures, de type Vector et MyLabels, de type Double.
  7. Cliquez sur OK.
  8. Cliquez sur la flèche verte dans l'onglet Basic settings de la vue Component pour ajouter une transformation.
  9. Dans Transformation, sélectionnez RFormula (Spark 1.5+).
  10. Ajoutez le code suivant dans le champ Parameters.
    featuresCol=MyFeatures;labelCol=MyLabels;formula=conversion ~ age + jobtype + maritalstatus + educationlevel + indefault + hasmortgage + haspersonalloan + numcampaigncalls + priorcampaignoutcome

    Les deux colonnes ajoutées au schéma, MyFeatures et MyLabels sont référencées ici. La formule est une syntaxe standard utilisée dans le langage de programmation R, utilisé pour le calcul de statistiques et les graphiques avancés. Pour plus d'informations, consultez The R Project (en anglais).

    Dans l'échantillonnage de données, il y a neuf attributs et une cible. Dans la formule R ci-dessus, la cible à prédire est la conversion et se situe à gauche du tilde. Toutes les colonnes à droite du caractère tilde sont les attributs. Les deux composants restant, featuresCol et labelCol, sont des valeurs factices pour les tuples et les libellés des attributs.

Cette page vous a-t-elle aidé ?

Si vous rencontrez des problèmes sur cette page ou dans son contenu – une faute de frappe, une étape manquante ou une erreur technique – dites-nous comment nous améliorer !