Soundex頻度統計 - Cloud - 7.3

Talend Studioユーザーガイド

Version
Cloud
7.3
Language
日本語
Product
Talend Big Data
Talend Big Data Platform
Talend Cloud
Talend Data Fabric
Talend Data Integration
Talend Data Management Platform
Talend Data Services Platform
Talend ESB
Talend MDM Platform
Talend Real-Time Big Data Platform
Module
Talend Studio
Content
ジョブデザインと開発
Last publication date
2024-02-13
対象製品...

Big Data Platform

Cloud API Services Platform

Cloud Big Data Platform

Cloud Data Fabric

Cloud Data Management Platform

Data Fabric

Data Management Platform

Data Services Platform

MDM Platform

Real-Time Big Data Platform

このグループのインジケーターはDBMSに搭載されたSoundexアルゴリズムを使用します。

これらのインジケーターはレコードに音でインデックスを作成します。これにより、同じ英語の発音のレコードは同一の表記にエンコードされるため、スペルが多少異なっていてもマッチングさせることができます。

  • Soundex頻度: 同じ発音を持つレコードの合計と比べて頻度の高い個別のレコードの数を計算します。
  • Soundex低頻度: 同じ発音を持つレコードの合計と比べて頻度の低い個別のレコードの数を計算します。

Soundex頻度統計インジケーターをPostgreSQL、Amazon for PostgreSQL、Amazon Redshiftで使用するには、CREATE EXTENSION fuzzystrmatch;クエリーを使用して拡張子をPostgreSQLデータベースにインストールします。

詳細は、PostgreSQLのドキュメンテーションをご覧ください。

Soundex頻度統計インジケーターをAmazon Redshiftで使用するには、カスタムユーザー定義ファンクションを作成する方法もあります。

詳細は、AWSのドキュメンテーションをご覧ください。

Soundex頻度統計インジケーターをSnowflakeで使用するには、Javaエンジンが必要です。

漢字がサポートされているのはSQLエンジンのみです。

Teradata Soundexの実装にある制限により、このインジケーターを使用してTeradataのプロファイリング結果をドリルダウンできない場合があります。

どのデータベースでも選択できるインジケーターを次のテーブルに示します。

データ型 数字 Text Date その他
分析エンジンのタイプ Java SQL Java SQL Java SQL Java SQL
Soundex頻度テーブル
Soundex低頻度テーブル