データクレンジングと名寄せとは?
データクレンジングと名寄せとは、欠損・重複・表記ゆれ・範囲外の値といった不備を検出して整える処理がデータクレンジング。そのうち、同一の実体を指す複数のレコードを1つにまとめる作業を名寄せと呼ぶ。ETLの変換工程の中心であり、分析の前提を作る作業。
でーたくれんじんぐとなよせ
データクレンジングと名寄せの意味
欠損・重複・表記ゆれ・範囲外の値といった不備を検出して整える処理がデータクレンジング。そのうち、同一の実体を指す複数のレコードを1つにまとめる作業を名寄せと呼ぶ。ETLの変換工程の中心であり、分析の前提を作る作業。
データクレンジングと名寄せの具体例
「株式会社ABC」「(株)ABC」「ABC(株)」を同一企業と判定して統合する。判定には正規化した文字列の一致に加え、住所や電話番号など複数項目の類似度を使う。過剰に寄せると別法人を統合してしまうため、閾値の設計と目視確認が要る。
データクレンジングと名寄せは試験でどう引っ掛けられる?
欠損値を一律に0で埋めると平均が下がり分析結果が歪む。欠損は「値が0」ではないため、除外・代表値補完・欠損フラグ付与のどれが妥当かを目的に応じて選ぶ必要がある。
データクレンジングと名寄せと関連する用語
最終更新:2026-08-25/解説は資格暗記が独自に作成しています。 過去問の出典は各問題に記載のとおりです。