資格暗記無料で始める

データクレンジングと名寄せとは?

データクレンジングと名寄せとは、欠損・重複・表記ゆれ・範囲外の値といった不備を検出して整える処理がデータクレンジング。そのうち、同一の実体を指す複数のレコードを1つにまとめる作業を名寄せと呼ぶ。ETLの変換工程の中心であり、分析の前提を作る作業。

でーたくれんじんぐとなよせ

基本情報技術者試験の頻出用語/テクノロジ系


データクレンジングと名寄せの意味

欠損・重複・表記ゆれ・範囲外の値といった不備を検出して整える処理がデータクレンジング。そのうち、同一の実体を指す複数のレコードを1つにまとめる作業を名寄せと呼ぶ。ETLの変換工程の中心であり、分析の前提を作る作業。

データクレンジングと名寄せの具体例

「株式会社ABC」「(株)ABC」「ABC(株)」を同一企業と判定して統合する。判定には正規化した文字列の一致に加え、住所や電話番号など複数項目の類似度を使う。過剰に寄せると別法人を統合してしまうため、閾値の設計と目視確認が要る。

データクレンジングと名寄せは試験でどう引っ掛けられる?

欠損値を一律に0で埋めると平均が下がり分析結果が歪む。欠損は「値が0」ではないため、除外・代表値補完・欠損フラグ付与のどれが妥当かを目的に応じて選ぶ必要がある。

データクレンジングと名寄せと関連する用語

最終更新:2026-08-25/解説は資格暗記が独自に作成しています。 過去問の出典は各問題に記載のとおりです。