DXPMO未分類
データクレンジングとは?データの汚れの6種類と進め方5ステップを解説
同じ取引先が別のコードで二重に登録されている、住所の欄が空いている、日付の形式がシステムごとに違う。データを分析や基幹システムへ使おうとした段階で、値の不ぞろいに気づくことがあります。
実務で難しいのは、汚れを見つけることよりも、どの値を正とするかを決める場面です。本記事では、データの汚れ6種類の見分け方、進め方5ステップ、ツールと人の役割分担に加え、品質を保ち続けるための運用の決め方までを整理します。
データクレンジングとは|データを使える状態に整える作業
データクレンジングは、表記ゆれや重複、欠損、誤りといった汚れを洗い出し、データを業務や分析に使える状態に整える作業です。
混同されやすいのが名寄せです。名寄せは、別々に登録された人物や企業のデータが同一かを判定し、関連付けたり1件にまとめたりする処理で、データクレンジングの一部として行う場合もあります。
データ統合は、複数のデータを組み合わせ、一貫した形で利用できるようにする工程です。

| 汚れの種類 | 具体例 | 起きやすい場面 |
|---|---|---|
| 表記ゆれ | 「株式会社〇〇」と「(株)〇〇」、全角と半角、カナの揺れ | 取引先マスタや顧客マスタの手入力 |
| 重複 | 同じ取引先が別コードで二重に登録されている | 拠点ごと、システムごとの個別登録 |
| 欠損 | 分析や業務に必要な項目が未入力になっている | 項目を追加した後の運用 |
| フォーマット不統一 | 日付の形式やコードの桁数がシステムごとに違う | 基幹システムと現場ツールの併用 |
| 異常値 | 単位の取り違えによる桁違いの数量や金額 | 実績データの手入力 |
| 陳腐化 | 社名変更や移転、退職が反映されていない | 長期間更新されないマスタ |
6種類のうち、重複と異常値は集計した数字を狂わせ、陳腐化は業務のミスにつながります。単位を取り違えた金額が1件混じるだけでも合計は大きくずれ、社名や住所の変更が未反映だと書類の誤送付や宛名の誤りにつながります。
ただし異常値は誤りとは限らず、実在の大口取引の場合もあるため、直す前に業務側へ確認します。整えたデータは、勘に頼らない意思決定の材料になります。
関連記事:データドリブンとは?実行する際の具体的なステップから必要なツールまで解説
データクレンジングが必要となる理由
データクレンジングが必要になる理由は2つあります。複数のシステムで個別に管理していると表記やコード体系の違いが生じやすいこと、そして違いを残したまま集計すると部門をまたいだ比較に使いにくいことです。
IPAの調査では、DXに取り組む日本企業のうち、現場主体のDXのデメリットに「現場が独自に導入したシステムと基幹システム間でデータ連携できない」を挙げた企業が45.1%と、米国25.8%、ドイツ30.1%を上回りました。マスターデータを全社で管理するMDMも、日本企業の43.9%が「活用していない」と答えています。
連携の課題は接続方式だけではありません。コード体系やデータ形式が異なると、つないだ後も同じ意味のデータとして扱えないため、統合したデータを正しく使うにはクレンジングが欠かせません。
データを整えれば、同じ基準で比較できるようになり、重複データに起因する請求ミスのリスクも減らせます。
参考:DX動向2025(データ集)(独立行政法人情報処理推進機構、2024年度調査。日本の回答数は現場主体のDXに関する設問がn=1,181、MDMに関する設問がn=1,497)
データクレンジングの進め方
データクレンジングは下記のように進めていくことがおすすめです。
- Step1|データの利用目的と対象範囲を決める
- Step2|現状のデータ品質を可視化する
- Step3|クレンジングルールを定義する
- Step4|変換を実行し元データと突き合わせて検証する
- Step5|汚れを再発させない運用ルールに落とす

基本的には順を追って進めますが、途中で想定外の例外が見つかることもあります。対象範囲やルールを見直しながら、反復して進める前提で計画を立てます。
5つのステップは、情報システム部門だけでは完結しません。対象データを日々扱う業務部門の担当者を、Step1の目的決めとStep3のルール定義に加えます。
後から現場の判断を聞き直すと、変換のやり直しが発生します。5つのうち工数を見積もりにくいのもStep3で、業務上の判断と関係者の合意が必要になるためです。
Step1|データの利用目的と対象範囲を決める
まず、どこまできれいにするかの基準を決めます。すべてのデータを完璧にそろえようとすると工数が際限なく膨らむため、データの用途を最初に確認します。
月次の売上分析に使うのか、基幹システムへ移行するのか、生成AIの入力にするのかで、必要な精度は変わります。用途が決まれば、対象範囲も絞り込めます。
取引先マスタと品目マスタのどちらを先に着手するか、過去何年分を対象にするかといった判断は、用途から逆算して決めます。用途を決めずに着手すると、対象が絞れないまま作業範囲が広がり、完了の見通しも立てにくくなります。
Step2|現状のデータ品質を可視化する
次に、対象データがどれくらい汚れているかを数字で把握します。空欄の件数、重複しているコードの件数、桁数や形式が想定と異なる件数を数え、汚れの分布を出します。
欠損率や重複率、形式適合率、システム間の整合性といった品質指標を先に決めておくと、クレンジングの前後で改善幅を比較できます。
Power Queryのデータプロファイリング機能のように、列ごとの有効値やエラー、空欄の件数を可視化できる仕組みを使うと、目視より早く全体像がつかめます。ただし既定では先頭1,000行しか見ていないため、表示を「データセット全体に基づく列プロファイリング」に切り替えてから件数を読みます。
数えた件数は担当者の手元で止めず、関係者に共有します。たとえば取引先マスタ3万件のうち住所が空欄のものが4,200件と示せれば、取引先に確認して埋めるのか、当面は空欄のまま集計から外すのかを現場と一緒に決められます。
Step3|クレンジングルールを定義する
Step3で決めるのは、どの値を正とするかの基準です。「株式会社」と「(株)」のどちらに寄せるか、同じ取引先が複数のコードで登録されていたときに統合するかどうかを、業務側と一緒に決めて文書に残します。
欠損値の扱いも項目ごとに判断します。すべてを補完するとは限らず、補完するか、集計の対象から除外するか、未入力のまま保持するかを選びます。
決めた内容は変換テーブルや辞書の形にして、誰が実行しても同じ結果になる状態にします。判断に迷う例外を誰が決め、ルールの変更を誰が承認するかもあわせて決めておきます。
法人の名寄せでは、国税庁が公表する13桁の法人番号が有力なキーになります。ただし法人番号は支店や事業所には指定されず、個人事業者や民法上の組合も対象外のため、支店単位で与信や請求を管理している企業では社内の判定ルールを別途決める必要があります。
参考:法人番号について(国税庁法人番号管理室、令和8年6月)
Step4|変換を実行し元データと突き合わせて検証する
変換の実行前に、バックアップの取得と元に戻す手順を確認します。1回で全件を変換せず、まず数百件で試して結果を確かめてから全件に広げると、戻す範囲を小さく抑えられます。
実行後は、元データと突き合わせて検証します。確認するのは、変わってはいけない金額の合計が変わっていないことと、重複の排除などで変わった件数がルールどおりの増減になっているかの2点です。
表記をそろえることと、データが事実として正しいことは別の問題です。社名や住所の正確さが求められる場合は法人番号公表サイトなどで照合しますが、公表されているのは登記上の商号と本店の所在地までのため、支店の住所は取引先に確認します。
関連記事:正しい数字を届け続ける。設計・更新・切り替えから見るBIレポート保守
Step5|汚れを再発させない運用ルールに落とす
クレンジングは一度で終わりません。同じ入力の仕方が続けば、データは同じように汚れていきます。
再発を防ぐために、登録時の必須項目や入力規則をシステム側で制約する、マスタ登録を申請制にして重複チェックを挟む、定期的に品質を点検する担当を決めるといった運用に落とし込みます。品質を保つには、入力の段階で汚れを作らない制御と、定期的に点検する運用の両方が要ります。
入力規則を1つ増やすだけでも現場には申請と確認の手間が生じます。制約と運用負荷のバランスは、登録件数の多いマスタから順に決め、運用を始めてから調整します。
関連記事:システム定着とは?導入後に現場で使われ続ける仕組みと進め方
データクレンジングの方法とツールの使い分け
方法は、同じ処理を繰り返すかどうかで選び分けます。一度きりの修正なら手作業やExcelで足りますが、毎月同じ変換を続けるなら、手順を記録して再実行できる仕組みに移したほうが安全です。
人が決めるべき工程は人に残し、基準が固まった工程からツールへ寄せる順番が現実的です。
| 方法 | 向く作業 | 限界 |
|---|---|---|
| Excelの関数や機能 | TRIMやSUBSTITUTEでの整形、COUNTIF関数や条件付き書式での重複候補の確認 | 指定した列の値が一致するかで判定するため、表記ゆれのあるデータや、同一取引先でも情報が異なるデータの判定には限界がある |
| Power Query | 記録した手順を毎回同じように再実行する変換 | あいまい一致が使えるのは2つの表を突き合わせるマージ操作のテキスト列に限られ、どこまでを同じとみなすかのしきい値は人が判断する |
| ETLやデータ準備ツール | 複数システムのデータを定期的に統合して変換する | 導入と運用の設計が前提になり、単発の修正には重い |
| RPA | 画面をまたぐ定型的な転記や突き合わせの自動化 | 同一かどうかを判定するロジックは実装者が作り込む必要がある |
| 外部委託 | 判断が多く、複数システムをまたいで対応関係を整理する作業 | 作業の代行だけを範囲にすると社内にルールが残らない |
| 手作業 | 一意のキーがない対象の最終確認 | 件数に比例して時間が増え、判断基準が担当者に閉じやすい |
どの方法にも限界があります。1つの方法にそろえようとせず、対象データの件数と更新頻度に応じて組み合わせるのが現実的です。
委託範囲にルールの定義と社内での運用移管まで含めるかどうかで、同じ汚れが再発するかどうかが変わります。依頼前に、成果物として何を受け取るかを確認しておきます。

現場でデータクレンジングを成功させるコツ
5つのステップを手順どおりに回しても、現場で使われるデータにならないことがあります。原因の多くは、技術的な処理よりも数字の作り方と指標の定義の側にあります。
データクレンジングの成否を分けやすいのは2点です。1つは計算式の元データまで遡って現場と擦り合わせること、もう1つは経営と現場で見ている指標が異なる前提に立つことです。
2点とも、ツールだけでは進められず、業務を知る人との合意が必要になります。データを整える前に、数字の意味をそろえる場をつくれるかどうかが分かれ目になります。関係部門の担当者が同席する場を、早い段階で設けます。
計算式の元データまで現場と擦り合わせる
当社が重視しているのは、出てきた数字の裏側にある元データまで遡り、現場と擦り合わせることです。同じ商品をあるシステムでは5桁、別のシステムでは7桁のコードで管理している場合、コードの対応関係が整理されていないと、結合漏れや集計漏れが起こる可能性があります。
対応関係を変換テーブルとして整備するか、コード体系を統一するかを決めます。同一の取引先に複数のコードがある場合も、どちらかを必ず削除するのではなく、管理単位や取引履歴との関係を確認したうえで統合の要否を判断します。
当社のコンサルタントは、システムごとに異なる商品コードやデータ形式、単位を洗い出して共通のルールにそろえる工程を、今後も人が担うべき作業と位置づけています。AIで候補を出せても、どの管理単位を残すかは取引の実態を知る担当者にしか決められないためです。
関連記事:AIに任せる分析、人が担う判断|SAPのデータ活用を現場に根付かせるポイント
経営と現場で異なる数字の定義を統合する
2つめのコツは、指標の定義をそろえることです。営業部門が受注金額を見て、経営層が会計上の売上高を見ている場合、同じ「売上」という言葉でも数値は一致しません。
受注金額は契約が決まった時点の金額、売上高は納品やサービスの提供が終わってから計上される金額で、数えている時点が違うためです。まだ納品していない受注やキャンセル、値引きの扱いでも差が出ます。
指標や集計条件の違いによる認識のずれは、データクレンジングだけでは解消しません。どの指標を何の判断に使うかを定める指標定義の統一と、決めた定義を誰が守り誰が点検するかまで含めて運用するデータガバナンスにまたがる課題です。
当社は、レポートの出力条件をお客様と一緒に確認し、どの条件で抽出した数字なのかを明示することを徹底しています。経営と現場の双方から指標の意味をそろえていくことが、実際に使われるデータをつくる土台になります。
データクレンジングを行うならノムラシステムコーポレーション
データクレンジングの成果は、ルールを決める工程をどれだけ丁寧に進めたかで変わります。判断の基準を文書に残し、誰が承認するかまで決めておくと、担当者が変わっても同じ結果を再現できます。
進め方は、利用目的の決定、現状の可視化、ルールの定義、実行と検証、再発を防ぐ運用への落とし込みという5つのステップです。ツールで支援できる工程と人が決める工程を分け、状況に応じて対象範囲を見直しながら進めます。
ノムラシステムコーポレーションは、SAPをはじめとする基幹システムの導入と、BIによるデータ活用の両方を現場で手がけてきました。システムを入れることではなく経営課題を解決することを共通の軸に置き、計算式の元データや指標の定義まで踏み込んでお客様と擦り合わせます。
データが合わない、分析に使えないといった課題がありましたら、お気軽にご相談ください。
データクレンジングに関するよくある質問
データクレンジングとデータクリーニングは同じ意味ですか
実務ではほぼ同じ意味で使われています。どちらも、データに含まれる誤りや重複、表記ゆれを検出して修正し、使える状態に整える作業を指します。
データスクラビングという呼び方もあります。呼び方をそろえること以上に、どの項目をどの基準で統一するかを決めるほうが実務では重要です。
データクレンジングにかかる期間と費用の目安はどれくらいですか
期間と費用を左右するのは、件数よりも業務上の判断が必要な項目の多さです。形式をそろえるだけの変換なら短期間で終わりますが、どのコードを残すかを業務側と決める工程が入ると、合意形成に時間がかかります。
見積もりの精度を上げるには、先に現状のデータ品質を可視化し、判断が必要な件数を把握することが近道です。
AIやRPAでデータクレンジングは自動化できますか
一部は自動化できます。AIは表記ゆれの検出、重複候補の抽出、ほかの項目や公開情報から推測できる範囲での欠損値の候補提示に活用でき、RPAは画面をまたぐ転記や突き合わせといった定型作業に向いています。
一方で、抽出された候補のうちどれを採用するかは、業務ルールに照らして担当者が確認する必要があります。ルール化できた部分から自動化に移す順番が、手戻りの少ない進め方になります。
東京MXの番組で、ノムラシステムコーポレーションが取り上げられました。詳しい内容を知りたい方は、ぜひ下記のYouTube動画をご覧ください。
ノムラシステムコーポレーションの紹介動画
お問い合わせはこちら
