データクレンジングとは?CRMデータをAI Readyにする意味・目的・進め方

CRMの表記ゆれ・欠損・重複をどう整えるか。データクレンジングの定義、名寄せ・マージとの違い、5段階の実行手順、継続運用の設計を市場VOCとDataSangoの実装状況をもとに解説します。

データクレンジングとは?CRMデータをAI-Readyにする意味・目的・進め方を実務目線で解説

CRMのデータクレンジングとは、会社名、電話番号、住所などの値を定義したルールに沿って補正・標準化し、業務で再利用できる状態にする処理です。重複レコードを同一対象として判定する「名寄せ」や、1件へ統合する「マージ」とは分けて設計します。

データを一度きれいにするだけでは、問題は解消しません。フォーム、CSVインポート、外部ツールとの同期、担当者による手入力が続けば、表記ゆれや重複は再び増えます。必要なのは、一括修正と再発防止を同じ運用として設計することです。

CRMのデータクレンジングで整えるもの

データクレンジングの対象は、誤記だけではありません。CRMで検索、集計、セグメント作成、重複判定を行うために、値の形式と意味をそろえます。

代表的な対象は次の通りです。

対象

問題の例

整え方の例

会社名

株式会社Mer、(株)Mer、Mer Inc.が混在

法人格と表記ルールを統一する

電話番号

ハイフン、国番号、全角数字が混在

数字形式と国番号の扱いを統一する

住所

都道府県の省略、全角・半角、番地表記が混在

住所を構成要素に分け、形式をそろえる

メールアドレス

大文字、前後の空白、無効な形式が混在

正規化し、形式を検証する

選択項目

「東京都」「東京」「Tokyo」が混在

許可する値を定義して変換する

必須項目

業種、従業員規模、担当部署などが欠損

利用目的に必要な項目を定義し、欠損を特定する

クレンジングの目的は、見た目を整えることではありません。同じ条件で検索・分類・集計したときに、同じ判断へ到達できる状態を作ることです。

CRMデータが乱れる原因

CRMのデータ品質は、入力経路が増えるほど崩れやすくなります。営業担当者の手入力、Webフォーム、展示会リスト、外部データ、MAやSFAとの同期では、それぞれ異なる形式が使われるためです。

部署ごとに入力ルールが違う場合もあります。マーケティングはメール配信の可否を重視し、営業は会社名と担当者名、管理部門は請求先情報を重視します。ルールを共有しないまま同じCRMへ書き込むと、各部署では正しいデータでも、横断利用では不整合が起きます。

問題が蓄積してからCSVへ書き出し、手作業で修正しても、入力経路が変わらなければ再発します。データクレンジングは「過去データの修正」と「新しく入るデータの標準化」を分けずに設計する必要があります。

市場VOCから見える2つの運用課題

CRMデータ管理ツールの公開レビューを確認すると、継続運用に関する二つの課題が見えます。以下はDataSango顧客の声ではなく、他社製品の公開レビューを要約した市場VOCです。

一つ目は、重複、表記ゆれ、一貫性不足が継続して発生し、新規インポート時から統一された構造へ整える必要があることです。一度の一括修正では、入力や連携が続くCRMの問題を止められません。

二つ目は、複雑なクレンジング条件を毎回作り直す負担です。同じ補正を繰り返すなら、ルールを保存し、対象と実行条件を管理して定期処理へ移す必要があります。

出典: Insycleの公開レビュー(2026-07-16確認、要約)

クレンジング・名寄せ・マージの違い

クレンジング、名寄せ、マージは、順番と責任範囲が異なります。三つを一つの処理にすると、どのルールで値が変わり、なぜレコードが統合されたのか追いにくくなります。

処理

役割

クレンジング

値を補正・標準化する

(株)Mer と 株式会社Mer の形式をそろえる

名寄せ・マッチング

同じ会社・人物である可能性を判定する

会社名、ドメイン、電話番号から同一企業の候補を作る

マージ

候補レコードを1件へ統合する

更新日や項目別の優先順位に沿って残す値を決める

先に値を標準化すると、名寄せの比較条件をそろえられます。その後、同一対象の候補を作り、最後にどの値を残すか決めて統合します。

単純な完全一致だけでは、文字欠け、旧社名、複数メールアドレスなどを扱えません。一方、条件を広げすぎると別の会社や人物を誤って統合します。自動判定する範囲と、人が確認する例外を分けてください。

違いを詳しく確認したい場合は、データマッチングとデータクレンジングの違いも参照してください。

CRMデータクレンジングの5段階

1. 対象を一つに絞る

最初からCRM全体を直そうとせず、会社、取引先責任者、リードなど、一つのオブジェクトを選びます。その中でも、会社名、電話番号、住所など、検索、集計、重複判定に使う項目を優先します。

2. 現状を診断する

欠損率、値の種類、形式の混在、重複候補を確認します。この段階では書き換えず、どの問題がどの入力経路から発生しているかを特定します。

3. 正規形と優先順位を決める

会社名の法人格を残すか、電話番号へ国番号を付けるか、複数の値があるときにどれを残すかを決めます。正解は一つではありません。検索、配信、分析、営業活動など、データの利用目的から決めます。

4. 影響を確認してから反映する

変更件数と変更前後の値を確認し、誤変換しやすい条件を除外します。完全一致など確度の高い処理は自動化し、曖昧な候補は人の確認へ回します。

5. ルールを保存して定期実行する

一括修正後も、新しいデータは入り続けます。使用したルール、対象項目、例外条件を保存し、インポート時または定期処理として再利用します。エラーや例外が増えたときにルールを見直せる状態も必要です。

より細かな実行手順は、CRM顧客情報をAIで整える具体的なやり方・手順で確認できます。

Excel・自社スクリプト・SaaSの選び方

手段は、データ量だけでなく、更新頻度とルールの再利用性で選びます。

手段

向いている状況

注意点

Excel・スプレッドシート

対象が限定され、単発で確認したい

元データとの差分、担当者ごとの手順、再実行の管理が難しい

自社スクリプト

独自ルールが多く、保守できる担当者がいる

仕様変更、例外処理、実行履歴の保守が必要

SaaS

CRMへの入出力が続き、同じルールを繰り返し使う

接続範囲、権限、プレビュー、例外確認、料金を確認する

単発のリスト整理なら、Excelで十分な場合があります。入力や連携が続くCRMで、同じ問題を繰り返し直しているなら、保存したルールを再実行できる仕組みが候補になります。

選定時の比較軸は、データクレンジングツール比較で整理しています。

DataSangoでできる範囲

DataSangoは、CRM上のデータを継続的に整えるAI Data Operations Platformです。2026年7月16日時点で、クレンジングとマージは本番公開済みです。プロスペクトとトランスフォームはベータ公開であり、同じ提供状況ではありません。

クレンジングでは、会社名、電話番号、住所などをルールに沿って標準化します。マージでは、重複候補と残す値の条件を設定し、レコードを統合します。公式サイトにはSalesforce、HubSpot、Pipedriveとの接続が掲載されています。

DataSangoを検討する場合も、最初に整える対象と正規形を決める作業は必要です。ツールが判断基準を代替するのではなく、決めたルールを再現し続けるために使います。

よくある質問

データクレンジングとデータクリーニングは違いますか?

実務では、ほぼ同じ意味で使われます。どちらも、誤記、表記ゆれ、欠損、形式不統一などを補正し、データを再利用できる状態に整える処理を指します。

重複レコードの削除もデータクレンジングに含まれますか?

広い意味では含める場合がありますが、運用設計では分ける方が安全です。値の補正と標準化をクレンジング、同一対象の判定を名寄せ、候補レコードの統合をマージとして管理します。

CRMのデータクレンジングはどの頻度で行うべきですか?

入力やインポートが続くCRMでは、問題が蓄積してから一括修正するより、保存したルールを取込時または定期処理で実行する方が再発を抑えられます。頻度はデータの流入量と利用目的に合わせて決めます。

最初にどの項目から整えるべきですか?

一つのCRMオブジェクトに範囲を絞り、会社名、電話番号、住所など、検索、重複判定、集計に使う項目から始めます。影響範囲を確認してから対象を広げます。

次に確認すること

最初の対象を決めるには、同じ会社や人物が複数登録されていないか、会社名・電話番号・住所の形式がどの程度混在しているかを確認します。

問題が一つのCSVに限られるなら、まず手元で修正できます。CRMへの入力と連携が続き、同じ修正を繰り返しているなら、ルールを保存して定期実行する運用へ移す時点です。

DataSangoでCRMデータの整備方法を確認する

参照情報

注: 市場VOCはDataSango顧客の導入効果を示すものではありません。公開レビューに見られる課題を、直接引用せず要約しています。