データ分析には、記述・診断・予測・処方という4つの段階があります。この順番を飛ばすと、もっともらしい結論は出ても、土台の数字が揺らいだままなので、的外れな対策につながりやすくなります。この記事では、データ分析の基本的な理論を手がかりに、中小企業が最初の一歩をどう踏み出せばよいかを解説します。原因の欄が空欄だったり、書き方がばらばらだったりした業務の記録を、原因の特定と効果の見積もりに使えるまで整えた例も紹介します。
1. データ分析には4つの段階がある
データ分析は、答えようとしている問いの種類によって、次の4つの段階に分けて考えるとわかりやすくなります。調査会社のガートナーが示した枠組みとして広く知られている整理です。学術的には、記述と診断をひとまとめにして3つに分けることもあります(参考文献1)。
どの段階も、正しく数えた記録が土台になります。下の段階ほど経営判断に近づきます。
後ろの段階ほど経営判断に近づきますが、どの段階も、記述で正しく数えたデータが土台になります。たとえば予測は、過去の記録から傾向を学びます。記録に抜けや重複があれば、それがそのまま予測の誤りになります。
もう1つ大事なのは、段階ごとに言えることの範囲が違う点です。記述は「過去に何が起きたか」を要約するもので、原因や将来については何も語りません。「A部署のミスが多い」という集計結果は、それだけでは「A部署に原因がある」ことを意味しません。原因を語るには、診断の段階で、別の切り口のデータや1件ずつの記録まで掘り下げる必要があります。
2. 「行動につながらない分析」が生まれる理由
分析が行動につながらない一番の理由は、結果をどの判断に使うかを決めないまま始めることです。時間をかけて分析資料を作ったのに、会議で眺めて終わってしまう。こうしたことが起きるのは、計算が間違っているからとは限りません。
数字を見ずに決めた対策は、外れても理由が分かりません。反対に、使い道の決まっていない分析は、資料が増えるだけです。分析を始める前に、判断したいことを先に決め、そこから逆算して、何を数えればよいかを決めます。
経営学者のハーバート・サイモンは、意思決定を「問題を見つける」「選択肢を考える」「選ぶ」という局面の流れとして整理しました(参考文献2)。データ分析がまず力を発揮するのは、最初の「問題を見つける」局面です。どこで何が起きているかを正しくつかめないまま選択肢を考えても、的外れな対策に時間とお金を使うことになります。
3. 最初の壁は「データの準備」
データ分析で最初につまずくのは、分析そのものではなく、データの準備です。データ分析の進め方として広く使われている手順に、CRISP-DM があります(参考文献3)。事業を理解したあと、すぐにモデル作りに入るのではなく、「データの理解」と「データの準備」を経てから進み、必要に応じて前の段階に戻ります(図2)。
- 1事業の理解
- 2データの理解
- 3データの準備中小企業がつまずきやすい
- 4モデル作り
- 5評価
- 6現場で使う
一方向ではなく、行き来しながら進める。6のあとは1に戻り、5から1に戻ることもある。1と2、3と4は行き来することが多い。
実際の現場では、分析そのものより、この準備に多くの時間がかかります。中小企業の記録で特に起きやすいのは、次の4つです。
| No. | 発生内容 | 原因の分類 |
|---|---|---|
| 101 | 見積書の金額を打ち間違えた | 入力ミス |
| 102 | 請求書の宛先が古いままだった | 1 |
| 1032 | 請求書の宛先が古いままだった | |
| 104 | 発注数を確かめなかった | 確認漏れ3 |
| 105 | 納品前の検品を省いた | 確認もれ3 |
| 106 | 前回と同じ手順でミス。確認したところ、古い版の手順書がそのまま使われていた4 | その他 |
- 1欠損(空欄):原因の欄が空のまま。数が減るだけでなく、書く人と書かない人の違いで結果が偏る。元々ない項目か、書き忘れかの区別も要る
- 2重複:同じ出来事が2回登録されている。件数が実態より多く見える
- 3表記ゆれ:「確認漏れ」と「確認もれ」が、別々の原因として数えられる
- 4分類されていない自由記述:文章には原因が書かれているのに、分類は「その他」のまま
図はイメージです(架空の例)
記録を整えたあとも、集計の数字だけで判断しないことが大切です。統計学者のアンスコムは、平均・分散・相関(2つの数字が一緒に動く度合い)がほぼ同じなのに、グラフにすると全く違う形になる4組のデータを示しました(参考文献4)。
xの平均
9.0
yの平均
7.50
相関係数
0.82
回帰直線(灰色の線)
y = 3 + 0.5x
データを表で見る
| データ1(x, y) | データ2(x, y) | データ3(x, y) | データ4(x, y) | ||||
|---|---|---|---|---|---|---|---|
| 10 | 8.04 | 10 | 9.14 | 10 | 7.46 | 8 | 6.58 |
| 8 | 6.95 | 8 | 8.14 | 8 | 6.77 | 8 | 5.76 |
| 13 | 7.58 | 13 | 8.74 | 13 | 12.74 | 8 | 7.71 |
| 9 | 8.81 | 9 | 8.77 | 9 | 7.11 | 8 | 8.84 |
| 11 | 8.33 | 11 | 9.26 | 11 | 7.81 | 8 | 8.47 |
| 14 | 9.96 | 14 | 8.10 | 14 | 8.84 | 8 | 7.04 |
| 6 | 7.24 | 6 | 6.13 | 6 | 6.08 | 8 | 5.25 |
| 4 | 4.26 | 4 | 3.10 | 4 | 5.39 | 19 | 12.50 |
| 12 | 10.84 | 12 | 9.13 | 12 | 8.15 | 8 | 5.56 |
| 7 | 4.82 | 7 | 7.26 | 7 | 6.42 | 8 | 7.91 |
| 5 | 5.68 | 5 | 4.74 | 5 | 5.73 | 8 | 6.89 |
経営の数字でも同じことが起きます。たとえば月平均のミスの件数が同じ2つの部署でも、毎月少しずつ出る部署と、特定の月だけ跳ねる部署とでは、打つ手が違います。平均などの要約だけで判断せず、元の記録やグラフで確かめることが大切です。
4. 事例:散らばった業務の記録から、原因の特定と効果の見積もりへ
Moltが支援した、福岡県内の中小企業(従業員100名前後)の例です。扱ったのは、日々の業務で起きたミスやトラブルの記録です。
分析前の状態
記録は時期ごとに別々のExcelファイルに分かれていました。原因を書く欄には空欄も目立ち、書かれた文章にも分類の決まりがなく、原因ごとに数えられる状態ではありませんでした。集計用のシートには、壊れた計算式も残っていました。これでは「何が起きたか」を正しく数えられず、原因の議論にも進めません。
段階に沿って進めたこと
記述:まず正しく数える
ファイルを1つにまとめ、数え方をそろえました。発生日で数える、同じ出来事は1件として扱う、といったルールを決め、表記ゆれと壊れた集計を直しました。
記述の仕上げ:自由記述を数えられる形に分類する
記録に書かれた「発生内容」「原因」「対策」の文章をAIで読み取り、原因と対策をそれぞれ少数の区分に分類しました。区分は、経営層の確認を得た分類表に合わせています。経営と現場が同じ物差しで話せるようにするためです。原因が書かれていない記録は、ほかの項目をもとに振り分けました。AIの分類結果は、最後に人が確認しています。こうして全件を分類し直した月では、どの区分にも当てはめられず「調査中」に残った記録は約5%でした(図6)。なお、この分類は分析のための区分で、原因を最終的に確定するものではありません。
診断:1件ずつの記録まで戻る
部署・原因・影響の大きさを掛け合わせて集計し、目立つところは1件ずつの記録まで戻って確かめました。たとえばある部署のある月の記録を掘り下げると、原因の記述の約3分の1が、指示や連絡の書き漏れ・伝え漏れに当たるものでした(図6)。個人への注意喚起だけでは防ぎにくい、指示の出し方と受け渡しの仕組みの問題として捉え直すことができました。
全件の原因を分類し直した月に、どの区分にも当てはめられず「調査中」に残った記録
約5%
ある部署のある月の記録のうち、原因の記述が指示や連絡の書き漏れ・伝え漏れに当たるもの
約3分の1
予測:施策の効果を「幅」で見積もる
原因が分かったことで、施策ごとに「どの原因のミスを、どのくらい減らせそうか」を見積もれるようになりました。見積もりは1つの数字ではなく、効果が大きい場合・小さい場合の幅で示しています。これで、経営が効果の見込みと手間を比べて、どの施策から手をつけるかを検討するための材料がそろいました。最後の処方(どれから手をつけるか)は、経営の判断です。
この事例で大切だったのは、いきなり予測や対策から入らず、正しく数えることと分類することに時間をかけたことです。ここが固まったことで、原因の特定と効果の見積もりができるようになりました。
5. 中小企業での進め方:最初の3ステップ
- 決めたいことを1つ決める:たとえば「来期、どの対策に人と時間を割くか」。そのために答える問いを、4つの段階に当てはめます。「なぜミスが減らないのか」は診断の問いです。その前に、記述(何が、どれだけ起きているか)が固まっているかを確かめます
- 必要な記録を1か所に集め、数え方を決める:何を1件とするか、空欄をどう扱うか、重複をどう見分けるかを決めます。ここを決めないまま集計すると、月ごとに数字が揺れます
- 分類の物差しを決めて「その他」を減らす:区分は現場の言葉で作り、経営の確認を得ます。自由記述が多い場合は、AIで分類を下支えできます(結果は最後に人が確認します)。そのうえで、原因の掘り下げに進みます
予測やAIによる高度な分析は、この3つが整ってから力を発揮します。まずは手元の記録で、原因の欄が空欄か「その他」になっている割合を数えてみてください。それが記述の第一歩です。
まとめ
- データ分析には、記述・診断・予測・処方の4つの段階がある。どの段階も、正しく数えた記録が土台になる
- 分析は、判断したいことから逆算して始める
- 最初の壁はデータの準備。欠損・重複・表記ゆれ・分類されていない自由記述を整えることが、最初の一歩になる
記録はあるが、どこから手をつければよいか分からない段階からご相談いただけます
株式会社Moltは、福岡を拠点に、社内のIT・DX化に課題のある中小企業を支援する伴走型のDXパートナーです。「データ分析・可視化」の領域では、経営データの集約・可視化から、AI・統計モデルによる予測分析、最適化による施策の試算・提示までを支援しています。代表は、海外ビジネススクールにて、経営学とAI・データアナリティクス領域を修了しています。
まずは無料相談(60分)で、現状と課題を一緒に整理します。小さく始めたい場合は、DX診断パック(8万円・税別)もご用意しています。
参考文献
- Delen, D., & Ram, S. (2018). Research challenges and opportunities in business analytics. Journal of Business Analytics, 1(1), 2–12. https://doi.org/10.1080/2573234X.2018.1507324
- Simon, H. A. (1977). The New Science of Management Decision (Revised ed.). Prentice-Hall.
- Chapman, P., Clinton, J., Kerber, R., Khabaza, T., Reinartz, T., Shearer, C., & Wirth, R. (2000). CRISP-DM 1.0: Step-by-step data mining guide. SPSS Inc.
- Anscombe, F. J. (1973). Graphs in statistical analysis. The American Statistician, 27(1), 17–21.