ビジネス×行動経済学

行動経済学や行動心理学など行動科学の理論やバイアスをビジネスに適用することを目的にしたブログです

〖その数字は、原因を語っているか⑥〗不完全な証拠で、経営はどう決めるか――分析の正しさと決断の責任

前回まで、製品Xのキャンペーン効果を題材に、何もしなかった場合の未来、すなわち反実仮想をどのように考えるかを見てきました。

第4回では、ランダム割り付けによるA/Bテストを使い、施策をしなかった「双子」を人工的につくりました。第5回では、実験ができない状況でも、制度、導入時期、地域差、基準値などを手掛かりに、現実の中に残された双子を探しました。

そして、製品Xについて最終報告が経営会議へ上がってきます。

  • キャンペーン実施後に在庫は4,000個減った
  • 前年実績から想定される自然販売は約3,000個
  • 差の差法では、1店舗・1週間当たりの粗利改善効果は約15万円
  • 在庫日数90日前後の店舗でも、一定の改善が確認された
  • ただし、平行トレンドや境界付近の連続性には仮定が残る
  • 全国展開には約3,000万円が必要になる

分析担当者は、次のように説明します。

「複数の分析結果から、施策効果はプラスである可能性が高いと考えます。ただし、全店舗で同じ効果が得られるとは断言できません」

すると、担当役員から聞かれます。

「説明は分かりました。それで、3,000万円を投じるのですか」

この問いに、分析手法だけで答えることはできません。

ここで分析者が「はい、投じるべきです」と請け合えば、分析の範囲を越えて経営判断まで背負うことになります。一方、経営者が「分析結果が確定するまで決められない」と先送りすれば、不確実性を理由に決断の責任を手放すことになります。どちらも、分析と経営の役割を取り違えています。

因果推論は、施策によって何が起きる可能性が高いかを示します。しかし、その不確実性を踏まえて、どのリスクを取り、どこへ経営資源を配分するかは、経営が決めなければなりません。

分析は不確実性を減らすことはできる。しかし、決断の責任まで引き受けることはできない。

1.因果効果が分かっても、意思決定は完成しない

仮に、製品Xのキャンペーンが売上や粗利を押し上げると推定できたとしても、それだけで全国展開が合理的とは限りません。

施策の効果がプラスでも、必要な販促費がそれを上回れば、会社には利益が残りません。効果が短期間で消えるなら、システム改修費や教育費を回収できないかもしれません。製品Xへ3,000万円を投じれば、その資金を別の商品開発や設備更新へ使うこともできなくなります。

経営判断には、推定された因果効果に加え、次のような情報が必要です。

  • 施策に必要な費用
  • 効果が続く期間
  • 値引きによる既存需要の粗利減少
  • 他の投資機会を失う機会費用
  • 効果がなかった場合の損失
  • 施策を実施しなかった場合の機会損失
  • 結果が判明するまでの時間
  • 撤回や修正のしやすさ

因果推論が主として答えるのは、「施策が結果をどれだけ変えたか」です。

経営が答えるのは、「その効果と不確実性を踏まえ、限られた資源をどこへ配分するか」です。

推定された因果効果に、効果の幅、費用と採算、失敗時の損失、可逆性を重ねて経営判断へ進む。

「効果がある」は分析上の結論であり、「投資すべき」は経営上の結論である。

2.点ではなく、「幅」として効果を見る

第5回の差の差法では、製品Xのキャンペーンによる粗利の増分効果を、1店舗・1週間当たり約15万円と推定しました。

しかし、実際の効果が、どの店舗でも必ず15万円になるわけではありません。

データ量、店舗の構成、観測期間、季節変動、比較対象の選び方などによって、推定値には不確実性があります。店舗によって効果が異なる可能性もあります。

例えば分析担当者が、次のように報告したとします。

「中心的な推定値は15万円です。ただし、データ上は5万円程度から25万円程度までの可能性があります」

経営層にとって重要なのは、15万円という一点だけではありません。

  • 5万円の効果でも投資を回収できるか
  • 効果がゼロになる可能性はどの程度残っているか
  • マイナス効果になる条件は何か
  • どの店舗で効果が大きく、どの店舗で小さいか

こうした幅と条件まで見て、判断する必要があります。

会議では、一つの明確な数字が好まれます。「効果は15万円です」と断言する報告の方が、「5万円から25万円程度の幅があります」という報告より、自信があるように聞こえるからです。

しかし、幅を隠して一点だけを示すと、経営側は推定値を確定値として扱ってしまいます。投資回収の計算にも15万円をそのまま入れ、想定より効果が小さかったときに「話が違う」となるでしょう。

不確実性を示すことは、分析の弱さではありません。投資規模や撤退基準を決めるために必要な経営情報です。

幅のない推定値は分かりやすい。しかし、その分かりやすさが経営判断を過信させることがある。

3.二つの誤り――実施する損失と、実施しない損失

施策の判断には、大きく二種類の誤りがあります。

一つは、効果のない施策を実施してしまうことです。

販促費を失い、不要な値引きで粗利を削り、人員や時間を浪費する。さらに、偶然の変化を施策の成功だと信じ、誤った成功体験を全社へ広げる危険もあります。

もう一つは、効果のある施策を見送ってしまうことです。

得られたはずの利益を失い、在庫削減が遅れ、競合に先行される。実施しなければ、施策について学ぶ機会も得られません。

経営会議では、実施して失敗した損失は目立ちます。投じた金額、不良在庫、減少した粗利が帳簿に残るからです。

一方、実施しなかったために得られなかった利益は、帳簿には直接現れません。そのため、現状を維持する方が安全に見えます。

しかし、何もしないことも一つの意思決定です。そこにも機会費用が発生します。

施策の真の効果とGO/NO GOの組み合わせから、利益獲得、投資損失、機会損失、損失回避の四つの結果が生じる。

経営判断のリスクは、間違って実施することだけではない。間違って見送ることにもある。

4.必要なのは「正解」ではなく、誤った場合の損失を管理すること

施策が成功する可能性が70%だとしても、常にGOになるわけではありません。

例えば、失敗しても100万円の損失で済み、すぐに元へ戻せる施策と、失敗すれば3億円を失い、顧客や取引先への影響も元に戻せない施策があったとします。

成功する可能性が同じでも、合理的な判断は異なります。

反対に、成功する可能性がそれほど高くなくても、損失が限定され、成功した場合の利益が大きければ、小さく試す価値があります。

確認すべきなのは、「効果がある確率」だけではありません。

  • 成功した場合に何を得るか
  • 失敗した場合に何を失うか
  • その損失に会社が耐えられるか
  • 結果が悪ければ途中で止められるか
  • 判断を遅らせる間に何を失うか

取り消しや修正が容易な判断には、完全な証拠を待たず、小さく動く合理性があります。一方、工場閉鎖、巨額設備投資、全社基幹システムの変更など、後戻りしにくい意思決定には、より強い証拠と慎重な検証が必要です。

因果推論の精度だけを一律に高めようとするのではなく、間違えた場合の損失と可逆性に応じて、必要な証拠の水準を変えるべきです。

証拠の要求水準は、意思決定の大きさだけでなく、間違えたあとに戻れるかで決まる。

5.「全面展開か中止か」の二択から離れる

製品Xのキャンペーンについて、効果はプラスと推定されたものの、全国の店舗で同じ効果が出るかは分からないとします。

このとき、選択肢は「3,000万円を投じて全国展開する」か「中止する」かだけではありません。

例えば、次のような方法があります。

  • 対象店舗を30店から60店へ広げる
  • 効果が確認された店舗属性に限定する
  • 初期の投資上限を1,000万円に設定する
  • 主要指標を粗利と在庫削減額に固定する
  • 4週間ごとに進捗を確認し、8週間後に再評価する
  • 販促費を回収できなければ追加展開を停止する
  • 段階ごとに次の投資を承認する

最初の投資によって施策の効果を学び、その情報を使って次の投資を決めることができます。

待つことにも価値がありますが、小さく実施して学ぶことにも価値があります。

推定が不確かであるなら、報告書に注意書きを加えるだけでは不十分です。その不確実性を、対象範囲、投資上限、観測期間、継続条件、撤退基準へ反映させる必要があります。

小規模検証から条件付き展開、対象拡大、全社展開へ進み、各段階で継続・撤退を判断する。

不確実性は、報告書の注釈に残すものではない。投資規模と撤退条件に反映させるものである。

6.意思決定をゆがめる四つの心理

反実仮想を慎重に考え、因果効果を推定しても、最後の意思決定には人間の心理が影響します。

曖昧性回避

人は、結果の確率や幅が明確でない選択肢を避け、確実に見える現状維持を選びたくなります。

しかし、現状維持の結果も確実ではありません。施策をしない間にも、市場、競合、在庫の劣化は進みます。

確証バイアス

自分が提案または承認した施策については、プラスの推定値を強く信じ、成立条件や否定的な結果を軽く扱いやすくなります。

第2回で見たように、現場と経営陣が成功物語を共同でつくる関係は、分析結果が出たあとにも残ります。

サンクコストとコミットメントのエスカレーション

すでに投じた費用や、自分が決めたという事実に引きずられ、効果が弱くても追加投資を続けてしまうことがあります。

判断すべきなのは、過去にいくら使ったかではなく、これから追加する資源に対して、どのような効果を期待できるかです。

不作為バイアスと責任回避

実施して失敗する責任を避けるため、「もう少しデータが必要だ」と追加分析を求め続けることがあります。

もちろん、追加検証が必要な場合はあります。しかし、その分析によって判断が変わる可能性がほとんどないなら、追加分析は精度向上ではなく、決断の先送りになっているかもしれません。

データが不足していることと、決断する覚悟が不足していることは同じではない。

7.分析者と意思決定者の「健全な契約関係」

不完全な反実仮想を経営判断に使うためには、分析者と意思決定者の責任を分ける必要があります。

分析者には、観測された事実と推定を分け、反実仮想をどのように設定したかを説明する責任があります。比較を成立させる仮定、推定値の幅、分析が崩れる条件、未確認事項、分析からは言えないことも開示しなければなりません。

一方、経営者や事業責任者には、どの目的を優先し、どこまでの損失を許容するかを決める責任があります。証拠の強さに投資規模を合わせ、GO、NO GO、追加検証のどれを選ぶかを決め、最後に残った不確実性を引き受けます。

分析者が「必ず成功します」と保証し、経営者がその言葉を根拠に責任を手放す関係は健全ではありません。

反対に、分析者が「最終的には経営判断です」と言って、仮定や推定精度の説明まで放棄することも適切ではありません。

事実、推定、仮定、リスク、決断、事後評価について、分析者と意思決定者の責任を分ける。

稟議書や役員会資料にも、「分析が成立するための前提条件」「推定効果の幅」「結果を適用できる範囲」「許容損失」「継続・撤退基準」を記載する欄を設けるとよいでしょう。

ただし、形式的なチェック欄にするだけでは機能しません。どこまで分かっており、何がまだ分からないのかを、言葉で共有することが重要です。

分析者は不確実性を隠さない。意思決定者は、不確実性が残ることを理由に責任を返さない。

8.良い意思決定と、良い結果は同じではない

十分な証拠を確認し、損失を限定し、合理的にGOと判断しても、結果が悪くなることはあります。

反対に、根拠の乏しい施策が、偶然成功することもあります。

結果だけで判断の質を評価すると、偶然の成功を優れた判断として称賛し、合理的だった挑戦を、失敗したという理由だけで否定することになります。

さらに、結果を知ったあとで、「こうなることは最初から分かっていた」と感じやすくなります。これは後知恵バイアスです。

経営会議でも、施策後の結果を見て、当時の判断材料以上のことが分かっていたかのように、過去の決断を評価しがちです。

評価すべきなのは、結果だけではありません。意思決定時点で利用できた情報をもとに、事実と推定を分けたか、仮定を明示したか、失敗時の損失を想定したか、撤退条件を決めたか、他の選択肢と比較したかという判断過程です。

合理的な手順で不確実性を引き受けた挑戦であれば、結果がマイナスに終わっても、その判断過程と得られた知見を組織の学習資産として残すことができます。

反対に、偶然の成功だけを称賛し、合理的な失敗を処罰する組織では、やがて誰も不確実な課題に挑まなくなります。成功物語だけが会議に上がり、都合の悪い仮定や失敗の兆候は隠されるようになります。

結果は意思決定の成否を示す。しかし、意思決定の質まで結果だけで決めてはいけない。

9.経営会議で確認する最後の七つの問い

製品Xへの3,000万円の追加投資を判断する前に、経営層が確認したい問いを整理します。

  1. 観測された事実と、推定された因果効果は分けられているか
  2. どの反実仮想を使い、どの仮定の上に推定値が立っているか
  3. 効果は一点ではなく、どの程度の幅があるか
  4. 効果が小さい場合やマイナスの場合、どれだけ損失が出るか
  5. 見送った場合には、どのような機会損失があるか
  6. 全面展開ではなく、小さく実施して学ぶ方法はないか
  7. 誰が仮定を説明し、誰が残されたリスクを引き受けるのか

これは書類や会議の項目を増やすことが目的ではありません。

断定的な成功物語ではなく、仮定とリスクを共有したうえで判断する仕組みをつくるためです。

事前に問いを定めておけば、施策後に都合のよい指標へ切り替えたり、結果に合わせて成功条件を書き換えたりすることも防ぎやすくなります。

経営会議で最後に問うべきなのは、「この数字は正しいか」だけではない。「この不確実性を、どの条件なら引き受けられるか」である。

10.「その数字は、原因を語っているか」を組織の習慣にする

この連載では、製品Xの在庫が1万個から6,000個へ減ったという事実から考え始めました。

[第1回「売上が上がったから、施策が効いたのか」]では、4,000個減ったという事実と、キャンペーンによる増分効果を分けました。

[第2回「『施策が効いた』を生む心理と組織力学」では、人や組織が、自分たちに都合の悪い反実仮想を避け、成功物語をつくる心理を考えました。

[第3回「その比較対象は、本当に比べられるか」]では、前年比や他店舗との比較に入り込む選択バイアス、交絡、平均への回帰、構成比の違いを見ました。

[第4回「施策をしなかった『双子』をつくる」]では、ランダム割り付けによって、施策をしなかった双子を人工的につくりました。

[第5回「現実の中に残された『双子』を探す」]では、ランダム実験ができない現実の中から、自然実験、差の差法、回帰不連続デザインによって双子を探しました。

そして最終回では、不完全な推定結果を、投資規模、許容損失、可逆性、撤退基準へつなぎ、最後に残るリスクを誰が引き受けるのかを考えています。

事実を分け、反実仮想を置き、心理と比較の罠を確認し、双子を調達し、不確実性を引き受けて決める。結果を検証し、次の判断へつなげる。

因果推論は、一度だけ正しい答えを出す技術ではありません。

施策前に仮定と成功条件を決め、実施後に結果を確認し、想定と違った理由を調べ、次の判断を更新する。その循環を組織の習慣にするための考え方です。

因果推論は、一度だけ正しい答えを出す技術ではない。判断し、結果を確かめ、次の判断を更新するための経営習慣である。

まとめ:数字に決断させない

今回は、不完全な因果推論を、どのように経営判断へつなげるかを考えました。

  • 因果と判断の分離: 効果があることと、投資すべきことは別の問い
  • 不確実性の可視化: 推定値を一点ではなく幅として捉える
  • 二つの誤りの比較: 実施する損失と、見送る機会損失の双方を見る
  • 可逆性の確認: 後戻りしにくい判断ほど、強い証拠を求める
  • 段階的な意思決定: 不完全な証拠には、小さく試して学ぶ方法で応える
  • 心理的な罠の管理: 曖昧性回避、確証バイアス、サンクコスト、不作為、後知恵に注意する
  • 責任の明確化: 分析者は仮定を開示し、意思決定者は残されたリスクを引き受ける
  • 判断過程の評価: 結果だけでなく、当時の情報に基づく判断の質を見る

製品Xへの3,000万円の追加投資について、経営会議は次のように決めました。

対象店舗を限定し、初期投資の上限を1,000万円として追加展開する。主要指標は粗利と在庫削減額とし、4週間ごとに確認する。8週間後に再評価し、推定効果の下限を下回り、販促費を回収できない場合には追加展開を中止する。

これは、決断を避けた結論ではありません。

不確実性に見合う大きさでリスクを引き受け、同時に、次の判断に必要な情報を得るという経営判断です。

数字は、原因を完全には語りません。反実仮想も、直接見ることはできません。

それでも私たちは、事実と推定を分け、比較対象を吟味し、仮定と不確実性を開示することで、判断の質を高めることができます。

数字に決断させるのではありません。数字が何を語り、何を語っていないのかを理解したうえで、人が決断します。

「その数字は、原因を語っているか」と問い続ける。答えを断言するためではない。分からない部分を明らかにしたうえで、それでも決めるためである。

全6回にわたり、最後までお読みいただき、ありがとうございました。

参考文献

  • Kahneman, D. and Tversky, A.(1979), “Prospect Theory: An Analysis of Decision under Risk,” Econometrica, 47(2), pp.263–291.
  • Staw, B. M.(1976), “Knee-Deep in the Big Muddy: A Study of Escalating Commitment to a Chosen Course of Action,” Organizational Behavior and Human Performance, 16(1), pp.27–44.
  • Baron, J. and Hershey, J. C.(1988), “Outcome Bias in Decision Evaluation,” Journal of Personality and Social Psychology, 54(4), pp.569–579.
  • Fischhoff, B.(1975), “Hindsight Is Not Equal to Foresight: The Effect of Outcome Knowledge on Judgment under Uncertainty,” Journal of Experimental Psychology: Human Perception and Performance, 1(3), pp.288–299.
  • March, J. G.(1994), A Primer on Decision Making: How Decisions Happen, Free Press.

〖その数字は、原因を語っているか⑤〗現実の中に残された「双子」を探す――自然実験・差の差法・回帰不連続デザイン

前回は、製品Xのキャンペーン効果を確かめるために、対象店舗をランダムに実施群と非実施群へ割り付けるA/Bテストについて考えました。

人が「売れそうな店舗」や「協力的な店舗」を選ぶのではなく、偶然に委ねることで、施策以外の条件が平均的にそろった二つのグループをつくる。その差から、施策をしなかった場合の結果、すなわち反実仮想を推定する方法です。

しかし、実際のビジネスでは、いつでもランダム割り付けができるとは限りません。

ある経営会議で、次のようなやり取りがあったとします。

「製品Xのキャンペーンを一部地域だけで試して、残りを比較対象にしてはどうでしょうか」

担当役員が答えます。

「もう全国の取引先に案内を出している。一部だけ中止にはできない」

別の担当者も続けます。

「そもそもシステムの更新時期が地域ごとに違います。こちらの都合で開始日をそろえることも難しいです」

そこで、こんな疑問が出てきます。

「ランダムに分けられないなら、もう効果は分からないということですか」

答えは「いいえ」です。

自分たちで施策をした世界と、しなかった世界の双子をつくれなくても、制度、時期、地域、基準値などによって、現実の中に似た状況が生まれていることがあります。

経営者は実験室をつくることはできなくても、ビジネスの現場に生まれた「偶然の実験場」を見つける目を持つことはできます。

ただし、自然に存在する二つのグループを比べれば、それだけで自然実験になるわけではありません。

自然実験は、自然に起きた比較ではない。施策の有無を分けた理由が、結果そのものから切り離されているかを問う設計である。

1.自分で分けられないなら、「分けた仕組み」を調べる

第3回では、製品Xのキャンペーンを実施した店舗と、実施しなかった店舗を比較しました。

ところが、実施店舗には、販売力の高い店長や固定客の多い店舗が選ばれていました。キャンペーン後の販売数が多かったとしても、それがキャンペーンの効果なのか、もともとの店舗の強さなのかは分かりません。

つまり、比較対象があることと、比較可能であることは同じではありません。

そこで第4回では、人が対象を選ぶことで生じる偏りを避けるため、ランダム割り付けを使いました。

では、自分たちで割り付けを決められないときは、何を見ればよいのでしょうか。

最初に確認したいのは、実施群と非実施群の見た目がどれだけ似ているかではありません。

なぜ、一方には施策が実施され、もう一方には実施されなかったのか。

その「割り振りの仕組み」を調べます。

例えば、法改正の施行時期、以前から決まっていたシステム移行日程、地域の境界線、補助金の適用基準、設備更新の都合、在庫日数などの基準値です。

製造業やサプライチェーンの現場でも、工場ラインの移管時期、物流拠点の統合日程、仕入先の切り替え時期などが、製品群や地域によって異なることがあります。その順序が、需要や採算性ではなく、設備、人員、認証、契約などの外部的な制約によって決まっていたなら、効果を検証するための手掛かりになる可能性があります。

製品Xのキャンペーンが、POSシステムの更新に合わせて始まったとします。ある地域では4月、別の地域では7月に更新された。その日程がキャンペーンの企画前から決まっており、店舗の販売力や売上見込みとは関係がなかったのであれば、開始時期の違いを効果の推定に利用できるかもしれません。

一方、将来性の高い地域、売上の伸びている店舗、協力的な店長がいる店舗から優先して更新したのであれば、話は変わります。施策を受けた理由と、将来の売上が最初から関係しているからです。

見た目の近い二つの店舗を探すだけでは足りません。両者を分けた仕組みまで確認して、初めて反実仮想の候補になります。

現実の中に双子がいるかどうかは、見た目の近さではなく、施策の有無を分けた仕組みで決まる。

2.自然実験――偶然は、原因を切り分ける機会になる

通常の実験では、分析者や企業が施策を受ける対象を割り付けます。それに対して自然実験では、分析者が割り付けを操作しません。制度変更や運用上の事情など、外部の仕組みによって、施策を受ける対象と受けない対象が分かれた状況を利用します。

重要なのは、単に「自然に分かれた」ということではありません。施策を受けるかどうかが、結果に影響する能力、意欲、将来性などとは無関係に、ランダムまたはランダムに近い形で決まっている必要があります。

製品XのPOS更新日程が、保守会社の作業計画によって以前から決まっていたのであれば、先行地域と後発地域の違いはキャンペーン効果を調べる手掛かりになります。しかし、販売力の高い店舗が更新を強く要望して優先されたのであれば、そこには再び選択バイアスが入り込みます。

経営層としては、少なくとも次の四点を確認する必要があります。

  • 施策を受けるかどうかを決めたものは何だったのか
  • その仕組みは、結果が出る前に決まっていたのか
  • その仕組み自体が、売上や利益に直接影響していないか
  • 店舗や担当者が、対象になるかどうかを操作できなかったか

例えば、POSシステムの更新自体が会計処理を速め、欠品を減らしていたなら、キャンペーンとシステム更新の効果を切り分けられません。現実に起きた差を使うからこそ、その差がどのように生まれたのかを丁寧に確認しなければなりません。

探すべきものは、偶然らしい出来事ではない。結果と切り離された割り振りの仕組みである。

3.差の差法――「変化の差」から反実仮想を推定する

自然実験や段階導入の状況で、よく使われる方法の一つが「差の差法」です。英語ではDifference-in-Differences、略してDiDと呼ばれます。

製品Xのキャンペーンを先に開始した地域と、まだ開始していない地域について、1店舗・1週間当たりの粗利を比較してみます。

キャンペーン地域の粗利は、実施前の100万円から実施後には130万円へ増えました。30万円の増加です。これだけを見ると、「キャンペーンによって粗利が30万円増えた」と報告したくなります。

しかし、比較地域でも、粗利は90万円から105万円へ増えていました。こちらも15万円増えています。同じ時期に季節需要が高まった、景気が回復した、競合商品が欠品したなど、市場全体の変化があった可能性があります。

そこで、二つの地域の「変化の差」を取ります。

(キャンペーン地域の実施後-実施前)-(比較地域の実施後-実施前)

今回の数字では、次のようになります。

(130万円-100万円)-(105万円-90万円)=30万円-15万円=15万円

キャンペーンによる粗利の増分効果は、1店舗・1週間当たり15万円と推定されます。

一つ目の差で、それぞれの地域に起きた時間的な変化を捉えます。二つ目の差で、キャンペーンを実施しなくても起きたと考えられる市場全体の変化を差し引きます。

差の差法は、施策後の差を見る方法ではない。施策がなくても生じたはずの変化を差し引く方法である。

4.差の差法を支える「平行トレンド」という仮定

差の差法は、数字を式に当てはめれば完成するものではありません。その背後には、「平行トレンド」と呼ばれる重要な仮定があります。

キャンペーンが実施されなかったとしても、キャンペーン地域と比較地域は、同じような傾向で変化していたはずだという仮定です。

少し比喩的に表現するなら、平行トレンドで確認したいのは、次のようなことです。

キャンペーンという帆の張り方だけが違い、季節性や景気という風は、両地域に同じように吹いていたと考えられるか。

もし一方の地域だけに強い追い風が吹いていたなら、船の進み方の違いを帆、すなわちキャンペーンの効果だけで説明することはできません。

実務では、施策前の複数期間について両地域の推移を確認するとともに、次の点を調べます。

  • 片方の地域だけで、別の販促施策が始まっていなかったか
  • 店舗の閉鎖や大型店の新規開店がなかったか
  • 顧客構成や販売チャネルが大きく変わっていないか
  • 施策開始前から買い控えや先行販売が起きていないか
  • 先行地域の広告が後発地域にも届いていないか
  • 競合企業の出店や値下げが片方だけで起きていないか

特に注意したいのが、スピルオーバーです。先行地域の広告を比較地域の顧客も見ていれば、比較地域は「何もしなかった世界」の代役ではなくなります。

また、地域ごとに導入時期が異なる場合、早期導入地域と後発地域を単純に比べると、導入時期や効果の持続期間の違いによって推定がゆがむことがあります。計算式が簡単であることと、比較が簡単であることは同じではありません。

平行トレンドとは、二本のグラフが似ていたという事実ではない。施策がなくても同じ変化をしたと説明できるかという反実仮想の仮定である。

5.回帰不連続デザイン――境界のすぐ両側を比べる

現実の中に残された双子を探す方法は、時期の違いを利用する差の差法だけではありません。何らかの基準値によって施策の対象が決められている場合、その境界を利用できることがあります。

これが「回帰不連続デザイン」です。英語ではRegression Discontinuity Design、略してRDDと呼ばれます。

製品Xの在庫対策キャンペーンについて、会社が「在庫日数が90日以上の店舗に限り、値引き原資と販促費を支給する」という基準を設けたとします。

在庫日数60日の店舗と120日の店舗では、取扱量、商圏、店舗規模、在庫管理能力などが異なる可能性があります。一方、在庫日数89日の店舗と91日の店舗であれば、状態はかなり似ています。それにもかかわらず、90日という境界を挟んで施策の有無だけが変わります。

在庫日数と将来の成果との関係が、90日の前後で滑らかにつながっていると考えられるなら、その境界で突然生じた段差を、キャンペーン効果として推定できる可能性があります。

もちろん、基準値があるだけでRDDが成立するわけではありません。90日を境に販促費だけでなく専門チームも派遣されるなら、どちらの効果か分かりません。また、店舗が基準値を操作できないことも重要です。

例えば、「90日以上なら販促費が出る」と知った店長が、発注や出荷の時期を調整し、在庫日数89日の店舗を意図的に91日へ動かしていたらどうでしょうか。こうした「社内ハック」、すなわちゲーミングが起きれば、境界のすぐ両側は、もはや偶然に分かれた双子とはいえません。

さらに、RDDで推定できるのは、主として境界付近の対象に対する効果です。90日前後の店舗で有効だったとしても、30日や200日の店舗でも同じ効果が得られるとは限りません。

RDDが比べるのは、遠く離れた実施群と非実施群ではない。境界のすぐ両側にいる、ほとんど同じ対象である。

6.手法の名前だけでは、反実仮想は完成しない

「差の差法で分析しました」「RDDを使って効果を算出しました」と説明されると、高度で信頼できる分析のように聞こえるかもしれません。しかし、手法の名前そのものが因果関係を保証するわけではありません。

どの方法にも、「この条件が成り立つなら、この比較を反実仮想の代役として使える」という成立条件があります。推定された効果の数字だけでなく、その数字を支えている仮定も合わせて確認しなければなりません。

手法の名前が因果を保証するのではない。比較が成立する条件をどこまで説明できるかが、証拠の強さを決める。

7.どの方法を選ぶか――経営判断から逆算する

実務では、「差の差法を使いたい」「AIでデジタルツインをつくりたい」と、分析手法から議論が始まることがあります。しかし、先に確認すべきなのは、何を判断するための分析なのかということです。

製品Xであれば、全国展開に3,000万円を投じるべきか、どの店舗まで広げるべきか、値引き原資を継続すべきかという経営判断があります。必要な証拠の強さは、意思決定の規模と、間違えた場合の損失によって変わります。

まず、安全かつ倫理的にランダム割り付けができるなら、RCTやA/Bテストを検討します。それが難しい場合は、制度、導入時期、地域差、境界、基準値などを利用できないか探します。現実に比較可能な状況がなければ、デジタルツインやシミュレーションで仮説やリスクを絞り込みます。

それでも証拠が弱いのであれば、「全社展開する」か「何もしない」かの二択にする必要はありません。投資規模を小さくする、対象地域を限定する、撤退基準を決める、段階的に広げる。不確実性に合わせて意思決定の大きさを調整できます。

また、一つの方法だけに依存する必要もありません。DiD、RDD、現場で確認したメカニズムなど、異なる証拠が同じ方向を示せば、判断の確信度は高まります。反対に結論が食い違えば、それは追加で調べるべき重要な経営情報です。

最適な手法は、最も高度な手法ではない。意思決定に必要な証拠を、現実の制約の中で最も誠実につくれる手法である。

8.経営層が分析報告で確認したい六つの問い

経営層が、差の差法やRDDの数式を自ら計算する必要はありません。しかし、分析担当者が提示した数字について、次の六つは確認する必要があります。

  1. 施策を受けた対象と受けなかった対象は、何によって分かれたのか
  2. 売上見込みや担当者の判断が、その振り分けに影響していないか
  3. DiDでは、なぜ平行トレンドを想定できるのか
  4. RDDでは、基準値を操作できず、別の制度も同時に変わっていないか
  5. 推定された効果は、どの地域・店舗・顧客まで当てはまるのか
  6. 結果がプラス、マイナス、不明確だった場合、それぞれ何を判断するのか

これらは、現場を詰問するための質問ではありません。分析者が置いた仮定、未確認の事項、結果を適用できる範囲を、経営側と共有するための問いです。

この六つの問いを毎回口頭で確認するだけでは、会議の時間や出席者によって扱いが変わってしまいます。例えば、稟議書や役員会資料に「分析が成立するための前提条件」と「結果を適用できる範囲」という欄を設け、未確認事項も含めて記載するようにすれば、因果推論を個人の注意力ではなく、組織の意思決定手順として定着させることができます。

経営層が「結局、効果はあるのか、ないのか」と結論だけを求めれば、現場は不確実性を隠し、断定的な物語をつくるようになります。一方、「どの条件なら、この数字を信頼できるのか」と聞けば、分析の限界も意思決定の材料になります。

経営層が確認すべきなのは、「高度な分析か」ではない。「どの仮定の上に、この数字が立っているか」である。

まとめ:不完全な双子でも、使い方はある

今回は、ランダム割り付けができない状況で、現実の中に残された反実仮想の代役を探す方法について考えました。

  • 割り振りの仕組みを見る: 見た目が似た比較対象ではなく、施策の有無を分けた理由を確認する
  • 自然実験を探す: 結果と切り離された制度、時期、地域、境界などを利用する
  • 変化の差を測る: 差の差法では、施策をしなくても起きた変化を比較群から差し引く
  • 平行トレンドを吟味する: 施策がなくても両群が同じように変化したと説明できるかを考える
  • 境界付近を比べる: RDDでは、基準値のすぐ両側にいる対象を比較する
  • ゲーミングを疑う: 評価や予算に使われる基準値は操作される可能性がある
  • 手法より仮定を見る: 分析手法の名前ではなく、比較が成立する条件を確認する
  • 証拠に投資規模を合わせる: 不確実性が大きければ、対象と投資を限定して段階的に判断する

RCTを実施できないからといって、因果推論を諦める必要はありません。現実のビジネスには、制度変更、導入時期、地域差、基準値など、反実仮想を考えるための手掛かりが残されています。

私自身、生産管理や在庫管理の仕事をするなかで、すべての施策を実験として設計できるわけではないと感じています。

工場移管、仕入先変更、発注基準の見直し、不稼働在庫の処分、物流条件の変更。こうした意思決定では、対象をランダムに分けることが難しく、すでに変化が始まっていることも少なくありません。

それでも、変更時期が異なる製品群はなかったか。適用基準の前後に似た製品はなかったか。外部要因によって対応が分かれた取引先はなかったか。「実験できなかった」で終わらせず、現実が残した差の理由をたどることで、判断材料を増やすことはできます。

ただし、そこで見つかる双子は完全ではありません。差の差法には平行トレンドなどの仮定があります。RDDには境界付近での連続性や、基準値を操作できないという条件があります。どれほど精緻に分析しても、何もしなかった未来を直接観測することはできません。

では、不完全な証拠しかない状況で、経営者はどこまで投資し、どこで撤退し、誰が残された不確実性を引き受けるのでしょうか。分析者は、どこまでを数字として示し、どこからを仮定として説明すべきなのでしょうか。

次回の第6回では、これまでの連載を総括しながら、「分析の正しさ」と「決断の責任」をどのように分け、不完全な反実仮想を経営判断へつなげるかを考えます。

反実仮想は、見つけた瞬間に完全になるのではない。仮定を開示したとき、初めて経営判断に使える。

最後までお読みいただき、ありがとうございました。

参考文献

  • Callaway, B. and Sant’Anna, P. H. C.(2021), “Difference-in-Differences with Multiple Time Periods,” Journal of Econometrics, 225(2), pp.200–230.
  • Cattaneo, M. D. and Titiunik, R.(2022), “Regression Discontinuity Designs,” Annual Review of Economics, 14, pp.821–851.
  • Dunning, T.(2012), Natural Experiments in the Social Sciences: A Design-Based Approach, Cambridge University Press.
  • Imbens, G. W. and Lemieux, T.(2008), “Regression Discontinuity Designs: A Guide to Practice,” Journal of Econometrics, 142(2), pp.615–635.
  • Angrist, J. D. and Pischke, J.-S.(2009), Mostly Harmless Econometrics: An Empiricist’s Companion, Princeton University Press.

〖その数字は、原因を語っているか④〗「施策をしなかった双子」をつくる――ランダム割り付けによるA/Bテスト

前回は、比較対象があっても、比較可能とは限らないことを考えました。

製品Xのキャンペーン実施店舗は、非実施店舗より20%多く販売しました。しかし、実施店舗には固定客が多く、販売力の高い店長がいました。観察された差には、キャンペーンの効果だけでなく、もともとの店舗力や顧客構成の違いも含まれている可能性があります。

そのため、ほかの商品へ3,000万円を投じる横展開は、いったん保留になりました。

次の会議で、担当者が新しい検証案を示します。

「対象条件を満たす60店舗を選び、30店舗ではキャンペーンを実施し、残る30店舗では通常販売を続けます。どちらに入るかは、ランダムに決めたいと思います」

すると、役員から疑問が出ました。

「効果がありそうな施策を、半分の店舗で実施しないのは機会損失ではないか」

「立地や売上が似た店舗を、人が選べばよいのではないか」

「最後をくじ引きで決めるのは、経営判断の放棄ではないか」

いずれも、実務では自然な疑問です。しかし、効果を測る場面では、「有望だから選ぶ」という判断そのものが、前回見た選択バイアスや交絡を生みます。

ランダム割り付けで偶然に委ねるのは、キャンペーンの内容でも、投資上限でも、成功基準でもありません。経営が検証条件を決めたうえで、最後の「どの店舗へ実施するか」だけを、人の都合から切り離します。

今回は、ランダム割り付けによるA/Bテストが、直接見ることのできない反実仮想の代役をどのようにつくるのかを考えます。

ランダム割り付けは判断の放棄ではない。経営が決めた条件の中で、施策対象の選定だけを人の都合から切り離す仕組みである。

選ばないことで、比較可能な集団をつくる

これまでの製品Xの検証では、固定客の多さ、店長の販売力、過去の販促実績、協力の得やすさからキャンペーン店舗を選んでいました。いずれも合理的な条件ですが、製品Xの販売数にも影響します。施策対象を選んだ時点で、二つの集団に系統的な差が入り込みます。

ランダム割り付けでは、対象条件を満たす店舗を、偶然によってキャンペーン群と通常販売群へ分けます。各店舗がどちらへ入るかを、店長の力量や担当者の期待から切り離すことで、観察できる特徴だけでなく、把握していない特徴についても、平均的には二つの集団へ散らばりやすくなります。

このような比較は、ランダム化比較試験(Randomized Controlled Trial:RCT)と呼ばれます。ビジネスでは、ランダム割り付けを伴うA/Bテストとして実施されることがあります。

そのうえで、同じ期間に観察した二群の差を比べます。通常販売群は、キャンペーン群で直接見ることのできない「キャンペーンをしなかった場合」の代役になります。

もちろん、あるキャンペーン店舗と完全に同じ店舗を一つつくれるわけではありません。A/Bテストがつくるのは、一店舗ごとの生き写しではなく、集団として見たときの双子です。

経営の役割も消えません。次の事項は、経営側が決めます。

  • 何を検証するか
  • どの店舗を対象候補にするか
  • 何を成功指標にするか
  • どのリスクを許容するか
  • 結果を受けて投資するか

偶然に委ねるのは、その条件内での割り付けだけです。

判断を手放すのではなく、判断力を使う場所を変える。

A/Bテストがつくるのは、一店舗ごとの双子ではない。集団としての「施策をしなかった自分たち」である。

ランダム抽出とランダム割り付けは、何が違うのか

ここで、混同されやすい二つの言葉を分けておきます。

一つは「ランダム抽出」です。母集団から、調査や実験に参加する店舗や顧客を無作為に選びます。主に関係するのは、得られた結果をどの範囲まで一般化できるかという問題です。

もう一つが「ランダム割り付け」です。実験の対象になった店舗や顧客を、施策ありと施策なしへ無作為に分けます。主に関係するのは、二群の結果差を施策の因果効果として、どれだけ偏りなく推定しやすいかという問題です。

製品Xで考えると、全国の店舗から実験対象の60店舗をどう選ぶかが抽出です。その60店舗を、キャンペーン群30店舗と通常販売群30店舗へどう分けるかが割り付けです。

都市部だけを抽出すれば、その結果が地方にも当てはまるとは限りません。これは、効果を適用する範囲に関する「外側」の問題です。一方、都市部でも売れそうな店舗だけへ施策を実施すれば、効果があったかどうかさえ分かりません。こちらは「内側」の問題です。

実務で「A/Bテスト」と呼ばれる比較が、常にランダム化比較試験になるわけではありません。希望者や有望店舗を一方へ入れれば、AとBの名称を付けても選択の偏りは残ります。

抽出の誤りは、効果を適用する相手を誤らせる。割り付けの誤りは、効果があったかどうか自体を誤らせる。

製品XのA/Bテストをどう設計するか

では、製品Xのキャンペーンを例に、実験を組み立ててみます。

1.対象条件を決める

まず、在庫量、商圏、販売体制などから、施策を実施できる60店舗を選びます。60という数字は説明上の例であり、必要数は販売数のばらつき、見つけたい効果、割り付け単位によって変わります。

2.重要な条件で層をつくる

地域、店舗規模、キャンペーン前の販売水準など、結果へ強く影響しそうな条件で店舗をいくつかの層に分けます。

例えば、大型店と中小型店を分け、それぞれの中で半分ずつ割り付けます。これを層別ランダム割り付けと呼びます。似た条件のまとまりを先につくり、その中で偶然に委ねます。

3.施策あり・なしへランダムに割り付ける

各層の店舗を、次の二群へ分けます。

  • A群30店舗:値引きと広告キャンペーンを実施
  • B群30店舗:通常価格・通常販促を継続する対照群

もし、同じ商圏内で広告がB群の顧客にも届くなら、店舗単位の割り付けでは施策が混ざります。その場合は、商圏や地域を一つのまとまりとして割り付ける方法も検討します。

4.同じ期間、同じ定義で測る

実施期間を8週間とし、両群で同じ方法、締め日、指標を使います。集計期間や分析方法も先に決めます。

5.経営判断に合う指標を決める

製品Xの目的が3,000万円の横展開判断なら、主要指標を販売個数だけにするのは不十分です。

値引き後の粗利から追加費用を差し引き、通常販売群との差を見る「増分利益」を主要指標にします。販売個数、在庫削減量、再購入率は補助指標、既存商品の売上減少、返品、顧客離れは不利益として記録します。

6.成功・撤退・追加検証の基準を先に決める

増分利益が横展開の費用を回収できれば展開候補、マイナスなら中止、判断できなければ追加検証といった基準を、稟議や承認の段階で合意します。結果を見て物語を書き換えないための、事前コミットメントです。

売れたかどうかではなく、どの指標を満たせば3,000万円を投じるのかを、実験前に決めておく。

ランダムに分けても、条件が完全にそろうとは限らない

ランダム割り付けは、二群を完全に同じにする魔法ではありません。

店舗数が少なければ、大型店や有力店長が偶然どちらかへ偏ることがあります。実施期間中に、一方の店舗だけで大口注文や近隣競合の休業が起きるかもしれません。

そのため、実験前の販売水準、推移、店舗規模、地域、顧客構成を確認します。重要な条件で層をつくるのも、偶然の偏りを小さくする工夫です。

ただし、結果を見た後で「この店舗は特殊だから」と群を入れ替えることはできません。都合の悪い店舗を外せば、人が選ぶ比較へ戻ってしまいます。

また、二群に差が出ても、一点の数字だけで受け取りません。店舗間のばらつきが大きければ不確実性は残ります。実験規模や期間は、見つけたい最低限の効果と、判断を誤るリスクから逆算します。

経営層に必要なのは、統計用語の細部を暗記することではありません。「この店舗数とばらつきで、3,000万円を決めるだけの精度があるか」と確認することです。

ランダム割り付けは不確実性を消さない。人の選択による偏りを、測定して判断できる偶然のばらつきへ変える。

なぜ組織はランダム割り付けを嫌がるのか

仕組みを理解しても、A/Bテストの導入には心理的な抵抗が残ります。

実施しない店舗が、機会損失に見える

会議では、A群で生まれるかもしれない売上は目に見えます。一方、効果のない施策を全店へ広げる損失は、まだ起きていないため見えにくいままです。

ここには、何かをする方を選びやすい「行動バイアス」と、目の前の取り逃しを重く見る「損失回避」が重なっています。

しかし、キャンペーンの効果がマイナスだった場合、全60店舗へ一斉展開すれば損失も全店へ広がります。30店舗で試していれば、少なくとも検証期間中の被害を限定できます。

A/Bテストは、成功を小さく試す「攻め」と、未知の損失を限定する「守り」の両方を担います。

人が選ぶ方が、責任ある判断に見える

経験豊富な担当者の選定力は、通常業務では価値があります。ただ、効果検証では、選定の精度が高いほど「施策店舗」と「売れやすい店舗」が重なり、施策効果と選定能力を分けられなくなります。

自分で対象を選ぶ方が結果を制御できるという「コントロール幻想」や、過去の成功評価が揺らぐことへの不安も、偶然に委ねることを難しくします。

一部だけ実施するのは不公平に見える

顧客や店舗に明確な不利益が生じる場合、公平性への配慮は欠かせません。一方、すべての店舗へ同時導入する必要がない施策なら、導入順をランダムに決める段階導入もあります。

一部の地域から順に開始し、全対象が最終的に施策を受ける方法です。専門的にはステップウェッジ型のデザインが選択肢になります。ただし、季節性などの時間変化を区別できるよう、開始時期と分析方法を事前に設計します。

なお、効果がすでに明白な安全対策や、施策を与えないこと自体が重大な不利益になる場合まで、無理にランダム化するべきではありません。倫理、安全、法令、顧客との約束は、実験より優先されます。

A/Bテストは効果を見つける手段であると同時に、未知の損失を全社へ広げないための保険でもある。

A/Bテストは、実施後の運用で壊れる

実験計画にランダム割り付けと書いてあっても、それだけでは十分ではありません。現場での運用によって、比較可能性は崩れます。

現実の店舗では、欠品で値引きできない日や、広告掲示が遅れる店舗もあります。

大切なのは、現場を無菌室のようにすることではありません。どの店舗がどの群へ割り付けられ、実際には何が行われたかを分けて記録することです。

効果を見る際は、まず当初の割り付けに従ってA群とB群を比較します。これは「割り付けベースの分析」、専門的にはITTと呼ばれる考え方です。

「指示通り実施した店舗だけ」を集め直すと、実行力の高い店舗だけが残り、再び選択バイアスが生まれます。

もちろん、実際にどの程度施策が実施されたかも、改善のために重要です。ただし、当初の割り付け結果と実施状況を混ぜず、二つを別々に報告します。

実験の規律とは、現場を無菌室にすることではない。割り付けと実施のずれを記録し、結果から都合よく除かないことである。

現実で実験できないとき、デジタルツインは何ができるか

すべての経営判断で、現実のA/Bテストができるわけではありません。

工場設備の更新、物流網の再編、基幹システムの切り替えなどは、費用が大きく、簡単には元へ戻せません。店舗間の影響が強く、施策ありとなしを分離できない場合もあります。

そこで、デジタルツインやシミュレーションを使い、現実の設備や業務をモデル上に再現して、施策ありと施策なしのシナリオを比べる方法があります。

例えば、工場ラインのボトルネック解消や、全社在庫の安全在庫基準の変更は、現場でいきなりA/Bテストを行いにくい領域です。設備能力、需要変動、在庫、輸送制約をモデルへ入れ、設備増強や安全在庫基準の変更の有無によって、生産量、欠品、納期、在庫金額がどう変わるかを試算します。現実へ適用する前に、どの前提で結果が変わるかを確認できます。

ただし、モデルの中の双子は、与えた前提と過去データの範囲で動きます。競合の反応、従業員の習熟、顧客行動などをモデルが十分に表していなければ、精密な計算でも現実の因果効果とはずれます。

デジタルツインは、仮説を絞り、シナリオを試し、現実のテスト規模を小さくするために使えます。同時に、妥当性確認と不確実性の評価が欠かせません。

反実仮想の代役を用意する方法は、一つではありません。

デジタルツインは、仮説を試す場所にはなる。しかし、現実の因果関係を自動的に証明するものではない。

A/Bテストを承認する前に、経営層が確認する六つの問い

経営層が実験計画を受け取ったとき、細かな統計計算を自ら行う必要はありません。まず、次の六つを確認します。

1.この実験で、どの意思決定を変えるのか

3,000万円の横展開、対象商品の変更、施策の中止など、結果がどの判断につながるかを明確にします。

2.何を、どの単位でランダムに割り付けるのか

顧客、店舗、地域のどれを割り付けるのか。施策が周囲へ漏れるなら、より大きな単位で分けます。

3.費用を含む主要指標は何か

販売個数だけでなく、値引き後の粗利、販促費、既存需要への影響を含め、経営判断に対応する指標を一つ定めます。

4.期間、成功、撤退、除外の基準を事前に決めたか

終了時点と判断基準を承認時に合意し、安全上の中止条件は別に明記します。

5.割り付けと実施状況を分けて記録できるか

どの群へ割り付けたかを残したうえで、実施漏れ、条件変更、他群への波及を記録します。予定と実績のずれは隠す対象ではなく、運用改善の情報です。

6.結果が「プラス」「マイナス」「判断不能」のとき、それぞれどうするか

プラスなら展開、マイナスなら中止、判断不能なら追加検証と、三つの出口を用意します。

A/Bテストで「明確な効果は確認できなかった」という結果が出ても、担当者の失敗とは限りません。3,000万円を投じる根拠が不足していると分かったこと自体が、資源配分に必要な成果です。

経営側が成功事例だけを評価すれば、現場は実験結果を成功物語へ加工します。仮説が外れたことを早く発見し、損失を小さく止めた検証も評価する必要があります。

実験は経営判断の代わりではない。経営が引き受けるリスクを、判断前に見えるようにする。

ランダム割り付けは、経営の責任を軽くしない

ランダム割り付けは、施策の対象選定を偶然に委ねます。しかし、経営判断まで偶然に委ねるものではありません。

むしろ、経営が決めるべき範囲を明確にします。

何を検証し、どの損失まで許容し、何をもって成功とし、どの証拠なら3,000万円を投じるのか。そこを曖昧にしたまま実験を始めれば、結果が出た後に都合のよい解釈を選ぶことになります。

私自身、業務のなかで対象を選ぶとき、経験を使うことは大切だと考えています。限られた人員や在庫を、成果が期待できる場所へ配分するのは、事業運営に必要な判断です。

一方、その施策が本当に効いたかを知りたい場面では、経験による選択をいったん止める必要があります。運営を最適化する選択と、効果を検証する割り付けは、目的が異なるからです。

判断力を手放すのではありません。判断力を使う場所を、施策対象の選定から、実験条件と結果の解釈へ移します。

偶然に委ねる範囲を経営が決めることも、経営判断の一部である。

まとめ:「施策をしなかった双子」は、偶然によってつくられる

今回のポイントを整理すると、次のようになります。

  • 人による選択を切り離す:ランダム割り付けは、売れそうな店舗だけを選ぶことで生じる偏りを抑える
  • 抽出と割り付けを分ける:抽出は結果を適用できる範囲、割り付けは効果があったかどうかの推定に関わる
  • 集団として双子をつくる:一店舗ずつ同じにするのではなく、施策あり・なしの集団を平均的に比較可能にする
  • 判断基準を先に決める:主要指標、期間、成功、撤退、除外の条件を実験前に合意する
  • 実施のずれを隠さない:当初の割り付けを基準に比較し、実施状況は別に記録する
  • 未知の損失を限定する:A/Bテストは効果を探すだけでなく、誤った全社展開を防ぐ保険にもなる

同じ店舗で、施策ありとなしを同時には観察できません。それでも、対象選定を人の期待や評価から切り離せば、「施策をしなかった自分たち」に近い集団を人工的につくれます。

では、費用、制度、倫理、顧客への影響などから、ランダム割り付けができない場合はどうすればよいのでしょうか。

法改正の境界、地域ごとの導入時期のずれ、適用基準の閾値など、現実の中に生まれた偶然や境界を使う方法があります。

次回は、自然実験と、差の差法(DiD)・回帰不連続デザイン(RDD)などの準実験デザインを取り上げ、世の中に残された「施策をしなかった双子」をどう見つけるのかを考えます。

自分たちで双子をつくれないなら、現実の中に残された双子を探す。

今回はここまでとします。 最後までお読みいただき、ありがとうございました。

参考文献

[1]Rubin, D. B.(1974)“Estimating Causal Effects of Treatments in Randomized and Nonrandomized Studies.” Journal of Educational Psychology, 66(5), 688–701. DOI

[2]Morgan, K. L. & Rubin, D. B.(2012)“Rerandomization to Improve Covariate Balance in Experiments.” The Annals of Statistics, 40(2), 1263–1282. DOI

[3]Hemming, K., Haines, T. P., Chilton, P. J., Girling, A. J. & Lilford, R. J.(2015)“The Stepped Wedge Cluster Randomised Trial: Rationale, Design, Analysis, and Reporting.” BMJ, 350, h391. DOI

[4]Hernán, M. A. & Hernández-Díaz, S.(2012)“Beyond the Intention-to-Treat in Comparative Effectiveness Research.” Clinical Trials, 9(1), 48–55. DOI

[5]Shao, G., Hightower, J. & Schindel, W.(2022)“Credibility Consideration for Digital Twins in Manufacturing.” Manufacturing Letters, 35, 24–28. NIST

〖その数字は、原因を語っているか③〗その比較対象は、本当に比べられるか――選択バイアスと交絡の罠

前回は、人や組織が反実仮想に気づきながら、再び分かりやすい成功物語へ戻ってしまう理由を考えました。

製品Xの在庫は、キャンペーン期間中に1万個から6千個へ減少しました。その実績をもとに、ほかの商品へ3,000万円を追加投資する案が出ています。しかし、キャンペーンをしなかった場合に何個売れていたのかは、直接見ることができません。

そこで担当者は、比較対象を加えた資料を次の経営会議へ提出します。

「キャンペーン実施店舗の1店舗当たり販売数は、非実施店舗より20%多くなりました。したがって、キャンペーンには効果があったと考えます」

施策を実施しなかった店舗との比較です。会議室には、これなら3,000万円の横展開を承認できるという空気が広がります。

ところが、ある役員が尋ねました。

「そもそも、なぜこの店舗をキャンペーン対象に選んだのですか」

担当者は答えます。

「固定客が多く、販売力の高い店長がいて、成果が期待できる店舗を選びました」

限られた予算を成果が期待できる店舗から投じるのは合理的です。しかし、その店舗はキャンペーンがなくても製品Xが売れやすかった可能性があります。観察された20%の差には、もともとの店舗力も含まれているかもしれません。

今回は、選ばれた比較対象が数字にどのような歪みを生むのかを見ていきます。

比較対象を置けば因果が見えるのではない。比較対象の選び方によって、見たい因果をつくることもできる。

比較対象があっても、比較可能とは限らない

反実仮想は直接観察できないため、実務では非実施店舗、前年同月、キャンペーン前の販売数などを「何もしなかった未来」の代役にします。ただし、別の数字を置くだけで反実仮想を推定できるわけではありません。

製品Xのキャンペーン店舗が、非実施店舗より20%多く販売したとします。この20%の差には、少なくとも次の三つが含まれている可能性があります。

  • キャンペーンそのものの効果
  • 店舗や顧客がもともと持っていた違い
  • 季節需要や競合欠品など、同じ時期に起きた変化

知りたいのはキャンペーン効果ですが、観察できる販売数には三つが一緒に現れます。比較可能な対象とは、外見が似た対象ではなく、施策がなくてもおおむね同じように推移したと考えられる対象です。

すべての条件をそろえることはできません。重要なのは、結果に影響しそうな違いと、それが推定を歪める方向を把握することです。

施策後に差が生まれたという事実だけでは、その差を生んだ原因までは確定しません。

施策後に生まれた差のすべてが、施策によって生まれた差ではない。

「前月」「前年」「他店舗」「計画」は、何を比べているのか

会議では、比較が使われます。

いずれも経営管理には必要な数字です。しかし、それぞれの比較が答えている問いは同じではありません。

前月との比較

キャンペーン前月と実施月を比べる方法は分かりやすい一方、季節需要、連休、競合商品の欠品など、時間とともに変わった要因も販売数へ影響します。

前月比から分かるのは「前月より売れたか」であって、「キャンペーンによって売れたか」ではありません。

前年同月との比較

前年同月なら季節性をある程度そろえられます。しかし、1年の間には価格、取引先、販売チャネル、競合環境も変化します。前年の数字は、今年の「キャンペーンをしなかった場合」そのものではありません。

他店舗との比較

同じ期間の他店舗なら外部環境を共有しやすい一方、立地、顧客構成、売場面積、販売員の力量が異なります。成果が期待できる店舗を選んでいれば、その違いを施策効果と取り違えやすくなります。

販売計画との比較

販売計画は予算管理に欠かせませんが、実際に観察された「施策なしの結果」ではありません。計画達成と施策効果は分けて考える必要があります。

整理すると、次のようになります。

  • 前月比は「前より増えたか」
  • 前年比は「昨年より増えたか」
  • 他店舗比は「別の店舗より多かったか」
  • 計画比は「目標を達成したか」
  • 因果推論は「施策によって増えたか」

前年比や計画比も必要ですが、答えられる範囲を超えて原因まで説明させないことが重要です。

比較の名前ではなく、施策がなければ同じ動きをしたと考えられるかを問う。

施策の対象を選んだ時点で、差が生まれている

製品Xの担当者は、成果を得やすい店舗をキャンペーン対象に選びました。

  • 固定客が多い
  • 販売力の高い店長がいる
  • 来店客数が多い
  • 過去の販促施策への反応がよい

これらは、限られた予算を有効に使うための合理的な選定条件です。同時に、キャンペーンがなくても販売数を増やす条件でもあります。

このように、比較する集団が選ばれた時点で性質が異なっていると、観察された差を施策だけに帰属できません。実務では、こうした対象選定による偏りを広い意味で「選択バイアス」と呼ぶことがあります。

厳密な因果推論では、対象の選ばれ方から生じる選択バイアスと、後ほど説明する交絡を区別します。ただ、経営会議で最初に確認すべき点は共通しています。

「なぜ、こちらの店舗や顧客だけが施策対象になったのか」

選ばれた理由が結果にも影響するなら、二つの集団は最初から同じスタートラインに立っていません。

不調店舗を選んだときにも、別の罠がある

では、売れそうな店舗ではなく、不調店舗をキャンペーン対象にした場合はどうでしょうか。

例えば、過去3か月で販売数が最も落ち込んだ店舗を選び、販促を実施したとします。翌月に販売数が回復すれば、施策が効いたように見えます。

しかし、毎月の販売数には、店舗の実力だけでなく、一時的な大口顧客の発注延期、天候、近隣工事などの偶然も含まれます。極端に悪かった時点を基準に店舗を選ぶと、次の測定値は、何もしなくても平常に近づくことがあります。

これは「平均への回帰」と呼ばれる現象です。

平均への回帰は、選択バイアスの言い換えではありません。ただし、極端に悪い結果を理由に対象を選び、その後の回復を施策効果として評価するときに、両者は一緒に現れやすくなります。

好調店舗を選べば、もともとの販売力を施策効果に含める可能性があります。不調店舗を選べば、自然な回復を施策効果に含める可能性があります。

どちらの場合も、対象を選んだ理由を確認しないまま、実施店舗と非実施店舗を比べることが問題です。

対象を選んだ理由があるなら、その理由が結果にも影響していないかを疑う。

第三の変数が、施策と結果を同時に動かす

製品Xのキャンペーン店舗には、販売力の高い店長がいました。

「店舗の販売力」は、二つの方向へ影響しています。

一つは、キャンペーン対象への選ばれやすさです。販売力の高い店舗ほど、キャンペーンで成果を出せると期待されます。

もう一つは、製品Xの販売数です。販売力の高い店舗は、キャンペーンをしなくても多く販売する可能性があります。

このように、第三の変数が施策の実施と結果の双方に影響し、両者の関係を混ぜてしまうことを「交絡」と呼びます。

交絡要因の候補は、店舗の販売力だけではありません。

  • 既存顧客と新規顧客の比率
  • 店舗の立地や規模
  • 季節需要
  • 競合商品の欠品
  • 大口注文の有無
  • 同時期に実施した営業強化や広告

大切なのは、思いつく限りの変数を分析へ投入することではありません。誰が、どの基準で対象を選んだのか。その条件は販売数にも影響しないか。施策と結果が生まれる順序をたどることで、疑うべき第三の変数が見えてきます。

一方、キャンペーンによって増えた来店数や商品ページの閲覧数は、施策の効果が結果へ届く途中の経路かもしれません。来店数や閲覧数は、キャンペーンとは別の「原因」ではなく、キャンペーンが売上を生み出すための「通り道」になっている可能性があるからです。こうした施策後の変数まで機械的に取り除けば、本来測りたい効果の一部を消してしまう可能性があります。

分析項目の多さより、施策前に何が決まり、どの順序で結果が生まれたかを理解する必要があります。

数字に差があることと、施策が差を生んだことは同じではない。第三の変数が、その両方に影響している可能性がある。

全体では成功、分けて見ると失敗する

第三の変数による集団構成の違いが、極端な形で現れることがあります。

製品Xのキャンペーンでは、既存顧客を中心に対象を選んだとします。既存顧客は、もともと製品Xを購入する可能性が高い顧客です。一方、非キャンペーン群には新規顧客が多く含まれていました。

結果は、次のようになりました。

全体ではキャンペーンありが50%、なしが26%で、購入率が大きく上がったように見えます。ところが顧客層別では、既存顧客は60%対70%、新規顧客は10%対15%となり、どちらもキャンペーンありの方が低くなっています。

全体と内訳で結論が逆転した理由は、キャンペーン群の80%が購入率の高い既存顧客であり、非キャンペーン群の80%が購入率の低い新規顧客だったからです。

このように、集団をまとめたときの傾向と、第三の変数で分けたときの傾向が逆転する現象は、シンプソンのパラドックスとして知られています。

ただし、この表だけを見て「キャンペーンには悪影響があった」と断言することもできません。既存顧客や新規顧客という同じ区分のなかにも、購入履歴、年齢、地域などの違いが残っている可能性があるからです。

ここから確実に言えるのは、「全体の50%対26%だけでは、キャンペーン効果を証明できない」ということです。

実務では、まず施策を始める前から決まっていた重要な属性でデータを分け、全体の結論と矛盾しないかを確認します。今回なら、顧客層、店舗規模、地域、販売チャネル、施策前の購入実績などが候補になります。

反対に、キャンペーンを見た後の来店やページ閲覧など、施策によって変わった可能性がある属性で安易に分けることには注意が必要です。

集計値は嘘をつかない。しかし、構成比の違いを見えにくくする。全体で成功に見える施策が、内訳ではすべて逆の傾向を示すことがある。

ABC分析は、原因を説明する道具ではない

在庫管理で使われるABC分析にも、同じ注意が必要です。

例えば、Aランク商品の在庫月数が短いからといって、Aランクと同じ発注ルールをCランクへ適用すれば在庫が減るとは限りません。需要量が、ABCランクと在庫月数の双方に影響している可能性があるからです。

ABC分析は、売上への寄与や在庫の偏りを把握するには有用ですが、なぜ売れるのか、発注や販促を変えればどうなるかまでは答えません。

ABC分析は、現在地を把握する健康診断です。因果推論は、原因を探る診断に当たります。そして経営判断は、診断を踏まえて対策を選ぶ処方です。

分類は、どこに問題があるかを示す。なぜそうなったかまでは示さない。

比較対象を承認する前に、経営層が確認すること

では、比較結果を受け取った経営層は、何を確認すればよいのでしょうか。

複雑な統計分析を求める前に、次の五つを確認します。

1.比較対象は、結果を見る前に決められていたか

結果を見てから施策がよく見える前月や店舗を選ばないよう、施策前に比較対象を決め、変更理由を記録します。

2.なぜ一方だけが施策対象に選ばれたのか

成果が期待できる店舗、不調な店舗、協力的な顧客など、選定には理由があります。その理由が結果にも影響するなら、単純比較には偏りが入ります。

3.施策前の水準や傾向は似ていたか

施策直前の販売数だけでなく、数か月の推移、顧客構成、店舗規模などを確認します。施策前から一方だけが伸び続けていたなら、施策後の差にもその傾向が残ります。

4.施策と結果の双方に影響する要因はないか

季節需要、競合欠品、大口注文、営業体制など、施策と同じ時期に動いた要因を確認します。完全に取り除けなくても、未確認事項として明示することに意味があります。

5.施策前から決まっていた重要な属性で分けても、結論は変わらないか

顧客層、地域、店舗規模、販売チャネルなどで一度分解し、全体と内訳の方向が一致しているかを検算します。結論が逆転するなら、その構成比を確認します。

この五つの問いは、現場を詰問するためのものではありません。

最初から完全な比較対象が見つかるとは限りません。「顧客構成が一致していない」「競合欠品の影響はまだ切り分けられていない」と率直に報告できれば、経営層は証拠の強さに応じて投資額を決められます。

製品Xの報告も、次のように書き換えられます。

「キャンペーン店舗の1店舗当たり販売数は、非実施店舗より20%多くなりました。ただし、対象店舗は固定客比率と施策前の販売力が高く、単純比較では店舗特性の影響を切り分けられません。顧客層別でも結論が変わるため、現時点ではキャンペーン単独の効果は確定できません。3,000万円の横展開前に、追加検証が必要です」

この報告は、分かったことと未確認事項を分け、次の投資判断に必要な情報を示しています。

少額で、失敗してもすぐに戻せる施策なら、不完全な比較をもとに試行を続ける判断もあります。しかし、3,000万円を投じて全社展開するなら、施策ありと施策なしの条件を、より丁寧にそろえる必要があります。

その一つが、店舗や顧客を施策あり・施策なしへランダムに割り付けるA/Bテストです。

ここで必要なのは、対象を無作為に集める「ランダム抽出」ではありません。施策を実施するかどうかを偶然に委ねる「ランダム割り付け」です。詳しい考え方は、次回取り上げます。

比較の弱点を明らかにすることは、分析の失敗ではない。誤った横展開を止めるための経営情報である。

比較を疑うことは、数字を否定することではない

キャンペーン店舗が非実施店舗より20%多く販売したことは、観察された事実です。その数字に意味がないわけではありません。

問題は、その差のすべてをキャンペーン効果とみなし、3,000万円の追加投資へ直結させることです。

比較に選択の偏りや交絡があると分かれば、結論を仮説として扱い、投資額や対象地域を絞り、より比較可能な条件で追加検証できます。

私自身、在庫月数やABCランクなどの数字を扱うなかで、比較対象が一つ置かれると、それだけで説明が完成したように感じることがあります。前月より減った、計画を達成した、別部門よりよかった。比較は、判断に安心感を与えてくれます。

しかし、その安心感が、比較対象の性質を確かめる作業を終わらせることもあります。

経営層が尋ねるべきなのは、「比較対象はありますか」だけではありません。

「なぜ、その比較対象なら、施策をしなかった未来の代役になるのですか」と問えているか。

まとめ:比較対象の数ではなく、比較可能性を見る

今回のポイントを整理すると、次のようになります。

  • 比較対象と反実仮想の区別:別の数字を置いても、施策なしの未来の代役になるとは限らない
  • 対象選定の影響:施策対象を選んだ理由が、そのまま結果の差を生むことがある
  • 平均への回帰:極端な不調を理由に対象を選ぶと、自然な回復を施策効果と誤認しやすい
  • 交絡と構成比の確認:第三の変数や集団構成によって、全体と内訳の結論が逆転することがある
  • 経営側の確認責任:意思決定が大きいほど、比較の限界を明示し、追加検証を行う

比較対象は、反実仮想そのものではありません。私たちが直接見ることのできない「何もしなかった未来」を推定するための代役です。

だからこそ、比較対象があるかどうかではなく、その対象が代役を務められる条件を備えているかを確かめる必要があります。

では、比較可能な対象が自然には見つからない場合、どうすればよいのでしょうか。

自分たちで、施策をしなかった集団をつくる方法があります。ただし、必要なのはランダムな抽出ではありません。施策を実施するかどうかをランダムに割り付けることです。

次回は、ランダム割り付けによるA/Bテストを使い、「施策をしなかった自分たちの双子」をどうつくるのかを考えます。

今回はここまでとします。

最後までお読みいただき、ありがとうございました。

参考文献

[1]Simpson, E. H.(1951)“The Interpretation of Interaction in Contingency Tables.” Journal of the Royal Statistical Society: Series B, 13(2), 238–241. DOI

[2]Hernán, M. A., Hernández-Díaz, S. & Robins, J. M.(2004)“A Structural Approach to Selection Bias.” Epidemiology, 15(5), 615–625. DOI

[3]Barnett, A. G., van der Pols, J. C. & Dobson, A. J.(2005)“Regression to the Mean: What It Is and How to Deal with It.” International Journal of Epidemiology, 34(1), 215–220. DOI

[4]Pearl, J.(2014)“Comment: Understanding Simpson’s Paradox.” The American Statistician, 68(1), 8–13. DOI

〖その数字は、原因を語っているか②〗「施策が効いた」を生む心理と組織力学

前回は、ある販促キャンペーンを取り上げました。

製品Xの在庫は、キャンペーン期間中に1万個から6千個へ減少しました。担当者は「キャンペーンによって在庫を4,000個削減した」と報告し、その実績をもとに、ほかの商品へ3,000万円を追加投資する案が経営会議に上がりました。

そこで、ある役員が尋ねます。

「何もしなかった場合、何個売れていたのか」

会議室は静まり返りました。

キャンペーン期間中に4,000個売れたことは確認できます。しかし、キャンペーンを実施しなかった場合に何個売れていたのかは、直接見ることができません。前回は、この「起きなかったもう一つの未来」を反実仮想と呼び、施策の効果を考えるには、観察された結果と反実仮想を分ける必要があると説明しました。

ところが、会議はそこで終わりません。

しばらくして、誰かが口を開きます。

「ただ、4,000個売れたこと自体は事実ですよね」

何人かがうなずき、張り詰めていた会議室の空気が少し緩みます。

「少なくとも、一定の効果はあったと考えてよいのではないか」

「では、横展開の方向で詳細を詰めましょう」

気づけば、「何もしなかった場合」という問いは脇へ置かれ、会議は元の成功物語へ戻っていました。議事録に残るのは、「キャンペーン効果を確認。横展開を検討」という結論だけです。

これは、因果推論を知らないから起きるのでしょうか。

反実仮想の必要性を説明されれば、多くの人は理屈として理解できます。それでも実際の会議では、見えない未来より、目の前にある結果へ引き寄せられます。そして、分かりやすい説明が一つ示されると、そこへ安堵するように戻っていきます。

今回は、なぜ人や組織が、一度は反実仮想に気づきながら、再び単純な成功物語へ戻ってしまうのかを考えます。

見える結果と、見えない未来は対等ではない

経営会議で使われる資料には、数字が並んでいます。

  • 在庫が1万個から6千個へ減った
  • キャンペーン期間中に4,000個売れた
  • 売上が前年同月を上回った
  • 販売計画を達成した

これらは、実際に観察された数字です。基幹システムや販売データから取り出すことができ、グラフにもできます。誰が見ても、そこに存在しています。

一方、「キャンペーンをしなかった場合には3,000個売れていた」という反実仮想は、どのデータベースにもそのまま保存されていません。比較対象や過去の傾向から推定する必要があり、そこには仮定と不確実性が残ります。

両者は、最初から対等ではありません。

第一に、可視性の非対称性があります。実績は見えますが、反実仮想は直接見えません。

第二に、説明負担の非対称性があります。「キャンペーンで4,000個売れた」は一文で済みます。しかし、「季節需要、競合欠品、大口注文の影響を考慮すると、キャンペーンがなくても約3,000個は売れた可能性がある」と説明すれば、前提や根拠を問われます。

第三に、評価の非対称性があります。「施策が成功した」と断言する人は、成果を生み出した人に見えます。「施策単独の効果はまだ分かりません」と報告する人は、分析が足りない人、判断できない人に見えることがあります。

もちろん、企業が複雑な出来事を短い物語に整理すること自体は悪くありません。経営には、限られた時間のなかで情報を圧縮し、資源配分を決める役割があります。考えられる原因を際限なく挙げ続けていれば、何も決められません。

問題は、分かりやすい物語が、検証されないまま評価や追加投資へ接続されることです。

見えている結果は、それだけで説明力を持っているように見える。見えない未来は、誰かが意識して会議へ持ち込まなければ存在しない。

成功したとき、検証は止まりやすい

では、なぜ私たちは、見えている結果から一つの原因を選びたくなるのでしょうか。

ここでは、三つの心理的な働きを見ていきます。

結果バイアス――良い結果が、良い判断に見える

結果バイアスとは、意思決定が行われた時点の情報や判断過程ではなく、後から判明した結果によって、その判断の良し悪しを評価してしまう傾向です。

同じ情報をもとに同じ判断をしたとしても、結果が良ければ「優れた判断だった」と評価し、結果が悪ければ「無謀な判断だった」と評価しやすくなります。

製品Xの在庫が4,000個減ったため、キャンペーンを実施した判断だけでなく、値引き幅、対象商品の選定、実施時期まで適切だったように感じられます。

しかし、良い結果が出たことと、当時の判断過程が適切だったことは同じではありません。逆に、判断過程が妥当でも、偶然や外部環境によって悪い結果になることもあります。

後知恵バイアス――結果を知ると、最初から分かっていたように感じる

結果を知った後では、その結果が事前に予測可能だったように見えます。

キャンペーンが終わった後になって、「この時期は需要が伸びると思っていた」「値下げすれば売れるのは当然だった」と語られることがあります。しかし、施策を承認した時点では、同じ強さの確信を持っていたとは限りません。

結果を知った私たちは、当時の迷いや不確実性を小さく見積もります。そのため、成功が偶然や複数要因の重なりによって生じた可能性を検討しにくくなります。

自己奉仕バイアスと動機づけられた推論

成功は自分たちの能力や施策に帰属させ、失敗は市場環境や競合などの外部要因に帰属させやすい傾向は、自己奉仕バイアスと呼ばれます。

また、人は常に中立的な立場から証拠を評価するわけではありません。先に望ましい結論があり、それを支える記憶、情報、推論を見つける方向へ思考が動くことがあります。これが、動機づけられた推論です。

キャンペーンの推進者にとって、「何もしなくても3,000個売れていた」という反実仮想は、成果を4,000個から1,000個へ縮小させます。場合によっては、値引きによって粗利を失い、施策をしない方が良かった可能性まで生じます。

反実仮想を検討することが、自分の評価、予算、過去の判断を揺らすのであれば、見ない理由が生まれます。

反実仮想は、成功と失敗で同じようには働かない

ここで注意したいのは、人が反実仮想をまったく考えないわけではないことです。

成功したときには、

「何もしなくても、同じように売れていたのではないか」

という反実仮想は持ち出されにくくなります。せっかく得られた成果や評価を、自ら小さく見せることになるからです。

一方、結果が悪かったときには、

「競合が値下げしていなければ売れていた」

「為替が急変しなければ採算は合っていた」

「大口顧客の発注延期がなければ計画を達成していた」

といった反実仮想が、次々と提示されることがあります。

実際よりも良い結果を想像するものは「上方反実仮想」と呼ばれます。失敗の原因を検討し、次の行動を改善するうえで、本来は重要な思考です。

ただし、自分たちが変えられた要因ではなく、外部要因だけを選んで語れば、学習の道具ではなく、自己正当化の道具になります。

問題は、反実仮想を考えるかどうかだけではありません。どの反実仮想を選び、何のために使っているかです。

人は反実仮想を避けるのではない。自分の成功物語を揺らす反実仮想を避けるのである。

成功物語は、現場と経営が共同でつくる

ここまでの説明では、キャンペーンの担当者だけに問題があるように見えるかもしれません。

しかし、成功物語を必要としているのは現場だけではありません。

施策の推進者には、成果として認めてもらいたい、次年度の予算を確保したい、プロジェクトを継続したいという動機があります。曖昧な報告をすれば、「結局、何が言いたいのか」と問われるかもしれません。

一方、経営陣にも、分かりやすい説明を求める理由があります。

  • 自分が承認した判断の妥当性を確認したい
  • 投資の成果を社内外へ説明したい
  • 誰を評価すべきか明確にしたい
  • 限られた会議時間で次の意思決定を行いたい

そこで、現場は「キャンペーンによって4,000個売れた」という短い成功物語を提出します。経営陣は、その説明をもとに担当者を評価し、追加予算を承認します。評価と予算を得た担当者は、次回も同じ形式で報告します。

こうして、成功物語をつくる側と、それを求める側の循環が生まれます。

これは、現場が意図的に数字を捏造しているという話ではありません。

むしろ、現場は経営側から求められる報告形式に適応しています。「施策単独の効果はまだ分かりません」と言う人より、「私たちの施策で売上を伸ばしました」と言う人が評価されるのであれば、確実そうな物語を提出することは、組織のなかで合理的な行動になります。

説明責任を課せば、必ず慎重な判断が増えるとも限りません。誰に対して、どのような結論を説明することが求められているかによって、説明責任は検討を深めることも、期待される結論への同調を強めることもあります。

「成功を証明せよ」と求めることと、「判断過程と不確実性を説明せよ」と求めることでは、現場から上がってくる情報が変わります。

成功物語は、報告する側だけがつくるものではない。分かりやすい説明を求める側との間で共同生成される。

反実仮想には、組織的なコストがかかる

反実仮想を考えない理由を、個人の怠慢だけで説明することもできません。

反実仮想を会議へ持ち込むことには、少なくとも三つのコストがあります。

認知的なコスト

単純な因果物語なら、「キャンペーンをした」「売れた」「だから効いた」という一直線で説明できます。

反実仮想を考える場合は、季節需要、競合欠品、大口注文、顧客構成、対象地域の選び方など、複数の可能性を同時に扱わなければなりません。資料を追加し、前提を確認し、分からない範囲を残す必要があります。

政治的なコスト

成功とされた施策を再検討すると、担当者だけでなく、その施策を承認した上司や経営陣の判断まで問い直されます。

追加投資を主導した役員にとっても、「施策の効果は確認できていない」という結論は歓迎しにくいものです。反実仮想を考えることが、過去の意思決定や部門間の力関係を揺らすからです。

意思決定上のコスト

比較対象の収集や追加検証には、時間と費用がかかります。競合が動いているときに、分析結果が出るまで何か月も待てるとは限りません。経営層もまた、取締役会や株主、金融機関に対する説明責任を負い、限られた時間のなかで判断を求められています。

したがって、反実仮想を考えないことは、単なる思考停止ではありません。短時間で結論を出し、組織内の摩擦を避けるという点では、一見すると合理的です。

だからといって、すべての施策に厳密な実験を求める必要もありません。

少額で、失敗してもすぐに戻せる施策であれば、簡易な検証で進める判断もあります。一方、全社展開、多額の設備投資、価格体系の変更など、失敗時の損失が大きく、元に戻しにくい判断ほど、反実仮想を丁寧に検討する必要があります。

検証の強度は、学術的な厳密さへのこだわりではなく、意思決定の大きさに応じて決めるものです。

問題は、反実仮想を考えない人がいることではない。考えない方が評価される仕組みが残っていることである。

心理的な都合は、比較対象の選び方に現れる

反実仮想を直接観察できない以上、実務では何らかの比較対象を使います。

製品Xのキャンペーンであれば、次のような比較が考えられます。

  • キャンペーン前月との比較
  • 前年同月との比較
  • キャンペーンをしなかった他店舗との比較
  • 販売計画との比較
  • 対象外だった顧客や地域との比較

どれも、一見すると合理的です。しかし、比較対象の選び方によって、同じ施策が成功にも失敗にも見えます。

施策の効果を強く見せたい人は、売上の低かった前月、不調だった前年、客足の鈍い別店舗を選びやすくなります。施策に懐疑的な人は、好調だった地域や高い計画値を選ぶかもしれません。

ここで起きているのは、必ずしも意図的なデータの捏造ではありません。

担当者は一生懸命に比較対象を探しています。しかし、複数の候補があるなかで、無意識のうちに自分たちの施策を肯定しやすい対象を選び取ってしまいます。

データそのものを改ざんしていなくても、結果を見た後で、自分に都合のよい比較対象を選ぶことはできます。これが、無意識のチェリーピッキングです。

しかも、製品Xの在庫減少には、キャンペーン以外にも次の要因が重なっていたかもしれません。

  • 季節需要が高まった
  • 競合商品が欠品した
  • 大口注文が偶然入った
  • 営業担当者や販売チャネルが変わった
  • もともと売れやすい地域だけをキャンペーン対象にした

比較する集団の性質が最初から違えば、施策の効果と集団の違いを切り分けられません。施策と同じ時期に別の要因が動けば、その影響も混ざります。

前者は選択バイアス、後者は交絡と呼ばれる問題につながります。また、全体で見た傾向と、部門や顧客層に分けて見た傾向が逆転することもあります。これはシンプソンのパラドックスとして知られています。

これらは統計上の問題ですが、その入口は、分析ソフトを操作するより前にあります。

選択バイアスや交絡は、統計上のミスである前に、組織が見たい物語に合う比較対象を選んだ結果かもしれない。

経営層が変えるべきは、個人より制度である

では、経営層は何を変えればよいのでしょうか。

「バイアスに気をつけよう」と呼びかけるだけでは不十分です。人間の心理を完全に変えることはできません。むしろ、反実仮想を考え、不確実性を報告する方が合理的になる制度をつくる必要があります。

1.成果を聞く前に、ほかの説明を聞く

「この施策で何が改善したのか」と聞く前に、次のように尋ねます。

「施策以外に、同じ結果を生んだ可能性はありますか」

代替説明を少なくとも一つ挙げることを、会議や報告書の定型にします。正解を求める質問ではありません。成功物語が一つに固まる前に、別の可能性を会議へ残すための質問です。

2.結果と意思決定プロセスを分けて評価する

良い結果が出た人だけを評価すれば、結果バイアスが強まります。

施策前にどのような仮説を置いたか、リスクを把握していたか、途中で新しい情報に対応したかも評価します。結果が悪くても判断過程が妥当だった施策と、結果は良かったものの偶然に助けられた施策を分けます。

3.成功条件・比較対象・撤退基準を施策前に合意する

施策を開始する前に、少なくとも次の事項を関係者間で共有します。

  • 何と比較して効果を判断するのか
  • どの程度の増分効果を成功とみなすのか
  • どこまでのコストを許容するのか
  • どの数字を下回ったら修正、縮小、撤退するのか
  • いつ、誰が検証するのか

これは、結果を知る前の自分たちの判断に、将来の自分たちを従わせる「事前コミットメント」です。

結果が出てから成功基準や比較対象を選べば、どのような結果でも後付けで正当化できます。施策前に判断基準を合意しておくことで、成功物語の後付けを防ぎます。

例えば製品Xであれば、「キャンペーンを実施しない場合の販売数を暫定的に約3,000個と置き、増分効果が1,000個以上、かつ増分粗利で販促費を含む追加負担を回収できる場合にのみ横展開する」と、キャンペーン開始前の稟議・承認段階で合意しておきます。

もちろん、途中で市場環境が大きく変われば、基準を修正して構いません。ただし、その場合は、何を、なぜ、いつ変更したのかを記録します。

4.結論を更新した人を評価する

過去の説明を守り続けることより、新しい証拠を受けて判断を変えることを評価します。

「当初はキャンペーン効果を2,000個と見積もっていたが、競合欠品の影響が判明したため1,000個へ修正した」という報告は、失点ではありません。経営判断に必要な情報の精度を上げた行動です。

5.意思決定の大きさに応じて、検証を強くする

すべての施策に同じ分析コストをかける必要はありません。

小規模でやり直しやすい施策なら、過去データや類似条件との比較から始められます。一方、3,000万円を投じて全社展開するのであれば、比較可能な対象を慎重に選び、可能であれば一部の店舗、顧客、地域を対象に、ランダム割り付けによるA/Bテストを先に実施する方法があります。

ランダム割り付けは、施策を実施したグループと実施しなかったグループの条件を、平均的にそろえるための方法です。詳しい考え方は、この連載の後半で扱います。

ここで重要なのは、現場に完璧な証明を求めることではありません。「まだ分からない」と言うだけで終わらず、何が分かり、何を仮定し、次にどう確かめるのかを共有できる状態をつくることです。

不確実性をなくすことが経営の仕事ではない。不確実性を隠さなくてもよい仕組みをつくることが、経営の仕事である。

原因を疑うことは、判断を遅らせることではない

冒頭の経営会議に戻りましょう。

「ただ、4,000個売れたこと自体は事実ですよね」という発言は、間違っていません。4,000個売れたことは、確認された事実です。

問題は、その事実を確認した瞬間に、「だからキャンペーンが効いた」という説明まで確定させてしまうことです。

会議で必要なのは、成功か失敗かをその場で断言することではありません。

  • 4,000個売れたことは事実である
  • キャンペーンがなくても売れた数量はまだ推定である
  • 季節需要や競合欠品が影響した可能性がある
  • 現時点では増分効果を約1,000個と仮定している
  • 3,000万円を投じる前に、追加検証が必要である

ここまで分けて考えられれば、経営は前へ進めます。

因果推論は、判断を止めるための学問ではありません。事実と推定を分け、不確実性がどこに残っているのかを確認し、次に投じる資源の大きさを決めるための補助線です。

私自身、生産、在庫、納期といった数字を扱うなかで、結果が改善すると安堵し、その理由を一つに決めたくなる場面があります。原因が分かった方が、報告もしやすく、次の対策も立てやすいからです。

しかし、その分かりやすさは、ときに検証を終わらせます。

人の心理だけを責めても、状況は変わりません。断言する人が評価され、慎重な報告をする人が予算を失うのであれば、誰も反実仮想を会議へ持ち込まなくなります。

まとめ:反実仮想を会議に残せるか

今回のポイントを整理すると、次のようになります。

  • 見える結果の強さ:観察された実績は、直接見えない反実仮想より説得力を持ちやすい

  • 反実仮想の非対称性:成功時には成果を小さくする反実仮想を避け、失敗時には自分を免責する反実仮想を持ち出しやすい

  • 成功物語の共同生成:現場と経営の双方が、短く確実な因果説明を必要としている

  • 無意識のチェリーピッキング:心理と組織の利害は、都合のよい比較対象を選ぶ行動として表れる

  • 経営側の設計責任:比較対象、成功条件、撤退基準を事前に合意し、不確実性を開示した人が不利にならない制度をつくる

反実仮想を考える能力は、個人の知識だけでは決まりません。

組織がどのような報告を求め、どのような人を評価し、どのような物語に予算をつけるかによって、会議に現れる情報は変わります。

最後に、経営層の立場から、次の問いを考えてみてください。

自社の会議で「この施策が効いたかは、まだ分かりません」と報告した人は、次の予算を得られるだろうか。

もし得られないのであれば、反実仮想を遠ざけているのは、担当者の思い込みではなく、その組織の評価制度です。

では、反実仮想を考えるために、何と比較すればよいのでしょうか。

前年同月、前月、他店舗、販売計画。実務では、さまざまな比較対象が使われます。しかし、比較対象があることと、比較可能であることは同じではありません。その対象が、本当に「何もしなかった未来」の代役になっているかを確かめる必要があります。

次回は、分かりやすい比較が因果関係を見誤らせる仕組みを、選択バイアス、交絡、シンプソンのパラドックスから考えていきます。

今回はここまでとします。 最後までお読みいただき、ありがとうございました。

参考文献

[1]Baron, J. & Hershey, J. C.(1988)“Outcome Bias in Decision Evaluation.” Journal of Personality and Social Psychology, 54(4), 569–579. DOI

[2]Fischhoff, B.(1975)“Hindsight ≠ Foresight: The Effect of Outcome Knowledge on Judgment under Uncertainty.” Journal of Experimental Psychology: Human Perception and Performance, 1(3), 288–299. DOI

[3]Roese, N. J.(1997)“Counterfactual Thinking.” Psychological Bulletin, 121(1), 133–148. DOI

[4]Kunda, Z.(1990)“The Case for Motivated Reasoning.” Psychological Bulletin, 108(3), 480–498. DOI

[5]Nickerson, R. S.(1998)“Confirmation Bias: A Ubiquitous Phenomenon in Many Guises.” Review of General Psychology, 2(2), 175–220. DOI

[6]Lerner, J. S. & Tetlock, P. E.(1999)“Accounting for the Effects of Accountability.” Psychological Bulletin, 125(2), 255–275. DOI

[7]Bryan, G., Karlan, D. & Nelson, S.(2010)“Commitment Devices.” Annual Review of Economics, 2, 671–698. DOI

〖その数字は、原因を語っているか①〗「売上が上がった。だから施策が効いた」は本当か

――起きなかった未来を考える「反実仮想」

皆さん、こんにちは。

本ブログでは、行動経済学や行動心理学などの知見を、企業経営やビジネスの現場でどのように活用できるのかを考えています。

今回から、

「その数字は、原因を語っているか」

と題して、因果推論と行動経済学を組み合わせた全6回の連載を始めたいと思います。

売上が増えた。

在庫が減った。

不良率が下がった。

納期遅延が減った。

企業では、こうした数字の改善をもとに、施策の成否を評価します。そして、うまくいったと判断した施策には、追加の予算や人員を配分し、他の商品や部門へ横展開していきます。

もちろん、数字を見て判断すること自体は間違っていません。むしろ、経験や勘だけに頼らず、数字を確認することは経営の基本です。

しかし、ここで一つ考えたいことがあります。

施策の後に数字が改善したことと、その施策によって数字が改善したことは、本当に同じなのでしょうか。

私自身、生産管理や在庫管理の仕事をするなかで、「在庫がこれだけ減った」「納期遅延がこれだけ改善した」といった報告を見る機会があります。そのたびに難しいと感じるのは、起きた結果を確認することではありません。その結果のうち、どこまでが施策によって生まれたのかを切り分けることです。

今回扱うのは、この「施策をしなかったら、どうなっていたのか」という問いです。

因果推論では、現実には起きなかったもう一つの結果を「反実仮想」と呼びます。少し難しそうな言葉ですが、経営会議で毎日のように行われている、投資、横展開、撤退、評価の質を左右する考え方です。

最初に結論を一つだけ申し上げておきます。

数字を見るな、という話ではありません。

見えている数字に、「何もしなかった場合」というもう一つの数字を重ねて考えよう、という話です。

4,000個の「成功」が、3,000万円の判断に変わる

「製品Xの在庫は、キャンペーン前の1万個から6千個まで減りました。今回の施策によって、4千個の在庫を削減できたことになります」

ある中堅メーカーの経営会議で、営業責任者が報告しました。製品Xは長く在庫が積み上がっていた商品です。そこで会社は、値下げと広告を組み合わせた8週間の販促キャンペーンを実施しました。期間中に4,000個が売れ、在庫は1万個から6千個へ減っています。数字そのものに間違いはありません。

次のスライドには、この「成功」を他の10商品へ横展開する計画が示されていました。必要な追加予算は3,000万円です。会議は承認に傾きます。そこで、一人の役員が尋ねました。

「このキャンペーンをしなかった場合、何個売れていたのでしょうか」

会議室が静かになりました。4,000個売れたことは分かっています。しかし、そのうち何個がキャンペーンによって追加的に売れたのかは、資料のどこにも書かれていませんでした。

この事例は、複数の実務場面を参考に再構成した架空のものです。ただし、似た構図は多くの会社にあります。「施策Aにより売上が20%増えた」「研修によって不良率が下がった」「会議を増やした結果、納期遅延が減った」。私たちは、施策の後に数字が改善すると、その施策が数字を変えたと考えます。

ところが、経営にとって本当に危険なのは、過去の施策効果を少し読み違えることだけではありません。その読み違いを成功モデルとして、人・モノ・金をもう一度配分してしまうことです。今回考えたいのは、数字の集計方法ではなく、その数字を根拠に次の3,000万円をどう決めるかです。

数字は正しい。だが、追加投資の根拠にはまだならない

営業責任者の報告には、異なる三つの層が含まれています。第一は「キャンペーン期間中に4,000個売れ、在庫が1万個から6千個へ減った」という事実です。第二は「キャンペーンが4,000個の販売を生み出した」という解釈です。第三は「だから、他の商品にも横展開すべきだ」という判断です。さらに、その判断が3,000万円の資源配分につながります。

会議では、この四段階がしばしば一文に圧縮されます。「キャンペーンによって4,000個削減した。したがって横展開する」。出発点にある4,000個という数字が正しいため、その後に続く因果の解釈や投資判断まで正しいように見えてしまいます。

しかし、「期間中に4,000個売れた」という事実と、「キャンペーンによって4,000個売れた」という主張の間には、大きな飛躍があります。キャンペーンがなくても、一定数は自然に売れていたはずだからです。季節需要が高まっていたかもしれません。競合商品が一時的に欠品していた可能性もあります。偶然、大口注文が重なっただけかもしれません。

経営判断は、事実だけでは完結しません。事実をどう解釈し、どの選択肢に資源を配るかまでが経営です。だからこそ、観察した数字と、その数字に与えた因果的な意味を分けなければなりません。

数字の読み違いは、報告書の中では小さな誤差でも、資源配分に移された瞬間に経営リスクへ変わる。

同じ会社に、二つの未来は訪れない

製品Xには、本来二つの未来が考えられます。一つは、実際にキャンペーンを実施した未来です。もう一つは、キャンペーンを実施しなかった未来です。

実施した未来では、4,000個が売れました。では、キャンペーンをしなかった未来では、何個売れていたのでしょうか。3,000個だったかもしれません。季節需要が強ければ、4,500個だった可能性もあります。反対に、何もしなければ1,000個しか売れなかったかもしれません。

時間を巻き戻し、同じ会社、同じ商品、同じ顧客、同じ競合状況のもとで、今度はキャンペーンだけを実施しない――そのようなやり直しはできません。同じ製品Xについて「実施した場合」と「実施しなかった場合」を同時に観察できないことが、因果推論の根本的な難しさです。

因果効果は、次のように表せます。

増分販売 = 施策ありの販売数 - 施策なしの販売数

前者は4,000個と観察できています。しかし、後者は観察できません。現実には起きなかったものの、ある条件だけが違っていたら起きていたはずの結果を「反実仮想」と呼びます。潜在的結果の考え方では、この観察できないもう一方の結果をどう推定するかが中心問題になります[1][2]。

反実仮想は、都合のよい空想ではありません。「景気がもっとよく、競合もなく、優秀な営業担当者が追加されていたら」と別世界を思い描くことではないのです。同じ時期、同じ市場、同じ商品、同じ販売条件をできる限り保ち、キャンペーンの有無だけを変えた未来を考えます。

経営会議で求められているのは、過去を言い当てる物語ではありません。観察できなかったもう一つの未来に照らして、今回の施策がどれだけの差を生んだのかを考えることです。

因果推論が探しているのは、過去の説明ではない。同時には見ることのできなかった、もう一つの未来である。

在庫が減っていても、会社は損をしているかもしれない

キャンペーンをしなかった場合の販売数について、三つのシナリオを考えてみます。実際の販売数は、どのシナリオでも4,000個です。違うのは、観察できなかった「施策なし」の販売数だけです。

  • 施策なしでは1,000個だった場合:増分効果はプラス3,000個

  • 施策なしでは3,000個だった場合:増分効果はプラス1,000個

  • 施策なしでは4,500個だった場合:増分効果はマイナス500個

三つ目のシナリオでは、在庫は実際に減っています。それでも、キャンペーンは本来なら得られた販売を500個減らしたことになります。例えば、値下げによって商品の価値認識を損ねた、既存顧客がキャンペーン終了後まで購入を待った、販売現場が別の商品より製品Xを優先した結果、全体の提案力が落ちた、といったことが考えられます。

4,000個で割ると、コストも見誤る

中央のシナリオを使い、投資採算を考えてみます。キャンペーンの広告費などが300万円だったとします。4,000個すべてを施策効果とみなせば、1個当たりの販促費は750円です。ところが、何もしなくても3,000個売れていたなら、真の増分は1,000個です。販促費だけでも、増分1個当たり3,000円になります。

さらに、会社負担で1個当たり1,000円を値下げしたとします。キャンペーンなしでも通常価格で買ったはずの3,000個にも値引きが適用されるため、300万円の粗利が失われます。増分1,000個が回収すべき負担は、販促費300万円と既存需要への値引き損失300万円を合わせた600万円です。つまり、増分1個当たり6,000円以上の値引き後粗利がなければ、このキャンペーンは利益を増やしません。増分分の値引きは、ここでいう「値引き後粗利」にすでに反映されているため、重ねて加算しません。

もっとも、利益が減るから直ちに失敗だとは限りません。滞留在庫には、保管費、資金の固定、陳腐化、将来の廃棄や評価損といった負担があります。それらを避けるためなら、目先の粗利を削ってでも在庫を減らす合理性があります。何を目的とする施策なのかによって、評価すべき成果は変わります。

問題は値下げそのものではありません。4,000個すべてをキャンペーン効果とみなし、増分効果と採算性を過大評価したまま、同じ施策へ追加投資することです。

見るべきなのは、施策後に売れた数ではない。その施策だけが増やした数と、その増分が回収すべきコストである。

KPIは経営管理の道具であり、因果関係の証明ではない

施策効果を説明するとき、企業では前月比、前年同月比、販売計画比、予算達成率、他部門との比較などが使われます。これらは、どれも重要な指標です。前年比を追わず、予算との差も見ない経営は成り立ちません。

ただし、KPIと因果効果は答えている問いが違います。前年比は「業績が以前より改善したか」を示します。計画比は「目標に対してどこまで進んだか」を示します。部門間比較は「どこに差があるか」を示します。一方、因果効果が答えようとするのは、「その変化のうち、今回の施策が生み出した部分はどれだけか」です。

前年同月より20%売上が増えていても、同じ市場全体が30%伸びていれば、自社の施策は相対的にマイナスだった可能性があります。反対に、前年比で売上が減っていても、市場全体がさらに大きく縮小していたなら、施策が下落を食い止めたのかもしれません。

販売計画も、施策をしなかった未来そのものではありません。計画は、達成したい意思や組織目標を含みます。需要予測は、施策前に作成され、前提と精度が検証されていれば反実仮想を考える手掛かりになります。しかし、「予測との差」がそのまま施策効果になるわけではありません。予測誤差と施策効果を分ける必要があります。

KPIを否定する必要はありません。管理指標として使うのか、原因を特定する証拠として使うのかを分ければよいのです。現在地を確認することと、そこへ至った原因を知ることは、経営に必要な別々の仕事です。

KPIは「会社がどこにいるか」を示す。しかし、「何が会社をそこへ動かしたか」まで自動的に示すものではない。

なぜ、分かりやすい成功物語が選ばれるのか

ここまでの話は、理屈としては単純です。施策をしなかった場合を考えなければ、施策効果は分からない。それでも私たちは、施策の後に数字が改善すると、「施策が効いた」と言いたくなります。

一つの理由は、見えるものと見えないものの非対称性です。目の前には4,000個という具体的な結果があります。一方、キャンペーンをしなかった場合の販売数は見えません。人は、見える結果に強く引かれます。結果を知った後では、その結果が予見できたように感じやすくもなります。

結果をもとに過去の判断の質を評価してしまう傾向は「結果バイアス」と呼ばれます[3]。また、結果を知った後で「そうなると思っていた」「起きるべくして起きた」と感じる傾向は「後知恵バイアス」として研究されてきました[4]。良い結果が出れば、判断も良かったように見えます。しかし、妥当な判断でも偶然悪い結果になることがあり、雑な判断でも運よく成功することがあります。

さらに、企業では個人の心理だけでなく、組織内の利害が重なります。施策を提案した現場は、自分たちの努力が成果につながったと評価されたい。承認した経営陣も、自らの資源配分が正しかったことを確認したい。次の予算を決めるため、会議では「結局、成功なのか失敗なのか」という明快な結論が求められます。

その二つの期待が重なると、「キャンペーン期間中に4,000個売れた」という事実は、「キャンペーンによって4,000個売れた」という物語へ変わります。誰かが意図的に数字を偽っているとは限りません。現場と経営の双方にとって受け入れやすい説明が、組織の中で補強されていくのです。

これは、現場だけを教育すれば解決する問題ではありません。経営側が確実な説明だけを求めれば、現場は不確実性を消した報告をつくります。意思決定者自身も、どのような報告を好み、どのような問いを投げているかを振り返る必要があります。

分かりやすい成功物語は、評価されたい現場と、判断を正当化したい経営によって共同生成されることがある。

経営者が施策効果を聞くときの「五つの問い」

では、経営会議でどのように聞けばよいのでしょうか。高度な統計手法を知らなくても、次の五つを確認するだけで、観察事実と因果的な主張を分けやすくなります。

  1. 実際に確認できた事実は何か
    「期間中に4,000個売れ、在庫が6千個になった」までは観察事実です。

  2. どこからが因果関係の推定か
    「キャンペーンによって4,000個売れた」は、事実ではなく推定です。

  3. 何もしなかった場合、どうなっていたと考えているか
    報告の中に暗黙に置かれている反実仮想を、言葉と数字で示してもらいます。

  4. 同じ時期に、ほかに何が変わったか
    季節、競合、価格、顧客構成、供給状況、大口注文など、別の説明を確認します。

  5. この推定が外れたら、どの資源配分が影響を受けるか
    追加予算、横展開、人員配置への影響を確認し、次に何を検証すれば判断を更新できるかまで考えます。

もちろん、問い3や問い4について、最初から精緻な数字が出なくても構いません。

「前年同期間の実績から、キャンペーンを実施しなくても約3,000個は売れたと仮定しています」「競合の動向はまだ確認できていません」といった形で、置いている仮定と未確認事項を分けて共有できるだけでも前進です。

反実仮想を考えることは、その場で正解を言い当てることではありません。何を根拠にどの数字を置き、何がまだ分からないのかを、会議の共通認識にするところから始まります。

ただし、これは現場を詰問するための質問ではありません。「証明できないなら報告するな」と求めれば、現場は不確実性を隠すようになります。経営側が求めるべきなのは、100%の証明ではなく、事実、推定、前提、未確認事項を分けた報告です。

報告をどう書き換えるか

書き換え前の報告は、次のようなものでした。

「販促キャンペーンによって、製品Xの在庫を4,000個削減した」

これを、次のように書き換えます。

「キャンペーン期間中に製品Xを4,000個販売し、在庫は1万個から6千個へ減少した。前年同期間の実績から、キャンペーンを実施しなくても約3,000個は売れたと仮定し、現時点の増分効果を約1,000個と見積もっている。ただし、季節需要や競合欠品の影響はまだ分離できていないため、この推定は暫定的である。横展開の判断に向け、比較可能な対象と追加検証方法を整理する」

後者は、弱い報告ではありません。観察できた事実と置いている仮定を分け、暫定的な増分効果を示したうえで、何が未確認で、次に何を確かめるかまで明らかにしています。むしろ、3,000万円の追加投資を検討する経営陣にとっては、こちらの方が意思決定に耐えられる報告です。

不確実性を開示した人が評価を下げ、断言した人が評価される組織では、誰も「まだ分かりません」と言わなくなります。不確実性を許容することと、曖昧な報告を許すことは違います。分からない範囲、置いた仮定、次の検証行動を明確にするところまで責任を求める。そのうえで、不確実性が残ること自体は責めない。この境界をつくるのは、経営側の仕事です。

経営が「確実な報告」だけを評価すれば、現場は確実性を発見するのではなく、確実そうな物語を製造するようになります。反対に、推定の限界を誠実に示せる組織は、誤った成功体験を全社へ拡大する前に立ち止まれます。

不確実性の開示は、責任の回避ではない。次の判断を誤らせないための経営情報である。

原因を断言する前に、次の投資を考える

冒頭の経営会議に戻りましょう。「何もしなかった場合、何個売れていたのか」という問いに、すぐ答えられる人はいませんでした。だからといって、キャンペーンを失敗と決めつける必要も、横展開をすべて止める必要もありません。

経営陣が確認すべきなのは、4,000個という観察事実、キャンペーンなしの基準値、季節需要や競合欠品の影響、販促費と値引きによる採算、そして追加投資をどの範囲まで可逆的に試せるかです。必要であれば、ランダム割り付けによるA/Bテストで対象を比較する、過去の類似条件を探す、小規模な追加検証を行うといった方法があります。具体的な方法は、この連載の後半で扱います。

因果推論は、経営判断を止めるためのものではありません。何が分かり、何がまだ分からないかを区別し、限られた経営資源を次にどこへ投じるかを考えるためのものです。完全な確実性を待っていては、経営はできません。しかし、見えている数字だけに原因を語らせる必要もありません。

自分が承認してきた施策のうち、何もしなくても同じ結果になっていたものは、どれだけあったのだろうか。

まとめ:見えている数字と、見えなかった未来を分けて考える

ここまで、「売上が上がった」「在庫が減った」という結果を、そのまま施策の効果とみなしてよいのかを考えてきました。

今回のポイントを整理すると、次のようになります。

  • 「事実」と「推定」の分離:「期間中に4,000個売れた」は事実ですが、「キャンペーンによって4,000個売れた」は推定です。

  • 「反実仮想」の想定:施策の効果を知るには、「何もしなかった場合にどうなっていたか」を考える必要があります。

  • KPIと因果効果の峻別:前年比や計画比は経営管理に必要ですが、それだけで施策の効果を証明できるわけではありません。

  • 増分ベースでの採算評価:施策後の販売総数ではなく、その施策だけが増やした数と、その増分が回収すべきコストで判断します。

  • 不確実性を開示できる組織づくり:事実、推定、前提、未確認事項、次の検証行動を分けて示せる環境を、経営側がつくります。

重要なのは、「施策が効いた」と断言しないことではありません。

断言する前に、その判断がどのような反実仮想に支えられているのかを確認することです。

経営は、完全な情報が揃うまで待つことはできません。不確実性が残るなかでも、予算を配分し、人を動かし、次の一手を決める必要があります。だからこそ、因果推論は経営判断を遅らせるための学問ではなく、どこまで分かっているのか、どこから先が仮定なのかを整理するための補助線になります。

私自身、在庫、生産、納期といった数字を扱うなかで、数字が改善した理由を一つに決めたくなる場面があります。しかし、原因を早く決めることと、正しく決めることは同じではありません。少なくとも、大きな追加投資や全社展開を決める前には、

「何もしなかった場合にも、同じ変化は起きていなかったか」

という問いを、一度は会議の中に置く必要があるのだと思います。

それでも私たちは、目の前に見える結果へ引き寄せられ、起きなかった未来を遠ざけてしまいます。しかも、その傾向は個人の思い込みだけでなく、評価、予算、責任、社内政治と結びつくことで、組織全体の成功物語へ変わっていきます。

次回は、なぜ人や組織が反実仮想を考えようとしないのか、そして複数の要因を単純な成功・失敗の物語へ変えてしまうのかを、行動経済学と組織力学から考えていきます。

今回はここまでとします。 最後までお読みいただき、ありがとうございました。

参考文献

[1]Rubin, D. B.(1974)“Estimating Causal Effects of Treatments in Randomized and Nonrandomized Studies.” Journal of Educational Psychology, 66(5), 688–701. DOI

[2]Holland, P. W.(1986)“Statistics and Causal Inference.” Journal of the American Statistical Association, 81(396), 945–960. DOI

[3]Baron, J. & Hershey, J. C.(1988)“Outcome Bias in Decision Evaluation.” Journal of Personality and Social Psychology, 54(4), 569–579. DOI

[4]Fischhoff, B.(1975)“Hindsight ≠ Foresight: The Effect of Outcome Knowledge on Judgment under Uncertainty.” Journal of Experimental Psychology: Human Perception and Performance, 1(3), 288–299. DOI

〖週末特別コラム〗「作れる」だけでは産業にならない ――中国「電子情報製造業・十五五」に見る、“使われるまで”の設計

皆さん、こんにちは。

9月15日、中国の工業情報化部と国家発展改革委が、「電子情報製造業発展・十五五計画」を公表しました。

2030年までに、一定規模以上の電子情報製造業の売上高を30兆元超へ。研究開発投資強度は3.5%。

数字だけを見ると、まず目に入るのはこの規模感です。

今回の記事を書くきっかけになったのは、工業情報化部が公開した公式解説でした。

工業情報化部「電子情報製造業発展・十五五計画」解説

ただ、読み進めていて、私が一番気になったのは「30兆元」という数字ではありませんでした。

半導体でもありません。

むしろ気になったのは、その周辺です。

「30兆元」の先に見えたもの

今回の計画では、集積回路だけではなく、電子部品、電子材料、スマートセンサー、電子製造装置、計測機器、先進計算、消費電子、ソフトとハードの協調、地域配置、国際協力まで、かなり広い範囲が扱われています。

工業情報化部の解説では、計画全体を「筑基・提質・育新・治理」の4つの方向から整理し、17項目の重点任務を設定しています。

2030年の目標にも、ハードウェア、ソフトウェア、標準、特許の協調や、地域配置、国際協力の進展まで含まれています。

そこで一つ、引っかかりました。

これは「何を作るか」だけを決めた計画ではないのではないか。

半導体を作る。

AI端末を作る。

高性能なセンサーを作る。

それだけなら、技術開発の計画として理解できます。

しかし実際には、その周囲にある部品、材料、製造装置、計測、ソフト、標準、そして地域や海外との接続まで入っています。

つまり、「作るもの」だけではなく、その技術が産業として成立する条件まで視野に入れているように見えます。

では、なぜそこが気になったのでしょうか。

考えてみると、私たちは普段、少し逆の見方をしているのかもしれません。

「完成品」だけを見ていると、見えなくなるもの

人型ロボットが歩けば、ニュースになります。

新しいAIスマートフォンが登場すれば、性能が比較されます。

半導体なら、処理性能や消費電力、プロセス世代が話題になります。

完成品は見えます。

写真にもできます。

数字でも比較できます。

一方で、電子材料、コネクタ、センサー、検査装置、標準規格、認証といったものがニュースの主役になることは、それほど多くありません。

行動経済学には顕著性(salience)という考え方があります。

人は、目立つもの、分かりやすいもの、印象に残りやすいものへ注意を向けやすい。

製造業を見るときにも、同じことが起きているのではないでしょうか。

AIやロボットの完成品には注目する。

しかし、それを成立させている無数の部品や材料、設備、標準には、それほど注意を払わない。

ところが製造業では、

普段目立たないものほど、なくなったときに重要性が分かる。

ということがあります。

数円、数十円の小さな部品が入らないだけで、数万円、数十万円の商品が出荷できない。

検査装置がなければ、作れても品質保証ができない。

材料が変われば、同じ図面でも同じ品質にならない。

完成品だけを見ていると、産業の本当の構造を見誤ることがあります。

半導体だけでは、産業は動かない

半導体は重要です。

ただ、半導体だけでは製品は完成しません。

電子部品があります。

電子材料があります。

センサーがあります。

製造装置があります。

測定・検査があります。

それらを制御するソフトウェアもあります。

今回の計画でも、「産業基礎能力」の中に、集積回路だけではなく、電子部品・電子材料、スマートセンサー、電子専用設備・計測機器、フォトニクスなどが並べられています。

さらに「整機・システム競争力」では、産業チェーンのレジリエンス、先進計算、消費電子、ソフト・ハード協調まで対象になっています。

ここで重要なのは、どれが主役でどれが脇役か、という話ではないと思います。

産業は、多数の補完関係で成立しています。

高性能な半導体があっても、対応する基板や電源がなければ使えません。

優れたセンサーがあっても、データを処理する仕組みがなければ価値になりません。

ロボットがあっても、工程側が受け入れられる状態になっていなければ導入できません。

一つひとつの技術が優れていることと、

それらが一つの産業として機能することは、同じではありません。

そして、もう一つあります。

仮に必要な技術がすべて揃い、「作れる」状態になったとしても、まだ終わりではありません。

その製品が実際に使われるかどうかは、また別の問題だからです。

「作れる」と「使われる」の距離

技術者から見れば、

「動くものができた」

というのは大きな到達点です。

しかし、使う側から見ると、そこがスタート地点になることがあります。

例えば工場に新しい設備を入れるとします。

性能が20%高い。

価格も下がった。

省エネにもなる。

それだけで採用されるでしょうか。

現場では、別の質問が出てきます。

既存設備につながるのか。

今の治具は使えるのか。

品質は保証できるのか。

故障したら誰が直すのか。

交換部品は何年供給されるのか。

作業者への教育は必要なのか。

導入中に生産を止める必要はあるのか。

そして、もし問題が起きたら、誰が責任を持つのか。

技術そのものの性能以外に、大量の条件があります。

工業情報化部の解説でも、今回の計画は「新技術・新製品の融合応用」を重視し、AIのハードウェア基盤だけでなく、業界向け電子技術のデジタル化・インテリジェント化との融合を重点任務に置いています。

ここに私は、

技術開発のゴールは、「作れる」ことではなく「使われる」ことなのではないか。

という問いを感じます。

製品が完成することと、現場が採用すること。

この間には、思っている以上に大きな距離があります。

「変えない」ことが合理的になるとき

ここで、行動経済学の話に戻ります。

新しい設備を導入すれば、生産性が5%上がるかもしれない。

しかし、新しい設備が原因でラインが半日止まるかもしれない。

この二つを、現場は同じ重さでは見ません。

行動経済学でいう損失回避です。

人は、同程度の利益を得る喜びより、損失を被る痛みを強く感じる傾向があります。

さらに、現状を変えない選択を取りやすくなる現状維持バイアスも関係します。

ただ、製造現場の場合、これを単に「人は変化を嫌うから」と説明するのは少し違うと思っています。

なぜなら、現場では成功と失敗の評価が非対称だからです。

新設備を入れて生産性が5%上がった。

これは「改善」として評価されるかもしれません。

一方、新設備が原因でラインを止めれば、生産遅延、納期遅延、緊急対応、品質問題、場合によっては顧客対応まで発生します。

担当者にとって、

成功したときのプラスより、失敗したときのマイナスの方がはるかに大きい。

そういう職場は珍しくありません。

そう考えると、現状維持は単なる心理的バイアスではありません。

制度や評価、責任の構造まで考えれば、変えないことが担当者にとって合理的な選択になる場合もあります。

だからこそ、認証、互換性、標準化、導入実績、品質保証、アフターサービス、安定供給、責任分界といった、一見地味な要素が重要になります。

新しい技術を採用する側が感じる、

「失敗したらどうするのか」

という不安を減らすからです。

“使われるまで”を設計するとは、採用する側の摩擦を下げることでもある。

私はそう考えています。

技術の“周辺”が、産業をつくる

ここまで考えてから、もう一度「電子情報製造業・十五五」を見ると、最初とは少し違って見えてきます。

集積回路を育てる。

電子部品を育てる。

AI端末を作る。

それだけではありません。

今回の計画では、電子部品・材料、製造装置・計測、ソフト・ハード協調、標準・特許、産業ガバナンスなども対象になっています。

また、計画の実施を支える仕組みとして、政策調整、教育・科技・人材、金融支援、業界団体による需給マッチングやサービスなども挙げられています。

つまり、

技術そのもの

だけではなく、

その技術が使われるための周囲の条件

まで政策対象にしている。

少なくとも、計画文書からはそう読むことができます。

ただし、ここは分けて考える必要があります。

計画に書かれていることと、実際に計画通り産業が形成されることは別です。

標準化を掲げれば標準が普及するわけではありません。

産業集積を計画すれば企業間連携が自動的に生まれるわけでもありません。

投資が増えれば、需要まで同時に増えるとも限りません。

したがって、今後見るべきなのは、政策目標そのものだけではなく、実際の投資、企業行動、需要、技術採用、生産性などです。

ただ、少なくとも今回の計画の射程を見ると、

技術を作る
↓
周辺を整える
↓
実際に使われる状態を作る

というところまでを対象にしていることは興味深いと思います。

工場の外側にある競争力

さらに今回の計画は、「何を作るか」だけではなく、「どこで作るか」という話にも広がっています。

17の重点任務には、産業の地域協同配置の最適化と、対外開放協力の新しい構図の構築も含まれています。

これは製造業で考えると、それほど不思議な話ではありません。

どれだけ良い技術があっても、近くにサプライヤーがいなければ調達リードタイムが長くなります。

人材がいなければ、工場は動きません。

物流インフラが弱ければ、在庫を多く持つ必要があります。

顧客から遠ければ、需要変化への対応速度も落ちます。

製造業は、一つの工場だけでは完結しません。

サプライヤー
+ 生産拠点
+ 物流
+ 人材
+ 市場
+ 技術

がつながって、初めて回ります。

ここは、前日の記事で書いた「部分最適の総和は、全体最適にはならない」という話にも少しつながります。

behavioral-economics.hatenablog.com

昨日は、営業、調達、生産、在庫、物流という企業の中の全体最適を考えました。

今回は、それよりカメラを引いて、企業、サプライヤー、地域、物流、人材、市場という産業全体を見ています。

スケールは違いますが、

一つの技術、一つの企業、一つの工場だけを最適化しても、産業全体が動くとは限らない。

という点では、よく似ています。

「作る」から、「使われる」まで

今回の計画を読んでいて考えたのは、中国の産業政策そのものだけではありません。

企業にも同じことが言えるのではないか、と思いました。

新しい技術を作る。

新しい製品を開発する。

性能を上げる。

原価を下げる。

もちろん、どれも重要です。

ただ、それだけでは売れないことがあります。

誰が使うのか。

なぜ今の商品から切り替えるのか。

切り替えると、何が失われるのか。

導入時に何が必要なのか。

誰が教育するのか。

故障したとき、誰が支えるのか。

供給は継続できるのか。

そこまで考えて初めて、技術は「商品」になり、商品は「事業」になっていきます。

これはBtoBでは特に重要だと思います。

性能が10%高いから買う。

価格が5%安いから切り替える。

実際の意思決定は、それほど単純ではありません。

新しいサプライヤーに変える。

新しい設備に変える。

新しいシステムに変える。

そのたびに、見えないスイッチングコストが発生します。

だから企業側には、

「なぜうちの製品を買わないのか」

ではなく、

「相手が今の製品から変えられない理由は何なのか」

と考える視点が必要になります。

ここには、行動経済学が扱ってきた損失回避や現状維持バイアスと、製造業が扱ってきた品質保証、標準化、サプライチェーン、サービス設計がつながります。

一見、別の話に見えます。

しかし実際には、

人が新しいものを採用する条件をどう作るか

という同じ問題を、別の角度から見ているのだと思います。

今回の「電子情報製造業・十五五」で私が気になったのは、30兆元という巨大な数字でも、特定の技術分野でもありませんでした。

むしろ、

材料、部品、設備、ソフト、標準、利用、地域、国際連携までを一つの産業として見ようとしていること

でした。

「作れる」と「使われる」の間には、技術だけでは埋まらない距離があります。

その距離を埋めるのが、標準、供給網、サービス、利用シーン、立地、そして導入する側の意思決定まで含めた「仕組み」なのだと思います。

「作れる」だけでは産業にならない。

企業にとっても、これから問われるのは、

良いものを作る能力だけではなく、“使われるまで”を設計する能力

なのかもしれません。

今回はここまでとします。

最後までお読みいただき、ありがとうございました。

参考資料