GeoXで地域実験をどう設計するか|MMMの予算配分を因果検証で補正する手順

MMM(マーケティング・ミックス・モデリング)を入れて予算配分の提案が出るようになったものの、「この数字をそのまま信じて予算を動かしてよいのか」で手が止まっている広告主は少なくありません。MMMは過去の観測データから各チャネルの貢献を推定する仕組みなので、広告費と売上が同じ季節に一緒に動いていると、どちらが原因なのかを取り違えることがあります。その弱点を埋めるのが、地域単位で広告を意図的に動かして純増効果を測る地域実験です。
Googleは2026年9月10日の公式ブログ「Drive profitable growth with new data and measurement tools」で、年初からベータ提供していたMeridian GeoXを、Meridianの中で全世界向けに一般提供したと発表しました。GeoXはオープンソースの地域実験ライブラリで、実験を単独で回すことも、実験結果をMMMに取り込んで精度を高めることもできると説明されています。つまり、MMMと因果検証を同じ枠組みでつなぐ道具が、正式に使える段階に入ったということです。
この記事は、MMMの実装手順ではなく、GeoXで地域実験をどう設計し、その結果でMMMの予算配分判断をどう補正するかに絞った実務ガイドです。仕様はGoogle for DevelopersのMeridian GeoXページと公開リポジトリで確認できた範囲だけを断定し、確認できなかった点は未確認と明記します。内容は2026年9月24日時点の公開情報にもとづいています。
この記事の要点
- Meridian GeoXはGoogleのオープンソース地域実験ライブラリで、2026年9月10日の公式ブログでベータを終えて一般提供に移行したと発表された
- 設計の型はholdback・go-dark・heavy-upの3つで、「何を判断したいか」から逆算して選ぶ。MMM校正が目的なら広告ゼロとの差を測る型が相性がよい
- 地域の割り付けと期間は検出力から決める。日本では都道府県の規模差と越境流入の扱いが設計の成否を分ける
- 実験結果はMeridianのCalibrationBuilderで事前分布に変換し、出稿規模・実施時期・実験期間のずれを補正してから予算配分に反映する
- 必要な地域数や最短期間の公式な下限値は、2026年9月時点で公開ドキュメントから確認できていない
GeoXの地域実験はMMMの推定を因果で裏づける検証手段である
GeoXの地域実験は、MMMが相関から推定したチャネル効果を、実際に広告を動かした結果で裏づけるための検証手段です。MMMが「過去のデータから見るとこのチャネルのROIはこのくらい」と推定するのに対し、地域実験は「このチャネルを止めたら、あるいは増やしたら、どれだけ成果が変わったか」を直接測ります。両者は競合する手法ではなく、推定と検証という役割分担で組み合わせるものです。
Meridian GeoXとは何を指す言葉か
Meridian GeoXとは、地域単位で広告出稿を操作し、操作した地域とそうでない地域の成果差から広告の純増効果(インクリメンタリティ)を測るための、Googleが公開しているオープンソースのライブラリです。Google for Developersでは、透明性が高く費用対効果に優れ、特定の媒体に依存しない地域実験を実行するためのグローバルなソリューションと説明されています。Cookieや個人単位の計測に頼らないため、プライバシー規制の影響を受けにくい点も特徴です。
なぜMMMに実験が必要なのかは、MMMの推定の仕組みから説明できます。MMMは広告費と成果の同時の動きから効果を推定するため、繁忙期に広告費を積み増す運用を続けていると、需要の山による売上増まで広告の効果として計上してしまいます。地域実験は、同じ時期に広告がある地域とない地域を並べて比べるので、季節や景気の影響を両方の群から打ち消せます。この「交絡を切り離せる」性質が、実験をMMMの校正材料として使う根拠です。
公開リポジトリの説明では、パッケージ名はmeridian-geoxで、GeoX単体ならPython 3.10以上、Meridian MMMと組み合わせる場合はPython 3.11以上が要件とされています。ライセンスはApache 2.0です。管理画面にボタンが追加される類いの機能ではなく、分析担当者がPythonとColabノートブックで扱うライブラリだという点を最初に押さえておく必要があります。
媒体内のリフト測定との違い
GeoXの最大の違いは、媒体をまたいで同じ物差しで効果を測れることです。Google広告やMetaが提供するリフト測定は、その媒体の配信ログの中でテスト群と対照群を分けるため、他媒体への波及や、媒体の外で起きた購買までは捉えにくい構造があります。地域実験は、地域ごとの売上や問い合わせ件数といった事業側のKPIを使うので、テレビやオフライン施策を含めて比較できます。
その代わり、地域実験は設計の自由度が高い分だけ設計ミスの影響も大きくなります。地域の選び方、期間、同時期に走る他施策の扱いを誤ると、出てきた数字は因果効果ではなく地域差や季節差を拾っただけになります。GeoXの価値は分析の自動化よりも、設計の良し悪しを事前に比較できる点にあると考えたほうが実務では失敗しません。
2026年9月時点で確認できた提供状況
2026年9月10日付の公式ブログでは、Meridian GeoXは年初にベータとして導入され、今回Meridianの中で全世界向けに一般提供になったと書かれています。同じ記事では、Meridianのエージェント機能の強化や、指名検索の検索量をモデルに取り込む機能なども合わせて発表されました。GeoXは単独で実験に使うことも、結果をMMMに組み込むこともできる位置づけです。
一方で、日本語のドキュメントの有無や、日本の地域区分に合わせた設定例は、本稿執筆時点で確認できていません。海外メディアのPPC Landは、大規模広告主では他のオープンソース手法に比べて31%超の予算削減が見込めるというGoogle側の数値を紹介していますが、同メディア自身が独立した検証はまだないと注記しています。自社の判断材料にする前に、自社データで検証する前提で受け取るべき数値です。
純増効果の考え方や、リフト測定・地域実験・MMMそれぞれの位置づけを先に整理しておきたい場合は、以下の記事が土台になります。
設計の型はholdback・go-dark・heavy-upを判断目的で使い分ける
地域実験の型は、判断したいことが「新施策を始めるか」「既存施策を止めるか」「既存施策を増やすか」のどれかで決まります。GeoXは公式ページでholdback・go-dark・heavy-upの3つの設計に対応すると明記しており、型ごとに測れる効果の意味が異なります。どれを選ぶかで、得られる数字の使い道も、MMMへの取り込みやすさも変わります。
3つの型が答える問いの違い
holdbackは、新しく始める施策を一部の地域だけで配信せず、配信した地域との差を測る型です。go-darkは、すでに走っている施策を一部の地域で止め、止めたことで失われる成果を測ります。heavy-upは、一部の地域だけ出稿を増やし、追加投資でどれだけ成果が上乗せされるかを測る型です。前の2つは「広告がある状態とない状態の差」、heavy-upは「今の出稿量からの上積み」を測っていることになります。
この違いは、MMMと組み合わせるときに決定的な意味を持ちます。Meridianのドキュメントは、限界的な上積みを測る実験は、広告費ゼロを反実仮想とするMMMのROIと推定対象がずれると注意喚起しています。つまり、MMMの校正が主目的ならholdbackかgo-dark、増額判断そのものが目的ならheavy-upという使い分けが基本になります。
支援の現場で最初の実験として相談が多いのはgo-darkです。すでに出稿しているチャネルの効果に疑問がある場合、止めて成果が落ちるかどうかを見るのが最も直感的で、社内説明もしやすいからです。ただし指名検索広告のように、止めると自然検索の流入に置き換わるだけのチャネルでは、止めた地域の成果がほとんど落ちないことがあります。それ自体が「このチャネルの純増効果は小さい」という重要な発見になります。
| 設計の型 | 答える問い | MMM校正との相性 | 主なリスク |
|---|---|---|---|
| holdback | 新施策を始めるべきか | 広告ゼロとの差を測るため相性がよい | 対照地域で新施策の機会を失う |
| go-dark | 既存施策を止めても成果は落ちないか | MMMのROIと推定対象がそろいやすい | 停止地域で売上が一時的に落ちる |
| heavy-up | 増額すれば成果は伸びるか | 限界効果のため推定対象がずれる | 増額分の予算が先に必要になる |
multi-cellで複数の問いを一度に検証する
GeoXの特徴のひとつが、複数の処置群を共通の対照群と比べるmulti-cell実行に標準で対応している点です。公式ページでは、同じ調査の中で複数の処置を共通の対照群と比較することで、費用と時間を減らせると説明されています。たとえば動画広告を止める地域群、検索広告を止める地域群、どちらも止めない地域群を同時に置けば、2本の実験を別々に回すより対照群の数を節約できます。
ただし、セルを増やすほど1セルあたりの地域数は減り、検出力は下がります。日本のように分割単位の数が限られる市場では、セルは2つまでに抑えるのが現実的です。欲張って3つ4つの施策を同時に検証しようとすると、どのセルも有意差が出ないまま実験費用だけが消えるという結果になりやすくなります。
Google広告の管理画面で完結するテストとの違いを押さえておくと、どの問いを地域実験に回すべきかの切り分けがしやすくなります。検索広告の効果検証については、以下の記事で整理しています。
地域の割り付けと実験期間は検出力から逆算して決める
地域の割り付けと期間は、「どのくらいの差なら検出できるか」という検出力から逆算して決めます。広告の効果が売上全体の数パーセントしかないのに、地域ごとの売上のばらつきがそれより大きければ、どれだけ丁寧に分析しても効果は見えません。GeoXはこの検出力を上げるために、時系列回帰(TBR)と層別サンプリングを組み合わせる設計を採っています。
GeoXが用意している設計の支援
GeoXの導入ページでは、利用の流れとして、MMMからの実験候補の提示、過去データの準備、設計の生成、実施、結果データの収集、分析と推論、MMMへの校正という段階が示されています。データ準備では、地域別の日次KPIの時系列が必要で、予算を増減する設計では地域別の日次広告費も求められます。設計の段階では、アルゴリズムが複数の候補設計を順位づけして提示する仕組みです。
Googleの研究論文「Meridian GeoX: An Open-Source Framework for Precision and Efficiency in Geo Experiments」では、TBRに加えて合成コントロールや合成差分の差分法、データにもとづく層別サンプリング、設計を考慮したプラセボ推論が中核の手法として挙げられています。地域を無作為に割り振るのではなく、似た地域どうしを層に分けてから割り付けることで、偶然の偏りを小さくする考え方です。
日本で地域を切るときの注意点
日本で地域実験を組む場合、最初に突き当たるのは分割単位の少なさと規模の偏りです。都道府県単位なら47しかなく、しかも東京都の売上が他県の何倍にもなるケースが珍しくありません。巨大な1地域が処置群と対照群のどちらに入るかで結果が大きく振れるため、首都圏を実験対象から外す、あるいは市区町村単位まで細かく切るといった判断が必要になります。
もうひとつの落とし穴が越境です。埼玉や神奈川に住む人が東京で広告に接触して購入する、ECの配送先住所と広告接触地が一致しないといったずれは、処置の効果を対照地域に漏らします。支援の現場では、KPIをどの住所で集計するのか、配信地域の判定がIPベースでどの程度ずれるのかを詰めないまま実験を始めてしまい、結果を読み直すことになるケースが多く見られます。
地域割り付け前に確認したいこと
- KPIを地域別・日別で取り出せるか(EC受注の配送先、店舗売上、問い合わせフォームの住所など)
- 規模が突出した地域をどう扱うか(除外、分割、層の固定)
- 通勤圏や配送圏をまたぐ越境の影響がどの程度ありそうか
- 実験期間中に地域限定のキャンペーンや出店・閉店の予定がないか
- 各媒体の地域ターゲティングで同じ地域定義を再現できるか
実験前の期間で割り付けの妥当性を確かめる
割り付けが決まったら、実験を始める前に、過去の期間で処置群と対照群の推移がそろっているかを必ず確かめます。広告をまだ動かしていない期間に両群の差が大きくぶれるなら、その割り付けでは広告の効果とノイズを見分けられません。海外メディアPPC LandのGeoX解説でも、従来のマッチドマーケット法は学習データへの当てはまりに頼るためノイズを過小評価しやすいと指摘されており、GeoXの層別サンプリングがデータ外での検証を取り入れているのもこの問題への対処です。
実務では、過去の同じ長さの期間に「効果ゼロの架空の実験」を当てはめ、どの程度の見かけの差が偶然で出るかを確認しておくと安心です。この見かけの差より小さい効果は、本番の実験でも検出できません。広告の想定効果がこの幅に埋もれるようであれば、地域数を増やすか、期間を延ばすか、あるいは実験自体を見送るかを、始める前に判断します。
期間とクールダウンの考え方
実験期間は、少なくとも購買検討の1サイクルを含む長さが必要です。高単価商材やBtoBのように検討期間が長い商材では、広告を止めてもすぐには成果が落ちないため、短い実験では効果を過小評価します。GeoXでは実施後に任意のクールダウン期間を設けて、遅れて現れる効果を拾えるようになっています。
なお、必要な地域数や最短の実験期間について、GeoXの公開ドキュメントに一律の下限値は2026年9月時点で確認できていません。これは商材ごとのKPIのばらつきで答えが変わるためで、数字は自社の過去データで設計候補を比較して決めるものです。「2週間あれば十分」といった一般論をそのまま当てはめるのは避けるべきです。
実験結果はCalibrationBuilderで補正してからMMMの事前分布に入れる
地域実験の結果は、そのままMMMに入れるのではなく、Meridianの補正機能を通してから事前分布に変換します。実験は特定の期間・特定の出稿規模・特定の地域で測った値であり、MMMが推定する「モデル期間全体のチャネルROI」とは条件が違うからです。この条件の違いを埋めずに取り込むと、正しい実験結果がかえってMMMを歪めます。
CalibrationBuilderが行う補正の中身
Meridianのドキュメントによると、CalibrationBuilderはGeoXまたは一般的な実験の結果を登録し、出稿規模・実施時期・実験期間の3つの観点で点推定を調整しつつ不確実性を広げたうえで、複数の実験をベイズ更新で統合し、対数正規分布・ガンマ分布・正規分布のいずれかに当てはめて事前分布を作ります。作られた事前分布は、モデル設定にそのまま渡せる形で出力されます。
補正の考え方はそれぞれ明快です。広告効果は時間をかけて持ち越されるため、短い実験では長期の効果を取りこぼす可能性があり、期間の調整が入ります。実験時の日次出稿額とモデル期間全体の出稿額も比べられ、キャンペーン単位の実験をチャネル単位のMMMに入れる場合はチャネル全体の出稿水準と比較されます。さらに実験が古いほど現在の事業実態を反映しにくいとみなされ、新しい実験ほど重く扱われます。
| ずれの種類 | 放置した場合に起きること | 設計段階での手当て |
|---|---|---|
| 出稿規模のずれ | 小規模テストのROIを全体に当てはめて過大評価する | 実験時の日次出稿額を平常時に近づける |
| 実施時期のずれ | 古い実験が現在の配分判断を縛る | 主要チャネルは年1回を目安に再検証する |
| 実験期間のずれ | 持ち越し効果を取りこぼしROIを過小評価する | クールダウン期間を設けて遅延効果を拾う |
| 推定対象のずれ | 上積み効果を平均ROIとして扱ってしまう | 校正目的ならholdbackかgo-darkを選ぶ |
どのチャネルから実験すべきか
実験の優先順位は、MMMの推定が不確かで、かつ予算額が大きいチャネルから決めます。GeoXにはMeridianのチャネルの中から実験すべきものを推奨する機能があると公式ページに明記されており、事前分布の幅が広いチャネルほど、実験による校正の効果が大きくなります。予算が小さいチャネルを精密に測っても、配分全体への影響は限られます。
MMM側の前提整理やデータ要件、予算配分シナリオの作り方そのものは、この記事では扱いません。Meridianの実装から配分シナリオを回すまでの手順は、以下の記事で詳しく解説しています。
MMMと実験結果が食い違ったときの予算配分の補正手順
MMMと実験結果が食い違ったときは、どちらかを捨てるのではなく、食い違いの原因を先に特定してから配分を動かします。実験のROIがMMMより大幅に低い場合、MMMが季節性や他施策の効果をそのチャネルに誤って割り当てていた可能性があります。逆に実験のほうが高い場合は、実験期間中だけの特殊要因や、出稿規模の違いが効いていることを疑います。
食い違いを読み解く順番
最初に確認するのは、実験そのものの品質です。GeoXの導入ページでは、品質チェックを通過した実験の結果をMMMの校正に使う流れが示されています。対照地域と処置地域の実験前の推移がそろっていたか、実験中に地域限定の出来事がなかったかを見て、実験が信頼できると判断できてから初めて、MMMとの差を議論の俎上に載せます。
実験が信頼できる場合は、CalibrationBuilderで補正した事前分布を入れてMMMを再推定し、配分シナリオを作り直します。支援の現場で多いのは、指名検索やリターゲティングのように、もともと購入意欲の高い人に当たりやすいチャネルがMMMで過大評価されていたと判明するパターンです。再推定後の配分は一度に全額動かさず、変更幅を段階的に広げるほうが、想定外の落ち込みに気づきやすくなります。
配分を動かすかどうかの判断基準
配分を動かす判断は、実験の信頼区間の幅と、動かす予算額の大きさで決めます。信頼区間が広く、ゼロ効果もありうる結果なら、配分を大きく動かすより実験期間を延ばすか地域数を増やして再実験するほうが合理的です。信頼区間が狭く、MMMとの差が明確なら、校正後のシナリオに沿って配分を変更します。
校正後に確認すべき変化
校正後のMMMでは、実験したチャネルのROIだけでなく、他チャネルの推定がどう動いたかも確認します。あるチャネルの効果が実験で下方修正されると、その分の売上はベースラインや別のチャネルに再配分されるため、実験していないチャネルの評価が押し上げられることがあります。この連鎖を見落とすと、検証していないチャネルに予算を移すという逆効果の判断をしかねません。
そのため、校正で評価が大きく上がったチャネルは次の実験候補として記録しておき、年間の実験計画に組み込むのが望ましい運用です。MMMと地域実験を一度きりで終わらせず、推定と検証を交互に回す仕組みにできるかどうかが、予算配分の精度を継続的に高められるかの分かれ目になります。
この判断を社内だけで下すのが難しい場合は、第三者の視点で実験設計とMMMの前提を点検することも選択肢になります。ハーマンドットの無料相談では、現在の計測環境で地域実験が成立するかどうかの見立てからご相談いただけます。実験結果が出たあとの解釈こそ、社内の利害が絡みやすい工程です。
MMMの全体像や、広告以外の施策も含めて予算配分を最適化する考え方をあらためて確認したい場合は、以下の記事が参考になります。
GeoXの運用を内製するか委託するかは分析体制で決まる
GeoXを内製で回せるかどうかは、Pythonで地域データを扱える分析担当者と、媒体の地域設定を正確に再現できる運用担当者の両方がいるかで決まります。GeoX自体はオープンソースで利用料はかかりませんが、実験のたびに設計・配信設定・結果の解釈という3つの工程が発生します。どれか1つが欠けると、ライブラリがあっても実験は成立しません。
社内で詰まりやすい工程
最も詰まりやすいのは、分析側が出した地域割り付けを、複数の媒体の配信設定に正確に落とし込む工程です。分析担当は設計に、運用担当は日々の成果に目が向きやすく、実験期間中に運用担当が良かれと思って対照地域の入札を調整してしまうといった事故が起こります。実験期間中は対照地域の設定を凍結するルールを、事前に文書で合意しておくことが欠かせません。
もうひとつは、go-darkやholdbackで対照地域の成果が一時的に落ちることへの社内の合意形成です。営業部門や地域の責任者から配信再開を求められて実験が途中で崩れるケースは、支援の現場でも少なくありません。実験の期間と、失う可能性のある売上の見込みを、始める前に経営判断として確定させておく必要があります。
委託先に必ず確認すべきこと
- 設計の候補比較と検出力の見積もりを、実施前に書面で提示できるか
- 実験期間中の配信設定の凍結と変更ログの管理をどう担保するか
- 校正に使う実験の型と、MMMへの取り込み方を説明できるか
- 有意差が出なかった場合に、再実験か配分据え置きかを事前に決めた基準で判断するか
委託費用の考え方
地域実験を委託する場合の費用は、ライブラリの利用料ではなく、設計と分析にかかる人の工数で決まります。実験は数週間から数か月にわたり、設計・配信・分析・校正のそれぞれに専門性が必要になるため、通常の運用代行費に含めるのか、別途の分析費として見積もるのかを最初に確認しておくことが重要です。見積もりの内訳に実験設計と結果解釈の工数が明示されているかは、委託先の本気度を測る目安にもなります。
運用代行費の相場や手数料の内訳、見積もりで確認すべきポイントについては、以下の記事で詳しく整理しています。
まとめ:地域実験の価値は設計とMMM校正の一貫性で決まる
Meridian GeoXの一般提供によって、地域実験とMMMを同じ枠組みでつなぐ道具は正式に使える段階に入りました。ただし、ライブラリが自動で正しい答えを出してくれるわけではなく、判断目的に合った型の選択と、日本の地域事情に即した割り付けが成果を左右します。
- 型は判断目的で選ぶ。MMMの校正が目的ならholdbackかgo-dark、増額判断そのものが目的ならheavy-upを使う
- 地域と期間は検出力から逆算する。都道府県の規模差と越境の影響を実験前に洗い出し、公式な下限値がない前提で自社データから決める
- 実験結果はCalibrationBuilderで出稿規模・時期・期間のずれを補正してから事前分布に入れ、配分は段階的に動かす
まずは無料で広告アカウント診断を
ハーマンドットでは、各媒体のアカウント構造と計測設計を第三者の目で点検する無料診断を実施しています。MMMの推定をどこまで信じてよいか迷っている段階や、地域実験を始めたいが自社のデータで成立するのか分からないという段階でのご相談も歓迎しています。
診断では、地域別のKPIが取り出せる状態か、各媒体で同じ地域定義を再現できるか、どのチャネルから検証すべきかといった実験の前提条件を具体的に確認します。実験の設計に入る前の土台づくりから伴走できるので、社内に分析体制が整っていない場合でも安心してご相談ください。
初回相談は完全無料・所要時間30分・オンライン対応可能です。




