説明可能AI(XAI)とは?判断理由の見方と、説明を過信しないための注意点

説明可能AIの判断理由と限界を確認するイメージ

説明可能AIの判断理由と限界を確認するイメージ

説明可能AIは、AIの予測や判断について、人が理解できる形で根拠やふるまいを示すための技術・考え方です。 説明を読むときは、「この1件の予測を説明しているのか」「モデル全体の傾向を説明しているのか」を分けると整理しやすくなります。 本記事では需要予測の架空例を使い、代表的な手法、数値の読み方、説明だけでは判断できないことを解説します。掲載図は生成AIを用いて本記事用に作成した概念図です。

説明可能AIとは

説明可能AIは英語でExplainable AI、略してXAIと呼ばれます。特定の製品名ではなく、AIの出力や処理を人が理解できるようにする取り組みを指します。

たとえば、ある店舗の翌日の需要を「120個」と予測するAIがあるとします。担当者が知りたいのは数量だけとは限りません。「普段より多いのはなぜか」「入力した天気が間違っていないか」「この店舗にも使える予測なのか」といった疑問が残ります。

説明可能AIは、こうした確認を助けます。ただし、読みやすい説明を出すだけでは十分とはいえません。説明がモデルのふるまいを適切に反映していることや、使える条件を示すことも必要です。

米国国立標準技術研究所(NIST)は、説明を提供すること、受け手が理解できること、説明が処理を正しく反映すること、適用できる範囲を守ることの4つを原則として整理しています。NIST:Four Principles of Explainable Artificial Intelligence

店舗の担当者には予測を確認する材料、開発者にはモデルの問題を調べる材料が必要です。同じ説明でも、誰が何を判断するために読むかによって、適切な詳しさは変わります。

1件の予測と、モデル全体を分ける

説明の範囲は、大きく個別の予測とモデル全体の傾向に分けられます。前者は局所的な説明、後者は大域的な説明とも呼ばれます。

観点 個別の予測を説明する モデル全体の傾向を説明する
知りたいこと この店舗・この日の予測は、どの特徴に左右されたか 対象の店舗・期間では、どの特徴と予測がどう関係するか
需要予測での問い 明日の予測が120個になった理由は? 週末や天気は、対象データ全体でどの程度関係している?
確認する対象 ある1件の入力と出力 複数の入力、またはモデルの構造
役立つ場面 個別の予測確認や入力ミスの調査 モデルの傾向把握や比較
注意点 その1件の説明を全店舗へ広げない 全体の傾向がどの1件にも当てはまるとは限らない

1店舗の1日の予測と、複数店舗・期間の傾向を比較する模式図

*説明対象の範囲を示す独自の模式図。実データの分析結果ではありません。*

NISTの資料でも、個々の判断の説明と、モデル全体を捉える説明を分けています。複数の個別説明をまとめて、全体を見る方法もあります。NIST:説明手法の分類

たとえば、ある日の予測で「雨予報」が大きく寄与していても、年間の全店舗で天気が最も重要とは限りません。全体を見る場合は、どの店舗・期間・データを集計したのかまで確認します。

説明を得る方法には違いがある

説明しやすいモデルを選ぶ方法と、既存モデルに説明手法を適用する方法があります。後者のように、予測モデルを作った後から説明を与えることを事後説明と呼びます。

方法 どのように説明するか 向く疑問 主な注意点
小さな決定木など、構造を追いやすいモデル 条件分岐などから出力までたどる どの条件でこの出力になるか 分岐が増えすぎると追いにくい。必要な予測性能も別に確認する
SHAP(シャープ) 特定の予測に対し、入力の各特徴へ寄与を割り当てる 何が基準値から予測を押し上げ・押し下げたか 基準や説明の設定、出力の単位を確認する
LIME(ライム) 説明したい入力の近くで、モデルの挙動を単純なモデルに近似する この入力の周辺では、どの特徴が予測に関係するか 近似した範囲での説明であり、モデル全体に通用するとは限らない

SHAPは、Shapley Additive exPlanationsの略です。原論文では、ある予測に対して各特徴の重要度を割り当てる加算的な枠組みとして示されています。ここでいう特徴は、曜日や天気など、モデルへ入力する情報の項目です。Lundberg・Lee:SHAP原論文

LIMEは、Local Interpretable Model-Agnostic Explanationsの略です。対象となる予測の周辺で、解釈しやすいモデルを学習して説明します。近くの範囲で分かりやすく近似できても、遠く離れた入力まで同じ説明が使えるとは考えないようにします。Ribeiroほか:LIME原論文

複雑なモデルへ後から説明を付けることだけが選択肢ではありません。業務で必要な精度を満たすなら、構造を追いやすいモデルも候補になります。説明のしやすさと精度が必ず引き換えになると決めつけず、同じ評価条件で比較することが大切です。NIST:解釈可能なモデルと事後説明

予測の説明は、基準・単位・符号の順に読む

SHAPの代表的な表示では、基準となる値から各特徴の寄与を加えて、ある1件の予測値へ進みます。公式のwaterfall plot(増減を段階的に示す図)は、背景として使うデータ上のモデル出力の期待値を出発点にします。SHAP:waterfall plot

ここでは読み方に絞り、需要予測の単位を「個」として、次の値を置きます。数値は説明用の架空例であり、モデルを学習させてSHAPを計算した結果ではありません。

項目 架空の値 この例での意味
基準値 100個 説明の出発点として置いた値
週末の寄与 +30個 基準より予測を高くする方向
雨予報の寄与 −20個 基準より予測を低くする方向
販促の寄与 +10個 基準より予測を高くする方向

この場合、計算は100 + 30 − 20 + 10 = 120個です。途中の値は100→130→110→120と変わります。途中値は足し算の経過であり、「天気だけを変更して再予測した結果」ではありません。また、説明の基準値はモデル出力を基にするため、実際の販売数の平均と同じとは限りません。

100個から週末プラス30、雨予報マイナス20、販促プラス10を加えて120個に至る計算例

*本文の架空値を図示。SHAPの実行結果ではなく、途中値も再予測ではありません。*

読むときは、次の順序で確認します。

  1. 何を予測した値か:数量、価格、確率など、対象を確認する。
  2. どの基準からの説明か:背景データや比較の出発点を確認する。
  3. 寄与の符号と大きさ:予測を上げる方向か下げる方向かを見る。
  4. どの入力を説明したか:店舗、日付、天気など、その1件の条件を確かめる。

「+30」は、常に「30%増」や「実際の販売数が30個増える」という意味にはなりません。この架空例では、予測数量を説明する寄与として30個を置いています。

実際のSHAPでは、説明する出力の種類によって単位が異なります。公式資料の分類モデルの例では、横軸が確率そのものではなく、対数オッズ(確率の比を対数に変換した値)になっています。グラフの数字をそのまま百分率へ読み替えず、出力の設定を確認してください。SHAP:waterfall plotの単位

説明できても、別に確認することがある

予測への寄与と、現実の原因は分ける

先ほどの架空例で雨予報の寄与を−20個と置いても、「晴れに変われば実際の需要が20個増える」とは判断できません。説明しているのは、そのモデルの予測と入力の関係だからです。

現実に条件を変えた結果を知りたいときは、因果関係(ある条件を変えることで結果が変わる関係)を調べる必要があります。過去のデータで一緒に変動していたことと、条件を操作した効果は区別します。

予測への寄与と、販促を変えた場合の現実の効果を区別する図

*予測を説明する問いと、現実の変化を調べる問いを独自に整理。効果の測定結果ではありません。*

SHAPの公式資料も、予測モデルが捉えた関係を可視化しただけでは、因果効果にならないと説明しています。たとえば販促の寄与が大きくても、販促だけを増やした場合の販売増加を、その値から決めることはできません。SHAP:予測モデルの解釈と因果関係への注意

説明の正確さと、予測の正確さは分ける

モデルが間違った予測をしていても、「そのモデルがどのように予測したか」を正しく説明できる場合はあります。そのため、説明が納得できることを理由に、予測が当たっていると判断しないようにします。

確認するもの 問い 需要予測の例
予測の正確さ 現実の結果とどれくらい合っているか 予測数量と実際の需要を、利用目的に合う条件で比較する
説明の正確さ モデルの処理や挙動を適切に表しているか 単純化した説明が元のモデルをどこまで表しているかを調べる
説明の分かりやすさ 受け手が判断に使えるか 店舗担当者が単位や比較対象を読み取れるか

NISTが説明の正確さと受け手にとっての分かりやすさを別の原則にしていることも、この整理に役立ちます。NIST:説明可能AIの4原則

基準や近似の条件も確認する

寄与の図だけを切り出すと、背景データや説明方法の設定が見えなくなります。SHAPでは何を背景とするか、LIMEではどの入力周辺を近似したかを、説明と一緒に記録しておくと読み違いを減らせます。

運用時の確認項目として、本記事では、同じモデル・入力・説明条件で結果を再確認できることを勧めます。比較する条件を変えた場合は、その違いを明記します。説明結果が変わったときに、モデルの変化と説明条件の変化を混同しないためです。

業務で読む前に決めること

説明手法を選ぶ前に、誰が何を判断するかを決めると、必要な情報を絞り込めます。次の表は、これまでの区別を利用時の確認へ落とし込んだものです。

決める・確認すること 需要予測での記録例
誰が、何のために読むか 店舗担当者が翌日の予測と入力を確認する
説明対象の範囲 店舗Aの翌日1件か、全店舗の一定期間か
出力の単位と基準 数量「個」、説明の背景に使ったデータ
モデルと説明の条件 モデルの版、入力日、説明手法、設定
説明だけでは決めないこと 販促の効果、予測の採用可否、公平性の判断

説明の見た目を整えることより、何を説明していて、何は別に確認するのかが伝わることを重視します。利用者が入力ミスを見つけたときに修正できるように、元の入力や担当者への確認経路も用意すると、説明を業務に使いやすくなります。

よくある疑問

生成AIに「理由を説明して」と聞けば、説明可能AIになる?

理由文が表示されたという事実だけでは、その文章がモデルの内部処理を正しく反映しているとは確認できません。説明が処理を反映しているかというNISTの原則に照らして、本記事では、生成された理由文も根拠との照合が必要な情報として扱います。

文章の自然さと内容の正確さを分けて確認する方法は、ハルシネーションの原因と回答の確認方法も参照してください。

SHAPとLIMEは、どちらを使えばよい?

入力のどこに注目したいか、対象モデル、計算負担、説明を受け取る人によって選びます。SHAPは特徴ごとの寄与を見る枠組み、LIMEは対象入力の近くでの挙動を単純なモデルで説明する方法です。どちらも説明条件と対象範囲を確認する必要があります。

名称だけで優劣を決めず、必要な範囲を説明できるか、基準や近似条件を記録できるかで判断します。構造を追いやすいモデルで目的を満たせる場合は、それも比較対象に含めます。

参考資料

コメント

タイトルとURLをコピーしました