大学・確率統計・場合の数・確率

確率空間とベイズの定理の練習問題

条件付き確率と独立性を扱い、ベイズの定理で事後確率を求められる。

考え方

条件付き確率と独立性を扱い、「検査で陽性だったとき、本当に病気である確率」のような逆向きの確率をベイズの定理で求められるようになります。迷惑メールフィルタ、医療検査、不正検知の結果を正しく読むための考え方です。

条件付き確率 P(A∣B)P(A \mid B)
BB が起きたと分かったときに、AA も起きている確率。P(A∩B)P(B)\dfrac{P(A \cap B)}{P(B)}。
独立
P(A∩B)=P(A)P(B)P(A \cap B) = P(A)P(B) が成り立つこと。一方が起きても、もう一方の確率が変わらない。
事前確率・事後確率
データを見る前の確率 P(A)P(A) と、データ BB を見たあとの確率 P(A∣B)P(A \mid B)。

確率は、起こりうること全体に対する割合です。条件付き確率 P(A∣B)P(A \mid B) は、全体を「BB が起きた場合」だけに絞ったときの AA の割合です。だから分母は P(B)P(B) になります。

P(A∣B)P(A \mid B) と P(B∣A)P(B \mid A) は別物です。「迷惑メールのとき検出される確率」が 95% でも、「検出されたメールが迷惑メールである確率」が 95% とは限りません。迷惑メールがもともと少なければ、検出されたものの中に誤検出の通常メールが多く混じるからです。

ベイズの定理は、この向きを入れかえる式です。検出されるのは「迷惑メールで検出」と「通常メールで誤検出」の2通りなので、それぞれ(割合)×(検出される確率)で求めて足したものが P(検出)P(\text{検出}) です。そのうち迷惑メールの分が占める割合が、求める確率です。

樹形図を描くか、全体を 10,000 通のような具体的な数に置きかえて数えると、取り違えを防げます。

樹形図。不良 0.02 と良品 0.98 に分かれ、不良は判定 0.9(確率 0.018)と判定なし 0.1(0.002)、良品は判定 0.05(0.049)と判定なし 0.95(0.931)に分かれる不良 0.02良品 0.98確率判定 0.90.018判定なし 0.10.002判定 0.050.049判定なし 0.950.931
例題の樹形図。「不良」と判定されるのは 0.018 と 0.049 の2本の枝で、そのうち本当に不良品なのは 0.0180.018+0.049=1867\dfrac{0.018}{0.018 + 0.049} = \dfrac{18}{67}(約 27%)です。

ポイント

P(A∣B)=P(A∩B)P(B)P(A \mid B) = \dfrac{P(A \cap B)}{P(B)}、P(A∩B)=P(A)P(B∣A)P(A \cap B) = P(A)P(B \mid A)

P(B)=P(A)P(B∣A)+P(Aˉ)P(B∣Aˉ)P(B) = P(A)P(B \mid A) + P(\bar{A})P(B \mid \bar{A})(Aˉ\bar{A} は「AA でない」)

ベイズの定理: P(A∣B)=P(A)P(B∣A)P(A)P(B∣A)+P(Aˉ)P(B∣Aˉ)P(A \mid B) = \dfrac{P(A)P(B \mid A)}{P(A)P(B \mid A) + P(\bar{A})P(B \mid \bar{A})}

独立: P(A∩B)=P(A)P(B)P(A \cap B) = P(A)P(B)

解き方の手順

  1. 「何が分かったうえでの確率か」を確かめ、求めるものを P(A∣B)P(A \mid B) の形で書く。
  2. AA で、かつ BB が起きる割合 P(A)×P(B∣A)P(A) \times P(B \mid A) を計算する。
  3. AA でないのに BB が起きる割合 P(Aˉ)×P(B∣Aˉ)P(\bar{A}) \times P(B \mid \bar{A}) を計算し、2つを足して P(B)P(B) を求める。
  4. P(A)×P(B∣A)P(A) \times P(B \mid A) を P(B)P(B) で割り、既約分数で答える。

例

製品の 2% が不良品です。検査は不良品の 90% を「不良」と判定しますが、良品の 5% も誤って「不良」と判定します。「不良」と判定された製品が本当に不良品である確率は?

  1. 不良品で、かつ「不良」と判定: 2100×90100=181000\dfrac{2}{100} \times \dfrac{90}{100} = \dfrac{18}{1000}
  2. 良品なのに「不良」と判定: 98100×5100=491000\dfrac{98}{100} \times \dfrac{5}{100} = \dfrac{49}{1000}
  3. P(判定)=181000+491000=671000P(\text{判定}) = \dfrac{18}{1000} + \dfrac{49}{1000} = \dfrac{67}{1000}
  4. P(不良∣判定)=181000÷671000=1867P(\text{不良} \mid \text{判定}) = \dfrac{18}{1000} \div \dfrac{67}{1000} = \dfrac{18}{67}(約 27%)

よくある間違い

練習問題でこの間違い方をしたときは、その場でお伝えします。

  • P(A|B) と P(B|A) の混同検査で陽性のときに病気である確率と、病気のときに陽性になる確率を混同する。「何がわかった上での確率か」を確かめましょう。ベイズの定理で向きを入れかえられます。

見る

計算例

受信メールの 10% が迷惑メールです。迷惑メールフィルタは、迷惑メールを 80% の確率で検出しますが、通常のメールも 10% の確率で誤って検出してしまいます。

迷惑メールの割合
10%
迷惑メールを検出する確率
80%
通常のメールを誤って検出する確率
10%

問いフィルタが「迷惑メール」と検出したメールが、本当に迷惑メールである確率を求めてください。

途中の式

  1. ベイズの定理: P(迷惑∣検出)=P(迷惑かつ検出)P(検出)P(\text{迷惑} \mid \text{検出}) = \dfrac{P(\text{迷惑かつ検出})}{P(\text{検出})}
  2. P(迷惑かつ検出)=110×45=225P(\text{迷惑かつ検出}) = \frac{1}{10} \times \frac{4}{5} = \frac{2}{25}
  3. P(通常かつ検出)=910×110=9100P(\text{通常かつ検出}) = \frac{9}{10} \times \frac{1}{10} = \frac{9}{100}
  4. P(検出)=225+9100=17100P(\text{検出}) = \frac{2}{25} + \frac{9}{100} = \frac{17}{100}
  5. P(迷惑∣検出)=225÷17100=817P(\text{迷惑} \mid \text{検出}) = \frac{2}{25} \div \frac{17}{100} = \frac{8}{17}
  6. 「迷惑メールのとき検出される確率」(80%)と「検出されたとき迷惑メールである確率」は別のものです。迷惑メールがもともと少ないと、後者はずっと小さくなります。

答え確率(既約分数で)は 817\frac{8}{17}

一緒にやる

小さく分けて、一緒に解く

1つずつ答えを確かめながら進みます。間違えても大丈夫です。

受信メールの 10% が迷惑メールです。迷惑メールフィルタは、迷惑メールを 90% の確率で検出しますが、通常のメールも 5% の確率で誤って検出してしまいます。

フィルタが「迷惑メール」と検出したメールが、本当に迷惑メールである確率を求めてください。

小さな問いに分けて、1つずつ一緒に進めます。

ステップ 1 / 3

メール全体のうち「迷惑メールで、かつ検出される」割合は?(分数で)

分数は 3/4、ルートは √3(または sqrt(3))、累乗は 2^3、円周率は π と入力できます。

読み取り:(入力すると、ここに数式で表示されます)

自分でやる

練習問題

数字は毎回変わります。2〜3問続けて解けたら、次の単元や元のレッスンに進みましょう。

問題を準備しています…

学び直しマップ

前後の単元

分からないところがあったら前提まで戻り、分かったら使う先へ進みましょう。

学び直しマップで、この単元のまわりを見る