Карта → событие
Теорема Байеса: от следствий к причинам
Прямая задача и обратная

Всё, что делали ПаскальБлез ПаскальСобрал в шестнадцать лет теорему о шестиугольнике, в девятнадцать — счётную машину, в тридцать один — теорию вероятностей, а потом бросил математику ради Бога., ГюйгенсХристиан ГюйгенсНаписал первый печатный учебник теории вероятностей, изобрёл маятниковые часы, открыл кольца Сатурна и объяснил свет волнами. и БернуллиБернуллиВосемь математиков в трёх поколениях одной базельской семьи — и почти столько же ссор между ними; на их фамилию приходится закон больших чисел, вариационное исчисление и уравнение гидродинамики., — это прямая задача: устройство известно, требуется вычислить вероятность результата. Урна содержит $3$ белых шара из $5$; какова вероятность вытащить $7$ белых из $10$?
Реальная жизнь ставит вопрос наоборот. Мы вытащили $7$ белых из $10$. Что можно сказать о составе урны? Это обратная задача, или, как её назвали в XVIII веке, «задача о вероятности причин». Именно она нужна и врачу, и судье, и естествоиспытателю.
Томас Байес (ок. 1701–1761) — пресвитерианский священник в курортном городке Танбридж-Уэллс, математик-любитель, член Королевского общества (избран в 1742-м за работу в защиту ньютоновского исчисления от нападок епископа Беркли). Свою знаменитую работу он при жизни не публиковал. После его смерти в апреле 1761 года бумаги разбирал друг, Ричард Прайс, — он нашёл рукопись, снабдил её введением и примечаниями и представил Королевскому обществу. «An Essay towards solving a Problem in the Doctrine of Chances» была прочитана 23 декабря 1763 года и напечатана в «Философских трудах» (том за 1763 год вышел в 1764-м). Роль Прайса была настолько велика, что некоторые историки говорят о «теореме Байеса — Прайса».
Формула
В современных обозначениях всё сводится к одной строке. Из определения условной вероятности
$$P(H \cap E) = P(E \mid H)\,P(H) = P(H \mid E)\,P(E)$$
получаем
$$\boxed{\;P(H \mid E) = \frac{P(E \mid H)\,P(H)}{P(E)}\;}$$
где $H$ — гипотеза, $E$ — наблюдение (evidence). Знаменатель раскрывается по формуле полной вероятности: если гипотезы $H_1, \dots, H_m$ попарно несовместны и исчерпывают все возможности, то
$$P(H_i \mid E) = \frac{P(E \mid H_i)\,P(H_i)}{\sum_{j=1}^{m} P(E \mid H_j)\,P(H_j)} .$$
Терминология: $P(H)$ — априорная вероятность (до наблюдения), $P(H\mid E)$ — апостериорная, $P(E\mid H)$ — правдоподобие.
Формула тривиальна алгебраически. Нетривиально всё остальное: откуда берётся $P(H)$ и что вообще значит «вероятность гипотезы».
Задача самого Байеса
Байес рассматривал не урну, а бильярдный стол. На стол случайно (равномерно) бросают шар; его положение задаёт неизвестную величину $\theta \in [0,1]$. Затем бросают ещё $n$ шаров и считают, сколько из них легло левее первого. Получилось $k$. Что можно сказать о $\theta$?
При заданном $\theta$ число $k$ имеет биномиальное распределение. Байес получает:
$$P(a < \theta < b \mid k \text{ из } n) = \frac{\displaystyle\int_a^b \theta^{k}(1-\theta)^{n-k}\,d\theta}{\displaystyle\int_0^1 \theta^{k}(1-\theta)^{n-k}\,d\theta} .$$
Это плотность бета-распределения $\mathrm{Beta}(k+1,\,n-k+1)$. Знаменатель — бета-функция $B(k+1, n-k+1) = \dfrac{k!\,(n-k)!}{(n+1)!}$.
Ключевой ход Байеса — конструкция с бильярдным столом, которая физически оправдывает равномерное априорное распределение: шар и правда бросают наудачу. Байес прекрасно понимал, что в общем случае такого оправдания нет, и, по-видимому, именно поэтому не публиковал работу.
Правило следования ЛапласаПьер-Симон ЛапласСвёл небесную механику в пять томов, а теорию вероятностей — в один, и на полтора столетия задал образ мира, в котором будущее вычисляется из настоящего.. Из бета-распределения средняя апостериорная вероятность успеха в следующем испытании равна
$$E[\theta \mid k, n] = \frac{k+1}{n+2} .$$
Если солнце всходило $n$ раз подряд, вероятность, что оно взойдёт завтра, есть $(n+1)/(n+2)$. Лаплас привёл этот пример с оговоркой, что к реальному Солнцу он неприменим (мы знаем механику, а не только счёт дней), — оговорку почти всегда опускают, и над «правилом следования» с тех пор насмехаются несправедливо.
Практический пример, ради которого стоит всё это учить
Болезнь встречается у $0{,}1\%$ населения. Тест обнаруживает её у больных в $99\%$ случаев (чувствительность) и даёт ложную тревогу у $1\%$ здоровых. Тест положительный. Насколько вероятно, что человек болен?
Интуиция кричит: «$99\%$». Считаем.
Возьмём $100\,000$ человек. Больны $100$, из них тест поймает $99$. Здоровы $99\,900$, из них тест ошибётся на $999$. Итого положительных результатов: $99 + 999 = 1098$, из них истинных — $99$.
$$P(\text{болен} \mid +) = \frac{99}{1098} \approx 0{,}090 = 9{,}0\% .$$
Девять процентов, а не девяносто девять. Причина — базовая частота: здоровых так много, что даже $1\%$ ошибок среди них перевешивает всех настоящих больных вдесятеро. Это самый практически важный вывод из формулы Байеса, и его систематически игнорируют — в том числе врачи, что многократно показано в экспериментах (классические работы Гигеренцера).
Форма шансов: удобнее считать в уме
Разделив формулу Байеса для $H$ на такую же для $\bar H$, получаем красивое:
$$\underbrace{\frac{P(H\mid E)}{P(\bar H\mid E)}}_{\text{апостериорные шансы}} = \underbrace{\frac{P(H)}{P(\bar H)}}_{\text{априорные шансы}} \times \underbrace{\frac{P(E\mid H)}{P(E\mid \bar H)}}_{\text{отношение правдоподобия}} .$$
Шансы просто умножаются на коэффициент. В примере выше: априорные шансы $100 : 99\,900 \approx 1:999$; отношение правдоподобия $0{,}99/0{,}01 = 99$; апостериорные шансы $99 : 999 \approx 1 : 10{,}1$, то есть вероятность $\approx 1/11{,}1 \approx 9\%$. Тот же ответ в две строки.
Если взять логарифм, умножение превращается в сложение, и «свидетельства» становятся аддитивными. Именно в такой форме Алан ТьюрингАлан ТьюрингОпределил, что значит «вычислить», за десять лет до появления компьютеров, взломал «Энигму» и был осуждён за то, кем он был. в Блетчли-парке в 1941 году применял байесовский подход при взломе «Энигмы»; его единицу веса свидетельства — десятичный логарифм отношения правдоподобия — называли бан (от Banbury, где печатали перфолисты). Работа была засекречена, и байесовская статистика в её «военном» изводе стала известна только в 1970-е, из книги Джека Гуда.
Судьба идеи
Париж, 1774. Пьер-Симон Лаплас, ничего не зная о работе Байеса, публикует «Mémoire sur la probabilité des causes par les événements» и независимо получает тот же результат в куда более общем виде. Весь XIX век метод называли «лапласовским»; прилагательное «байесовский» вошло в обиход только в 1950-е.
XX век устраивает байесовский ренессанс, причём начинается он с философии:
- Фрэнк РамсейФрэнк Пламптон РамсейДоказал, что полный беспорядок невозможен: в любой достаточно большой структуре найдётся большой упорядоченный кусок. Теорема была у него вспомогательной леммой. Умер в двадцать шесть лет, успев основать три… (1926, «Truth and Probability») показывает, что если ваши степени уверенности не подчиняются аксиомам вероятности, против вас можно составить набор ставок, гарантированно приносящий вам убыток при любом исходе. Это аргумент голландской книги (Dutch book): согласованность = вероятность.
- Бруно де Финетти (1931, 1937) идёт дальше и доказывает теорему о перестановочности: если ваше суждение о последовательности испытаний не зависит от порядка (последовательность обменивaема), то она автоматически представима как смесь независимых схем Бернулли с некоторым распределением на $p$. То есть «объективная вероятность $p$» и «априорное распределение на неё» возникают сами собой из требования симметрии суждений. Знаменитый лозунг де Финетти: объективной вероятности не существует.
- Ричард Кокс (1946) выводит правила вероятности из требований согласованности рассуждений о степенях правдоподобия.
Сегодня формула скромного священника работает в спам-фильтрах, в медицинской диагностике, в байесовских сетях, в фильтрах частиц у роботов, в иерархических моделях эконометрики и в каждом смартфоне, который перебирает гипотезы о том, что вы хотели набрать.