Карта → событие
Лондон: биометрическая революция
Гальтон и данные, купленные по три пенса

Фрэнсис Гальтон (1822–1911) — двоюродный брат Дарвина, географ, метеоролог (он ввёл слово «антициклон»), изобретатель дактилоскопической классификации и — увы — автор термина «евгеника». Его занимал вопрос наследственности: как передаются измеримые признаки?
Для этого нужны были данные, которых не существовало. На Международной выставке здоровья 1884 года в Южном Кенсингтоне Гальтон открыл антропометрическую лабораторию: посетитель платил три пенса, ему измеряли рост, вес, силу сжатия, остроту зрения, скорость реакции, и он получал копию результатов. За время работы через лабораторию прошло свыше девяти тысяч человек. Гальтон, по сути, изобрёл платный сбор данных.
Регрессия к среднему
Сопоставив рост родителей и взрослых детей, Гальтон обнаружил странность. Высокие родители имеют в среднем высоких детей — но менее высоких, чем они сами. Низкие — низких, но менее низких. Он назвал это «регрессией к посредственности» (позднее — к среднему); отсюда и слово «регрессия» в современной статистике, где оно уже давно потеряло исходный смысл.
Гальтон получил, что если родительский рост отклоняется от среднего на $d$, то детский отклоняется примерно на $\tfrac{2}{3}d$. На современном языке:
$$E[Y \mid X = x] = \mu_Y + \rho\,\frac{\sigma_Y}{\sigma_X}\,(x - \mu_X),$$
где $\rho$ — коэффициент корреляции. Коэффициент $\rho < 1$ и есть регрессия.
Ключевое понимание, которое до сих пор ускользает от многих. Регрессия к среднему — не биологический закон и не «сила, тянущая к посредственности». Это чисто статистическое следствие того, что корреляция меньше единицы. Она симметрична: если посмотреть на очень высоких детей, их родители тоже окажутся в среднем менее высокими. Никакая «природа» здесь ничего не «выравнивает».
Практическая цена непонимания огромна. Если после худших результатов вы что-то меняете, а результаты улучшаются, — они улучшились бы и сами по себе. На этом эффекте держатся: вера в эффективность наказаний (после разноса за плохой полёт курсант летит лучше — но он полетел бы лучше и так), успех гомеопатии при самопроходящих болезнях, «проклятие обложки спортивного журнала» и добрая половина корпоративных «оптимизаций». Именно из-за регрессии к среднему в медицине обязательна контрольная группа.
Корреляция и доска Гальтона
В 1888 году Гальтон вводит коэффициент корреляции — меру совместной изменчивости, не зависящую от единиц измерения:
$$r = \frac{\sum (x_i - \bar x)(y_i - \bar y)}{\sqrt{\sum (x_i - \bar x)^{2}}\sqrt{\sum (y_i - \bar y)^{2}}}, \qquad -1 \leqslant r \leqslant 1 .$$
Из неравенства КошиОгюстен Луи КошиПервым потребовал от анализа доказательств вместо очевидности — и первым написал учебник, по которому это можно было выучить. — Буняковского сразу следует $|r| \leqslant 1$, с равенством только при точной линейной связи.
Его же изобретение — доска Гальтона (квинкункс): шарики падают сквозь ряды штырьков, на каждом отклоняясь влево или вправо. Число попаданий в ячейку $k$ после $n$ рядов равно $C_n^k/2^n$ — биномиальное распределение, которое на глазах у зрителя складывается в колокол. До сих пор это лучшая наглядная демонстрация ЦПТ, какую придумало человечество.
Пирсон: критерий согласия
Карл Пирсон (1857–1936) в University College London превращает идеи Гальтона в дисциплину с аппаратом. Ему принадлежат термины «стандартное отклонение», «гистограмма», «мода», система кривых Пирсона и — главное — критерий хи-квадрат (1900).
Задача: данные разбиты на $k$ категорий, наблюдалось $O_1,\dots,O_k$, теория предсказывает $E_1,\dots,E_k$. Насколько велико расхождение? Пирсон предлагает статистику
$$\chi^{2} = \sum_{i=1}^{k} \frac{(O_i - E_i)^{2}}{E_i}$$
и доказывает, что при верной гипотезе она асимптотически имеет распределение хи-квадрат с $\nu = k - 1 - m$ степенями свободы ($m$ — число параметров, оценённых по данным). Вычисленное значение сравнивается с табличным; большое $\chi^2$ означает, что модель данным не соответствует.
Почему это поворотный пункт: впервые гипотезу о распределении стало можно отвергнуть, а не только подогнать под неё кривую. До Пирсона статистик описывал данные; после — проверял утверждения. Это рождение статистического вывода как отдельного жанра.
(Число степеней свободы Пирсон поначалу считал неправильно — брал $k-1$ независимо от числа оценённых параметров. Поправку внёс Фишер в 1922-м, что стало началом их многолетней вражды.)
В 1901 году Гальтон, Пирсон и зоолог Уолтер Уэлдон основывают журнал Biometrika — первый журнал математической статистики.
Ротамстед: Фишер
Рональд Эйлмер Фишер (1890–1962) с 1919 по 1933 год работает статистиком на Ротамстедской опытной сельскохозяйственной станции в Хартфордшире. Задача, которую ему поставили, звучала скромно: разобрать шестидесятишестилетний архив полевых опытов. Из этой работы вышло больше идей, чем из иных университетов.
Максимальное правдоподобие (идея — 1912, разработка — 1922). Функция правдоподобия
$$L(\theta) = \prod_{i=1}^{n} f(x_i; \theta), \qquad \hat\theta = \arg\max_{\theta} L(\theta) .$$
Практически удобнее логарифм: $\ell(\theta) = \sum \ln f(x_i;\theta)$, максимум ищется из $\ell'(\theta) = 0$. Фишер вводит понятия достаточной статистики, эффективности и информации Фишера
$$I(\theta) = E\left[\left(\frac{\partial}{\partial\theta}\ln f(X;\theta)\right)^{2}\right],$$
через которую выражается нижняя граница дисперсии любой несмещённой оценки (неравенство Рао — Крамера): $D[\hat\theta] \geqslant 1/(nI(\theta))$.
Дисперсионный анализ (ANOVA). Ключевое тождество для разложения изменчивости: если наблюдения разбиты на $g$ групп,
$$\underbrace{\sum_{j}\sum_{i}(y_{ij}-\bar y)^{2}}_{\text{общая}} = \underbrace{\sum_{j} n_j(\bar y_j - \bar y)^{2}}_{\text{межгрупповая}} + \underbrace{\sum_{j}\sum_{i}(y_{ij}-\bar y_j)^{2}}_{\text{внутригрупповая}} .$$
Если групповые различия — только шум, отношение соответствующих средних квадратов имеет $F$-распределение. Идея разложить дисперсию на слагаемые, каждое со своим смыслом, — одна из самых плодотворных в прикладной математике XX века.
Рандомизация. Самая недооценённая идея Фишера. Делянки на поле различаются плодородием, и как ни раскладывай варианты по схеме, систематическая ошибка возможна. Фишер предложил распределять варианты по жребию. Это выглядит как отказ от контроля, но на деле именно случайное распределение делает вероятностный расчёт законным: без него $p$-значение не имеет смысла. Отсюда — весь современный рандомизированный клинический эксперимент, то есть основа доказательной медицины.
«Леди, дегустирующая чай» (из «The Design of Experiments», 1935). Коллега Фишера, Мюриэл Бристоль, утверждала, что различает на вкус, наливали ли молоко в чай или чай в молоко. Фишер придумал проверку: восемь чашек, четыре одного типа и четыре другого, порядок случаен; даме сообщают, что чашек каждого типа по четыре, и просят их разделить. Число способов угадать вслепую:
$$C_8^4 = 70 ,$$
значит, вероятность угадать все восемь случайно равна $1/70 \approx 0{,}014$. Если она угадывает всё — либо произошло событие вероятности полтора процента, либо она действительно различает. Из этого игрушечного примера выросли точный критерий Фишера и вся логика проверки гипотез. (Историческое послесловие: по свидетельству присутствовавших, дама угадала все восемь.)
Нейман и Пирсон-младший: теория проверки гипотез
Фишер дал технику, но не теорию: почему именно эта статистика, почему этот порог? Ежи Нейман (1894–1981) и Эгон Пирсон (1895–1980, сын Карла) в 1933 году строят теорию.
Вводятся: нулевая гипотеза $H_0$ и альтернатива $H_1$; ошибка первого рода $\alpha$ (отвергли верную $H_0$) и второго рода $\beta$ (не отвергли ложную); мощность $1-\beta$.
Лемма Неймана — Пирсона. Среди всех критериев с заданным уровнем $\alpha$ наибольшую мощность для различения двух простых гипотез имеет критерий отношения правдоподобия: отвергать $H_0$, когда
$$\Lambda(x) = \frac{L_1(x)}{L_0(x)} > c ,$$
где $c$ подобрано так, чтобы $P_{H_0}(\Lambda > c) = \alpha$.
В 1937 году Нейман строит теорию доверительных интервалов: интервал $[\hat\theta_1, \hat\theta_2]$, вычисленный по данным, покрывает истинное значение с вероятностью $1-\alpha$. Тонкость, которую путают все: случаен интервал, а не параметр. Фраза «с вероятностью $95\%$ параметр лежит в этом интервале» строго говоря неверна; верно — «процедура, породившая этот интервал, в $95\%$ случаев даёт интервал, накрывающий истину».
Война школ. Фишер и Нейман публично враждовали десятилетиями. Фишер считал теорию Неймана механической и неприменимой к научному исследованию (в науке нет «повторяющихся решений о приёмке партии»); Нейман считал фишеровскую фидуциальную теорию логически несостоятельной. Ни один не уступил. Современный учебник статистики — неудобный гибрид двух враждовавших школ: студенту рассказывают фишеровское $p$-значение и неймановский уровень $\alpha$ как единую процедуру, хотя авторы считали их несовместимыми. Значительная часть нынешнего «кризиса воспроизводимости» в науке имеет корни ровно здесь.
Необходимое замечание. Гальтон ввёл слово «евгеника», Карл Пирсон и Фишер последовательно занимали учреждённую Гальтоном кафедру евгеники в University College London. Их научные результаты от этого не перестают быть верными, но история биометрической школы неотделима от истории евгенического движения — с его прямыми политическими последствиями. В 2020 году UCL по итогам собственного расследования убрал имена Гальтона и Пирсона с зданий и аудиторий.