Карта → событие

Париж 1810–1812

Лаплас: собор классической вероятности

Теория вероятностей Демон и монетка

Центральная предельная теорема

Пьер-Симон Лаплас
Пьер-Симон ЛапласPublic domain

В 1810 году Лаплас докладывает Академии наук результат, который сегодня формулируется так. Пусть $X_1, X_2, \dots$ — независимые одинаково распределённые случайные величины с конечными математическим ожиданием $\mu$ и дисперсией $\sigma^2 > 0$. Тогда для любого $x$

$$P\left( \frac{X_1 + \dots + X_n - n\mu}{\sigma\sqrt{n}} \leqslant x \right) \;\xrightarrow[n\to\infty]{}\; \Phi(x) = \int_{-\infty}^{x} \frac{1}{\sqrt{2\pi}} e^{-t^{2}/2}\,dt .$$

Читается это так: сумма многих независимых слагаемых, ни одно из которых не доминирует, распределена приблизительно нормально — независимо от того, как распределены слагаемые. Кости, монеты, ошибки измерения, рост призывников — форма исходного распределения забывается, остаётся колокол.

Отсюда сразу понятно, почему результат де МуавраАбрахам де Муаврфранцузский математик, работавший в Англии · 1667–1754Первым вывел кривую нормального распределения — и всю жизнь зарабатывал консультациями в лондонской кофейне, потому что иностранцу кафедры не давали. (§5) — частный случай: там слагаемые были индикаторами успеха ($0$ или $1$), $\mu = p$, $\sigma^2 = pq$.

Строгости в докладе 1810 года нет: Лаплас работает с производящими функциями и переходит к пределу свободно, без контроля остатков. Условия, при которых теорема действительно верна, будут выясняться весь XIX век и окончательно установлены ЛяпуновымАлександр Михайлович Ляпуноврусский математик и механик · 1857–1918Дал точное определение устойчивости движения и способ её проверять без решения уравнений; он же первым строго доказал центральную предельную теорему. (1901) и Линдебергом (1922) — см. точку о петербургской школе.

Три замечания, полезных для интуиции:

  1. Что здесь удивительного. Не то, что сумма концентрируется около $n\mu$ (это закон больших чисел), а то, что форма отклонений универсальна. Универсальность — редкое явление в математике, и её приходится доказывать заново для каждого класса условий.
  2. Где теорема ломается. Если дисперсия бесконечна (распределение КошиОгюстен Луи Кошифранцузский математик · 1789–1857Первым потребовал от анализа доказательств вместо очевидности — и первым написал учебник, по которому это можно было выучить., «толстые хвосты»), предел другой — устойчивые законы Леви. Финансовые данные часто именно таковы, и слепая вера в нормальность стоила рынкам очень дорого.
  3. Насколько быстро. Неравенство Берри — Эссеена (1941–1942) даёт оценку скорости: расхождение с $\Phi$ не превосходит $C\rho/(\sigma^{3}\sqrt{n})$, где $\rho = E|X-\mu|^{3}$. Снова $1/\sqrt{n}$.

«Théorie analytique des probabilités» (1812)

Тысячестраничный том, посвящённый «Наполеону Великому» (в третьем издании посвящение было тихо снято). В нём собрано всё: производящие функции, преобразования, асимптотика, теория ошибок, приложения к демографии, к судебным решениям, к астрономии. Это книга, после которой теория вероятностей стала разделом анализа.

Двумя годами позже Лаплас выпускает популярное изложение — «Опыт философии теории вероятностей» (1814), где формулирует классическое определение вероятности как отношения благоприятных исходов к общему числу равновозможных, описывает «демона Лапласа» (ум, знающий положения и скорости всех частиц, для которого будущее было бы столь же очевидно, как прошлое) и заканчивает знаменитым: теория вероятностей есть здравый смысл, сведённый к исчислению. Обратите внимание на внутреннее напряжение: демон означает, что случайности в мире нет, — вероятность есть мера нашего незнания. Это чисто эпистемический взгляд, и он господствовал до конца XIX века.

Метод наименьших квадратов: спор о приоритете

Параллельный сюжет, без которого статистика невозможна.

Задача. Есть $n$ измерений $(x_i, y_i)$, есть модель $y \approx a + bx$. Как выбрать $a, b$? Ответ, который сегодня кажется очевидным: минимизировать сумму квадратов отклонений

$$S(a,b) = \sum_{i=1}^{n} \left(y_i - a - b x_i\right)^{2} .$$

Приравнивая частные производные нулю, получаем нормальные уравнения, и в явном виде

$$\hat b = \frac{\sum (x_i - \bar x)(y_i - \bar y)}{\sum (x_i - \bar x)^{2}}, \qquad \hat a = \bar y - \hat b \bar x .$$

Приоритет. Адриен Мари ЛежандрАдриен Мари Лежандрфранцузский математик · 1752–1833Первым напечатал метод наименьших квадратов, первым сформулировал закон распределения простых чисел — и в обоих случаях приоритет у него оспорил Гаусс. публикует метод в 1805 году («Nouvelles méthodes pour la détermination des orbites des comètes») — чисто как удобный вычислительный приём, без вероятностного обоснования. Карл Фридрих ГауссКарл Фридрих Гаусснемецкий математик и астроном · 1777–1855«Король математиков», у которого напечатанное было заметно меньше сделанного: половина результатов пролежала в дневнике до самой смерти — включая неевклидову геометрию. печатает его в 1809-м («Theoria motus corporum coelestium») с фразой, что пользуется им с 1795 года. Вспыхивает один из самых ожесточённых приоритетных споров эпохи; Лежандр пишет Гауссу возмущённые письма. Историки сегодня считают, что Гаусс, вероятно, говорил правду (в его бумагах есть следы), но публикация — это публикация.

Козырь Гаусса — обоснование. Он ставит вопрос иначе: почему именно квадраты? И доказывает поразительную теорему. Предположим, ошибки измерения независимы, одинаково распределены с плотностью $f$, и мы требуем, чтобы наиболее правдоподобной оценкой неизвестной величины при любом числе измерений оказывалось среднее арифметическое. Тогда $f$ обязана быть нормальной плотностью:

$$f(\varepsilon) = \frac{1}{\sigma\sqrt{2\pi}} e^{-\varepsilon^{2}/(2\sigma^{2})} .$$

Набросок доказательства: условие максимума правдоподобия $\prod f(x_i - \theta)$ в точке $\theta = \bar x$ даёт $\sum g(x_i - \bar x) = 0$ для $g = (\ln f)'$ при любых данных; отсюда $g$ линейна, $g(\varepsilon) = -c\varepsilon$, и интегрирование даёт гауссиану.

Круг замкнулся: если ошибки нормальны, то метод наименьших квадратов есть метод максимального правдоподобия. Лаплас немедленно добавил второй аргумент — ЦПТ: ошибка измерения складывается из множества мелких независимых причин, а значит, приблизительно нормальна. Нормальный закон получил два независимых обоснования сразу, и это обеспечило ему на век положение почти догмы.

Второй козырь Гаусса — предъявленный результат. 1 января 1801 года Джузеппе Пиацци обнаружил в Палермо новую малую планету — Цереру. Он успел проследить её всего $41$ день, примерно $3^\circ$ дуги, после чего Церера ушла в лучи Солнца и потерялась. Задача найти её снова считалась безнадёжной. Двадцатичетырёхлетний Гаусс за несколько недель разработал метод определения орбиты по трём наблюдениям, обработал данные Пиацци методом наименьших квадратов и указал, где искать. В конце декабря 1801 — начале января 1802 года Франц Ксавер фон Цах и Генрих Ольберс нашли Цереру там, где сказал Гаусс. Это сделало Гаусса европейской знаменитостью в двадцать четыре года и одновременно стало лучшей рекламой статистического метода за всю его историю.

Применения хлынули сразу

Адольф Кетле, Брюссель, 1835 («Sur l'homme et le développement de ses facultés»). Кетле переносит гауссову теорию ошибок с астрономии на человека и совершает концептуальный переворот: если рост солдат распределён нормально, то, может быть, есть некий истинный рост — «средний человек» (l'homme moyen), — а индивидуальные отличия суть «ошибки природы»? Идея сомнительная философски, но чрезвычайно плодотворная практически: из неё выросла социальная статистика, а заодно и индекс массы тела (индекс Кетле). Его знаменитый пример — обхваты груди $5738$ шотландских солдат, лёгшие на нормальную кривую с поразительной точностью.

Симеон Дени Пуассон, Париж, 1837 («Recherches sur la probabilité des jugements»). Пуассон рассматривает предел биномиального распределения, когда $n \to \infty$, $p \to 0$, а произведение $np = \lambda$ остаётся постоянным:

$$C_n^kp^{k}(1-p)^{n-k} \;\longrightarrow\; \frac{\lambda^{k}e^{-\lambda}}{k!} .$$

Это распределение Пуассона — закон редких событий. У него замечательное свойство: $E[X] = D[X] = \lambda$, то есть среднее и дисперсия совпадают. Кстати, в самой книге Пуассона это распределение — второстепенный технический результат; знаменитым оно станет через шестьдесят лет.

Ладислаус Борткевич, 1898 («Das Gesetz der kleinen Zahlen» — «Закон малых чисел»). Именно он, а не Пуассон, предъявил тот самый пример с прусской кавалерией. Данные: число смертей от удара конским копытом в армейских корпусах за $20$ лет, $200$ наблюдений «корпус-год».

Смертей за год 0 1 2 3 4
Наблюдалось корпус-лет 109 65 22 3 1
Предсказано Пуассоном ($\lambda = 0{,}61$) 108,7 66,3 20,2 4,1 0,6

Совпадение почти неприличное. Смысл этого примера — не в лошадях: Борткевич показал, что осмысленный статистический вывод возможен и на малых числах, если известна правильная модель. До него считалось, что статистика работает только там, где действует нормальное приближение, то есть на больших массивах.

Открыть на карте