Карта → событие

Харьков 1912 и 1917

Бернштейн: полиномы и первая аксиоматика вероятности

Теория вероятностей Двадцать три проблемы

Человек не отсюда

Сергей Натанович Бернштейн
Сергей Натанович БернштейнKonrad Jacobs, Erlangen · CC BY-SA 2.0 de

Сергей Натанович Бернштейн (1880, Одесса — 1968, Москва) — фигура, которая в русской математике стоит немного наособицу. Учился он в Париже: Сорбонна, затем Высшая нормальная школа, докторская диссертация 1904 года, в которой он дал первый ответ на девятнадцатую проблему ГильбертаДавид Гильбертнемецкий математик · 1862–1943Человек, сделавший Гёттинген столицей математики и задавший ей повестку на весь XX век — двадцатью тремя проблемами и одной программой, которую сам же и не смог спасти.: решения аналитических эллиптических уравнений сами аналитичны — для двумерного случая. Двадцать четыре года, парижский диплом, задача из списка 1900 года. (Общий случай закроют только в 1957–1964 годах Де Джорджи, Нэш, Ладыженская и Уральцева — точка о Ладыженской.)

В России диплом не признали. Пришлось защищаться заново: магистерская в Харькове в 1908 году, докторская — в 1913-м. С 1907 по 1933 год он профессор Харьковского университета, и всё, о чём идёт речь в этой точке, сделано там.

Стоит держать в голове, что вероятность была для него не главным делом. Основное — конструктивная теория функций: как приближать функции многочленами и насколько хорошо это в принципе возможно. Обе половины этой точки выросли именно оттуда, и это объясняет их обе.

Подарок первый: как вероятность доказала теорему анализа

Теорема Вейерштрасса (1885) утверждает: всякая непрерывная на отрезке функция — равномерный предел многочленов. Доказательство самого ВейерштрассаКарл Вейерштрасснемецкий математик · 1815–1897Пятнадцать лет учительствовал в провинциальной гимназии, а потом переписал анализ на языке $\varepsilon$ и $\delta$ — и предъявил функцию, у которой нигде нет касательной. неконструктивно: оно говорит, что многочлены существуют, но не предъявляет их.

Бернштейн в 1912 году предъявил — и не средствами анализа.

Для $f\in C[0,1]$ положим

$$B_{n}(f)(x)=\sum_{k=0}^{n} f\!\left(\frac{k}{n}\right)C_{n}^{k}x^{k}(1-x)^{n-k}.$$

Формула выглядит как выдумка, пока не прочесть её вероятностно. Пусть $X\sim \mathrm{Bin}(n,x)$ — число успехов в $n$ независимых испытаниях с вероятностью успеха $x$. Тогда $C_{n}^{k}x^{k}(1-x)^{n-k}=P(X=k)$, и вся сумма есть попросту

$$B_{n}(f)(x)=E\left[f\!\left(\frac{X}{n}\right)\right].$$

Многочлен Бернштейна — это среднее значение функции в случайной точке.

Дальше работает закон больших чисел. Доля успехов $X/n$ концентрируется около $x$; значит, $f(X/n)$ близка к $f(x)$; значит, среднее близко к $f(x)$.

Оценка выписывается полностью и укладывается в четыре строки. Пусть $\omega$ — модуль непрерывности $f$, а $M=\max|f|$. Разобьём исходы на близкие ($|X/n-x|<\delta$) и далёкие:

$$\left|B_{n}(f)(x)-f(x)\right|\ \leqslant\ \omega(\delta)\ +\ 2M\cdot P\!\left(\left|\frac{X}{n}-x\right|\geqslant\delta\right).$$

Вторую вероятность оценивает неравенство Чебышёва (петербургская школа) — дисперсия $X/n$ равна $x(1-x)/n\leqslant 1/(4n)$:

$$P\!\left(\left|\frac{X}{n}-x\right|\geqslant\delta\right)\leqslant\frac{1}{4n\delta^{2}}.$$

Итого

$$\left|B_{n}(f)-f\right|\leqslant \omega(\delta)+\frac{M}{2n\delta^{2}},$$

и при $\delta=n^{-1/3}$ обе добавки стремятся к нулю — равномерно по $x$, потому что оценка от $x$ не зависит. Теорема Вейерштрасса доказана, и доказана конструктивно: многочлены выписаны явно.

Это один из первых случаев, когда вероятность применена как инструмент к задаче, в которой никакой случайности нет. Через сорок лет ЭрдёшПал Эрдёшвенгерский математик · 1913–1996Полторы тысячи статей, пятьсот соавторов, ни дома, ни семьи, ни постоянной работы — сорок лет он ездил из университета в университет с одним чемоданом. сделает такой приём отдельным ремеслом и назовёт его вероятностным методом; БорельЭмиль Борельфранцузский математик, министр и участник Сопротивления · 1871–1956Придумал меру, на которой стоит вся современная теория вероятностей, а потом ушёл в политику — был министром флота, депутатом и сидел в тюрьме при Виши. уже сделал шаг в ту же сторону нормальными числами (Борель). Но здесь случайность введена в задачу об аппроксимации совершенно демонстративно — как способ рассуждения, а не как предмет.

Почему эти многочлены оказались на каждом экране

У многочленов Бернштейна плохая репутация у вычислителей: сходятся они медленно, порядка $1/n$, и для численного приближения непригодны — интерполяция ЧебышёваПафнутий Львович Чебышёврусский математик и механик · 1821–1894Основал петербургскую математическую школу, дал первые строгие оценки в законе распределения простых чисел и построил около сорока механизмов, включая шагающую машину. делает то же самое во много раз дешевле.

Зато у них есть свойство, которого нет у быстрых методов: они сохраняют форму. График $B_n(f)$ повторяет поведение $f$ — монотонность, выпуклость, положительность; кривая лежит в выпуклой оболочке своих коэффициентов и не идёт вразнос между узлами.

Именно поэтому в конце 1950-х их независимо переоткрыли в двух французских автомобильных компаниях: Поль де Кастельжо в Citroën (1959) и Пьер Безье в Renault (1962) искали способ задавать обводы кузова так, чтобы конструктор двигал несколько точек, а поверхность вела себя предсказуемо. Кривая Безье — это

$$\mathbf{B}(t)=\sum_{k=0}^{n}\mathbf{P}_{k}C_{n}^{k}t^{k}(1-t)^{n-k},$$

то есть буквально многочлен Бернштейна, у которого вместо значений функции стоят опорные точки.

Сегодня на этой формуле нарисован каждый шрифт (TrueType — квадратичные кривые, PostScript и OpenType CFF — кубические), каждая векторная иллюстрация и каждая кривая плавности в анимации интерфейсов. Харьковская работа 1912 года о приближении функций лежит внутри любого текста на экране — включая этот.

Подарок второй: аксиоматика, которая проиграла

С. Н. Бернштейн. Опыт аксиоматического обоснования теории вероятностей. Сообщения Харьковского математического общества, 1917.

Задача та же, что у КолмогороваАндрей Николаевич Колмогороврусский и советский математик · 1903–1987Дал вероятности аксиомы, турбулентности — закон, сложности — определение, а школьной математике в СССР — программу, по которой учились миллионы. шестнадцать лет спустя («Grundbegriffe»): что такое вероятность как математический объект. Подход — противоположный.

Колмогоров начинает с числа: вероятность есть мера, то есть функция из событий в отрезок $[0,1]$. Бернштейн считает число производным и начинает со сравнения. Первичное отношение у него — «событие $A$ не более вероятно, чем событие $B$». Аксиомы описывают свойства этого порядка: он полон, транзитивен, согласован с операциями над событиями, и существуют разбиения на равновероятные части. Из этих качественных требований числовая вероятность выводится, а не постулируется.

С философской точки зрения это честнее. Сравнивать неопределённости человек умеет, а приписывать им числа — навык вторичный и требующий обоснования; Бернштейн обосновывает.

И всё-таки победила система Колмогорова. Почему — стоит разобрать, потому что причина общая и относится далеко не только к этому случаю.

Первое: качественный порядок не порождает счётную аддитивность. Из аксиом о сравнении событий естественно следует конечная аддитивность и не следует счётная. А без счётной аддитивности недоступно всё, что относится к бесконечным сериям испытаний: усиленный закон больших чисел (Борель), закон нуля или единицы, случайные процессы. Первое же серьёзное утверждение теории оказывается несформулируемым.

Второе, и это главное: у системы Бернштейна ничего не стояло за спиной. Она самодостаточна — и потому пуста: всё, что понадобится, нужно строить с нуля. Колмогоров же не столько придумал аксиомы, сколько опознал вероятность в уже существующей и мощной теории меры ЛебегаАнри Лебегфранцузский математик · 1875–1941Предложил считать интеграл, разрезая не ось абсцисс, а ось значений, — и получил теорию, в которой предел и интеграл наконец можно менять местами.. Вместе с отождествлением он получил бесплатно и немедленно: интеграл, теоремы о предельном переходе, теорему Радона — Никодима (а через неё условное ожидание), теорему Фубини, готовую технику работы с бесконечномерными пространствами.

Побеждает не более аккуратная аксиоматика, а та, которая подключается к работающему аппарату. Это, пожалуй, единственная мораль, которую история математики повторяет чаще прочих.

Третье, житейское: «Опыт» вышел по-русски, в харьковском журнале, в 1917 году. Хуже места и времени для международного распространения идеи придумать трудно.

И всё же он не проиграл

У качественной вероятности оказалось собственное продолжение, просто в другой дисциплине. Линию Бернштейна продолжили Купман (1940), де Финетти и Сэвидж: если вероятность выводится из сравнения степеней уверенности, то естественно считать её мерой уверенности субъекта, а не свойством мира. Так качественный подход стал фундаментом байесовской статистики и теории принятия решений — то есть той половины предмета, о которой сказано во вступлении к этой линии как об эпистемическом понимании вероятности.

Аксиоматика, проигравшая математику, выиграла философию. Колмогоров, к слову, ссылался на Бернштейна в «Grundbegriffe» прямо.

Что ещё за ним осталось

Неравенства Бернштейна — экспоненциальные оценки вероятности больших уклонений, точнее чебышёвских, если известна ограниченность слагаемых:

$$P\left(\left|\sum (X_{i}-E[X_{i}])\right|\geqslant t\right)\leqslant 2\exp\left(-\frac{t^{2}}{2(\sigma^{2}+Mt/3)}\right).$$

Эти оценки — прямые предки неравенств Хёфдинга и Чернова и сегодня стоят в основании статистической теории обучения: именно ими оценивают, насколько ошибка модели на обучающей выборке отличается от ошибки на генеральной совокупности. Из всех результатов Бернштейна этот цитируется чаще всего — и почти всегда без имени автора.

Кроме того: теория приближений как дисциплина, неравенство Бернштейна для производной многочлена, работы по уравнениям в частных производных, учебник «Теория вероятностей» (1927) — первый в стране современный курс. С 1933 года он работал в Ленинграде, с 1943-го — в Москве.

Следующая точка: Петербург, 1913 — та же зима, та же страна, и снова вероятность применяется к предмету, который в ней не нуждается.

Открыть на карте