Про отношения 👩❤️💋👨
Я до недавнего времени думал, что вот это

является несмещенной оценкой вот этого

Был неправ, но считаю, что стыдится тут нечего. Давайте посмотрим на формулу доверительного интервала для процентного прироста, полученную с помощью дельта-метода:

Эта формула буквально кричит нам о том, что распределение процентных приростов будет симметричным, нормальным и несмещенным. Да и на всех моих симуляциях ровно эту картину я и наблюдал. Как выяснилось, это работает только в соевом мире больших выборок и маленьких стандартных ошибок.
Откуда байас
Когда мы строим распределение разностей средних и берем его мат. ожидание, работает такая логика

Давайте попытаемся сделать что-то похожее для процентных приростов

Для того чтобы ≠ стало =, нужно чтобы E[1 / Y_bar^c] = 1 / mu^c. Представьте, что вы многократно сэмплируете контрольную группу и считаете среднее, возведенное в степень -1. Затем строите распределение таких величин и смотрите на его мат. ожидание. Если оно будет равно мат. ожиданию в контрольной группе, возведенному в степень -1, то наблюдаемый процентный прирост будет несмещенной оценкой истинного процентного прироста.
Это верно только в одном случае – когда Y_bar^c – константа (то есть никогда). В общем же случае наблюдаемые процентные приросты будут систематически переоценивать истинный процентный прирост. То есть наша выборочная оценка является смещенной.

Чем больше разброс значений, тем сильнее будет выражен байас. Вот гифка с демонстрацией этого явления.
Более того, теоретичсекое распределение процентных приростов может вообще не иметь мат. ожидания и дисперсии. В частности, если Y_bar^c и Y_bar^t распределены нормально и имеют нулевые мат. ожидания, то их отношение будет иметь распределение Коши. Оно похоже на нормальное, но с более толстыми хвостами. Эти хвосты вылезают из-за того, что мы делим числитель на близкие к 0 значения знаменателя, получая таким образом большие хвостовые значения случайной величины. Как раз в силу этих толстых хвостов у распределения Коши нет ни мат. ожидания, ни дисперсии.
Фан-факт про распределение Коши: Если вы будете многократно брать выборки одинакового размера из распределения Коши, чтобы построить распределение средних, то оно будет в точности таким как то, из которого вы брали выборки.

Распределение Коши, хоть и не имеет моментов n-го порядка, по крайней мере симметрично относительно медианы/моды. Если же Y_bar^c и Y_bar^t распределены нормально, но имеют ненулевые мат. ожидания, то распределение их отношений будет несимметричным. Для положительной метрики типа выручки на пользователя вы получите длинный хвост справа.
Все эти проблемы будут всплывать при большом коэффициенте вариации знаменателя, SE(Y^c_bar) / Y^c_bar, потому что существенная масса распределения Y^c_bar в таком случае сконцентрирована возле 0. Конечно же в такой ситуации симметричный ДИ, построенный с помощью дельта-метода, будет иметь покрытие, меньшее чем нужно.
Second order Taylor
Каждый раз когда я открывал статью Алекса Денга и видел в формуле ДИ для ratio-метрик слагаемое "+ bc", я думал, что bc расшифровывается как "some Bullshit you should never Care about".

Иногда я еще думал, что это поправка, которая делает оценку SE ratio-метрики более точной. Как выяснилось, это поправка, которая делает более точной не SE, а точечную оценку (что логично, учитывая то, что "+ bc" располагается в строчке с point estimate). Если мы приближаем (Y^t_bar - Y^c_bar) / Y^c_bar с помощью разложения в ряд Тейлора первого порядка, а затем берем мат. ожидание, то получаем просто процентный прирост.

Если же мы разложим в ряд Тейлора второго порядка, то как раз и получим формулу со скриншота выше

В теории такой скорректированный прирост (pest со скрина) должен давать более точную точечную оценку интересующего нас отношения mu^t / mu^c – 1. На практике же это some bullshit you should never care about.
Ну ладно, на самом деле это, наверное, лучшее, что можно репортить в качестве точечной оценки (мб еще можно сюда добавить поправку Эджворта – Алекс Денг упоминает её в той же статье). Но по крайней мере на моих данных корректировка "+ bc" проблему недопокрытия ДИ решить не смогла.
Доверительные интервалы Филлера
Раз дельта-метод не справляется, давайте использовать что-нибудь поточнее. Что-нибудь поточнее предложил Филлер. Но прежде чем переходить к методу Филлера, давайте вспомним, что доверительный интервал – это такой интервал, который при многократном построении будет содержать в себе истинное значение параметра с заданной частотой. Построение ДИ для уже реализованной выборки эквивалентно нахождению всех возможных значений параметра, для которых наблюдаемая статистика не попадает в критическую область.
Вооружившись этим знанием, давайте для наглядности сайд-бай-сайд рассмотрим процедуру построения ДИ для разности средних и для отношения двух средних по методу Филлера.

Наша задача – проверить соотносятся ли наблюдаемые данные с предположением о том, что интересующий нас параметр ρ (или Δ для разности средних) равен ρ_0 (Δ_0 для разности средних). Все значения ρ_0, для которых это так, будут формировать нужный нам ДИ.
Обе гипотезы мы можем переписать таким образом, чтобы ρ_0 (Δ_0) оказалось слева, а справа был 0. Это ключевой момент в подходе Филлера. Нам очень неудобно работать с отношением, но вполне себе удобно работать с линейной комбинацией. Ведь E[X_bar] = mu_X и E[Y_bar] = mu_Y. Другими словами, мы можем спокойно использовать наши наблюдаемые оценки X_bar и Y_bar для построения несмещенной статистики.
После перехода к "Эквивалентной форме" (см. скрин) наша задача сводится к тому, чтобы проверить, что при конкретном значении ρ_0 (Δ_0) статистика лежит вне критической области распределения вокруг 0. То есть проверить гипотезу H_0: mu_x – ρ_0*mu_Y = 0. Если мы найдем все такие значения ρ_0 (Δ_0), то получим нужный ДИ. И в случае с Филлером, примененным к отношению средних, и в случае с разностью средних обе статистики будут (ассимптотически) иметь t-распределение. Фактически нам нужно просто решить неравенство T(ρ_0) <= |t_crit|относительно ρ_0.
Перепишем дисперсию из знаменателя T(ρ_0):

Подставим её в неравенство T(ρ_0) <= |t_crit| и приведем его к классическому виду:

Графически это парабола, направление ветвей которой определяется знаком коэффициента A. Если вы приравняете A к 0 и совершите несколько арифметических операций, то обнаружите, что проверяете гипотезу о равенстве знаменателя 0. Если знаменатель статистически значимо отличается от 0, то A > 0, и ветви параболы будут смотреть вверх, и ДИ, который мы получим, будет в привычном формате [ρ_left, ρ_right]. В противном случае ДИ будет открытым (–inf, ρ_left] ∪ [ρ_right, +inf). Чуть позже посмотрим на геометрическую интерпретацию явления. А пока давайте найдем корни:

Это формула границ ДИ Филлера для отношения каких-то двух нормально распределенных случайных величин. На практике нас интересуют отношения
- (Y_bar^t - Y_bar^c) / Y_bar^c
- (Y_bar^t_CUPED - Y_bar^c_CUPED) / Y_bar^c
Заменим x и y и преобразуем дисперсии и ковариации:


Итоговые формулы для ДИ Филлера будут выглядеть так:
- Для процентного прироста

- Для CUPED-прироста

Кстати, обе формулы при g = 0 будут удивительным образом превращаться в формулы, полученные с помощью дельта-метода. А еще помните, что я говорил, что дельта-метод будет работать плохо при большом коэффициенте вариации знаменателя? Попробуйте разглядеть его в g.
Графическая интерпретация метода Филлера
Теперь давайте посмотрим, как можно представить ДИ Филлера геометрически. Это поможет нам понять, почему интервал может в некоторых случаях (при A < 0) быть открытым.
Возьмем 2 случайные величины X_bar и Y_bar. Нас интересует ДИ для отношения их мат. ожиданий mu_Y / mu_X (тут x в знаменателе, а y в числителе, потому что я брал картинку ниже из чужой статьи). Смотрим на левую часть картинки – график a. Нанесем на координатную плоскость точку с наблюдаемыми значениями (X_bar, Y_bar).
Вокруг этой точки построим эллипс, для которого верно то, что если мы будем многократно строить эллипс таким образом для разных значений (X_bar, Y_bar), то точка (mu_X, mu_Y) будет попадать внутрь эллипса в 95% случаев. Доверительное множество, короче.

Также проведем прямую через точки (0,0) и (X_bar, Y_bar). Уравнение этой прямой y = (Y_bar / X_bar) * x. В точке пересечения этой прямой и вертикальной прямой x = 1 значение по y будет равно Y_bar / X_bar. Разукрасим эту точку в жирный (она помечена крестиком).
А теперь давайте возьмем еще одну точку внутри эллипса – (X_bar*, Y_bar*). Так как эта точка находится внутри доверительного множества, она, как и любая другая точка внутри элипса, является кандидатом на роль (mu_X, mu_Y). Аналогичным образом пересечем прямую y = (Y_bar* / X_bar*) * x с прямой x = 1. Точку пересечения тоже разукрасим в жирный.
Повторим этот процесс для всех точек внутри эллипса. В итоге на прямой x = 1 мы получим жирненький отрезок, состоящий из точек с такой координатой по y, которая соответствует отношению Y_bar* / X_bar* для всех X_bar* и Y_bar*, которые исходя из наших данных являются кандидатами на роль mu_X и mu_Y (лежат внутри эллипса). Если доверительное множество (элипс) не ошиблось и действительно содержит в себе точку (mu_X, mu_Y), то и наш отрезок содержит в себе значение mu_Y / mu_X по оси ординат. Так как доверительное множество не ошибается в 95% случаев, то наш отрезок тоже. А значит наш отрезок – 95% ДИ для mu_Y / mu_X 😎. Более того, он совпадает с тем интервалом, что мы получили, решая квадратное уравнение, то есть с интервалом Филлера.
Границы жиреньекого отрезка – коэффициенты наклона касательных к эллипсу через точку 0. Они соответствуют таким парам X_bar* и Y_bar*, для которых отношение Y_bar* / X_bar* является минимальным и максимальным. По мере того как мы будем сдвигать эллипс влево к оси ординат, верхняя касательная будет пересекать прямую x = 1 все выше и выше. Когда эллипс коснется оси y, верхняя граница ДИ уйдет в бесконечность. Это логичное поведение – чем ближе к 0 знаменатель, тем больше будет наблюдаемое отношение.
А если сдвинуть эллипс еще больше влево, как на графике b, то то, что было верхней касательной, при пересечении с x = 1 теперь будет давать верхнюю границу нижней части интервала (-inf, ρ_left]. То есть интервал станет (-inf, ρ_left] ∪ [ρ_right, +inf), что соответствует ситуации, когда в квадратном уравнении A < 0 (= когда знаменатель статистически не отличим от 0).
Филлер-стайл бутстрэп
Способность стать незакрытым – это то, что отличает ДИ Филлера от ДИ, построенного с помощью дельта-метода и классического бутстрэпа. И то, что делает его более точным с точки зрения процента покрытия.
Если у вас есть сомнения в том, что распределение t-статистики по Филлеру будет t, то можно использовать бутстрап, предложенный тут.
- Сэмплируете с повторениями отдельно тест и контроль
- На каждой итерации считаете t-статистику T(ρ), подставляя исходный процентный прирост (Y_bar^t - Y_bar^c) / Y_bar^c вместо ρ
- Находите квантили бутстрапированного распределения t статистики
- Решаете уравнение t_0.025 <= T(ρ) <= t_0.975 для ρ
Такой ДИ, как и классический ДИ Филлера, может быть как закрытым, так и открытым, что делает его более точным, чем ДИ, полученный с помощью классического процентильного бутстрэпа.
Мой тгк @abtesticles