Где преференциальная медиана полезна — проверьте сами

Ни одна оценка не лучшая всегда. Задайте условия — шум, выбросы, честность неопределённостей — и браузер покажет на сотнях сгенерированных наборов, какая из десяти оценок точнее и почему. Итоговая таблица — внизу страницы.

Задайте условия

Выберите готовую ситуацию или задайте условия сами. Браузер сгенерирует сотни наборов данных с известным истинным значением, применит к каждому десять оценок и сравнит их ошибки.

Где ПМ точнее остальных

Где точнее другие оценки

Условия

сколько результатов объединяется (лабораторий, датчиков, повторов)
у всех распределений нулевое среднее и дисперсия σ2; различается форма
σ — типичная погрешность измерения, единица всех величин на странице
1 — неопределённости честные; 2 — все результаты ошибаются вдвое сильнее, чем заявляют
общий для всех результатов разброс, не отражённый в заявленных u
вероятность, что результат окажется выбросом
насколько далеко выброс от истинного значения
чем меньше, тем «увереннее» ошибочный результат — и тем сильнее он тянет взвешенные оценки

Настройки метода

каким интервалом результат «голосует»; в метрологии интервал результата — x ± 2u. На взвешенные оценки не влияет
под рейтингом появятся строки ПМ с другими настройками и место, которое каждая заняла бы; считается дольше

Как меняется картина

Одна точка условий — ещё не ответ. Здесь браузер проходит ряд значений и показывает, где ПМ выигрывает, а где уступает. Остальные условия берутся из панели «Условия» выше.

Итог: какую оценку выбрать

СитуацияПризнаки в ваших данныхЧто выбратьПМ против лучшей из остальных
ПМ точнее остальных
Часть результатов смещена и заявляет слишком малую неопределённостьузкие интервалы далеко от основной группы и не перекрываются с нейПМточнее на 36–44 %
Мало результатов, один из них — уверенный выброс4–6 результатов, один узкий интервал в сторонеПМточнее на 41–52 %
Уверенные выбросы в обе стороныузкие интервалы в стороне по обе стороны от основной группыПМточнее на 15–30 %
Тяжёлые хвосты и уверенные выбросымного далёких значений, у части — узкие интервалыПМточнее на 43–49 %
Все занижают погрешность, а часть ещё и сбоитинтервалы перекрываются хуже, чем должны; есть узкие интервалы в сторонеПМточнее на 37 %
Погрешность ограничена, часть результатов сдвинутаизвестен предел погрешности: класс точности, разрешение, допускПМточнее на 37–41 %
Погрешность ограничена, сбои в обе стороны с обычной неопределённостьюто же, сдвинутые результаты по обе стороныПМточнее на 48–62 %
Погрешность ограничена, выбросов нетвсе интервалы перекрываются, предел погрешности известенПМточнее на 22–25 %
Погрешность скошена, выбросы в одну сторонуотклонения в одну сторону длиннее, чем в другуюПМточнее на 27–29 %
Точнее другие оценки
Выбросов нет, погрешность нормальная, неопределённости честныевсе интервалы перекрываются, χ² согласия в нормеВзвешенное среднеехуже на 27–28 %
Выбросы в обе стороны с обычной неопределённостьюдалёкие результаты с широкими, «честными» интерваламиМедиана, алгоритм A ISO 13528хуже в 1,5–1,6 раза
Разброс больше заявленного у всех («тёмная» неопределённость)интервалы систематически не перекрываются, явных выбросов нетDerSimonian–Lairdхуже в 1,5–1,7 раза
Тяжёлые хвосты без уверенных выбросовдалёкие значения встречаются, но их неопределённость обычнаяМода смеси, согласованное подмножествохуже в 1,8–1,9 раза
Около четырёх результатов, выброс с обычной неопределённостьюочень мало результатовМедиана, Ходжес–Леманхуже на 17–21 %
Результаты распадаются на две группы равной силыдве согласованные внутри группыНи одна: разберитесь с группами—Открыть пример

Числа — отношение среднеквадратичных ошибок ПМ и лучшей из остальных девяти оценок, 500 наборов, зёрна 1 и 7. Наведите на ситуацию, чтобы увидеть, почему так.

Как устроена имитация

Конфигуратор — это эксперимент Монте-Карло: браузер много раз генерирует набор результатов с известным истинным значением, применяет к каждому набору все десять оценок и смотрит, насколько каждая ошиблась. Всё считается у вас в браузере; тот же расчёт повторяет benchmark.py с теми же числами.

Данные

Истинное значение равно нулю; все величины измеряются в единицах σ — типичного стандартного отклонения измерения. Для каждого из m результатов:

  • заявленная неопределённость uk = 1, а если включено «неопределённости разные» — случайна от 0,5 до 2, равномерно по логарифму (точные и грубые результаты встречаются одинаково часто);
  • результат xk = r · uk · ε + τ · N(0, 1), где ε — погрешность выбранного распределения, r — во сколько раз реальная погрешность больше заявленной, τ — «тёмная» неопределённость, общая для всех и не отражённая в uk;
  • с вероятностью «доля выбросов» результат становится выбросом: к нему прибавляется смещение — всегда в плюс, если выбросы односторонние, или со случайным знаком. Заявленная неопределённость выброса умножается на выбранный множитель, а реальный разброс остаётся прежним: множитель 0,3 означает «ошибся на 6σ и уверен, что точен втрое лучше обычного».

Распределения погрешности ε: нормальное; равномерное и треугольное (ограниченные — цифровой прибор, округление, допуск); Лапласа (острый пик, экспоненциальные хвосты); Стьюдента с 3 степенями свободы (тяжёлые хвосты); логнормальное с параметром формы 0,6 (скошенное). Все приведены к нулевому среднему и единичной дисперсии, поэтому различается только форма.

Какие оценки сравниваются

ИспользуетОценки
только значения xсреднее арифметическое, медиана, оценка Ходжеса–Лемана, робастное среднее ISO 13528 (алгоритм A)
x и u как весвзвешенное среднее и взвешенная медиана (веса 1/u²), DerSimonian–Laird, наибольшее согласованное подмножество, мода смеси распределений
x и u как ширина интервалапреференциальная медиана: каждый результат — один голос, узкий интервал не даёт лишнего веса

Формулы и код всех оценок — на странице «Код».

Преференциальная медиана в имитации

Результат «голосует» интервалом x ± k·u; по умолчанию k = 2, как у расширенной неопределённости в метрологии (≈ 95 %). Разбиение ДАЗ — мелкое, с нормой h не больше 0,05 медианы u: она заменяет самоуточнение IF&PA-A из статей. Можно выбрать среднее разбиение (h ≤ 0,2u) или разбиение облегчённой версии IF&PA-L (h по самому узкому интервалу). Если максимальное покрытие достигается в двух несмежных областях, берётся самая широкая из них, а при равной ширине — ближайшая к медиане результатов. Остальные оценки получают исходные x и u.

Под рейтингом конфигуратор показывает варианты ПМ с другими разбиениями и k и место, которое занял бы каждый. В рейтинг они не входят: выбрать лучший вариант, зная истину, — нечестное преимущество.

Как сравниваются оценки

  • место — по среднеквадратичной ошибке (корень из среднего квадрата отклонения от истины): она учитывает и смещение, и разброс, и сильно наказывает редкие большие промахи;
  • медианная ошибка — типичный промах: в половине наборов ошибка меньше;
  • 90 % ошибок меньше — промах в плохих, но не исключительных наборах;
  • накрытие ±2u — доля наборов, где интервал оценки ±2u её собственной неопределённости накрыл истину; честная оценка неопределённости даёт около 95 %. Прочерк — у оценки нет своей неопределённости.

Насколько точна сама имитация

Среднеквадратичная ошибка по N наборам сама случайна: её относительная погрешность — около 1/√(2N), то есть примерно 3 % при 500 наборах и 5 % при 200. Разница мест при ошибках, отличающихся на несколько процентов, — случайность; значимым считайте отрыв от 10 % и больше. Проверить устойчивость просто: смените зерно или увеличьте число наборов. Генератор случайных чисел детерминирован: с тем же зерном результат повторяется в браузере и в benchmark.py. Графики «Как меняется картина» считают 150 наборов на точку, карта — 80 на клетку.

Чего имитация не учитывает

  • корреляций между результатами (общий эталон, общая методика);
  • нескольких групп результатов сравнимой силы — такой случай разобран в калькуляторе;
  • несимметричных интервалов и дрейфа измеряемой величины.

Поэтому конфигуратор отвечает на вопрос «какая оценка надёжнее в условиях такого типа», а не «какое значение верно для моих данных» — для этого есть калькулятор.