Задайте условия
Выберите готовую ситуацию или задайте условия сами. Браузер сгенерирует сотни наборов данных с известным истинным значением, применит к каждому десять оценок и сравнит их ошибки.
Где ПМ точнее остальных
Где точнее другие оценки
Условия
Настройки метода
Почему так
Ошибка оценок — чем левее, тем лучше
Так выглядят данные в этих условиях
Один из сгенерированных наборов: красным — выбросы, зелёная линия — истинное значение, рядом — оценки на этом наборе.
Повторить у себя (Python, те же числа; файлы benchmark.py и ifpa.py):
Как меняется картина
Одна точка условий — ещё не ответ. Здесь браузер проходит ряд значений и показывает, где ПМ выигрывает, а где уступает. Остальные условия берутся из панели «Условия» выше.
Подсвечены значения, при которых ПМ — лучшая из всех десяти оценок. Наведите на график, чтобы увидеть значения всех линий. 150 наборов на точку.
В клетке — лучшая оценка в этих условиях и отношение ошибки ПМ к ошибке лучшей из остальных девяти: меньше 1 — ПМ точнее. Наведите на клетку, чтобы увидеть числа. 80 наборов на клетку, поэтому соседние клетки могут немного отличаться случайно.
Итог: какую оценку выбрать
| Ситуация | Признаки в ваших данных | Что выбрать | ПМ против лучшей из остальных | |
|---|---|---|---|---|
| ПМ точнее остальных | ||||
| Часть результатов смещена и заявляет слишком малую неопределённость | узкие интервалы далеко от основной группы и не перекрываются с ней | ПМ | точнее на 36–44 % | |
| Мало результатов, один из них — уверенный выброс | 4–6 результатов, один узкий интервал в стороне | ПМ | точнее на 41–52 % | |
| Уверенные выбросы в обе стороны | узкие интервалы в стороне по обе стороны от основной группы | ПМ | точнее на 15–30 % | |
| Тяжёлые хвосты и уверенные выбросы | много далёких значений, у части — узкие интервалы | ПМ | точнее на 43–49 % | |
| Все занижают погрешность, а часть ещё и сбоит | интервалы перекрываются хуже, чем должны; есть узкие интервалы в стороне | ПМ | точнее на 37 % | |
| Погрешность ограничена, часть результатов сдвинута | известен предел погрешности: класс точности, разрешение, допуск | ПМ | точнее на 37–41 % | |
| Погрешность ограничена, сбои в обе стороны с обычной неопределённостью | то же, сдвинутые результаты по обе стороны | ПМ | точнее на 48–62 % | |
| Погрешность ограничена, выбросов нет | все интервалы перекрываются, предел погрешности известен | ПМ | точнее на 22–25 % | |
| Погрешность скошена, выбросы в одну сторону | отклонения в одну сторону длиннее, чем в другую | ПМ | точнее на 27–29 % | |
| Точнее другие оценки | ||||
| Выбросов нет, погрешность нормальная, неопределённости честные | все интервалы перекрываются, χ² согласия в норме | Взвешенное среднее | хуже на 27–28 % | |
| Выбросы в обе стороны с обычной неопределённостью | далёкие результаты с широкими, «честными» интервалами | Медиана, алгоритм A ISO 13528 | хуже в 1,5–1,6 раза | |
| Разброс больше заявленного у всех («тёмная» неопределённость) | интервалы систематически не перекрываются, явных выбросов нет | DerSimonian–Laird | хуже в 1,5–1,7 раза | |
| Тяжёлые хвосты без уверенных выбросов | далёкие значения встречаются, но их неопределённость обычная | Мода смеси, согласованное подмножество | хуже в 1,8–1,9 раза | |
| Около четырёх результатов, выброс с обычной неопределённостью | очень мало результатов | Медиана, Ходжес–Леман | хуже на 17–21 % | |
| Результаты распадаются на две группы равной силы | две согласованные внутри группы | Ни одна: разберитесь с группами | — | Открыть пример |
Числа — отношение среднеквадратичных ошибок ПМ и лучшей из остальных девяти оценок, 500 наборов, зёрна 1 и 7. Наведите на ситуацию, чтобы увидеть, почему так.
Как устроена имитация
Конфигуратор — это эксперимент Монте-Карло: браузер много раз генерирует набор результатов с известным истинным значением, применяет к каждому набору все десять оценок и смотрит, насколько каждая ошиблась. Всё считается у вас в браузере; тот же расчёт повторяет benchmark.py с теми же числами.
Данные
Истинное значение равно нулю; все величины измеряются в единицах σ — типичного стандартного отклонения измерения. Для каждого из m результатов:
- заявленная неопределённость uk = 1, а если включено «неопределённости разные» — случайна от 0,5 до 2, равномерно по логарифму (точные и грубые результаты встречаются одинаково часто);
- результат xk = r · uk · ε + τ · N(0, 1), где ε — погрешность выбранного распределения, r — во сколько раз реальная погрешность больше заявленной, τ — «тёмная» неопределённость, общая для всех и не отражённая в uk;
- с вероятностью «доля выбросов» результат становится выбросом: к нему прибавляется смещение — всегда в плюс, если выбросы односторонние, или со случайным знаком. Заявленная неопределённость выброса умножается на выбранный множитель, а реальный разброс остаётся прежним: множитель 0,3 означает «ошибся на 6σ и уверен, что точен втрое лучше обычного».
Распределения погрешности ε: нормальное; равномерное и треугольное (ограниченные — цифровой прибор, округление, допуск); Лапласа (острый пик, экспоненциальные хвосты); Стьюдента с 3 степенями свободы (тяжёлые хвосты); логнормальное с параметром формы 0,6 (скошенное). Все приведены к нулевому среднему и единичной дисперсии, поэтому различается только форма.
Какие оценки сравниваются
| Использует | Оценки |
|---|---|
| только значения x | среднее арифметическое, медиана, оценка Ходжеса–Лемана, робастное среднее ISO 13528 (алгоритм A) |
| x и u как вес | взвешенное среднее и взвешенная медиана (веса 1/u²), DerSimonian–Laird, наибольшее согласованное подмножество, мода смеси распределений |
| x и u как ширина интервала | преференциальная медиана: каждый результат — один голос, узкий интервал не даёт лишнего веса |
Формулы и код всех оценок — на странице «Код».
Преференциальная медиана в имитации
Результат «голосует» интервалом x ± k·u; по умолчанию k = 2, как у расширенной неопределённости в метрологии (≈ 95 %). Разбиение ДАЗ — мелкое, с нормой h не больше 0,05 медианы u: она заменяет самоуточнение IF&PA-A из статей. Можно выбрать среднее разбиение (h ≤ 0,2u) или разбиение облегчённой версии IF&PA-L (h по самому узкому интервалу). Если максимальное покрытие достигается в двух несмежных областях, берётся самая широкая из них, а при равной ширине — ближайшая к медиане результатов. Остальные оценки получают исходные x и u.
Под рейтингом конфигуратор показывает варианты ПМ с другими разбиениями и k и место, которое занял бы каждый. В рейтинг они не входят: выбрать лучший вариант, зная истину, — нечестное преимущество.
Как сравниваются оценки
- место — по среднеквадратичной ошибке (корень из среднего квадрата отклонения от истины): она учитывает и смещение, и разброс, и сильно наказывает редкие большие промахи;
- медианная ошибка — типичный промах: в половине наборов ошибка меньше;
- 90 % ошибок меньше — промах в плохих, но не исключительных наборах;
- накрытие ±2u — доля наборов, где интервал оценки ±2u её собственной неопределённости накрыл истину; честная оценка неопределённости даёт около 95 %. Прочерк — у оценки нет своей неопределённости.
Насколько точна сама имитация
Среднеквадратичная ошибка по N наборам сама случайна: её относительная погрешность — около 1/√(2N),
то есть примерно 3 % при 500 наборах и 5 % при 200. Разница мест при ошибках, отличающихся на несколько процентов, —
случайность; значимым считайте отрыв от 10 % и больше. Проверить устойчивость просто: смените зерно или увеличьте число наборов.
Генератор случайных чисел детерминирован: с тем же зерном результат повторяется в браузере и в benchmark.py.
Графики «Как меняется картина» считают 150 наборов на точку, карта — 80 на клетку.
Чего имитация не учитывает
- корреляций между результатами (общий эталон, общая методика);
- нескольких групп результатов сравнимой силы — такой случай разобран в калькуляторе;
- несимметричных интервалов и дрейфа измеряемой величины.
Поэтому конфигуратор отвечает на вопрос «какая оценка надёжнее в условиях такого типа», а не «какое значение верно для моих данных» — для этого есть калькулятор.