Статистическая значимость оценки

Наблюдаемая разница может быть шумом выборки. Стандартная ошибка биномиального распределения √(p(1-p)/n): при 100 примерах и успехе 70% полоса шума ±9 пунктов — разница 3% несущественна. Правильный подход для одного набора задач — парный анализ (критерий Макнемара: смотреть только примеры, где результаты разошлись) — чувствительнее вычитания независимых долей. Ловушка множественных сравнений: при 6 гипотезах вероятность ложноположительного вывода ~26% — нужна поправка Бонферрони или независимая перепроверка. Несколько прогонов с разными сидами обязательны.

Связано: Метрики оценки агентов, Три уровня системы оценки