Разрыв между MAE и RMSE в 15-20% при прогнозировании временных рядов в CatBoost чаще всего указывает не на ошибку модели, а на наличие нефильтрованных выбросов в данных. В Yandex DataSphere Studio этот разрыв становится критическим маркером качества датасета, позволяя локализовать аномалии до того, как они обрушат точность бизнес-прогноза.
MAE vs RMSE: математика поиска аномалий
Средняя абсолютная ошибка (MAE) дает линейную оценку отклонения, в то время как среднеквадратичная ошибка (RMSE) возводит разницу в квадрат, тем самым «штрафуя» модель за крупные промахи. На практике, если RMSE превышает MAE более чем в 1.5 раза, вы имеете дело с «тяжелыми хвостами» распределения ошибок. Например, при прогнозировании почасового спроса на электроэнергию (диапазон 100-500 МВт) MAE в 15 МВт при RMSE в 45 МВт сигнализирует о единичных всплесках, которые модель не смогла предсказать.
Экспертный вывод: используйте отношение RMSE/MAE как коэффициент «зашумленности» данных. Если коэффициент растет при увеличении окна обучения, значит, ваши данные содержат структурные сдвиги или некачественные замеры, которые требуют очистки.
Локализация слабых мест в датасетах
Анализ остатков (residuals) в DataSphere позволяет понять, где именно CatBoost теряет точность. Часто ошибка концентрируется в периоды высокой волатильности: например, в ритейле это всплески продаж в 3-5 раз выше нормы в периоды промо-акций. Если модель стабильно ошибается на 20-30% именно в эти пики, проблема заключается в отсутствии внешних признаков (фичей), а не в настройке алгоритма.
Мини-кейс: при анализе цен на логистику ошибка RMSE росла на 40% каждые выходные. Решением стала автоматизация Feature Engineering для временных рядов в DataSphere: создание бинарного признака «выходной день» и лагов за предыдущие 3 недели, что снизило RMSE с 1200 до 850 руб. за рейс.
Влияние обработки пропусков на метрики
Некорректное заполнение пустот в данных напрямую раздувает RMSE. Использование простого среднего значения (mean imputation) в рядах с ярко выраженным трендом создает искусственные скачки, которые CatBoost воспринимает как реальные паттерны. Это приводит к переобучению на шуме, когда MAE кажется приемлемой, но модель катастрофически ошибается на тестовой выборке (out-of-sample).
Сравнение методов: линейная интерполяция в рядах с сезонностью снижает RMSE на 10-12% по сравнению с заполнением константой. Поэтому обработка пропусков в временных рядах для CatBoost: сравнение методов интерполяции и заполнения должна стать первым этапом перед финальным расчетом метрик.
Борьба с переобучением через анализ ошибок
Когда разница между MAE на обучающей и валидационной выборках превышает 5-7%, модель начинает «запоминать» шум. В CatBoost это часто связано с избыточной глубиной деревьев (depth > 6) на малых датасетах (до 5000 наблюдений). В таком случае RMSE на тесте может быть в 2-3 раза выше, чем на трейне, что делает прогноз бесполезным для бизнеса.
Экспертный вывод: чтобы купировать этот эффект, внедряйте борьба с переобучением CatBoost на малых наборах данных временных рядов: методы регуляризации и кросс-валидации. Оптимальный путь — ограничение iterations и использование ранней остановки (early_stopping_rounds) на основе минимизации RMSE, а не MAE, чтобы модель была более устойчивой к выбросам.
Вывод
Для достижения промышленного качества прогноза в DataSphere откажитесь от слепого доверия одной метрике. Мой выбор — итеративный подход: сначала минимизируем RMSE для подавления грубых ошибок и очистки данных, затем доводим MAE до целевых бизнес-показателей. Избегайте простых методов заполнения пропусков и глубины деревьев более 6 на выборках менее 10к строк. Начните с анализа отношения RMSE/MAE — если оно выше 1.4, тратьте время не на гиперпараметры, а на поиск аномалий в исходном датасете.
