Может ли машинное обучение предсказать следующий лесной пожар в Сан-Диего?

Может ли машинное обучение предсказать следующий лесной пожар в Сан-Диего?

При рассмотрении климатически обусловленных природных катастроф в Соединённых Штатах лесные пожары часто занимают передовые позиции в обсуждениях. По мере того как лесные пожары становятся всё более распространёнными, они приводят к увеличению ущерба и воздействия на общество; к примеру, в 2025 году пожары в Лос-Анджелесе охватили около 40 000 акров земли в этом регионе и привели к оценочным убыткам и экономическим потерям свыше 200 миллиардов долларов.

Но Лос-Анджелес — лишь один из многих примеров районов, где зарегистрирован резкий рост пожаров, подогреваемых климатическими изменениями. По данным Climate Central, число «пожарной погоды» дней в Сан-Диего, штат Калифорния, растёт; в близлежащих юго-восточных пустынных бассейнах, включая Палм-Спрингс, оно увеличилось на целых 60 дней между 1973 и 2024 годами.

Существует множество факторов, которые влияют на распространённость пожаров в этих районах, но к наиболее частым относятся погодные показатели, такие как влажность, температура и скорость ветра. В рамках этого анализа мы рассматриваем прошлые данные по Сан-Диего, чтобы выяснить, могут ли эти конкретные переменные служить предикторами возникновения пожаров в регионе.

Данные: переменные погоды, связанные с пожарами, и случаи их возникновения

Исторические данные по пожарам из штата Калифорния (Cal Fire), а также данные о погоде от Национального управления океанических и атмосферных исследований (NOAA) за период с 2019 по 2025 год были собраны для отслеживания случаев возгораний и погодных показателей в Сан-Диего за данный промежуток времени.

Ежедневные измерения погоды по средней влажности, средней скорости ветра, максимальным и минимальным температурам сухого столбика и пиковым скоростям ветра были объединены и использованы в качестве множества независимых переменных для предсказания того, произойдёт ли пожар в конкретный день или нет (да/нет) в качестве зависимой бинарной переменной по отношению ко всем этим показателям. Ниже приводится карта зарегистрированных пожаров в округе Сан-Диего за период с 2019 по 2025 год.

Figure 1: Map of wildfire occurrences in San Diego County between 2019 and 2025. Data: Cal Fire.

Чтобы предсказывать появления пожаров на этом наборе данных, была построена и поочерёдно сопоставлена три бинарные модели машинного обучения, чтобы определить, какая из них наиболее пригодна для их прогнозирования.

Чтобы справедливо оценить наши модели, данные разделили на две группы: 70% были использованы как «обучающий набор», чтобы научить модели историческим связям между погодными паттернами и пожарами, в то время как оставшиеся 30% были отложены как «тестовый набор». Этот тестовый набор выступает экзаменом, оценивая, насколько точно модели предсказывают пожары на данных, которых они ранее не видели.

Результаты модели логистической регрессии

Первая из трёх построенных моделей — модель логистической регрессии — это алгоритм машинного обучения, используемый для бинарной классификации, для предсказания вероятности бинарного исхода; в данном случае — вероятность того, произойдут ли пожары или нет.

После построения модели были определены ключевые параметры, позволяющие расшифровать результаты. Первый из них — показатель точности, который оценивает соотношение правильно классифицированных случаев. Следующим параметром была точность предсказания, аналогичная показателю точности, но ориентированная на корректность предсказания «чистых» дней (количество дней без пожаров, которые были предсказаны верно, по сравнению с днями, когда предсказано отсутствие пожаров, но они всё же произошли). Результаты модели логистической регрессии приведены ниже.

Параметры логистической регрессии Значение
Точность 95,96%
Точность предсказания 95,96%

Последним найденным параметром стала матрица ошибок, которая показывает, где модель была правой и где ошибалась в предсказанных против фактических исходов.

Результаты модели наивного байеса

Вторая из трёх построенных моделей — классификатор Наивного Байеса, который также применяется для бинарной классификации (предсказания двух различных исходов). Эта модель отличается от логистической регрессии тем, что она применяется не только для расчёта вероятности события в будущем, но и предполагает, что признаки (передаваемые в модель переменные) являются независимыми друг от друга; другими словами, наличие одного признака не влияет на другие и они не имеют взаимосвязи (отсюда и название «наивный» классификатор). После построения этой модели были найдены те же ключевые параметры, что и для модели логистической регрессии, результаты приведены ниже.

Параметры классификатора наивного Байеса Значение
Точность 95,80%
Точность предсказания 95,95%

Результаты модели случайного леса

Последняя из трёх моделей — случайный лес, который также используется для бинарной классификации, но отличается от первых двух тем, что состоит из большого количества деревьев решений, или узлов, которые представляют собой решения. Каждое «листье» представляет исход (возникновение пожара или нет), и все они работают вместе как ансамбль: каждое дерево выдает предсказание, и тот исход, который набирает большее количество голосов в ансамбле, становится предсказанием модели. После построения этой модели показатели точности и предсказаний были вновь определены, и результаты приведены ниже.

Параметры случайного леса Значение
Точность 96,12%
Точность предсказания 96,42%

Заключительные мысли

Возвращаясь к исходному вопросу о том, можно ли использовать потенциальные переменные прогнозирования пожаров для предсказания случаев возгорания в Сан-Диего, результаты показывают, что это возможно, и все три модели демонстрируют очень высокую точность и прецизионность. Однако модель случайного леса показала чуть более высокие значения точности (96,12% против 95,96% и 95,80%) и прецизионности (96,42% против 95,96% и 95,95%) по отношению к двум другим моделям.

Более того, глядя на матрицу ошибок, модель случайного леса оказалась немного более надёжной в прогнозах: хотя она зафиксировала две ложные тревоги по пожарам, а наивный байесовский классификатор — одну, именно случайный лес смог обнаружить наибольшее число реальных случаев возгораний в данных (три случая), тогда как две другие модели предсказали ноль. Несмотря на то, что видно, что большинство дней не сопровождаются возгоранием, зафиксированы случаи примерно в 4% от общего числа дней; поскольку модель случайного леса смогла корректно предсказать несколько из этих реальных случаев, её применение предпочтительнее в таком сценарии.

Wildfire in San Diego, California.Wildfire in San Diego, California.

Хотя результаты анализа оказались впечатляющими, существует ещё множество способов расширить работу, например, исследование других регионов Калифорнии с использованием тех же данных Cal Fire или других штатов США с различными источниками statewide-данных. Ещё один путь — запустить дополнительные алгоритмы машинного обучения, подходящие для бинарной классификации, такие как обычное дерево решений, нейронная сеть или метод опорных векторов (SVM), и использовать их как дополнительные точки сравнения с тремя моделями, созданными для данного анализа.

По мере того как пожары продолжают нарастать по частоте в ряде регионов из-за изменения климата, исследование различных методов прогнозирования их возникновения предоставляет важные знания для надлежащей подготовки и стимулирует развитие инициатив в области устойчивости.