Масштабное картографирование земного покрова на основе мультимодальных данных и мульти-модельного слияния

  • role: First author第一作者
  • Affiliation:

    Hangzhou Institute for Advanced Study, School of Physics and Optoelectronic Engineering, University of Chinese Academy of Sciences, Hangzhou 310024, China

    Shanghai Institute of Technical Physics, Chinese Academy of Sciences, Shanghai 200083, China

  • Email:ruyifan22@mails.ucas.ac.cn
  • Introduction:E-mail ruyifan22@mails.ucas.ac.cn
RU Yifan12,  
  • Affiliation:

    Hangzhou Institute for Advanced Study, School of Physics and Optoelectronic Engineering, University of Chinese Academy of Sciences, Hangzhou 310024, China

TANG Guoliang1,  
  • role: Corresponding author通信作者
  • Affiliation:

    Shanghai Institute of Technical Physics, Chinese Academy of Sciences, Shanghai 200083, China

  • Email:Lichunlai@mail.sitp.ac.cn
  • Introduction:E-mailLichunlai@mail.sitp.ac.cn
LI Chunlai2*

реферат

Современное картографирование изменения земного покрова сталкивается с такими основными проблемами, как ограниченность однородных источников данных, высокая гетерогенность данных и недостаточная обобщающая способность одиночных моделей. В связи с этим в настоящем исследовании на основе спектральных характеристик мультиспектральных изображений MSI (Multispectral Imagery) и особенностей данных синтетической апертурной радиолокации SAR (Synthetic Aperture Radar) была построена мультимодальная база данных (MSI+SAR) для компенсации недостатков одиночных данных SAR в сложных условиях. Кроме того, после систематической оценки 7 репрезентативных моделей на уровне моделей предложен метод мульти-модельного слияния, объединяющий 3 типа архитектур: FCN, представляющий сверточные нейронные сети (CNN); ConViT, представляющий визуальные трансформеры (ViT); CoAtNet, представляющий гибридную архитектуру CNN-ViT. Результаты экспериментов показывают, что мультимодальные данные (MSI+SAR) обеспечивают значительное улучшение по сравнению с одиночными SAR по двум ключевым показателям семантической сегментации: общая точность (OA) и частотно-взвешенное пересечение пересечения (FWIoU). Предложенная структура мульти-модельного слияния дополнительно улучшает показатели OA и FWIoU. Предложенный в исследовании инновационный метод не только усиливает способность моделей извлекать сложные характеристики объектов, но и эффективно повышает качество классификации в масштабном картографировании земного покрова, подтверждая мощный потенциал мультимодальных данных и мульти-модельного слияния в дистанционном зондировании.

ключеви́че слова́

картографирование земного покрова;мультиспектральный;синтетическая апертура радара;мультимодальный;мульти-модельное слияние;сверточная нейронная сеть;визуальный трансформер

Введение

Картография почвенно - растительного покрова является одним из основных направлений научных исследований в области дистанционного зондирования, которое обеспечивает важную базу данных для глобального мониторинга окружающей среды, рационального использования ресурсов и устойчивого развития путем точной классификации типов поверхностных объектов.Congalton等,2014*Wu等,2024В)). Картография почвенно - растительного покрова имеет чрезвычайно широкий охват и охватывает гидрологический мониторинг (Jacqueminet等,2013Оценка сельскохозяйственных ресурсов (Oetter等,2001Охрана окружающей среды (Zhang等,2021Многие области (García-Mora等,2012В)). Однако традиционные методы картирования почвенно - растительного покрова часто опираются на мономодальные данные дистанционного зондирования, получаемые с помощью одного датчика (Li等,2023Несмотря на то, что производительность в определенных сценариях является приемлемой, все еще существуют значительные недостатки в точности классификации и пружинности перед лицом сложной и гетерогенной поверхностной среды (Joshi等,2016В)).
Многоспектральное изображение MSI (Multispectral Imagery), как основной источник данных дистанционного зондирования в настоящее время, записывает спектральную информацию о отражении объектов через несколько спектральных каналов и может эффективно различать типы объектов, таких как растительность, водоемы и голая почва, основным преимуществом которой является предоставление обширной спектральной информации (Thyagharajan和Vignesh,2019В)). Тем не менее, данные MSI подвержены облачному покрову, атмосферному рассеянию и изменениям в условиях освещения, а их доступность и точность классификации серьезно ограничены в облачных и дождливых районах или затененных районах (Haque等,2024В)). Кроме того, MSI в основном полагается на спектральные характеристики и имеет ограниченную способность различать объекты с аналогичными спектральными реакциями, но различными структурами (например, различные типы сельскохозяйственных культур, материалы для городских зданий и т. Д.), что приводит к путанице результатов классификации.
Напротив, радар с синтезированной апертурой SAR (Synthetic Aperture Radar), как активная технология микроволнового дистанционного зондирования, не зависит от внешних условий освещения и обладает высокой способностью проникать в атмосферные помехи, такие как облака и дымка, и может непрерывно и стабильно получать информацию о поверхности в различных сложных условиях окружающей среды. Изображения SAR отражают структурные характеристики объектов с помощью радиолокационных сигналов и широко используются в таких областях, как мониторинг изменений рельефа местности, оценка стихийных бедствий и анализ городского строительства. Хотя изображения SAR имеют очевидные преимущества в извлечении структурных характеристик объекта, их спектральная информация ограничена и может привести к менее точной классификации, чем изображения MSI в некоторых задачах (Brown和Porcello,1969В)).
Таким образом, мультимодальный подход к интеграции данных MSI и SAR стал важным направлением исследований в области обработки изображений дистанционного зондирования. Органически сочетая богатые спектральные характеристики MSI с уникальной структурной информацией SAR, эта стратегия слияния может эффективно компенсировать ограничения, присущие одному источнику данных, и значительно повысить точность классификации объектов. Интеграция мультимодальных (MSI + SAR) данных не только повышает способность модели к обучению представлениям, но и значительно улучшает распознавание сложных типов объектов, демонстрируя значительные технические преимущества в применении картирования почвенно - растительного покрова (Quan等,2020В)). В частности, спектральные характеристики, предоставляемые данными MSI, могут быть использованы для различения материала, а структурная информация, предоставляемая данными SAR, помогает определить трехмерные характеристики объекта.
В последние годы с быстрым развитием технологий искусственного интеллекта, особенно методов глубокого обучения, технологии картирования почвенно - растительного покрова достигли прорыва (Ajibola和Cabral,2024*Paheding等,2024В)). поLi等(2022)В качестве примера была предложена модель L2HNet, которая успешно генерировала карты почвенно - растительного покрова с высоким разрешением благодаря инновационному использованию маркировки земного покрова с низким разрешением, что значительно улучшило способность выражать детали изображения. Общая проблема нехватки учебных образцов (Tong等,2025),Li等(2024)Дальнейшая разработка слабой системы мониторинга « Paraformer», метод, который эффективно смягчает проблему дефицита высококачественных данных маркировки путем внедрения исторических данных с низким разрешением в качестве сигналов мониторинга.
В глобальном масштабе было выпущено несколько репрезентативных продуктов растительного покрова (Grekousis等,2015В)). Национальная база данных почвенно - растительного покрова (NLCD), разработанная Геологической службой США (USGS), обеспечивает важную поддержку данных для анализа долгосрочных изменений почвенно - растительного покрова в США (Wickham等,2021); Китайский набор данных о почвенно - растительном покрове (CLCD), разработанный национальной исследовательской группой, обеспечивает важную поддержку данных для мониторинга почвенно - растительного покрова в региональном масштабе (Yang和Huang,2021В)). Несмотря на значительный прогресс, достигнутый в отношении существующих продуктов почвенно - растительного покрова, точность классификации в сложных поверхностных условиях еще предстоит повысить (Xu等,2024В)).
В ответ на эти проблемы в исследовании предлагается инновационное техническое решение: во - первых, создание мультимодальных наборов данных на основе изображений MSI и данных SAR для преодоления ограничений одного SAR - данных; Во - вторых, на основе данных мультимодальных (MSI + SAR) были объединены три передовые модели сверточной нейронной сети (CNN), визуального преобразователя (Vit) и гибридной архитектуры CNN - Vit (FCN, ConViT и CoAtNet соответственно), что значительно повысило точность классификации сложных поверхностных сцен и прочность моделей.

2 Обзор района исследования и набор данных

какFig. 1Как показано, область исследования, выбранная для этого исследования, находится в Пекине, Китай. Используемые в эксперименте многоспектральные данные HP - 6 и SAR - 3, полученные с помощью спутников серии HP, были получены в период с конца 2019 года по начало 2020 года, чтобы обеспечить минимизацию изменений наземных целей между различными изображениями. На платформе ENVI 5.6 многоспектральные данные с высокой оценкой VI обрабатываются с помощью таких этапов предварительной обработки, как радиационная коррекция, быстрая коррекция спектрального гиперкубического анализа атмосферного обзора (FLAASH), коррекция положительного излучения и выбор диапазона, в результате чего отображается изображение с пространственным разрешением до 10 м. Операция выбора диапазона используется для удаления поглощения водяного пара, шума и низкого качества диапазона, тем самым поддерживая качество изображения (Liu等,2024В)).
figure

Fig. 1 Schematic of the study area and data sources

Данные SAR с высоким рейтингом 3 собираются в широкополосном режиме с пространственным разрешением 10 м и шириной 100 км. Данные SAR предварительно обрабатываются с помощью функции удаления пятен и топографической коррекции в наборе инструментов ENVI SARscape Analytics. Выберите фильтр Refined Lee с размером скользящего окна 5×5 пикселей для удаления пятнистого шума; В то же время топографическая коррекция данных SAR осуществляется с использованием данных Глобальной цифровой модели высоты GMTED 2010 (DEM).Hong等,2023В)). Кроме того, размер и разрешение данных SAR с высокой оценкой 3 такие же, как и у изображений MSI с высокой оценкой 6 (Liu等,2024В)).
Изображение MSI, использованное в эксперименте, представляет собой трехмерный куб данных, размер которого составляет 256×256×4 канала. Изображения SAR также являются трехмерными кубиками данных с размерами 256×256×2 каналов. Формат и структура данных ПодробнееFig. 1иFig. 2А.
figure

Fig. 2 Comparison of single-modal and multi-modal data, from left to right: baseline land cover map, single-modal SAR data, multispectral data, multi-modal fusion data

Четыре канала для каждого изображения MSI соответствуют следующему диапазону: синий спектр 0,4 - 0,52 мкм (B1); Зеленый спектр в диапазоне 0,52 - 0,60 мкм (B2); Красный спектр в диапазоне 0,63 - 0,69 мкм (B3); Диапазон ближнего инфракрасного спектра (B4) в диапазоне 0,76 - 0,90 мкм. Два канала для каждого изображения SAR соответствуют двум различным способам поляризации HH и HV. Канал HH показывает, что радиолокационная передача и прием сигналов являются горизонтальной поляризацией; Канал HV показывает, что сигнал радиолокационной передачи является горизонтальной поляризацией, а полученный сигнал - вертикальной поляризацией. В то же время оба канала для каждого изображения SAR относятся к C - диапазону (частота около 5,3 ГГц, длина волны около 3,1 см).
Задача картирования почвенно - растительного покрова в этом исследовании охватывает 14 категорий объектов и требует точной классификации каждой точки пикселя на изображении. какFig. 1Как показано внизу, каждая из этих категорий имеет конкретное имя. Каждый набор экспериментальных данных содержит изображение MSI и соответствующее изображение SAR, которые сравниваются с реальным почвенно - растительного покрова реальной земли с точки зрения пространственного положения и разрешения в качестве эталонного стандарта.

3 Методы исследования

3.1 Показатели оценки

В этом исследовании используется общая точность OA (Overall Accuracy) и частотное взвешивание, а также FWIoU (Frequency - Weighted Intersection over Union) в качестве основного индикатора оценки.Fitzgerald和Lees,1994*LeCun等,1998Математические выражения OA и FWIOU являются
В формуле C обозначает общее количество категорий; TP c означает, что модель правильно предсказала количество пикселей для определенной категории; c обозначает конкретную категорию; n c означает реальное общее количество пикселей категории c , то есть n c = TP c + FN c , в котором FN c указывает количество пикселей, которое не было правильно предсказано для определенной категории.
В формуле n c также означает общее количество реальных пикселей категории c , то есть nc=TPc+FNc, Среди них FN c также указывает на неправильное прогнозирование количества пикселей для определенной категории; TP c также означает, что модель правильно предсказала количество пикселей для определенной категории; c обозначает конкретную категорию; FP c означает количество пикселей, которое модель ошибочно предсказала для определенной категории; FN c означает количество пикселей, которое не было правильно предсказано для определенной категории.
ОА используется для оценки точности классификации модели по всему набору данных и позволяет получить эффективные результаты измерений, когда распределение категорий относительно равномерно. В FWIOU учитывается несбалансированность распределения классов, а частоты классов взвешиваются путем суммирования, что более полно отражает уровень производительности модели в случае неравномерного распределения классов. Как правило, чем выше значение этих двух показателей, тем выше точность классификации и надежность модели представления.

3.2 Многомодальные данные

Это исследование объединяет изображения MSI с изображениями SAR, генерирует мультимодальные данные и сравнивает их с мономодальными данными, состоящими из одного изображения SAR. Затем эти два типа данных были введены в семь репрезентативных моделей машинного обучения с семантическим разделением для сравнения, чтобы оценить преимущества производительности мультимодальных данных по сравнению с мономодальными данными.
В частности, с помощью метода обучения под надзором для выбранной CoAtNet (Dai等,2021), ConViT(D’Ascoli等,2022), FCN(Shelhamer等,2017), HRNet(Wang等,2021), LinkNet(Chaurasia和Culurciello,2017), U-Net(Ronneberger等,2015Эти 6 репрезентативных моделей глубокого обучения и Random Forest (Rodriguez-Galiano等,2012*Congalton等,2014Эта репрезентативная модель семантического разделения машинного обучения проходит обучение и тестирование. Каждая модель использует два набора данных, построенных на основе мономодальных данных SAR и мультимодальных данных (MSI + SAR), чтобы получить полную оценку нейтральных энергетических различий между мономодальными и полимодальными данными в семантическом разделении задач.
Данные, используемые в этом институте, можно разделить на две категории: во - первых, мономодальные данные соответствуют эталонным меткам, соответствующим их истинному соответствию.Fig. 2а) мономодальные данные SAR и базовые карты почвенно - растительного покрова; Во - вторых, многомодальные данные соответствуют эталонным меткам, соответствующим их истинному соответствию, отдельноFig. 2Данные о мультимодальной интеграции и базовые карты почвенно - растительного покрова.
В более подробной форме, исследование создало два набора данных, каждый из которых содержал 7140 наборов учебных образцов. Каждый набор учебных образцов состоит из одномодальных данных SAR, мультимодальных данных (MSI + SAR) и соответствующих реальных эталонных меток, которые демонстрируют абсолютную согласованность в пространственном положении. На этапе моделирования 7140 образцов одномодального обучения SAR из первого набора данных и 7140 образцов многомодального обучения (MSI + SAR) из второго набора данных были импортированы в семь моделей семантического разделения машинного обучения: CoAtNet, ConVit, FCN, HRNET, LinkNet, U - Net и Random Forest. Затем на этапе тестирования модели 1428 тестовых образцов первого набора данных и 1428 тестовых образцов, соответствующих второму набору данных, были введены в семь моделей, которые были обучены. В конечном итоге, на основе двух ключевых показателей, OA и FWIOU, была проведена комплексная оценка производительности модели в мультимодальных (MSI + SAR) сценариях данных и мономодальных сценариях данных SAR.

3.3 Многомодельные стратегии слияния

Специфика мультимодельной стратегии слиянияFig. 3. Эта стратегия эффективно интегрирует способность CNN извлекать локальные детали и способность ViT воспринимать глобальную информацию, тем самым улучшая характеристики и классификационные характеристики модели (Chua,1997*Dosovitskiy等,2021В)). Классификационные свойства моделей оцениваются с использованием показателей OA и FWIOU.
figure

Fig. 3 Schematic diagram of the multi-model fusion framework

какFig. 3На левой стороне показаны входные мультимодальные (MSI + SAR) данные метода мультимодельного слияния. Справа, красная пунктирная рамка содержит 3 ветви, соответственно, ветви визуального преобразователя (ViT), сверточной нейронной сети (CNN) - гибридной ветви визуального преобразователя (ViT) и ветви сверточной нейронной сети (CNN). Каждая ветвь выводит размер 256256.14 Трехмерный тензор, соответствующий трем категориям вероятностных картАА. Каждый канал в диаграмме вероятности для каждой категории соответствует размеру 256256 Двумерная матрица, представляющаяFig. 1Двумерное распределение прогнозируемых вероятностей по одной из 14 категорий.
В частности, ветви ViT используют модель ConViT для изучения эффекта извлечения характеристик на основе механизма самовнимания; Смешанная ветвь CNN - Vit использует модель CoAtNet для достижения слияния характеристик в сочетании с преимуществами свертки и преобразователя; В подразделении CNN используется модель FCN, которая фокусируется на возможностях извлечения характеристик традиционных сверточных сетей.
Его можно выразить двумя математическими формулами:
В формуле,Показывает 256 пикселей, полученных из ветви визуального преобразователя (Vit), соответствующей классу c Двумерная прогнозируемая матрица вероятностей 256 пикселей.Показывает 256 пикселей, соответствующих классу c , полученных из гибридной ветви сверточной нейронной сети (CNN) и визуального преобразователя (Vit)Двумерная прогнозируемая матрица вероятностей 256 пикселей.Показывает 256 пикселей, полученных из ветви сверточной нейронной сети (CNN), соответствующей классу c Двумерная прогнозируемая матрица вероятностей 256 пикселей.
w 1 , w 2 , w 3 Fig. 3Весы: Weight 1, Weight 2, Weight 3. Весовые коэффициенты, отражающие различные модели.
Показывает 256 пикселей, соответствующих 3 классам c 256 - пиксельная матрица вероятностиААПосле слияния была получена новая двумерная матрица вероятности прогноза.Показать двумерную матрицу вероятности прогноза в измерении каналаИз первых 256 пикселей256 - пиксельная матрица вероятностиДо последнего 256256 Двумерная матрица вероятности прогнозаОбъединить, чтобы создать новый размер 256 пикселей256 пикселей14 - канальная трехмерная карта вероятности классаА.
через式(5)Конвертировать с конечным выходом в 256 пикселейДвумерная матрица 256 пикселейЭтот результат соответствует картам почвенно - растительного покрова, созданным после моделирования.
式(5)Описание двумерной матрицы.Каждый элемент и трехмерный тензорСоответствие между элементами. Среди них значение c имеет диапазон значений от 0 до 13 целых чисел (включая 0 и 13), соответствующих 14 категориям индексов, каждое конкретное значение c обозначает класс индекса иСоответствующий указатель канала. Соответствие конкретных категорий и индексовFig. 1Категории в маркировке. В формуле выражение a иСоответствующий индекс произвольной строки. b ПоказатьиСоответствующий индекс произвольного столбца.
式(5)Описание двумерной матрицы.Произвольный элементЗначение и трехмерный тензорОтношения. Если c находится в диапазоне целых чисел от 0 до 13 (включая 0 и 13) иПри достижении максимума максимальное значение соответствует значению c Значение. Это значение c иFig. 1Категории указаны соответствующим образом.
И, наконец, через правильноеиFig. 3Набор входных данных слева соответствует пиктограмме реального почвенно - растительного покрова, которая сравнивает показатели OA и FWIOU, чтобы оценить производительность этой мультимодельной стратегии слияния.

4 Эксперименты и анализ результатов

4.1 Экспериментальные настройки

Аппаратная среда для этого эксперимента использует графический процессор RTX 4090 от Nvidia. В программной среде используется язык программирования Python 3.9 и фреймворк PyTorch 2.3.
Во время обучения модели глубокого обучения параметры устанавливаются следующим образом: цикл обучения (epoch) составляет 600, каждый из которых содержит 892 итерации; Размер партии (batch size) составляет 32.
Выбор учебных циклов имеет научный характер, и, наблюдая и анализируя изменения производительности в процессе обучения, в этой статье определяется рациональность 600 раундов обучения. Это объясняется следующими причинами:
(1) Быстрое повышение производительности на начальном этапе обучения: например,Fig. 4иFig. 5Как показано, в первых 100 итерациях модели производительность (например, показатели FWIOU и OA) значительно улучшилась. После этого, с увеличением количества раундов обучения, скорость улучшения производительности постепенно замедляется, как правило, стабилизируется. Таким образом, 600 раундов обучения гарантируют полное обучение модели и достижение стабильной производительности.
figure

Fig. 4 The relationship between the average FWIoU of the ConViT model’s output results and the number of training iterations under multimodal (MSI+SAR) data

figure

Fig. 5 The relationship between the average FWIoU of the ConViT model’s output results and the number of training iterations under multimodal (MSI+SAR) data

(2) Экспериментальное наблюдение и стабильность производительности: В ходе нескольких экспериментов мы обнаружили, что количество 600 раундов обучения позволяет модели достичь высокой стабильности, а дальнейшее увеличение количества циклов обучения для улучшения производительности уже очень ограничено. отFig. 4иFig. 5Можно видеть, что производительность модели вступила в фазу стабилизации после значительного улучшения в предыдущей итерации, поэтому 600 раундов обучения являются разумным выбором.
(3) Избегайте чрезмерной адаптации и стабильности модели: учитывая постепенную стабилизацию производительности модели во время обучения, выбор 600 раундов обучения не только предотвращает риск переосмысления, но и обеспечивает согласованность производительности модели в течение более длительного периода времени.
Кроме того, пространственный размер входных данных составляет 256 пикселей.256 - пиксельные графические блоки, произвольно вырезанные для 4 размеров 224 пикселей во время тренировки224 - пиксельные подсхемы и соответственно разделить метки на блоки гамет. Оптимизатор выбирает AdamW с начальным коэффициентом обучения 0001; Функция потери - функция потери перекрестной энтропии (Cross - Entropy Loss). Планировщик уровня обучения использует ReduceLRONPlateau.
Вышеуказанная конфигурация предназначена для оптимизации эффективности обучения модели и обеспечения научного характера эксперимента.

4.2 Эксперименты по сопоставлению мультимодальных и мономодальных данных

Table 1Результаты работы одномодальных данных SAR были зафиксированы в шести методах семантического разделения глубокого обучения, включая CoAtNet, ConViT, FCN, HRNET, LinkNet, U - Net и Random Forest, а также в классической модели классификации пикселей машинного обучения. Для оценки производительности используются показатели общей точности и частотного взвешивания. Данные в таблице представляют собой средние значения OA и FWIOU, полученные каждой моделью на момент тестирования на основе одного и того же набора данных 1428.

Table 1 The performance of different models on Single-modality data

模型OAFWIoU
CoAtNet
ConViT80.0068.98
FCN52.2241.88
HRNet53.2744.74
LinkNet51.5343.08
U-Net48.9941.13
Random Forest41.5234.46
Table 2Представлена производительность мультимодальных (MSI + SAR) данных в семи моделях, а оценочные показатели также установлены для OA и FWIOU. Данные в таблице взяты из иTable 1Средние значения OA и FWIOU для тех же 1428 наборов тестовых данных.

Table 2 The performance of different models on Multi-modality data

ModelsOAFWIoU
CoAtNet64.3655.34
ConViT88.2180.48
FCN
HRNet58.3749.63
LinkNet58.8750.71
U-Net54.2045.99
Random Forest44.6637.08
С помощью двухосной ломаной диаграммы производительность различных моделей сравнивается с одномодальными данными SAR и мультимодальными данными (MSI + SAR).Fig. 6А.
figure

Fig. 6 Performance evaluation of different models on multi-modal SAR+MSI data and single-Modal SAR data

В сочетании с таблицами 1 - 2 естьFig. 6Можно сделать вывод, что в этих семи моделях полимодальные данные, объединяющие данные MSI, значительно улучшили как средний OA, так и средний FWIOU по сравнению с одномодальными данными, состоящими из одного SAR. Это убедительно свидетельствует о том, что внедрение полимодальных данных может эффективно повысить способность модели распознавать характеристики поверхности; Кроме того, с точки зрения мономодальных данных SAR и мультимодальных данных (MSI + SAR), модель ConViT превосходит остальные модели по обоим показателям, демонстрируя более сильную способность к извлечению характеристик и семантическому разделению.

4.3 Эксперимент по слиянию нескольких моделей

Чтобы повысить производительность модели более эффективно, это исследование, подкрепленное мультимодальными данными, представляет инновационную стратегию слияния нескольких моделей. Эта стратегия сочетает в себе преимущества трех превосходных моделей семантического разделения глубокого обучения: модели ConViT с Vit в качестве основной структуры; Модель CoAtNet, смешанная CNN с Vit; А также модель FCN, в которой доминирует CNN.
какTable 3Показано, согласноFig. 3Три ветви веса, определенные в weight1(w1)、weight2(w2)、weight3(w3) Были проведены сравнительные эксперименты с семью наборами различных параметров. Выбор этих весовых комбинаций основан на четырех основных соображениях:

Table 3 The results of different weights in the test phase

权重OA/%FWIoU/%
w1=0.6, w2=0.2, w3=0.2(baseline)89.2881.89
84.9376.35
w1=0.4, w2=0.3, w3=0.387.1679.07
w1=0.5, w2=0.25, w3=0.25
w1=0.7, w2=0.15, w3=0.1589.0981.64
w1=0.8, w2=0.1, w3=0.188.8181.25
w1=0.9, w2=0.05, w3=0.0588.5180.86
(1) На основеTable 2В результате « производительности различных моделей на мультимодальных данных» мы обнаружили, что точность CoAtNet аналогична точности FCN, поэтому предоставление равного веса обоим помогает сбалансировать вклад обоих в мультимодальном слиянии, то есть w 2 = w 3 . Такая расстановка весов гарантирует, что они дополняют друг друга и вместе повышают производительность конечной модели, избегая чрезмерного доминирования любой ветви.
(2) Поскольку модель ConVit хорошо зарекомендовала себя на OA и FWIOU, она может обеспечить более высокое качество представления характеристик по сравнению с другими моделями, такими как CoAtNet и FCN. Таким образом, постепенно увеличиваясь, можно проверить влияние модели ConVit на слияние нескольких моделей, особенно когда вес ConViT постепенно увеличивается, что приводит к значительному улучшению производительности.
(3) О весовых комбинацияхЦель состоит в том, чтобы проверить, как характеристики нескольких моделей работают вместе в слиянии без предвзятости к одной модели, и посмотреть, можно ли получить лучшую производительность.
(4) Кроме того, при выборе шага w 1 , скорректированном с использованием шага 0,1, можно эффективно фиксировать шаги, которые оказывают большее влияние на конечную производительность в пределах разумного экспериментального диапазона, так что каждое изменение в эксперименте может отражать значительные различия в производительности, что помогает быстро определить наилучшую комбинацию весов. Напротив, слишком малые шаги (например, 0,05) увеличивают количество экспериментов, что может привести к тому, что незначительные изменения окажут незначительное влияние на конечный результат, а также увеличит нагрузку на вычисления и анализ.
При этом в качестве входных данных используются мультимодальные (MSI + SAR) данные, которые сначала обучают модели ConVit, CoAtNet и FCN, а полученные модели служат основой для последующих экспериментов. Модель слияния для семи наборов различных весовых комбинаций, на основеTable 3Для оценки комбинаций используются показатели OA и FWIOU2. Результаты испытаний каждой комбинации весов взяты из средних значений выходных результатов 1428 наборов данных, согласующихся с « Экспериментом по сопоставлению 4.2 мультимодальных и мономодальных данных».
Экспериментальные результаты показывают, что в случае w 1 = 0,6, w 2 = 0,2, w 3 = 0,2, общая производительность полимодальной стратегии слияния лучше, чем у других комбинаций, средняя общая точность 89,28%, среднее взвешенное соотношение пересечений 81,89%. Эта комбинация весов работает значительно лучше, чем остальные 6 групп, демонстрируя лучший эффект слияния.
Кроме этого, в " i>w1=0.6、w2=0.2、w3=0.2; w1=0.5、w2=0.25、w3=0.25; w1=0.7、w2=0.15、w3=0.15; w1=0.8、w2=0.1、w3=0.1; w1=0.9、w2=0.05、w3=0.05 В сочетании с этими пятью наборами весов средняя общая точность и среднее соотношение частот стратегии слияния с несколькими моделями лучше, чем у одной модели ConVit, которая лучше всего работает при вводе мультимодальных данных. В условиях мультимодального ввода данных средняя общая точность и среднечастотное взвешивание ConViT составили 88,21% и 80,48% соответственно, в то время как стратегия мультимодельного слияния показала лучшую производительность по обоим показателям.

4.4 Визуализация результатов

Fig. 7Показывает сравнение результатов вывода различных моделей глубокого обучения на основе одномодальных данных SAR;Fig. 8Было показано сравнение результатов вывода различных моделей глубокого обучения в мультимодальном режиме (SAR + MSI).
figure
figure
figure

Fig. 7 The comparison of output results from different deep learning models on single-modal SAR data

figure
figure
figure

Fig.8 The comparison of output results from different deep learning models on multimodal (SAR+MSI) data

По сравнениюFig. 7иFig. 8Результаты классификации и реальные вкладки, соответствующие пространственным позициям, видны: результаты классификации в мономодальных данных SAR, таких какFig. 7Показано более низкое соответствие с реальной этикеткой; После введения данных MSI для формирования мультимодального ввода, например,Fig. 8Как показано, точность результатов классификации значительно повысилась. Этот феномен подтверждает преимущества мультимодальных (MSI + SAR) данных в классификации почвенно - растительного покрова, которые повышают способность модели к распознаванию с помощью комплементарных характеристик.
Fig. 9Показаны результаты экспериментов по слиянию данных с несколькими моделями слияния (MSI + SAR) с различными комбинациями весов при использовании мультимодальных данных в качестве входных условий. иFig. 9По сравнению,Fig. 8Визуализация результатов в той или иной степени имеет определенные ограничения. Например, модели CoAtNet, HRNET и LinkNet не обладают достаточными возможностями для сбора подробной информации, что приводит к более заметным трещинам в результатах классификации; С другой стороны, модель FCN игнорирует общую пространственную структурную согласованность из - за чрезмерного акцента на извлечении локальных характеристик. Вышеприведенные сравнительные результаты убедительно свидетельствуют о том, что дезагрегированный эффект картирования почвенно - растительного покрова может быть дополнительно оптимизирован на основе мультимодальных (MSI + SAR) данных путем мультимодельного слияния с использованием разумного сочетания весов.
figure
figure
figure

Fig. 9 The output results of the multimodel fusion strategy based on multimodal (SAR+MSI) data under different weight combinations

5 Обсуждение

В этом исследовании мы использовали общую точность (OA) и взвешенное соотношение частот (FWIOU) в качестве основных показателей для оценки производительности и продемонстрировали эффективность предложенного мультимодельного метода слияния в задачах картирования почвенно - растительного покрова посредством визуального сравнения результатов. Хотя производительность модели может быть количественно оценена с помощью показателей OA и FWIOU, только эти показатели и визуальные результаты не полностью раскрывают причины, лежащие в их основе. Таким образом, в настоящем разделе подробно рассматриваются преимущества предлагаемых методов и лежащие в их основе научные причины в контексте технологии дистанционного зондирования.

5.1 Разнообразие и сложность данных дистанционного зондирования

Применение изображений дистанционного зондирования для картирования почвенно - растительного покрова сталкивается с ключевыми проблемами, такими как высокая неоднородность поверхности и сложные типы объектов (Lu等,2010В)). Разнообразие ландшафта и пространственно - временная изменчивость спектральных характеристик местности часто затрудняют классификацию на основе одного источника данных для достижения желаемой точности. В частности, многодиапазонные свойства данных дистанционного зондирования, хотя и обеспечивают богатый спектральный объем информации, также создают проблемы, присущие изотопному спектру (один и тот же объект имеет различную спектральную реакцию в разных диапазонах) и изоспектру инородного тела (различные объекты ведут себя одинаково в определенных диапазонах) (Sharma等,2018:: Van Der Werff and Van Der Meer, 2008;Mickaelian和Sargsyan,2010В)). Например, при гетероспектральных проблемах некоторые категории объектов (например, леса и пахотные земли) могут обладать аналогичными спектральными реакциями в определенных диапазонах, но их поведение в разных диапазонах значительно различается из - за различий в условиях роста и их физических характеристиках. В случае гомоспектральной проблемы инородного тела характеристики отражения различных категорий объектов (например, водоемов и водно - болотных угодий) в некоторых спектральных диапазонах сильно перекрываются, что приводит к значительному снижению точности классификации мономодальных изображений дистанционного зондирования в этом контексте.
Эта проблема особенно заметна в сложных ситуациях, таких как горы и водно - болотные угодья. Сложные рельефные флуктуации и плотное распределение объектов делают спектральные характеристики различных категорий объектов более сходными, что в сочетании с такими факторами, как шумовые помехи, изменения окружающей среды и условия освещения, еще больше снижает надежность классификации традиционных мономодальных изображений дистанционного зондирования (Rehman等,2021В)). В ответ на эту проблему многомодальная стратегия слияния данных демонстрирует значительные преимущества. Среди них изображения MSI с помощью многоспектральной спектральной информации могут эффективно улавливать спектральные различия объектов и имеют уникальную ценность в решении проблем гомологического спектра; С другой стороны, данные SAR демонстрируют сильную способность различать инородные объекты в односпектральных сценариях путем извлечения структурных характеристик поверхности.
Эксперименты показали, что синергическое слияние данных MSI и SAR значительно улучшило классификационные характеристики модели (Table 1иTable 2В)). Эта стратегия полимодального слияния не только повышает способность модели к распознаванию благодаря взаимодополняемости спектрально - структурных характеристик, но и демонстрирует отличную адаптивность в сложных топографических областях.

5.2 Преимущества мультимодельного слияния

Как видно из таблиц 1 - 3, хотя модель ConVit превосходит отдельные модели, такие как CoAtNet и FCN, по показателям OA и FWIOU, ее классификационные характеристики были еще более улучшены за счет объединения этих трех моделей. Это повышение производительности в основном связано с взаимодополняющей синергией моделей на уровне принятия решений по извлечению характеристик и классификации (Arpitha等,2023В)). В частности, модель ConViT с ее глобальным механизмом внимания отлично зарекомендовала себя в моделировании зависимости на большие расстояния; С другой стороны, CoAtNet демонстрирует большую прочность при работе со сложными объектами пространственной структуры, сочетая в себе локальные возможности извлечения характеристик CNN и преимущества глобального моделирования ViT, особенно в районах с размытыми границами и резкими изменениями рельефа; С другой стороны, модель FCN имеет уникальные преимущества в задачах захвата деталей и точной классификации благодаря своей полностью сверточной структуре. Таким образом, стратегия конвергенции с несколькими моделями не только сохраняет преимущества каждой модели, но и компенсирует недостатки одной модели в конкретных категориях объектов, тем самым повышая общую точность классификации.

5.3 Классификация деталей местности

Исследование охватывает 14 типов объектов со значительными гетерогенными свойствами, включая типичный поверхностный покров в естественной и искусственной среде. В частности, 14 типов объектов в исследовании включают: фон, который обычно обозначается как неопределенная или несвязанная часть, часто удаляется, чтобы подчеркнуть важные элементы; поверхностные воды, включая воды, такие как реки, озера и водохранилища; Улицы, включая городскую или сельскую дорожную систему; Городские районы, охватывающие высокозастроенные городские районы, включая жилые и деловые районы; Промышленные, коммерческие и транспортные земли, включая промышленные объекты, коммерческие объекты и транспортную инфраструктуру, такие как аэропорты и железнодорожные станции; Минералы, свалки и строительные площадки, включая наземные рудники, зоны обращения с отходами и строительные площадки; Районы искусственного растительного покрова, которые относятся к искусственно культивируемой растительности, такой как газоны, зеленые насаждения и сады; пахотные земли, сельскохозяйственные угодья, используемые для сельскохозяйственного производства; Постоянные сельскохозяйственные угодья, районы выращивания долгосрочных культур, таких как фруктовые деревья, виноград и оливки; Пастбищные угодья, луга и другие пастбищные угодья; Леса, включая естественные и искусственно выращенные хвойные и широколиственные леса; Кусты, покрытые преимущественно кустарниковыми растениями; b) открытые земли без растительности, т.е. голые земли, песчаные поля, скалистые районы и другие земли без растительного покрова; Внутренние водно - болотные угодья, включая небрежные районы, такие как болота и торфяники.

5.4 Визуальный анализ результатов

отFig. 7- Да.Fig. 9Визуализация в результатах наглядно показывает, что модели слияния имеют значительные преимущества в идентификации различных типов объектов. В частности, в районах со сложной топографией и широким спектром типов объектов, модели слияния более заметны в деталях и могут лучше различать похожие категории объектов, уменьшая классификационные трещины и ошибки классификации. Кроме того,Fig. 9Результаты слияния в различных комбинациях весов также показывают, что разумная настройка веса может значительно повысить конечный эффект классификации и оптимизировать производительность модели.
В частности,Fig. 9Было продемонстрировано преимущество мультимодельных стратегий слияния с различными комбинациями весов при работе с районами с сложной топографией и богатыми деталями. Разумно устанавливая вес каждой модели, можно оптимизировать реагирование модели на различные типы объектов и повысить способность распознавать сложные категории объектов, такие как города, водно - болотные угодья и леса. сравнениеFig. 8иFig. 7Результаты классификации моделей при вводе мультимодальных (MSI + SAR) данных показывают более детальное распределение объектов по сравнению с одномодальными данными SAR, особенно в городских районах и водоемах, где точность классификации значительно улучшилась.

6 Заключение

В исследовании предложена инновационная основа для интеграции мультимодальных данных для картирования почвенно - растительного покрова и оптимизации взаимодействия с несколькими моделями. На уровне данных при слиянии изображений MSI с данными SAR на уровне канала были созданы мультимодальные наборы данных с дополнительным выражением характеристик. Экспериментальная проверка показала, что эта стратегия слияния данных значительно повышает точность классификации и обобщение модели по сравнению с едиными данными SAR.
Что касается архитектуры модели, то механизм мультимодельного слияния, предложенный в этом исследовании, обеспечивает взаимодополняемость между локальным извлечением характеристик и глобальным контекстным моделированием путем совместной оптимизации гибридных ветвей, объединяющих ветви CNN, ветви ViT, CNN и ViT. Как количественные эксперименты, так и визуальный анализ подтверждают, что стратегия слияния может эффективно повысить точность и прочность распознавания объектов в сложных сценариях.
Это исследование предлагает новые технические идеи для картирования почвенно - растительного покрова на основе глубокого обучения, а его многомодальные рамки обработки данных и стратегии мультимодельного слияния обеспечивают не только важную теоретическую поддержку в области картирования почвенно - растительного покрова, но и новые идеи и направления для будущих исследований и практического применения.

References

  1. 1.
    Ajibola S and Cabral P. 2024. A systematic literature review and bibliometric analysis of semantic segmentation models in land cover mapping. Remote Sensing, 16(12): 2222
  2. 2.
    Brown W M and Porcello L J. 1969. An introduction to synthetic-aperture radar. IEEE Spectrum, 6(9): 52-62
  3. 3.
    Chaurasia A and Culurciello E. 2017. LinkNet: exploiting encoder representations for efficient semantic segmentation//2017 IEEE Visual Communications and Image Processing (VCIP). St. Petersburg: IEEE: 1-4
  4. 4.
    Chua L O. 1997. CNN: a vision of complexity. International Journal of Bifurcation and Chaos, 7(10): 2219-2425
  5. 5.
    Congalton R G, Gu J Y, Yadav K, Thenkabail P and Ozdogan M. 2014. Global land cover mapping: a review and uncertainty analysis. Remote Sensing, 6(12): 12070-12093
  6. 6.
    Dai Z H, Liu H X, Le Q V and Tan M X. 2021. CoAtNet: marrying convolution and attention for all data sizes//Proceedings of the 35th International Conference on Neural Information Processing Systems. Virtual Event: Curran Associates Inc.: 3965-3977
  7. 7.
    D’Ascoli S, Touvron H, Leavitt M L, Morcos A S, Biroli G and Sagun L. 2022. ConViT: improving vision transformers with soft convolutional inductive biases. Journal of Statistical Mechanics: Theory and Experiment, 2022: 114005
  8. 8.
    Dosovitskiy A, Beyer L, Kolesnikov A, Weissenborn D, Zhai X H, Unterthiner T, Dehghani M, Minderer M, Heigold G, Gelly S, Uszkoreit J and Houlsby N. 2021. An image is worth 16x16 words: transformers for image recognition at scale. arXiv preprint arXiv: 2010.11929
  9. 9.
    Fitzgerald R W and Lees B G. 1994. Assessing the classification accuracy of multisource remote sensing data. Remote sensing of Environment, 47(3): 362-368
  10. 10.
    García-Mora T J, Mas J F and Hinkley E A. 2012. Land cover mapping applications with MODIS: a literature review. International Journal of Digital Earth, 5(1): 63-87
  11. 11.
    Grekousis G, Mountrakis G and Kavouras M. 2015. An overview of 21 global and 43 regional land-cover mapping products. International Journal of Remote Sensing, 36(21): 5309-5335
  12. 12.
    Haque M A, Reza M N, Ali M, Karim M R, Ahmed S, Lee K D, Khang Y H and Chung S O. 2024. Effects of environmental conditions on vegetation indices from multispectral images: a review. Korean Journal of Remote Sensing, 40(4): 319-341
  13. 13.
    Jacqueminet C, Kermadi S, Michel K, Béal D, Gagnage M, Branger F, Jankowfsky S and Braud I. 2013. Land cover mapping using aerial and VHR satellite images for distributed hydrological modelling of periurban catchments: application to the Yzeron catchment (Lyon, France). Journal of Hydrology, 485: 68-83
  14. 14.
    Joshi N, Baumann M, Ehammer A, Fensholt R, Grogan K, Hostert P, Jepsen M R, Kuemmerle T, Meyfroidt P, Mitchard E T A, Reiche J, Ryan C M and Waske B. 2016. A review of the application of optical and radar remote sensing data fusion to land use mapping and monitoring. Remote Sensing, 8(1): 70
  15. 15.
    LeCun Y, Bottou L, Bengio Y and Haffner P. 1998. Gradient-based learning applied to document recognition. Proceedings of the IEEE, 86(11): 2278-2324
  16. 16.
    Li Z H, He W, Cheng M F, Hu J X, Yang G Y and Zhang H Y. 2023. SinoLC-1: the first 1 m resolution national-scale land-cover map of China created with a deep learning framework and open-access data. Earth System Science Data, 15(11): 4749-4780
  17. 17.
    Li Z H, He W, Li J P, Lu F X and Zhang H Y. 2024. Learning without exact guidance: updating large-scale high-resolution land cover maps from low-resolution historical labels//Proceedings of the 2014 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE: 27717-27727
  18. 18.
    Li Z H, Zhang H Y, Lu F X, Xue R Y, Yang G Y and Zhang L P. 2022. Breaking the resolution barrier: a low-to-high network for large-scale high-resolution land-cover mapping using low-resolution labels. ISPRS Journal of Photogrammetry and Remote Sensing, 192: 244-267
  19. 19.
    Liu Y H, Wang Y, Zhang Y F, Mei S H, Zou J Q, Li Z H, Lu F X, He W, Zhang H Y, Zhao H L, Chen C, Xia C, Li H, Vivone G, Hänsch R, Taskin G, Yao J, Qin A K, Zhang B, Chanussot J and Hong D F. 2024. Cross-City Semantic Segmentation (C2Seg) in multimodal remote sensing: outcome of the 2023 IEEE WHISPERS C2Seg Challenge. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 17: 8851-8862
  20. 20.
    Lu D S, Hetrick S and Moran E. 2010. Land cover classification in a complex urban-rural landscape with QuickBird imagery. Photogrammetric Engineering and Remote Sensing, 76(10): 1159-1168
  21. 21.
    Arpitha M, S A Ahmed and Harishnaika N. 2023. Land use and land cover classification using machine learning algorithms in Google earth engine. Earth Science Informatics, 16(4): 3057-3073
  22. 22.
    Mickaelian A M and Sargsyan L A. 2010. Spectral observations of big objects. Astrophysics, 53(4): 483-489
  23. 23.
    Oetter D R, Cohen W B, Berterretche M, Maiersperger T K and Kennedy R E. 2001. Land cover mapping in an agricultural setting using multiseasonal Thematic Mapper data. Remote Sensing of Environment, 76(2): 139-155
  24. 24.
    Paheding S, Saleem A, Siddiqui M F H, Rawashdeh N, Essa A and Reyes A A. 2024. Advancing horizons in remote sensing: a comprehensive survey of deep learning models and applications in image classification and beyond. Neural Computing and Applications, 36(27): 16727-16767
  25. 25.
    Quan Y H, Tong Y P, Feng W, Dauphin G, Huang W J and Xing M D. 2020. A novel image fusion method of multi-spectral and SAR images for land cover classification. Remote Sensing, 12(22): 3801
  26. 26.
    Rehman A U, Ullah S, Shafique M, Khan M S, Badshah M T and Liu Q J. 2021. Combining Landsat-8 spectral bands with ancillary variables for land cover classification in mountainous terrains of northern Pakistan. Journal of Mountain Science, 18(9): 2388-2401
  27. 27.
    Rodriguez-Galiano V F, Ghimire B, Rogan J, Chica-Olmo M and Rigol-Sanchez J P. 2012. An assessment of the effectiveness of a random forest classifier for land-cover classification. ISPRS Journal of Photogrammetry and Remote Sensing, 67: 93-104
  28. 28.
    Ronneberger O, Fischer P and Brox T. 2015. U-net: convolutional networks for biomedical image segmentation//18th International Conference on Medical Image Computing and Computer-Assisted Intervention-MICCAI 2015. Munich: Springer: 234-241
  29. 29.
    Sharma A, Liu X W and Yang X J. 2018. Land cover classification from multi-temporal, multi-spectral remotely sensed imagery using patch-based recurrent neural networks. Neural Networks, 105: 346-355
  30. 30.
    Shelhamer E, Long J and Darrell T. 2017. Fully convolutional networks for semantic segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 39(4): 640-651
  31. 31.
    Thyagharajan K K and Vignesh T. 2019. Soft computing techniques for land use and land cover monitoring with multispectral remote sensing images: a review. Archives of Computational Methods in Engineering, 26(2): 275-301
  32. 32.
    Tong X Y, Dong R M and Zhu X X. 2025. Global high categorical resolution land cover mapping via weak supervision. ISPRS Journal of Photogrammetry and Remote Sensing, 220: 535-549
  33. 33.
    Van Der Werff H M A and Van Der Meer F D. 2008. Shape-based classification of spectrally identical objects. ISPRS Journal of Photogrammetry and Remote Sensing, 63(2): 251-258
  34. 34.
    Wang J D, Sun K, Cheng T H, Jiang B R, Deng C R, Zhao Y, Liu D, Mu Y D, Tan M K, Wang X G, Liu W Y and Xiao B. 2021. Deep high-resolution representation learning for visual recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(10): 3349-3364
  35. 35.
    Wickham J, Stehman S V, Sorenson D G, Gass L and Dewitz J A. 2021. Thematic accuracy assessment of the NLCD 2016 land cover for the conterminous United States. Remote Sensing of Environment, 257: 112357
  36. 36.
    Wu H, Li Y, Lin A Q, Fan H C, Fan K X, Xie J Y and Luo W T. 2024. A review of crowdsourced geographic information for land-use and land-cover mapping: current progress and challenges. International Journal of Geographical Information Science, 38(11): 2183-2215
  37. 37.
    Xu P P, Tsendbazar N E, Herold M, De Bruin S, Koopmans M, Birch T, Carter S, Fritz S, Lesiv M, Mazur E, Pickens A, Potapov P, Stolle F, Tyukavina A, Van De Kerchove R and Zanaga D. 2024. Comparative validation of recent 10 m-resolution global land cover maps. Remote Sensing of Environment, 311: 114316
  38. 38.
    Yang J and Huang X. 2021. The 30 m annual land cover dataset and its dynamics in China from 1990 to 2019. Earth System Science Data Discussions, 13(8): 3907-3925
  39. 39.
    Zhang T T, Du Z R, Yang J Y, Yao X C, Ou C, Niu B W and Yan S. 2021. Land cover mapping and ecological risk assessment in the context of recent ecological migration. Remote Sensing, 13(7): 1381
  40. 40.
    Hong D, Zhang B, Li H, Li Y, Yao J, Li C,Werner M, Chanussot J , Zipf A, Zhu X. 2023. Cross-city matters: A multimodal remote sensing benchmark dataset for cross-city semantic segmentation using high-resolution domain adaptation networks. Remote Sensing of Environment, 299: 113856.

Читать полностью

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website