Введение
Картография почвенно - растительного покрова является одним из основных направлений научных исследований в области дистанционного зондирования, которое обеспечивает важную базу данных для глобального мониторинга окружающей среды, рационального использования ресурсов и устойчивого развития путем точной классификации типов поверхностных объектов.Congalton等,2014*Wu等,2024В)). Картография почвенно - растительного покрова имеет чрезвычайно широкий охват и охватывает гидрологический мониторинг (Jacqueminet等,2013Оценка сельскохозяйственных ресурсов (Oetter等,2001Охрана окружающей среды (Zhang等,2021Многие области (García-Mora等,2012В)). Однако традиционные методы картирования почвенно - растительного покрова часто опираются на мономодальные данные дистанционного зондирования, получаемые с помощью одного датчика (Li等,2023Несмотря на то, что производительность в определенных сценариях является приемлемой, все еще существуют значительные недостатки в точности классификации и пружинности перед лицом сложной и гетерогенной поверхностной среды (Joshi等,2016В)).
Многоспектральное изображение MSI (Multispectral Imagery), как основной источник данных дистанционного зондирования в настоящее время, записывает спектральную информацию о отражении объектов через несколько спектральных каналов и может эффективно различать типы объектов, таких как растительность, водоемы и голая почва, основным преимуществом которой является предоставление обширной спектральной информации (Thyagharajan和Vignesh,2019В)). Тем не менее, данные MSI подвержены облачному покрову, атмосферному рассеянию и изменениям в условиях освещения, а их доступность и точность классификации серьезно ограничены в облачных и дождливых районах или затененных районах (Haque等,2024В)). Кроме того, MSI в основном полагается на спектральные характеристики и имеет ограниченную способность различать объекты с аналогичными спектральными реакциями, но различными структурами (например, различные типы сельскохозяйственных культур, материалы для городских зданий и т. Д.), что приводит к путанице результатов классификации.
Напротив, радар с синтезированной апертурой SAR (Synthetic Aperture Radar), как активная технология микроволнового дистанционного зондирования, не зависит от внешних условий освещения и обладает высокой способностью проникать в атмосферные помехи, такие как облака и дымка, и может непрерывно и стабильно получать информацию о поверхности в различных сложных условиях окружающей среды. Изображения SAR отражают структурные характеристики объектов с помощью радиолокационных сигналов и широко используются в таких областях, как мониторинг изменений рельефа местности, оценка стихийных бедствий и анализ городского строительства. Хотя изображения SAR имеют очевидные преимущества в извлечении структурных характеристик объекта, их спектральная информация ограничена и может привести к менее точной классификации, чем изображения MSI в некоторых задачах (Brown和Porcello,1969В)).
Таким образом, мультимодальный подход к интеграции данных MSI и SAR стал важным направлением исследований в области обработки изображений дистанционного зондирования. Органически сочетая богатые спектральные характеристики MSI с уникальной структурной информацией SAR, эта стратегия слияния может эффективно компенсировать ограничения, присущие одному источнику данных, и значительно повысить точность классификации объектов. Интеграция мультимодальных (MSI + SAR) данных не только повышает способность модели к обучению представлениям, но и значительно улучшает распознавание сложных типов объектов, демонстрируя значительные технические преимущества в применении картирования почвенно - растительного покрова (Quan等,2020В)). В частности, спектральные характеристики, предоставляемые данными MSI, могут быть использованы для различения материала, а структурная информация, предоставляемая данными SAR, помогает определить трехмерные характеристики объекта.
В последние годы с быстрым развитием технологий искусственного интеллекта, особенно методов глубокого обучения, технологии картирования почвенно - растительного покрова достигли прорыва (Ajibola和Cabral,2024*Paheding等,2024В)). поLi等(2022)В качестве примера была предложена модель L2HNet, которая успешно генерировала карты почвенно - растительного покрова с высоким разрешением благодаря инновационному использованию маркировки земного покрова с низким разрешением, что значительно улучшило способность выражать детали изображения. Общая проблема нехватки учебных образцов (Tong等,2025),Li等(2024)Дальнейшая разработка слабой системы мониторинга « Paraformer», метод, который эффективно смягчает проблему дефицита высококачественных данных маркировки путем внедрения исторических данных с низким разрешением в качестве сигналов мониторинга.
В глобальном масштабе было выпущено несколько репрезентативных продуктов растительного покрова (Grekousis等,2015В)). Национальная база данных почвенно - растительного покрова (NLCD), разработанная Геологической службой США (USGS), обеспечивает важную поддержку данных для анализа долгосрочных изменений почвенно - растительного покрова в США (Wickham等,2021); Китайский набор данных о почвенно - растительном покрове (CLCD), разработанный национальной исследовательской группой, обеспечивает важную поддержку данных для мониторинга почвенно - растительного покрова в региональном масштабе (Yang和Huang,2021В)). Несмотря на значительный прогресс, достигнутый в отношении существующих продуктов почвенно - растительного покрова, точность классификации в сложных поверхностных условиях еще предстоит повысить (Xu等,2024В)).
В ответ на эти проблемы в исследовании предлагается инновационное техническое решение: во - первых, создание мультимодальных наборов данных на основе изображений MSI и данных SAR для преодоления ограничений одного SAR - данных; Во - вторых, на основе данных мультимодальных (MSI + SAR) были объединены три передовые модели сверточной нейронной сети (CNN), визуального преобразователя (Vit) и гибридной архитектуры CNN - Vit (FCN, ConViT и CoAtNet соответственно), что значительно повысило точность классификации сложных поверхностных сцен и прочность моделей.
2 Обзор района исследования и набор данных
какFig. 1Как показано, область исследования, выбранная для этого исследования, находится в Пекине, Китай. Используемые в эксперименте многоспектральные данные HP - 6 и SAR - 3, полученные с помощью спутников серии HP, были получены в период с конца 2019 года по начало 2020 года, чтобы обеспечить минимизацию изменений наземных целей между различными изображениями. На платформе ENVI 5.6 многоспектральные данные с высокой оценкой VI обрабатываются с помощью таких этапов предварительной обработки, как радиационная коррекция, быстрая коррекция спектрального гиперкубического анализа атмосферного обзора (FLAASH), коррекция положительного излучения и выбор диапазона, в результате чего отображается изображение с пространственным разрешением до 10 м. Операция выбора диапазона используется для удаления поглощения водяного пара, шума и низкого качества диапазона, тем самым поддерживая качество изображения (Liu等,2024В)).
Данные SAR с высоким рейтингом 3 собираются в широкополосном режиме с пространственным разрешением 10 м и шириной 100 км. Данные SAR предварительно обрабатываются с помощью функции удаления пятен и топографической коррекции в наборе инструментов ENVI SARscape Analytics. Выберите фильтр Refined Lee с размером скользящего окна 5×5 пикселей для удаления пятнистого шума; В то же время топографическая коррекция данных SAR осуществляется с использованием данных Глобальной цифровой модели высоты GMTED 2010 (DEM).Hong等,2023В)). Кроме того, размер и разрешение данных SAR с высокой оценкой 3 такие же, как и у изображений MSI с высокой оценкой 6 (Liu等,2024В)).
Изображение MSI, использованное в эксперименте, представляет собой трехмерный куб данных, размер которого составляет 256×256×4 канала. Изображения SAR также являются трехмерными кубиками данных с размерами 256×256×2 каналов. Формат и структура данных ПодробнееFig. 1иFig. 2А.
Четыре канала для каждого изображения MSI соответствуют следующему диапазону: синий спектр 0,4 - 0,52 мкм (B1); Зеленый спектр в диапазоне 0,52 - 0,60 мкм (B2); Красный спектр в диапазоне 0,63 - 0,69 мкм (B3); Диапазон ближнего инфракрасного спектра (B4) в диапазоне 0,76 - 0,90 мкм. Два канала для каждого изображения SAR соответствуют двум различным способам поляризации HH и HV. Канал HH показывает, что радиолокационная передача и прием сигналов являются горизонтальной поляризацией; Канал HV показывает, что сигнал радиолокационной передачи является горизонтальной поляризацией, а полученный сигнал - вертикальной поляризацией. В то же время оба канала для каждого изображения SAR относятся к C - диапазону (частота около 5,3 ГГц, длина волны около 3,1 см).
Задача картирования почвенно - растительного покрова в этом исследовании охватывает 14 категорий объектов и требует точной классификации каждой точки пикселя на изображении. какFig. 1Как показано внизу, каждая из этих категорий имеет конкретное имя. Каждый набор экспериментальных данных содержит изображение MSI и соответствующее изображение SAR, которые сравниваются с реальным почвенно - растительного покрова реальной земли с точки зрения пространственного положения и разрешения в качестве эталонного стандарта.
3 Методы исследования
3.1 Показатели оценки
В этом исследовании используется общая точность OA (Overall Accuracy) и частотное взвешивание, а также FWIoU (Frequency - Weighted Intersection over Union) в качестве основного индикатора оценки.Fitzgerald和Lees,1994*LeCun等,1998Математические выражения OA и FWIOU являются
В формуле C обозначает общее количество категорий; TP c означает, что модель правильно предсказала количество пикселей для определенной категории; c обозначает конкретную категорию; n c означает реальное общее количество пикселей категории c , то есть n c = TP c + FN c , в котором FN c указывает количество пикселей, которое не было правильно предсказано для определенной категории.
В формуле n c также означает общее количество реальных пикселей категории c , то есть nc=TPc+FNc, Среди них FN c также указывает на неправильное прогнозирование количества пикселей для определенной категории; TP c также означает, что модель правильно предсказала количество пикселей для определенной категории; c обозначает конкретную категорию; FP c означает количество пикселей, которое модель ошибочно предсказала для определенной категории; FN c означает количество пикселей, которое не было правильно предсказано для определенной категории.
ОА используется для оценки точности классификации модели по всему набору данных и позволяет получить эффективные результаты измерений, когда распределение категорий относительно равномерно. В FWIOU учитывается несбалансированность распределения классов, а частоты классов взвешиваются путем суммирования, что более полно отражает уровень производительности модели в случае неравномерного распределения классов. Как правило, чем выше значение этих двух показателей, тем выше точность классификации и надежность модели представления.
3.2 Многомодальные данные
Это исследование объединяет изображения MSI с изображениями SAR, генерирует мультимодальные данные и сравнивает их с мономодальными данными, состоящими из одного изображения SAR. Затем эти два типа данных были введены в семь репрезентативных моделей машинного обучения с семантическим разделением для сравнения, чтобы оценить преимущества производительности мультимодальных данных по сравнению с мономодальными данными.
В частности, с помощью метода обучения под надзором для выбранной CoAtNet (Dai等,2021), ConViT(D’Ascoli等,2022), FCN(Shelhamer等,2017), HRNet(Wang等,2021), LinkNet(Chaurasia和Culurciello,2017), U-Net(Ronneberger等,2015Эти 6 репрезентативных моделей глубокого обучения и Random Forest (Rodriguez-Galiano等,2012*Congalton等,2014Эта репрезентативная модель семантического разделения машинного обучения проходит обучение и тестирование. Каждая модель использует два набора данных, построенных на основе мономодальных данных SAR и мультимодальных данных (MSI + SAR), чтобы получить полную оценку нейтральных энергетических различий между мономодальными и полимодальными данными в семантическом разделении задач.
Данные, используемые в этом институте, можно разделить на две категории: во - первых, мономодальные данные соответствуют эталонным меткам, соответствующим их истинному соответствию.Fig. 2а) мономодальные данные SAR и базовые карты почвенно - растительного покрова; Во - вторых, многомодальные данные соответствуют эталонным меткам, соответствующим их истинному соответствию, отдельноFig. 2Данные о мультимодальной интеграции и базовые карты почвенно - растительного покрова.
В более подробной форме, исследование создало два набора данных, каждый из которых содержал 7140 наборов учебных образцов. Каждый набор учебных образцов состоит из одномодальных данных SAR, мультимодальных данных (MSI + SAR) и соответствующих реальных эталонных меток, которые демонстрируют абсолютную согласованность в пространственном положении. На этапе моделирования 7140 образцов одномодального обучения SAR из первого набора данных и 7140 образцов многомодального обучения (MSI + SAR) из второго набора данных были импортированы в семь моделей семантического разделения машинного обучения: CoAtNet, ConVit, FCN, HRNET, LinkNet, U - Net и Random Forest. Затем на этапе тестирования модели 1428 тестовых образцов первого набора данных и 1428 тестовых образцов, соответствующих второму набору данных, были введены в семь моделей, которые были обучены. В конечном итоге, на основе двух ключевых показателей, OA и FWIOU, была проведена комплексная оценка производительности модели в мультимодальных (MSI + SAR) сценариях данных и мономодальных сценариях данных SAR.
3.3 Многомодельные стратегии слияния
Специфика мультимодельной стратегии слиянияFig. 3. Эта стратегия эффективно интегрирует способность CNN извлекать локальные детали и способность ViT воспринимать глобальную информацию, тем самым улучшая характеристики и классификационные характеристики модели (Chua,1997*Dosovitskiy等,2021В)). Классификационные свойства моделей оцениваются с использованием показателей OA и FWIOU.
какFig. 3На левой стороне показаны входные мультимодальные (MSI + SAR) данные метода мультимодельного слияния. Справа, красная пунктирная рамка содержит 3 ветви, соответственно, ветви визуального преобразователя (ViT), сверточной нейронной сети (CNN) - гибридной ветви визуального преобразователя (ViT) и ветви сверточной нейронной сети (CNN). Каждая ветвь выводит размер 256256.14 Трехмерный тензор, соответствующий трем категориям вероятностных картАА. Каждый канал в диаграмме вероятности для каждой категории соответствует размеру 256256 Двумерная матрица, представляющаяFig. 1Двумерное распределение прогнозируемых вероятностей по одной из 14 категорий.
В частности, ветви ViT используют модель ConViT для изучения эффекта извлечения характеристик на основе механизма самовнимания; Смешанная ветвь CNN - Vit использует модель CoAtNet для достижения слияния характеристик в сочетании с преимуществами свертки и преобразователя; В подразделении CNN используется модель FCN, которая фокусируется на возможностях извлечения характеристик традиционных сверточных сетей.
Его можно выразить двумя математическими формулами:
В формуле,Показывает 256 пикселей, полученных из ветви визуального преобразователя (Vit), соответствующей классу c Двумерная прогнозируемая матрица вероятностей 256 пикселей.Показывает 256 пикселей, соответствующих классу c , полученных из гибридной ветви сверточной нейронной сети (CNN) и визуального преобразователя (Vit)Двумерная прогнозируемая матрица вероятностей 256 пикселей.Показывает 256 пикселей, полученных из ветви сверточной нейронной сети (CNN), соответствующей классу c Двумерная прогнозируемая матрица вероятностей 256 пикселей.
w 1 , w 2 , w 3 Fig. 3Весы: Weight 1, Weight 2, Weight 3. Весовые коэффициенты, отражающие различные модели.
Показывает 256 пикселей, соответствующих 3 классам c 256 - пиксельная матрица вероятностиААПосле слияния была получена новая двумерная матрица вероятности прогноза.Показать двумерную матрицу вероятности прогноза в измерении каналаИз первых 256 пикселей256 - пиксельная матрица вероятностиДо последнего 256256 Двумерная матрица вероятности прогнозаОбъединить, чтобы создать новый размер 256 пикселей256 пикселей14 - канальная трехмерная карта вероятности классаА.
через式(5)Конвертировать с конечным выходом в 256 пикселейДвумерная матрица 256 пикселейЭтот результат соответствует картам почвенно - растительного покрова, созданным после моделирования.
式(5)Описание двумерной матрицы.Каждый элемент и трехмерный тензорСоответствие между элементами. Среди них значение c имеет диапазон значений от 0 до 13 целых чисел (включая 0 и 13), соответствующих 14 категориям индексов, каждое конкретное значение c обозначает класс индекса иСоответствующий указатель канала. Соответствие конкретных категорий и индексовFig. 1Категории в маркировке. В формуле выражение a иСоответствующий индекс произвольной строки. b ПоказатьиСоответствующий индекс произвольного столбца.
式(5)Описание двумерной матрицы.Произвольный элементЗначение и трехмерный тензорОтношения. Если c находится в диапазоне целых чисел от 0 до 13 (включая 0 и 13) иПри достижении максимума максимальное значение соответствует значению c Значение. Это значение c иFig. 1Категории указаны соответствующим образом.
И, наконец, через правильноеиFig. 3Набор входных данных слева соответствует пиктограмме реального почвенно - растительного покрова, которая сравнивает показатели OA и FWIOU, чтобы оценить производительность этой мультимодельной стратегии слияния.
4 Эксперименты и анализ результатов
4.1 Экспериментальные настройки
Аппаратная среда для этого эксперимента использует графический процессор RTX 4090 от Nvidia. В программной среде используется язык программирования Python 3.9 и фреймворк PyTorch 2.3.
Во время обучения модели глубокого обучения параметры устанавливаются следующим образом: цикл обучения (epoch) составляет 600, каждый из которых содержит 892 итерации; Размер партии (batch size) составляет 32.
Выбор учебных циклов имеет научный характер, и, наблюдая и анализируя изменения производительности в процессе обучения, в этой статье определяется рациональность 600 раундов обучения. Это объясняется следующими причинами:
(1) Быстрое повышение производительности на начальном этапе обучения: например,Fig. 4иFig. 5Как показано, в первых 100 итерациях модели производительность (например, показатели FWIOU и OA) значительно улучшилась. После этого, с увеличением количества раундов обучения, скорость улучшения производительности постепенно замедляется, как правило, стабилизируется. Таким образом, 600 раундов обучения гарантируют полное обучение модели и достижение стабильной производительности.
(2) Экспериментальное наблюдение и стабильность производительности: В ходе нескольких экспериментов мы обнаружили, что количество 600 раундов обучения позволяет модели достичь высокой стабильности, а дальнейшее увеличение количества циклов обучения для улучшения производительности уже очень ограничено. отFig. 4иFig. 5Можно видеть, что производительность модели вступила в фазу стабилизации после значительного улучшения в предыдущей итерации, поэтому 600 раундов обучения являются разумным выбором.
(3) Избегайте чрезмерной адаптации и стабильности модели: учитывая постепенную стабилизацию производительности модели во время обучения, выбор 600 раундов обучения не только предотвращает риск переосмысления, но и обеспечивает согласованность производительности модели в течение более длительного периода времени.
Кроме того, пространственный размер входных данных составляет 256 пикселей.256 - пиксельные графические блоки, произвольно вырезанные для 4 размеров 224 пикселей во время тренировки224 - пиксельные подсхемы и соответственно разделить метки на блоки гамет. Оптимизатор выбирает AdamW с начальным коэффициентом обучения 0001; Функция потери - функция потери перекрестной энтропии (Cross - Entropy Loss). Планировщик уровня обучения использует ReduceLRONPlateau.
Вышеуказанная конфигурация предназначена для оптимизации эффективности обучения модели и обеспечения научного характера эксперимента.
4.2 Эксперименты по сопоставлению мультимодальных и мономодальных данных
Table 1Результаты работы одномодальных данных SAR были зафиксированы в шести методах семантического разделения глубокого обучения, включая CoAtNet, ConViT, FCN, HRNET, LinkNet, U - Net и Random Forest, а также в классической модели классификации пикселей машинного обучения. Для оценки производительности используются показатели общей точности и частотного взвешивания. Данные в таблице представляют собой средние значения OA и FWIOU, полученные каждой моделью на момент тестирования на основе одного и того же набора данных 1428.
Table 1 The performance of different models on Single-modality data
| 模型 | OA | FWIoU |
|---|
| CoAtNet | | |
| ConViT | 80.00 | 68.98 |
| FCN | 52.22 | 41.88 |
| HRNet | 53.27 | 44.74 |
| LinkNet | 51.53 | 43.08 |
| U-Net | 48.99 | 41.13 |
| Random Forest | 41.52 | 34.46 |
Table 2Представлена производительность мультимодальных (MSI + SAR) данных в семи моделях, а оценочные показатели также установлены для OA и FWIOU. Данные в таблице взяты из иTable 1Средние значения OA и FWIOU для тех же 1428 наборов тестовых данных.
Table 2 The performance of different models on Multi-modality data
| Models | OA | FWIoU |
|---|
| CoAtNet | 64.36 | 55.34 |
| ConViT | 88.21 | 80.48 |
| FCN | | |
| HRNet | 58.37 | 49.63 |
| LinkNet | 58.87 | 50.71 |
| U-Net | 54.20 | 45.99 |
| Random Forest | 44.66 | 37.08 |
С помощью двухосной ломаной диаграммы производительность различных моделей сравнивается с одномодальными данными SAR и мультимодальными данными (MSI + SAR).Fig. 6А.
В сочетании с таблицами 1 - 2 естьFig. 6Можно сделать вывод, что в этих семи моделях полимодальные данные, объединяющие данные MSI, значительно улучшили как средний OA, так и средний FWIOU по сравнению с одномодальными данными, состоящими из одного SAR. Это убедительно свидетельствует о том, что внедрение полимодальных данных может эффективно повысить способность модели распознавать характеристики поверхности; Кроме того, с точки зрения мономодальных данных SAR и мультимодальных данных (MSI + SAR), модель ConViT превосходит остальные модели по обоим показателям, демонстрируя более сильную способность к извлечению характеристик и семантическому разделению.
4.3 Эксперимент по слиянию нескольких моделей
Чтобы повысить производительность модели более эффективно, это исследование, подкрепленное мультимодальными данными, представляет инновационную стратегию слияния нескольких моделей. Эта стратегия сочетает в себе преимущества трех превосходных моделей семантического разделения глубокого обучения: модели ConViT с Vit в качестве основной структуры; Модель CoAtNet, смешанная CNN с Vit; А также модель FCN, в которой доминирует CNN.
какTable 3Показано, согласноFig. 3Три ветви веса, определенные в weight1(w1)、weight2(w2)、weight3(w3) Были проведены сравнительные эксперименты с семью наборами различных параметров. Выбор этих весовых комбинаций основан на четырех основных соображениях:
Table 3 The results of different weights in the test phase
| 权重 | OA/% | FWIoU/% |
|---|
| w1=0.6, w2=0.2, w3=0.2(baseline) | 89.28 | 81.89 |
| 84.93 | 76.35 |
| w1=0.4, w2=0.3, w3=0.3 | 87.16 | 79.07 |
| w1=0.5, w2=0.25, w3=0.25 | | |
| w1=0.7, w2=0.15, w3=0.15 | 89.09 | 81.64 |
| w1=0.8, w2=0.1, w3=0.1 | 88.81 | 81.25 |
| w1=0.9, w2=0.05, w3=0.05 | 88.51 | 80.86 |
(1) На основеTable 2В результате « производительности различных моделей на мультимодальных данных» мы обнаружили, что точность CoAtNet аналогична точности FCN, поэтому предоставление равного веса обоим помогает сбалансировать вклад обоих в мультимодальном слиянии, то есть w 2 = w 3 . Такая расстановка весов гарантирует, что они дополняют друг друга и вместе повышают производительность конечной модели, избегая чрезмерного доминирования любой ветви.
(2) Поскольку модель ConVit хорошо зарекомендовала себя на OA и FWIOU, она может обеспечить более высокое качество представления характеристик по сравнению с другими моделями, такими как CoAtNet и FCN. Таким образом, постепенно увеличиваясь, можно проверить влияние модели ConVit на слияние нескольких моделей, особенно когда вес ConViT постепенно увеличивается, что приводит к значительному улучшению производительности.
(3) О весовых комбинацияхЦель состоит в том, чтобы проверить, как характеристики нескольких моделей работают вместе в слиянии без предвзятости к одной модели, и посмотреть, можно ли получить лучшую производительность.
(4) Кроме того, при выборе шага w 1 , скорректированном с использованием шага 0,1, можно эффективно фиксировать шаги, которые оказывают большее влияние на конечную производительность в пределах разумного экспериментального диапазона, так что каждое изменение в эксперименте может отражать значительные различия в производительности, что помогает быстро определить наилучшую комбинацию весов. Напротив, слишком малые шаги (например, 0,05) увеличивают количество экспериментов, что может привести к тому, что незначительные изменения окажут незначительное влияние на конечный результат, а также увеличит нагрузку на вычисления и анализ.
При этом в качестве входных данных используются мультимодальные (MSI + SAR) данные, которые сначала обучают модели ConVit, CoAtNet и FCN, а полученные модели служат основой для последующих экспериментов. Модель слияния для семи наборов различных весовых комбинаций, на основеTable 3Для оценки комбинаций используются показатели OA и FWIOU2. Результаты испытаний каждой комбинации весов взяты из средних значений выходных результатов 1428 наборов данных, согласующихся с « Экспериментом по сопоставлению 4.2 мультимодальных и мономодальных данных».
Экспериментальные результаты показывают, что в случае w 1 = 0,6, w 2 = 0,2, w 3 = 0,2, общая производительность полимодальной стратегии слияния лучше, чем у других комбинаций, средняя общая точность 89,28%, среднее взвешенное соотношение пересечений 81,89%. Эта комбинация весов работает значительно лучше, чем остальные 6 групп, демонстрируя лучший эффект слияния.
Кроме этого, в " i>w1=0.6、w2=0.2、w3=0.2; w1=0.5、w2=0.25、w3=0.25; w1=0.7、w2=0.15、w3=0.15; w1=0.8、w2=0.1、w3=0.1; w1=0.9、w2=0.05、w3=0.05 В сочетании с этими пятью наборами весов средняя общая точность и среднее соотношение частот стратегии слияния с несколькими моделями лучше, чем у одной модели ConVit, которая лучше всего работает при вводе мультимодальных данных. В условиях мультимодального ввода данных средняя общая точность и среднечастотное взвешивание ConViT составили 88,21% и 80,48% соответственно, в то время как стратегия мультимодельного слияния показала лучшую производительность по обоим показателям.
4.4 Визуализация результатов
Fig. 7Показывает сравнение результатов вывода различных моделей глубокого обучения на основе одномодальных данных SAR;Fig. 8Было показано сравнение результатов вывода различных моделей глубокого обучения в мультимодальном режиме (SAR + MSI).
По сравнениюFig. 7иFig. 8Результаты классификации и реальные вкладки, соответствующие пространственным позициям, видны: результаты классификации в мономодальных данных SAR, таких какFig. 7Показано более низкое соответствие с реальной этикеткой; После введения данных MSI для формирования мультимодального ввода, например,Fig. 8Как показано, точность результатов классификации значительно повысилась. Этот феномен подтверждает преимущества мультимодальных (MSI + SAR) данных в классификации почвенно - растительного покрова, которые повышают способность модели к распознаванию с помощью комплементарных характеристик.
Fig. 9Показаны результаты экспериментов по слиянию данных с несколькими моделями слияния (MSI + SAR) с различными комбинациями весов при использовании мультимодальных данных в качестве входных условий. иFig. 9По сравнению,Fig. 8Визуализация результатов в той или иной степени имеет определенные ограничения. Например, модели CoAtNet, HRNET и LinkNet не обладают достаточными возможностями для сбора подробной информации, что приводит к более заметным трещинам в результатах классификации; С другой стороны, модель FCN игнорирует общую пространственную структурную согласованность из - за чрезмерного акцента на извлечении локальных характеристик. Вышеприведенные сравнительные результаты убедительно свидетельствуют о том, что дезагрегированный эффект картирования почвенно - растительного покрова может быть дополнительно оптимизирован на основе мультимодальных (MSI + SAR) данных путем мультимодельного слияния с использованием разумного сочетания весов.
5 Обсуждение
В этом исследовании мы использовали общую точность (OA) и взвешенное соотношение частот (FWIOU) в качестве основных показателей для оценки производительности и продемонстрировали эффективность предложенного мультимодельного метода слияния в задачах картирования почвенно - растительного покрова посредством визуального сравнения результатов. Хотя производительность модели может быть количественно оценена с помощью показателей OA и FWIOU, только эти показатели и визуальные результаты не полностью раскрывают причины, лежащие в их основе. Таким образом, в настоящем разделе подробно рассматриваются преимущества предлагаемых методов и лежащие в их основе научные причины в контексте технологии дистанционного зондирования.
5.1 Разнообразие и сложность данных дистанционного зондирования
Применение изображений дистанционного зондирования для картирования почвенно - растительного покрова сталкивается с ключевыми проблемами, такими как высокая неоднородность поверхности и сложные типы объектов (Lu等,2010В)). Разнообразие ландшафта и пространственно - временная изменчивость спектральных характеристик местности часто затрудняют классификацию на основе одного источника данных для достижения желаемой точности. В частности, многодиапазонные свойства данных дистанционного зондирования, хотя и обеспечивают богатый спектральный объем информации, также создают проблемы, присущие изотопному спектру (один и тот же объект имеет различную спектральную реакцию в разных диапазонах) и изоспектру инородного тела (различные объекты ведут себя одинаково в определенных диапазонах) (Sharma等,2018:: Van Der Werff and Van Der Meer, 2008;Mickaelian和Sargsyan,2010В)). Например, при гетероспектральных проблемах некоторые категории объектов (например, леса и пахотные земли) могут обладать аналогичными спектральными реакциями в определенных диапазонах, но их поведение в разных диапазонах значительно различается из - за различий в условиях роста и их физических характеристиках. В случае гомоспектральной проблемы инородного тела характеристики отражения различных категорий объектов (например, водоемов и водно - болотных угодий) в некоторых спектральных диапазонах сильно перекрываются, что приводит к значительному снижению точности классификации мономодальных изображений дистанционного зондирования в этом контексте.
Эта проблема особенно заметна в сложных ситуациях, таких как горы и водно - болотные угодья. Сложные рельефные флуктуации и плотное распределение объектов делают спектральные характеристики различных категорий объектов более сходными, что в сочетании с такими факторами, как шумовые помехи, изменения окружающей среды и условия освещения, еще больше снижает надежность классификации традиционных мономодальных изображений дистанционного зондирования (Rehman等,2021В)). В ответ на эту проблему многомодальная стратегия слияния данных демонстрирует значительные преимущества. Среди них изображения MSI с помощью многоспектральной спектральной информации могут эффективно улавливать спектральные различия объектов и имеют уникальную ценность в решении проблем гомологического спектра; С другой стороны, данные SAR демонстрируют сильную способность различать инородные объекты в односпектральных сценариях путем извлечения структурных характеристик поверхности.
Эксперименты показали, что синергическое слияние данных MSI и SAR значительно улучшило классификационные характеристики модели (Table 1иTable 2В)). Эта стратегия полимодального слияния не только повышает способность модели к распознаванию благодаря взаимодополняемости спектрально - структурных характеристик, но и демонстрирует отличную адаптивность в сложных топографических областях.
5.2 Преимущества мультимодельного слияния
Как видно из таблиц 1 - 3, хотя модель ConVit превосходит отдельные модели, такие как CoAtNet и FCN, по показателям OA и FWIOU, ее классификационные характеристики были еще более улучшены за счет объединения этих трех моделей. Это повышение производительности в основном связано с взаимодополняющей синергией моделей на уровне принятия решений по извлечению характеристик и классификации (Arpitha等,2023В)). В частности, модель ConViT с ее глобальным механизмом внимания отлично зарекомендовала себя в моделировании зависимости на большие расстояния; С другой стороны, CoAtNet демонстрирует большую прочность при работе со сложными объектами пространственной структуры, сочетая в себе локальные возможности извлечения характеристик CNN и преимущества глобального моделирования ViT, особенно в районах с размытыми границами и резкими изменениями рельефа; С другой стороны, модель FCN имеет уникальные преимущества в задачах захвата деталей и точной классификации благодаря своей полностью сверточной структуре. Таким образом, стратегия конвергенции с несколькими моделями не только сохраняет преимущества каждой модели, но и компенсирует недостатки одной модели в конкретных категориях объектов, тем самым повышая общую точность классификации.
5.3 Классификация деталей местности
Исследование охватывает 14 типов объектов со значительными гетерогенными свойствами, включая типичный поверхностный покров в естественной и искусственной среде. В частности, 14 типов объектов в исследовании включают: фон, который обычно обозначается как неопределенная или несвязанная часть, часто удаляется, чтобы подчеркнуть важные элементы; поверхностные воды, включая воды, такие как реки, озера и водохранилища; Улицы, включая городскую или сельскую дорожную систему; Городские районы, охватывающие высокозастроенные городские районы, включая жилые и деловые районы; Промышленные, коммерческие и транспортные земли, включая промышленные объекты, коммерческие объекты и транспортную инфраструктуру, такие как аэропорты и железнодорожные станции; Минералы, свалки и строительные площадки, включая наземные рудники, зоны обращения с отходами и строительные площадки; Районы искусственного растительного покрова, которые относятся к искусственно культивируемой растительности, такой как газоны, зеленые насаждения и сады; пахотные земли, сельскохозяйственные угодья, используемые для сельскохозяйственного производства; Постоянные сельскохозяйственные угодья, районы выращивания долгосрочных культур, таких как фруктовые деревья, виноград и оливки; Пастбищные угодья, луга и другие пастбищные угодья; Леса, включая естественные и искусственно выращенные хвойные и широколиственные леса; Кусты, покрытые преимущественно кустарниковыми растениями; b) открытые земли без растительности, т.е. голые земли, песчаные поля, скалистые районы и другие земли без растительного покрова; Внутренние водно - болотные угодья, включая небрежные районы, такие как болота и торфяники.
5.4 Визуальный анализ результатов
отFig. 7- Да.Fig. 9Визуализация в результатах наглядно показывает, что модели слияния имеют значительные преимущества в идентификации различных типов объектов. В частности, в районах со сложной топографией и широким спектром типов объектов, модели слияния более заметны в деталях и могут лучше различать похожие категории объектов, уменьшая классификационные трещины и ошибки классификации. Кроме того,Fig. 9Результаты слияния в различных комбинациях весов также показывают, что разумная настройка веса может значительно повысить конечный эффект классификации и оптимизировать производительность модели.
В частности,Fig. 9Было продемонстрировано преимущество мультимодельных стратегий слияния с различными комбинациями весов при работе с районами с сложной топографией и богатыми деталями. Разумно устанавливая вес каждой модели, можно оптимизировать реагирование модели на различные типы объектов и повысить способность распознавать сложные категории объектов, такие как города, водно - болотные угодья и леса. сравнениеFig. 8иFig. 7Результаты классификации моделей при вводе мультимодальных (MSI + SAR) данных показывают более детальное распределение объектов по сравнению с одномодальными данными SAR, особенно в городских районах и водоемах, где точность классификации значительно улучшилась.
6 Заключение
В исследовании предложена инновационная основа для интеграции мультимодальных данных для картирования почвенно - растительного покрова и оптимизации взаимодействия с несколькими моделями. На уровне данных при слиянии изображений MSI с данными SAR на уровне канала были созданы мультимодальные наборы данных с дополнительным выражением характеристик. Экспериментальная проверка показала, что эта стратегия слияния данных значительно повышает точность классификации и обобщение модели по сравнению с едиными данными SAR.
Что касается архитектуры модели, то механизм мультимодельного слияния, предложенный в этом исследовании, обеспечивает взаимодополняемость между локальным извлечением характеристик и глобальным контекстным моделированием путем совместной оптимизации гибридных ветвей, объединяющих ветви CNN, ветви ViT, CNN и ViT. Как количественные эксперименты, так и визуальный анализ подтверждают, что стратегия слияния может эффективно повысить точность и прочность распознавания объектов в сложных сценариях.
Это исследование предлагает новые технические идеи для картирования почвенно - растительного покрова на основе глубокого обучения, а его многомодальные рамки обработки данных и стратегии мультимодельного слияния обеспечивают не только важную теоретическую поддержку в области картирования почвенно - растительного покрова, но и новые идеи и направления для будущих исследований и практического применения.