1 Introducción
La cartografía de la cubierta terrestre es una de las direcciones centrales de investigación de la ciencia de la teleobservación, que proporciona soporte de datos clave para la vigilancia ambiental mundial, la gestión de recursos y el desarrollo sostenible mediante una clasificación precisa de los tipos de características superficiales.Congalton等,2014V;Wu等,2024). La cartografía de la cubierta terrestre tiene un alcance extremadamente amplio y abarca el monitoreo hidrológico.Jacqueminet等,2013) Evaluación de los recursos agrícolasOetter等,2001) y la protección del medio ambiente ecológico..Zhang等,2021) y muchas otras áreas..García-Mora等,2012). Sin embargo, los métodos tradicionales de cartografía de la cubierta terrestre a menudo dependen de datos de teleobservación monomodo obtenidos por un solo sensor.Li等,2023), aunque el rendimiento es aceptable en escenarios específicos, todavía hay deficiencias significativas en la precisión y robustez de su clasificación frente a entornos superficiales complejos y heterogéneos..Joshi等,2016).
Como fuente principal de datos de teleobservación en la actualidad, la imagen multiespectral MSI (imágenes multiespectrales) puede distinguir eficazmente los tipos de objetos terrestres, como la vegetación, el agua y el suelo desnudo, registrando la información espectral de la reflexión de los objetos terrestres a través de múltiples canales espectrales, y su principal ventaja es proporcionar una rica información espectral.Thyagharajan和Vignesh,2019). Sin embargo, los datos del MSI son vulnerables a los cambios en la oclusión de las nubes, la dispersión atmosférica y las condiciones de iluminación, y su disponibilidad de datos y precisión de clasificación están muy restringidas en áreas Nubladas y lluviosas o áreas cubiertas de sombra.Haque等,2024). Además, el MSI depende principalmente de las características espectrales y tiene una capacidad limitada de distinguir entre características con respuestas espectrales similares pero con diferentes estructuras (como diferentes tipos de cultivos, materiales de construcción urbana, etc.), lo que resulta en errores de confusión en los resultados de la clasificación.
Por el contrario, el radar de apertura sintética sar, como tecnología activa de teleobservación por microondas, su proceso de imagen no depende de las condiciones de iluminación externa y tiene una fuerte capacidad de penetración en interferencias atmosféricas como nubes y neblina, y puede obtener información superficial de manera continua y estable en diversas condiciones ambientales complejas. Las imágenes SAR reflejan las características estructurales de los objetos a través de señales reflejadas por ondas de radar y son ampliamente utilizadas en el monitoreo de cambios topográficos, evaluación de desastres y análisis de construcción urbana. Aunque las imágenes SAR tienen ventajas obvias en la extracción de características estructurales de objetos físicos, su información espectral es limitada, lo que puede conducir a una precisión de clasificación inferior a la de las imágenes MSI en algunas tareas.Brown和Porcello,1969).
Por lo tanto, el método multimodal de fusión de datos MSI y Sar se ha convertido en una importante dirección de investigación en el campo del procesamiento de imágenes de teleobservación. Al combinar orgánicamente las ricas características espectrales de MSI con la información estructural única de sar, esta estrategia de fusión puede compensar eficazmente las limitaciones inherentes de una sola fuente de datos y mejorar significativamente la precisión de la clasificación de características. La fusión de datos multimodal (msi + sar) no solo mejora la capacidad de aprendizaje de caracterización del modelo, sino que también mejora considerablemente el efecto de identificación de tipos de características complejas, mostrando ventajas técnicas significativas en la aplicación de la cartografía de la cubierta terrestre.Quan等,2020). Específicamente, las características espectrales proporcionadas por los datos MSI se pueden utilizar para distinguir los materiales de la figura, mientras que la información estructural proporcionada por los datos SAR ayuda a identificar las características tridimensionales de la figura.
En los últimos años, con el rápido desarrollo de la tecnología de inteligencia artificial, especialmente los métodos de aprendizaje profundo, se han logrado avances en la tecnología de cartografía de la cubierta terrestre.Ajibola和Cabral,2024V;Paheding等,2024). ConLi等(2022)Tomando como ejemplo el modelo l2hnet propuesto, que ha logrado generar mapas de cubierta terrestre de alta resolución mediante el uso innovador de etiquetas de cubierta terrestre de baja resolución, lo que mejora en gran medida la capacidad de expresión de los detalles de la imagen. En respuesta al problema general de la falta de muestras de ENTRENAMIENTO..Tong等,2025),Li等(2024)Se ha desarrollado aún más el marco de supervisión débil "paraformer", que ha aliviado efectivamente la escasez de datos de etiquetado de alta calidad introduciendo datos históricos de baja resolución como señales de supervisión.
A nivel mundial, se han lanzado varios productos representativos de cubierta terrestre.Grekousis等,2015). La base de datos nacional de cubierta terrestre (nlcd), desarrollada por el Servicio Geológico de los Estados Unidos (usgs), proporciona un importante soporte de datos para el análisis de cambios de cubierta terrestre a largo plazo en los Estados Unidos.Wickham等,2021); El conjunto de datos de cubierta terrestre de China (clcd) desarrollado por el equipo de investigación nacional proporciona un importante soporte de datos para el monitoreo de la cubierta terrestre a escala regional.Yang和Huang,2021). Aunque los productos de cubierta terrestre existentes han logrado avances importantes, la precisión de la clasificación en entornos superficiales complejos aún debe mejorarse.Xu等,2024).
En respuesta a los problemas anteriores, este estudio propone un esquema técnico innovador: en primer lugar, se construye un conjunto de datos de fusión multimodal basado en imágenes MSI y datos Sar para superar las limitaciones de los datos SAR únicos; En segundo lugar, sobre la base de datos multimodales (msi + sar), se fusionan tres modelos avanzados (fcn, convit y coatnet, respectivamente), la red neuronal de convolución (cnn), el convertidor visual (vit) y la arquitectura mixta CNN - vit, mejorando así significativamente la precisión de clasificación de escenas superficiales complejas y la robustez del modelo.
2 Perfil del área de investigación y conjunto de datos
comoFig. 1Como se muestra, el área de investigación seleccionada para este estudio se encuentra en beijing, china. Los datos multiespectrales de gaofen 6 y los datos SAR de gaofen 3 utilizados en el experimento provienen de satélites de la serie gaofen, y el período de adquisición de datos es de finales de 2019 a principios de 2020 para garantizar que los cambios en los objetivos superficiales se minimicen entre diferentes imágenes. Los datos multiespectrales de gaofen 6 pasan por pasos de preprocesamiento como corrección de radiación, corrección de hipercubos espectrales atmosféricos de visión rápida (flaash), corrección de Ortofotografía y selección de bandas en la plataforma envi 5.6, y finalmente la imagen se vuelve a muestrear a una resolución espacial de 10 m. La operación de selección de banda se utiliza para eliminar la absorción de vapor de agua, el ruido y las bandas de baja calidad, manteniendo así la calidad de la imagen..Liu等,2024).
Los datos SAR de alta puntuación 3 se recogen en modo de banda ancha y fina, con una resolución espacial de 10 m y un ancho de 100 km. Los datos SAR se preprocesan utilizando las funciones de eliminación de manchas y corrección topográfica de la Caja de herramientas envi salscape analytics. Se selecciona el filtro refined lee, con un tamaño de ventana deslizante de 5 × 5 píxeles, para eliminar el ruido de manchas; Al mismo tiempo, la corrección topográfica de los datos SAR utilizando los datos del modelo digital global de elevación (dem) gmted2010..Hong等,2023). Además, el tamaño y la resolución de los datos SAR de gaofen 3 son los mismos que los de la imagen MSI de gaofen 6..Liu等,2024).
La imagen MSI utilizada en el experimento es un cubo de datos tridimensional con un tamaño de 256 × 256 × 4 canales. Las imágenes SAR también son cubos de datos tridimensionales, con un tamaño de 256 × 256 × 2 canales. Para más detalles sobre el formato y la estructura de los datos, consulteFig. 1yFig. 2.
Los cuatro canales de cada imagen MSI corresponden a los siguientes rangos de banda: segmento de espectro azul (b1) de 0,4 a 0,52 micras; Segmento espectral verde (b2) en el rango de 0,52 - 0,60 micras; Segmento de espectro rojo (b3) en el rango de 0,63 - 0,69 micras; Segmento de espectro infrarrojo cercano (b4) en el rango de 0,76 - 0,90 micras. Los dos canales de cada imagen SAR corresponden a los dos modos de polarización diferentes de HH y hv, respectivamente. El canal HH significa que las señales transmitidas y recibidas por radar están polarizadas horizontalmente; El canal HV significa que la señal emitida por el radar es polarización horizontal y la señal recibida es polarización vertical. Al mismo tiempo, ambos canales de cada imagen SAR pertenecen a la banda C (aproximadamente 5,3 GHz de frecuencia y aproximadamente 3,1 cm de longitud de onda).
La tarea de cartografía de la cubierta terrestre de este estudio, que involucra 14 categorías de características, requiere una clasificación precisa de cada píxel en la imagen. comoFig. 1En la parte inferior se muestra que cada una de estas categorías tiene un nombre específico. Cada grupo de datos experimentales contiene una imagen MSI y una imagen SAR coincidente, y los dos se comparan con el mapa de cobertura real del suelo del suelo real como criterio de referencia en términos de posición y resolución espacial.
3 métodos de investigación
3.1 indicadores de evaluación
Este estudio utiliza la precisión general oa (oversall precision) y la relación de intersección ponderada por frecuencia fwiou (frency - Weighted intersection over union) como indicadores básicos de evaluación..Fitzgerald和Lees,1994V;LeCun等,1998), las expresiones matemáticas OA y fwiou son
En la fórmula, " C indica el número total de categorías; TP C significa que el modelo predice correctamente el número de píxeles en una determinada categoría; C indica una categoría específica; n C / / I > indica el número total de píxeles reales en la categoría C es decir, el número total de píxeles reales en la categoría n C TP subab > C + / / I > FN C C i > en la que FN subab > C no indica correctamente.se predice el número de píxeles en una determinada categoría.
En la fórmula, " n C C también indica el número total de píxeles reales en la categoría C es decir, i>nc=TPc+FNc, Entre ellos, FN C también dijo que no podía predecir correctamente el número de píxeles en una determinada categoría; TP C también significa que el modelo predice correctamente el número de píxeles en una determinada categoría; C indica una categoría específica; PM C significa que el modelo predice erróneamente el número de píxeles en una determinada categoría; FN C significa que no se puede predecir correctamente el número de píxeles en una determinada categoría.
OA se utiliza para evaluar la precisión de clasificación del modelo en toda la categoría de conjuntos de datos, y puede proporcionar resultados de medición válidos cuando la distribución de cada categoría se encuentra en una situación relativamente equilibrada. Fwiou, por su parte, tiene en cuenta el desequilibrio de la distribución de categorías, comparando el peso de la frecuencia de categorías por la intersección, lo que a su vez refleja de manera más completa el nivel de rendimiento del modelo en el caso de una distribución desigual de categorías. En términos generales, cuanto mayor sea el valor de estos dos indicadores, mejor será la precisión y robustez de la clasificación del modelo de caracterización.
3.2 datos multimodales
Este estudio fusiona imágenes MSI con imágenes sar, genera datos multimodal y los compara con datos monomodo compuestos por una sola imagen sar. Posteriormente, los dos tipos de datos se introducen en siete modelos representativos de Aprendizaje automático de segmentación semántica para la comparación, con el objetivo de evaluar las ventajas de rendimiento de los datos multimodal sobre los datos monomodo.
En concreto, con la ayuda de métodos de aprendizaje supervisados, para los coatnet seleccionados..Dai等,2021), ConViT(D’Ascoli等,2022), FCN(Shelhamer等,2017), HRNet(Wang等,2021), LinkNet(Chaurasia和Culurciello,2017), U-Net(Ronneberger等,2015) estos seis modelos representativos de aprendizaje profundo y Random forest..Rodriguez-Galiano等,2012V;Congalton等,2014) Este modelo representativo de segmentación semántica de Aprendizaje automático implementa entrenamiento y pruebas. Cada modelo utiliza dos conjuntos de datos construidos a partir de datos SAR monomodo y datos multimodales (msi + sar) para lograr una evaluación integral de la diferencia de energía neutral entre los datos monomodo y multimodales en la tarea de segmentación semántica.
Los datos utilizados en este estudio se pueden dividir en dos categorías: primero, los datos monomodo y sus etiquetas de referencia reales correspondientes, respectivamente.Fig. 2Datos SAR monomodo y mapas de cobertura terrestre de referencia en el interior; En segundo lugar, los datos multimodal corresponden a sus etiquetas de referencia reales, respectivamente.Fig. 2Datos de fusión multimodal y mapas de cobertura terrestre de referencia en el Interior.
En detalle, este estudio construyó los dos conjuntos de datos anteriores, cada uno de los cuales contiene 7.140 grupos de muestras de entrenamiento. Cada grupo de muestras de entrenamiento está compuesto por datos SAR monomodo, datos multimodales (msi + sar) y sus etiquetas de referencia reales correspondientes, y estos tres muestran una consistencia absoluta en la posición espacial. En la fase de entrenamiento del modelo, se importaron 7.140 grupos de muestras de entrenamiento SAR monomodo en el primer conjunto de datos y 7.140 grupos de muestras de entrenamiento multimodal (msi + sar) en el segundo conjunto de datos en siete modelos de segmentación semántica de aprendizaje automático, coatnet, convit, fcn, hrnet, linknet, u - Net y Random forest, respectivamente, para operaciones de entrenamiento. Posteriormente, durante la fase de prueba del modelo, se ingresaron 1.428 muestras de prueba en el primer conjunto de datos y 1.428 muestras de prueba correspondientes en el segundo conjunto de datos a los siete modelos mencionados que habían completado el entrenamiento. Finalmente, sobre la base de los dos indicadores clave de OA y fwiou, se realizó una evaluación integral del rendimiento del modelo en escenarios de datos multimodales (msi + sar) y datos SAR monomodo.
3.3 estrategia de fusión de múltiples modelos
La forma específica de la estrategia de fusión de múltiples modelos se presenta enFig. 3. Esta estrategia integra efectivamente la capacidad de CNN para extraer características de detalle local y la capacidad de Vit para percibir información global, mejorando así el rendimiento de expresión y clasificación de características del Modelo..Chua,1997V;Dosovitskiy等,2021). La evaluación del rendimiento de clasificación del modelo también se evalúa con dos indicadores, OA y fwiou.
comoFig. 3Se muestra que el lado izquierdo son los datos multimodales de entrada (msi + sar) del método de fusión multimodelo. A la derecha, el marco punteado rojo contiene tres ramas, a saber, la rama del convertidor visual (vit), la rama mixta de la red neuronal de convolución (cnn) - convertidor visual (vit) y la rama de la red neuronal de convolución (cnn). Cada rama emite un tamaño de 25625614 tensiones tridimensionales, que corresponden a tres gráficos de probabilidad de categoría, respectivamente,,. cada canal del mapa de probabilidad de cada categoría corresponde a un tamaño de 256Matriz bidimensional de 256, que representaFig. 1Mapa de distribución de probabilidad de predicción bidimensional de una de las 14 categorías.
Específicamente, la rama Vit utiliza el modelo convit para explorar el efecto de extracción de características basado en el mecanismo de autoatención; La rama mixta CNN - Vit adopta el modelo coatnet, que combina las ventajas de la convolución y el convertidor para lograr la fusión de características; La rama CNN adopta el modelo fcn, centrándose en la capacidad de extracción de características de las redes de convolución tradicionales.
Se puede expresar con las siguientes dos fórmulas matemáticas:
En la fórmula,Representa 256 píxeles obtenidos de la rama del convertidor visual (vit) que corresponden a la clase C IMatriz de probabilidad de predicción bidimensional de 256 píxeles.Representa 256 píxeles obtenidos de la rama mixta de la red neuronal de convolución (cnn) y el convertidor visual (vit) correspondientes a la clase C IMatriz de probabilidad de predicción bidimensional de 256 píxeles.Representa 256 píxeles obtenidos de la rama de la red neuronal de convolución (cnn) correspondientes a la clase C IMatriz de probabilidad de predicción bidimensional de 256 píxeles.
W 1 < subab], W 2 y W 3 se expresan por separado.Fig. 3Entre ellos, el peso es 1, el peso es 2, el peso es 3. Representa el coeficiente de peso de diferentes modelos.
Indica 256 píxeles correspondientes a 3 categorías C Matriz de probabilidad de predicción bidimensional de 256 píxeles,,Una nueva matriz de probabilidad de predicción bidimensional obtenida después de la fusión.Representa una matriz de probabilidad de predicción bidimensional en la dimensión del canalDe los primeros 256 píxeles correspondientesMatriz de probabilidad de predicción bidimensional de 256 píxelesAl último 256Matriz de probabilidad de predicción bidimensional de 256Fusión para formar un nuevo tamaño de 256 píxeles256 píxelesGráfico de probabilidad de categoría tridimensional de 14 canales.
a través de式(5)Conversión, la salida final es de 256 píxelesUna matriz bidimensional de 256 píxelesEste resultado de salida corresponde al mapa de cubierta terrestre generado después del modelo.
式(5)Se describe la matriz bidimensional.Cada elemento en el y el tensión tridimensionalLa relación entre los elementos correspondientes. Entre ellos, el rango de valores de C es de 0 a 13 enteros (incluidos 0 y 13), que corresponden a 14 índices de categoría, cada uno de los cuales representa un índice de categoría y se compara conEl índice de un canal en corresponde. La relación correspondiente entre la categoría específica y el índice se puede consultar.Fig. 1Etiqueta de categoría en. En la fórmula, " a indicayCualquier índice de línea correspondiente en. B indicayCualquier índice de columna correspondiente en.
式(5)Explica la matriz bidimensionalCualquier elemento enValores y tensiones tridimensionalesRelaciones. Cuando C está dentro del rango entero de 0 a 13 (incluidos 0 y 13), yCuando se alcanza el valor máximo, el valor de C correspondiente al valor máximo esValor. Este valor de C yFig. 1Corresponde a la etiqueta de categoría en.
Finalmente, a través de layFig. 3La etiqueta de icono de cobertura real del suelo correspondiente al conjunto de datos de entrada a la izquierda se compara para calcular los dos indicadores de OA y fwiou, evaluando así el rendimiento de la estrategia de fusión multimodelo.
4 configuración experimental y análisis de resultados
4.1 configuración experimental
En este experimento, el entorno de hardware utiliza la GPU RTX 4090 proporcionada por nvidia. En términos de entorno de software, se utiliza el lenguaje de programación Python 3.9 y el marco pytorch 2.3.
Durante el entrenamiento del modelo de aprendizaje profundo, los parámetros se establecen de la siguiente manera: la Ronda de entrenamiento (epoch) es de 600, cada ronda contiene 892 iteraciones; El tamaño del lote (tamaño del lote) es de 32.
La selección de las rondas de entrenamiento tiene su cientificidad. a través de la observación y el análisis de los cambios de rendimiento durante el entrenamiento, este artículo determina la racionalidad de 600 rondas de entrenamiento. Las razones específicas son las siguientes:
(1) mejora rápida del rendimiento en la etapa inicial del entrenamiento: por ejemploFig. 4yFig. 5Como se muestra, en las primeras 100 iteraciones del modelo, el rendimiento (como los indicadores fwiou y oa) mejoró significativamente. Después de eso, con el aumento de las rondas de entrenamiento, la tasa de mejora del rendimiento se ralentiza gradualmente y tiende a estabilizarse. Por lo tanto, 600 rondas de entrenamiento pueden garantizar que el modelo aprenda completamente y alcance un rendimiento estable.
(2) observación experimental y estabilidad del rendimiento: a través de muchos experimentos, hemos descubierto que 600 rondas de entrenamiento pueden lograr una mayor estabilidad del modelo, y el aumento adicional de las rondas de entrenamiento para mejorar el rendimiento ya es muy limitado. porFig. 4yFig. 5Se puede ver que después de una mejora significativa en la iteración anterior, el rendimiento del modelo ha entrado en una etapa estable, por lo que 600 rondas de entrenamiento es una opción razonable.
(3) evitar el Sobreajuste y la estabilidad del modelo: teniendo en cuenta la estabilidad gradual del rendimiento del modelo durante el entrenamiento, la selección de 600 rondas de entrenamiento no solo evita el riesgo de sobreajuste, sino que también garantiza que el rendimiento del modelo se mantenga consistente durante mucho tiempo.
Además, el tamaño del espacio de los datos de entrada es de 256 píxelesBloques de 256 píxeles recortados al azar a 4 dimensiones de 224 píxeles durante el entrenamientoBloques hijo de 224 píxeles y etiquetas divididas en consecuencia para coincidir con los bloques hijo. El optimizador selecciona Adam w, y la tasa de aprendizaje inicial se establece en 0001; La función de pérdida es la función de pérdida de entropía cruzada (cross - Entropy loss); El despachador de tasa de aprendizaje utiliza reduce lronplatau.
La configuración anterior tiene como objetivo optimizar el efecto de entrenamiento del modelo y garantizar la cientificidad del experimento.
4.2 Experimentos comparativos entre datos multimodal y datos monomodales
Table 1Se registró el rendimiento de los datos SAR monomodo en seis métodos de segmentación semántica de aprendizaje profundo, como coatnet, convit, fcn, hrnet, linknet, u - Net y Random forest, y un modelo clásico de clasificación de píxeles de aprendizaje automático. En términos de evaluación del rendimiento, se utiliza la intersección ponderada de precisión general y frecuencia para comparar estos dos indicadores. Los datos de la tabla son los valores medios de OA y fwiou obtenidos por cada modelo en el momento de la prueba, basados en los mismos 1.428 conjuntos de datos.
Table 1 The performance of different models on Single-modality data
| 模型 | OA | FWIoU |
|---|
| CoAtNet | | |
| ConViT | 80.00 | 68.98 |
| FCN | 52.22 | 41.88 |
| HRNet | 53.27 | 44.74 |
| LinkNet | 51.53 | 43.08 |
| U-Net | 48.99 | 41.13 |
| Random Forest | 41.52 | 34.46 |
Table 2Presenta el rendimiento de los datos multimodal (msi + sar) en los siete modelos anteriores, y los indicadores de evaluación también se establecen en OA y fwiou. Los datos de la tabla se derivan de yTable 1Promedio de OA y fwiou de los resultados de salida de los mismos datos de prueba de 1.428 grupos.
Table 2 The performance of different models on Multi-modality data
| Models | OA | FWIoU |
|---|
| CoAtNet | 64.36 | 55.34 |
| ConViT | 88.21 | 80.48 |
| FCN | | |
| HRNet | 58.37 | 49.63 |
| LinkNet | 58.87 | 50.71 |
| U-Net | 54.20 | 45.99 |
| Random Forest | 44.66 | 37.08 |
Con la ayuda del gráfico de línea de doble eje, se compara el rendimiento de diferentes modelos en datos SAR monomodo y datos multimodales (msi + sar). para más detalles, consulteFig. 6.
Combinado con la Tabla 1 - 2, también hayFig. 6Se puede llegar a la siguiente conclusión: en estos siete modelos, los datos multimodales que fusionan los datos MSI han logrado una mejora significativa en términos de OA media y fwiou promedio en comparación con los datos monomodo compuestos por datos SAR únicos. Esto demuestra plenamente que la introducción de datos multimodal puede fortalecer efectivamente la capacidad del modelo para identificar las características de la superficie; Además, en lo que respecta a los datos SAR monomodo y los datos multimodales (msi + sar), el modelo convit tiene un mejor rendimiento en ambos indicadores anteriores que el resto de modelos, lo que refleja una mayor capacidad de extracción de características y segmentación semántica.
4.3 experimentos de fusión de múltiples modelos
Con el fin de mejorar el rendimiento del modelo de manera más efectiva, con el apoyo de datos multimodal, este estudio lanzó de manera innovadora una estrategia de fusión multimodelo. Esta estrategia combina las ventajas de tres modelos de segmentación semántica de aprendizaje profundo con excelente rendimiento: el modelo convit con Vit como estructura central; El modelo coatnet híbrido de CNN y vit; Y el modelo FCN con CNN como estructura principal.
comoTable 3Como se muestra, de acuerdo conFig. 3Los tres pesos de rama definidos en weight1(w1)、weight2(w2)、weight3(w3) Se realizaron siete grupos de experimentos comparativos con diferentes combinaciones de parámetros. La selección de estas combinaciones de pesos se basa principalmente en los siguientes cuatro aspectos:
Table 3 The results of different weights in the test phase
| 权重 | OA/% | FWIoU/% |
|---|
| w1=0.6, w2=0.2, w3=0.2(baseline) | 89.28 | 81.89 |
| 84.93 | 76.35 |
| w1=0.4, w2=0.3, w3=0.3 | 87.16 | 79.07 |
| w1=0.5, w2=0.25, w3=0.25 | | |
| w1=0.7, w2=0.15, w3=0.15 | 89.09 | 81.64 |
| w1=0.8, w2=0.1, w3=0.1 | 88.81 | 81.25 |
| w1=0.9, w2=0.05, w3=0.05 | 88.51 | 80.86 |
(1) basado enTable 2Como resultado de "el rendimiento de los diferentes modelos en datos multimodales", encontramos que coatnet y FCN tienen una precisión similar, por lo que otorgar los mismos pesos a los dos ayuda a equilibrar las contribuciones de los dos en la fusión multimodelo, es decir W 2 = / / subi > i > w 3 en la fusión multimodelo. Este ajuste de peso garantiza que los dos puedan complementarse y mejorar conjuntamente el rendimiento del modelo final, evitando el dominio excesivo de cualquier rama.
(2) debido al excelente desempeño del modelo convit en OA y fwiou, es capaz de proporcionar una representación característica de alta calidad en comparación con otros modelos como coatnet y fcn. Por lo tanto, al aumentar gradualmente, se puede probar el impacto del modelo convit en la fusión de múltiples modelos, especialmente si el peso de convit puede traer una mejora significativa en el rendimiento cuando aumenta gradualmente.
(3) sobre la combinación de pesosSe trata de verificar cómo las características de varios modelos trabajan juntos en la fusión sin inclinarse hacia un modelo determinado y observar si se puede obtener un mejor rendimiento.
(4) además, en la selección del tamaño del paso W 1 se puede ajustar utilizando el tamaño del paso de 0,1, lo que permite capturar eficazmente el tamaño del paso con mayor impacto de las diferentes configuraciones de peso en el rendimiento final dentro de un rango experimental razonable, lo que permite que cada cambio del experimento refleje diferencias significativas en el rendimiento, ayudando así a identificar rápidamente la mejor combinación de pesos. Por el contrario, un paso demasiado pequeño (como 0,05) aumenta el número de experimentos, lo que puede provocar cambios sutiles que no tengan un impacto significativo en el resultado final, al tiempo que aumenta la carga de cálculo y análisis.
En este proceso, los datos multimodal (msi + sar) se utilizan como entrada, primero se entrenan el modelo convit, el modelo coatnet y el modelo fcn, y el modelo resultante se utiliza como base para experimentos posteriores. Para siete grupos de modelos de fusión con diferentes combinaciones de pesos, en el momento de la prueba, de acuerdo conTable 3Dos indicadores, OA y fwiou2, en los que se evalúan las combinaciones. Los resultados de las pruebas de cada combinación de pesos se toman de la media de los resultados de salida de 1.428 conjuntos de datos consistentes con el "experimento de comparación de datos multimodales con datos monomodales 4.2".
Los resultados experimentales muestran que el rendimiento general de la estrategia de fusión multimodal es mejor que el de otras combinaciones cuando W 1 = 0,6, W 2 = 0,2 y W 3 < Suba > 0,2, con una precisión general promedio del 89,28% y una relación de ponderación promedio del 81,89%. El rendimiento de esta combinación de peso es significativamente mejor que el de los otros seis grupos de combinación, mostrando un mejor efecto de fusión.
Además de eso, en i>w1=0.6、w2=0.2、w3=0.2; w1=0.5、w2=0.25、w3=0.25; w1=0.7、w2=0.15、w3=0.15; w1=0.8、w2=0.1、w3=0.1; w1=0.9、w2=0.05、w3=0.05 Bajo estas cinco combinaciones de pesos, la precisión general promedio y la relación de intersección ponderada de frecuencia promedio de la estrategia de fusión multimodelo son mejores que el convit de un solo modelo con el mejor rendimiento cuando se introducen datos multimodales. En condiciones de entrada de datos multimodal, la precisión global media y la relación de intersección ponderada de frecuencia media de convit son del 88,21% y el 80,48%, respectivamente, mientras que la estrategia de fusión multimodelo muestra un mejor rendimiento en estos dos indicadores.
4.4 presentación de los resultados de la visualización
Fig. 7Muestra la comparación de los resultados de salida de diferentes modelos de aprendizaje profundo bajo datos SAR monomodo;Fig. 8Se muestra la comparación de los resultados de salida de diferentes modelos de aprendizaje profundo bajo multimodo (sar + msi).
A través de la comparaciónFig. 7yFig. 8Los resultados de la clasificación son visibles con la etiqueta real de la posición espacial correspondiente: los resultados de la clasificación bajo los datos SAR monomodo, comoFig. 7Se muestra que el grado de coincidencia con la etiqueta real es bajo; Y después de introducir datos MSI para formar una entrada multimodal, comoFig. 8Como se muestra, la precisión de los resultados de la clasificación ha mejorado significativamente. Este fenómeno verifica la superioridad de los datos multimodal (msi + sar) en la clasificación de la cubierta terrestre, que mejora la capacidad de discernimiento del modelo a través de características complementarias.
Fig. 9Se muestran los resultados experimentales de fusión de datos multimodo (msi + sar) con diferentes combinaciones de pesos bajo las condiciones de entrada de datos multimodo. yFig. 9En comparación,Fig. 8Todavía hay algunas limitaciones en los resultados de visualización en diferentes grados. Por ejemplo, los modelos coatnet, hrnet y linknet no tienen suficiente capacidad para capturar información detallada, lo que resulta en grietas más obvias en los resultados de la clasificación; El modelo fcn, por su parte, ignora la coherencia de la estructura espacial general porque se centra demasiado en la extracción de características locales. Los resultados de la comparación anterior demuestran plenamente que la fusión multimodelo mediante una combinación razonable de pesos puede optimizar aún más el efecto de clasificación de la cartografía de la cubierta terrestre sobre la base de datos multimodales (msi + sar).
5 debate
En este estudio, utilizamos la precisión general (oa) y la relación de intersección ponderada por frecuencia (fwiou) como los principales indicadores de evaluación del rendimiento, y a través de la comparación de los resultados de visualización, demostramos la efectividad del método de fusión multimodelo propuesto en las tareas de cartografía de la cubierta terrestre. Aunque el rendimiento del modelo se puede evaluar cuantitativamente a través de los indicadores OA y fwiou, solo a través de estos indicadores y resultados visuales no se pueden revelar completamente las causas detrás de él. Por lo tanto, esta sección combinará los antecedentes de la tecnología de teleobservación para explorar en profundidad las ventajas de los métodos propuestos y las razones científicas detrás de ellos.
5.1 diversidad y complejidad de los datos de teleobservación
En la tarea de cartografía de la cubierta terrestre, la aplicación de imágenes de teleobservación se enfrenta a desafíos clave como la fuerte heterogeneidad de la superficie y los tipos complejos de objetos terrestres.Lu等,2010). La diversidad de la topografía y la variabilidad espacio - temporal de las características espectrales de las características físicas hacen que los métodos de clasificación basados en una sola fuente de datos a menudo sean difíciles de lograr la precisión ideal. En concreto, aunque las características multibanda de los datos de teleobservación proporcionan una gran cantidad de información espectral, también plantean problemas inherentes como el mismo espectro (la misma característica presenta diferentes respuestas espectrales en diferentes bandas) y el mismo espectro de cuerpos extraños (diferentes características tienen un rendimiento similar en bandas específicas) ()Sharma等,2018; van der Werff y van der meer, 2008;Mickaelian和Sargsyan,2010). Por ejemplo, en el problema de la heterogeneidad, ciertas categorías de características físicas (como bosques y tierras cultivadas) pueden tener respuestas espectrales similares en algunas bandas, pero debido a los diferentes entornos de crecimiento y sus características físicas, su desempeño en diferentes bandas varía significativamente. En el problema del mismo espectro de cuerpos extraños, las características de reflexión de diferentes categorías de objetos terrestres (como cuerpos de agua y humedales) se superponen altamente en algunas bandas espectrales, lo que resulta en una disminución significativa de la precisión de clasificación de las imágenes de teleobservación monomodo en este escenario.
Este problema es particularmente prominente en escenarios complejos como montañas y humedales. Los complejos altibajos topográficos y la densa distribución de las características espectrales de las diferentes categorías de características espectrales de las características físicas muestran una mayor similitud, junto con la interferencia acústica, los cambios ambientales y las condiciones de iluminación y otros factores, lo que reduce aún más la fiabilidad de la clasificación de las imágenes de teleobservación monomodo tradicionales.Rehman等,2021). En respuesta a este desafío, la estrategia de fusión de datos multimodal muestra ventajas significativas. Entre ellos, las imágenes MSI pueden capturar eficazmente las diferencias espectrales de las características terrestres a través de la información espectral multibanda, que tiene un valor único en la solución del problema de la homogeneidad y la heterogeneidad; Los datos sar, por su parte, muestran una fuerte capacidad de distinción en escenas del mismo espectro de cuerpos extraños a través de la extracción de características estructurales superficiales.
Los resultados experimentales muestran que la fusión colaborativa de datos MSI y Sar mejora significativamente el rendimiento de clasificación del modelo.Table 1yTable 2). Esta estrategia de fusión multimodal no solo mejora la capacidad de discernimiento del modelo a través de la complementariedad de las características espectrales y estructurales, sino que también muestra una excelente adaptabilidad en áreas topográficas complejas.
5.2 ventajas de la fusión de múltiples modelos
Como se puede ver en la Tabla 1 - 3, aunque el modelo convit es mejor que los modelos individuales como coatnet y FCN en los indicadores OA y fwiou, el rendimiento de clasificación se ha mejorado aún más mediante la integración de estos tres modelos. Esta mejora del rendimiento se debe principalmente a las sinergias complementarias entre los modelos a nivel de extracción de características y toma de decisiones clasificadas.Arpitha等,2023). Específicamente, el modelo convit, con su mecanismo de atención global, ha tenido un buen desempeño en el modelado de dependencia a largo plazo; Coatnet, por su parte, muestra una mayor robustez al procesar figuras de estructuras espaciales complejas combinando la capacidad de extracción de características locales de CNN y las ventajas de modelado global de vit, especialmente en áreas con límites terrestres inexistentes y cambios topográficos drásticos; Por su parte, el modelo FCN tiene ventajas únicas en las tareas de captura de características detalladas y clasificación fina debido a su estructura de convolución completa. Por lo tanto, a través de la estrategia de fusión de múltiples modelos, no solo se pueden conservar las ventajas de cada modelo, sino también compensar las debilidades de un solo modelo en categorías específicas de características, mejorando así la precisión general de la clasificación.
5.3 clasificación de los detalles de las características
Este estudio abarca 14 tipos de características físicas con heterogeneidad significativa, incluyendo cubiertas superficiales típicas en entornos naturales y artificiales. Específicamente, los 14 tipos de características en el estudio incluyen: antecedentes, generalmente representados como partes inciertas o no relacionadas, a menudo eliminados para resaltar contenidos importantes; Aguas superficiales, incluidas las aguas de ríos, Lagos y embalses; Calles, incluidos los sistemas viales urbanos o rurales; Zonas urbanas, que cubren zonas urbanas altamente construidas, incluidas zonas residenciales y comerciales; Terrenos industriales, comerciales y de transporte, incluidas instalaciones industriales, locales comerciales e infraestructura de transporte, como aeropuertos y estaciones de tren; Minas, vertederos y sitios de construcción, incluidas minas superficiales, áreas de gestión de residuos y sitios de construcción; Área de vegetación artificial, que se refiere a la vegetación cultivada artificialmente, como césped, espacio verde y jardín; Tierras cultivadas, tierras agrícolas utilizadas para la producción agrícola; Campos de cultivo permanentes, áreas donde se cultivan cultivos a largo plazo como árboles frutales, uvas y aceitunas; Pastos, pastizales y otras áreas utilizadas para el pastoreo; Bosques, incluidos bosques de coníferas y bosques de hojas anchas de crecimiento natural y cultivo artificial; Arbustos, áreas cubiertas principalmente por plantas arbustivas; Las tierras abiertas sin vegetación se refieren al suelo desnudo, la arena, las zonas rocosas y otras tierras sin cobertura vegetal; Humedales del interior, incluidas zonas no costeras, como pantanos y turberas.
5.4 análisis de los resultados de la visualización
desdeFig. 7- -Fig. 9Los resultados de la visualización en pueden ver intuitivamente que el modelo de fusión tiene ventajas significativas en la identificación de diferentes tipos de características. Especialmente en áreas con topografía compleja y muchos tipos de características, el modelo de fusión es más prominente en detalles, lo que puede distinguir mejor las categorías de características similares y reducir las grietas de clasificación y los fenómenos de clasificación errónea. Además,Fig. 9Los resultados de fusión bajo diferentes combinaciones de pesos en también muestran que un establecimiento razonable de pesos puede mejorar significativamente el efecto de clasificación final y optimizar el rendimiento del modelo.
En concreto,Fig. 9Muestra las ventajas de la estrategia de fusión de múltiples modelos con diferentes combinaciones de pesos al manejar áreas con topografía diversa y detalles ricos. Al establecer razonablemente el peso de cada modelo, se puede optimizar la respuesta del modelo a diferentes tipos de características y mejorar la capacidad de identificación de categorías de características complejas como ciudades, humedales y bosques. ComparaciónFig. 8yFig. 7Los resultados de la clasificación del modelo bajo la entrada de datos multimodal (msi + sar) muestran una distribución geográfica más detallada que los datos SAR monomodo, especialmente en las zonas urbanas y acuáticas, y la precisión de la clasificación ha mejorado significativamente.
6 Conclusiones
Este estudio propone de manera innovadora un marco de fusión de datos multimodal y optimización colaborativa multimodelo para la cartografía de la cubierta terrestre. A nivel de datos, a través de la fusión a nivel de canal de imágenes MSI y datos sar, se construye un conjunto de datos multimodal con expresión de características complementarias. La verificación experimental muestra que la estrategia de fusión de datos mejora significativamente la precisión de clasificación y la capacidad de generalización del modelo en comparación con los datos SAR únicos.
En términos de arquitectura de modelo, el mecanismo de fusión de múltiples modelos propuesto en este estudio logra ventajas complementarias entre la extracción de características locales y el modelado de contexto global optimizando conjuntamente las ramas mixtas de cnn, vit, CNN y vit. Tanto los experimentos cuantitativos como el análisis visual confirman que la estrategia de fusión puede mejorar efectivamente la precisión y robustez del reconocimiento de objetos terrestres en escenarios complejos.
Esta investigación proporciona nuevas ideas técnicas para la cartografía de la cubierta terrestre basada en el aprendizaje profundo. su marco de procesamiento de datos multimodal y su estrategia de fusión de modelos múltiples no solo proporcionan un importante apoyo teórico para el campo de la cartografía de la cubierta terrestre, sino que también proporcionan nuevas ideas y direcciones para futuras investigaciones y aplicaciones prácticas.