FLGF-UNet: red de extracción de edificios de imágenes ópticas de teledetección fusionando características locales y globales

  • role: First author第一作者
  • Affiliation:

    School of Computer and Information Engineering, Tianjin Chengjian University, Tianjin 300384, China

  • Email:ligy@tcu.edu.cn
  • Introduction:E-mail ligy@tcu.edu.cn
LI Guoyan,  
  • Affiliation:

    School of Computer and Information Engineering, Tianjin Chengjian University, Tianjin 300384, China

LIU Tao,  
  • role: Corresponding author通信作者
  • Affiliation:

    School of Computer and Information Engineering, Tianjin Chengjian University, Tianjin 300384, China

  • Email:wanglichengjian@tcu.edu.cn
  • Introduction:E-mail wanglichengjian@tcu.edu.cn
WANG Li*,  
  • Affiliation:

    School of Computer and Information Engineering, Tianjin Chengjian University, Tianjin 300384, China

LIU Yi

resumen

La segmentación semántica de imágenes de teledetección desempeña un papel importante en la detección de cambios urbanos, la protección ambiental, el reconocimiento de desastres geológicos y otros campos. Para abordar los problemas actuales en la extracción de edificios a partir de imágenes de teledetección, como omisiones, falsas detecciones e extracción incompleta debido a la obstrucción de árboles o la interferencia de objetos similares, este artículo propone una red mejorada de extracción de edificios basada en la red UNet: la red de fusión de características locales y globales FLGF-UNet (Fusion of Local Global Features Network). La fusión paralela de características en FLGF-UNet garantiza que cada etapa incluya información local detallada y dependencias globales, permitiendo que la red posea información local y global en la representación de características en cada etapa, superando eficazmente las limitaciones del Transformer en el intercambio de información local y superando a las CNN tradicionales en el modelado de información global. Además, para compensar la brecha semántica entre el codificador y el decodificador, se añade un módulo de fusión interactiva IF (Interactive Fusion) que mejora la integración de detalles espaciales, contexto global y características semánticas. Para validar la superioridad y generalización de FLGF-UNet, la red propuesta se comparó con U2Net, Swin Transformer, MA-Net, HD-Net y RS-Mamba en los conjuntos de datos WHU, Massachusetts y conjuntos de datos de edificios urbanos típicos en China. Los resultados muestran que FLGF-UNet supera en rendimiento a otras redes SOTA y tiene un alto valor de aplicación práctica.

palabra clave

imágenes de teledetección; extracción de edificios; red de fusión de características locales y globales; fusión de características; módulo de fusión interactiva

1 Introducción

El objetivo principal de la extracción de edificios es distinguir la forma de los edificios de las imágenes de teledetección de alta resolución. En las últimas décadas, se han logrado avances notables en este campo, que se ha utilizado ampliamente en áreas como la planificación urbana, el monitoreo dinámico urbano y el monitoreo de desastres. La investigación temprana se basó principalmente en la clasificación secundaria de características arquitectónicas marcadas a mano, como formas, bordes y sombras, que generalmente se consideran características de bajo nivel y dependen en gran medida del conocimiento previo. Para aprender adaptativamente la información característica de alto nivel a partir de una gran cantidad de datos..Wang等,2022En los últimos años, la tecnología de aprendizaje profundo se ha introducido en la extracción de edificios, logrando buenos resultados y se ha convertido en un foco de Investigación.
Entre los métodos de aprendizaje profundo, la red neuronal de convolución CNN (red neuronal volátil), como una poderosa red de aprendizaje de características, es ampliamente utilizada en diversas tareas de visión por computadora.Long等(2015)Basado en cnn, se propone una red de convolución completa FCN (red de convolución completa), que tiene la ventaja de ser capaz de aceptar imágenes de entrada de cualquier tamaño con flexibilidad y generar eficazmente salidas del tamaño correspondiente. Por ejemplo,Ronneberger等(2015)Se propone una red u - net, que utiliza decodificadores para aprender la correlación espacial de las características de la imagen en la etapa de codificación, mejorando así significativamente el rendimiento de segmentación. Además,Qin等(2020)U2net está diseñado con una estructura en forma de u anidada en dos niveles, en la que el bloque u residual (rsu) puede extraer campos sensoriales de diferentes escalas, capturando así más información contextual. Con el fin de resolver el problema de la utilización insuficiente de las características y la integración insuficiente de la información a múltiples escalas,Li等(2022)Se propone una red de atención múltiple (manet) para extraer la Dependencia del contexto a través de varios módulos de atención efectivos.Li等(2024b)Se propone además una red de desacoplamiento de alta resolución HD - net, que utiliza la interacción paralela de su información multiescala para aliviar significativamente el problema del acoplamiento entre las características generales y fronterizas. Aunque la red CNN ha logrado buenos resultados en la extracción de edificios, debido a las limitaciones del diseño del decodificador, CNN no puede aprovechar al máximo la información global..Song等,2023). Además, debido a la existencia de un fondo complejo y un gran ruido en la imagen, el uso de información contextual global y características espaciales meticulosas puede realizar eficazmente la segmentación semántica de las imágenes de teleobservación.Ding等,2021). Sin embargo, la red tradicional CNN todavía tiene deficiencias en la segmentación semántica de las imágenes de teleobservación y necesita ser mejorada aún más.
Para resolver esta limitación de las redes CNN tradicionales, se utilizan mecanismos de atención y estrategias de fusión de características multiescala, como el módulo de agrupación piramidal.Zhao等,2017), estrategia de fusión de características multinivel..Wang等,2018), módulo de atención canal y atención posicional..Fu等,2019), módulo de atención cruzada..Chen等,2021). Sin embargo, la información global capturada por este método no se codifica directamente del modelado global..He等,2022), pero está compuesto por características locales capturadas por la red CNN existente; Por lo tanto, la información global puede no haber sido capturada..Mou等,2020). Transformer tiene una fuerte capacidad para capturar relaciones de información global en el campo del procesamiento del lenguaje natural (pnl), proporcionando una solución factible para la segmentación semántica. Por ejemplo,Carion等(2020)Se diseña una estructura de transformador de doble rama, que se basa principalmente en la relación entre el objetivo de modelado y el Fondo de la imagen global. Además,Liu等(2021)Construir swin Transformer para mostrar un gran potencial en tareas de clasificación de imágenes y predicción intensiva. Cabe señalar que, aunque Transformer puede capturar eficazmente las dependencias de larga distancia de las características globales, la información de las características locales a menudo se ignora. Para segmentar eficazmente las imágenes de teleobservación utilizando características locales y globales, es esencial diseñar una red que combine Transformer y cnn, lo que a su vez puede capturar eficazmente tanto información global como detalles espaciales finos.Azad等,2022).Li等(2024a)Se propone una red ligera de extracción de características globales locales LLG - Net (lightweight local Feature Extraction network), en la que la combinación efectiva de bloques de autocuidado y bloques de convolución garantiza la integración gradual de características globales y locales a través de varios niveles.Zhang等(2024)Se propone una red de purificación espacial espectral para mejorar la precisión de la clasificación, utilizando el módulo de conducción mutua global - local para realizar la interacción de características a nivel de imagen y píxel, mejorar la diferenciación espacial de las características extraídas y reducir la heterogeneidad espacial. La mayoría de los métodos anteriores utilizan ramas CNN para extraer características locales, ramas Transformer para extraer características globales y luego fusionarse en el lado del decodificador, lo que a menudo conduce a la redundancia semántica en la fusión de características multiescala y la fusión insuficiente. En el último estudio,Zhao等(2024)Se propone un método de predicción intensiva de imágenes de teleobservación de alta resolución a gran escala basado en Mamba (rsm) para capturar el contexto global de imágenes de teleobservación con complejidad lineal, promoviendo así el procesamiento efectivo de imágenes de teleobservación a gran escala.
Dado que hay limitaciones en la plena integración de la información global y local, y para resolver el problema de la detección incompleta, la detección incorrecta, la oclusión por árboles o la interferencia de objetos similares en las imágenes de edificios de teleobservación, se propone una red de características locales y globales flgf - unet, que integra directamente la información local y global y obtiene características en paralelo a través del modelado multiescala y global, de modo que la representación de características en cada etapa de la red tenga información local y global, y pueda integrar la información de diferentes escalas y niveles de manera más natural y completa en el proceso de extracción de características.
El extremo del codificador de la red flgf - unet utiliza el módulo de atención residual ra (asistencia sexual) como capa inicial para extraer eficazmente las características poco profundas y propone el módulo de fusión lineal LF (fusión lineal) como columna vertebral para capturar detalles espaciales e información de contexto global. El módulo LF contiene los módulos MSF de fusión multiescala (fusión multiescala) y GM de modelado de atención global (modelado de atención global), que se utilizan para extraer información local y contexto global de diferentes escalas, respectivamente, para garantizar la integridad de las dependencias de características, compensando así las deficiencias de un solo bloque en la extracción de características. El extremo del decodificador también utiliza un módulo de atención residual para fusionar información de características de varias capas, mejorando aún más la precisión de la extracción del edificio. Además, se introduce un módulo de fusión interactiva if (fusión interactiva) entre códecs para compensar la brecha semántica y mejorar el efecto de fusión de detalles espaciales, contexto global y características semánticas. El experimento verificó la efectividad y universalidad de flgf - unet en el conjunto de datos wha, Massachusetts y el conjunto de datos de ejemplo de edificios urbanos típicos de china.

2 fusión de redes características locales - globales

El techo del edificio tiene una variedad de materiales y es similar a los materiales de carreteras, plazas, tierra desnuda y otros lugares. Por lo tanto, en las imágenes de teledetección de alta resolución, los edificios se confunden fácilmente con carreteras, plazas, tierra desnuda y otros objetos en el espectro. Sin embargo, las características espectrales de la vegetación, las sombras, el agua y los edificios son muy diferentes. El promedio de edificios y carreteras, plazas y tierra desnuda es más cercano. La variación del edificio está más cerca de la carretera. El contraste entre el edificio y la carretera es más cercano. En resumen, los edificios son similares a las carreteras, plazas y suelo desnudo en algunas características de textura, que son muy diferentes de las texturas de sombras, vegetación y cuerpos de agua.
Debido a que el edificio tiene diferencias geométricas significativas de múltiples escalas (por ejemplo, y la envergadura de la distribución del tamaño), y sus límites claros del edificio son vulnerables a interferencias ambientales complejas (como la oclusión de la vegetación o la adherencia de edificios vecinales), esto plantea un doble requisito para el modelo de segmentación: por un lado, es necesario capturar las características del contorno a nivel de píxeles a través de un mecanismo de percepción de borde fino, por otro lado, es necesario establecer un mecanismo de interacción de características de varios niveles para manejar cambios drásticos en la escala objetivo. Flgf - unet diseña de manera innovadora una arquitectura de fusión bimodal lineal e interactiva para este tipo de características: la capa de fusión lineal logra una alineación gradual de las características de escala cruzada a través de una estrategia de ponderación de canal paramétrica aprendible, aliviando efectivamente el problema del desajuste de características causado por el salto de escala del objetivo del edificio; El módulo de fusión interactiva, por su parte, compensa la brecha semántica en el proceso de codificación y decodificación estableciendo un mecanismo de interacción de atención de dos dimensiones espacio - canal, manteniendo la coherencia estructural global mientras mejora la sensibilidad de los detalles locales.
Ver la estructura general de flgf - unetFig. 1Se muestra. El codificador está compuesto por un módulo ra y cuatro módulos lf, y el decodificador está compuesto por cuatro módulos ra. El módulo LF consta de 3La capa de convolución, el módulo MSF y el módulo ga están compuestos. El flgf - unet utiliza un módulo if en lugar de una conexión de salto entre el codificador y el decodificador, logrando así una fusión multiescala entre capas. Cuando el mapa de características entra en el módulo if, use- -Primero se toma un muestreo bilineal de la imagen, y luego se comprime el canal del mapa característico de baja resolución para eliminar la información redundante. Posteriormente, se alimenta al módulo if para decodificar aún más la información de contexto, y el módulo if realiza una conexión perfecta entre el códec. El grado de diferencia entre la salida predictiva de la red y la etiqueta (gt) determina el valor de pérdida. Este artículo utiliza la función de pérdida sigmoid IOU loss para calcular. La adición de la función de pérdida a sus cinco ramas por flgf - unet puede supervisar el entrenamiento de la red y expresarlo más a partir de las características del mapa de características agregadas. Cuando la salida de predicción de la red no coincide con el tamaño de la forma de gt, se toma una muestra superior de la salida de predicción teniendo en cuenta la pérdida semántica después de tomar una muestra inferior de la salida de la red, de modo que su tamaño de forma es el mismo que el de gt, y luego se utiliza La función de pérdida para calcular la pérdida. Las ramas de la red de muestreo superior pueden suavizar su ruido, la salida de la red es similar a la de gt, y las ramas del mapa de características pueden supervisar mejor el aprendizaje.
figure

Fig. 1 FLGF-UNet network model

2.1 módulo de atención residual

Para hacer frente a los problemas de desaparición de gradientes, extracción insuficiente de características y asignación insuficiente de parámetros provocados por el aumento del número de capas de red, este artículo propone el módulo de atención residual ra (módulo de atención residual ra). Los principales componentes de este módulo incluyen una estructura de convolución residual y un módulo de atención, comoFig. 2Se muestra. El procesamiento del módulo de atención se realiza en el siguiente orden. Mapeo de característicasComo entrada a la atención del canal, se genera a su vez un mapa de atención 1 - D.Y multiplicar elementos por elementos con i > x x por crear características de atención del canal i > x '/ / I > i . La expresión de la atención del canal es la siguiente:
La salida del paso anterior < STRONG > i > x '/ / I > / / STRONG > se utiliza como entrada a la atención espacial, y luego se genera un mapa de atención espacial bidimensional., multiplicado por elementos con < STRONG > x '/ / I > / STRONG > para obtener características de atención espacial < STRONG > x / STRONG > y i > respectivamente. Entre ellos, Sigma significa la función sigmoid y significa multiplicar elemento por elemento. La expresión de la atención espacial es la siguiente:
figure

Fig. 2 Residual attention module

figure

Fig. 3 Linear fusion module

2.2 módulo de fusión lineal

La limitación de la red neuronal de convolución tradicional CNN (red neuronal revolucionaria) en el procesamiento de imágenes de teleobservación radica en su falta de capacidad de modelado global, que solo puede extraer características de áreas locales de la imagen, lo que resulta en una vulnerabilidad a la interferencia acústica en un contexto complejo. Además, debido a las múltiples operaciones de muestreo, las características de los edificios de teleobservación en las profundidades de la red pueden perderse gradualmente, lo que afecta la precisión e integridad de la extracción de edificios. La introducción de Transformer trae nuevas posibilidades para la extracción de edificios en imágenes de teleobservación, y su mecanismo de autoatención tiene una fuerte capacidad de modelado global, que puede capturar eficazmente las dependencias entre características de larga distancia. Sin embargo, los edificios de teleobservación tienen las características de límites complejos, formas diversas y interferencias obvias de fondo, y la Dependencia simple de las características globales a menudo no es suficiente para extraer los edificios con precisión. Por lo tanto, la extracción de características locales sigue siendo una parte indispensable del proceso de extracción de edificios de teleobservación. Para superar las limitaciones anteriores, se puede diseñar un módulo de fusión lineal.Fig. 3Se muestra que no sólo tiene la capacidad de modelado de características globales, sino que también conserva la representación detallada de características locales para mejorar la precisión y robustez de la extracción de edificios en imágenes de teleobservación. El módulo LF está compuesto por 3La capa de convolución (capturar la semántica de contexto dentro del gran vecindario), el módulo MSF de fusión multiescala (que puede inhibir la interferencia de la información de áreas no relacionadas, enfatizando selectivamente las características multiescala) y el módulo ga de atención global (modelado de atención global) (mejorar la información global en el mapa de características obtenido). El módulo de modelado global es responsable de calcular la matriz de atención, combinada con la reconstrucción de características y la operación de convolución punto a punto, para lograr una fusión más eficiente de características globales y locales, conservando detalles espaciales. Dar una característica de entrada, pasar por separadoDespués de la convolución, se obtieney. y luegoyCirugía plástica para obteneryA continuación, se calcula y reconstruye a través de una capa de conexión completa de < STRONG > i > q y < STRONG > i > k i < STRONG > para obtenery. multiplicar la matriz en < STRONG > i > q y < STRONG > i > k para obtener atención. finalmente, la atenciónConvolución y operaciones de softmax para obtener atención de salidaEntre ellosRepresenta la convolución punto a punto,Indica la capa de conexión completa. Este módulo puede aprender y optimizar más directamente el peso de atención de la posición del objetivo en el mapa de características y adaptarse a la compleja distribución espacial de los objetos en las imágenes de teleobservación. Por el contrario, Transformer puede perder información espacial local al intercambiar información sobre bloques de imagen, especialmente dentro de un solo bloque sin percepción de detalles. Después de un aprendizaje continuo optimizado, la matriz de atención puede percibir eficazmente la posición del objetivo en el mapa de características.
El valor en el módulo LF ( V pasa por 3La capa de convolución y el módulo de fusión multiescala se calculan. Apilar 3Equivalente a unEl campo sensorial puede extraer eficazmente características locales más ricas. comoFig. 4Se muestra que el módulo MSF puede obtener información de características de diferentes escalas, lo que hace que la extracción de características sea más detallada y precisa. La capa de convolución y el módulo MSF se complementan entre sí para compensar las deficiencias entre sí, extrayendo así características más finas. Este diseño estructural mejora aún más la capacidad de expresión de las características y ayuda a hacer frente mejor a las complejas interferencias de forma y Fondo del edificio.
figure

Fig. 4 Multi-scale fusion module

Dar características de entradaSe calcula a través de la capa de enrollado y el módulo msf, respectivamente.yY luegoySe puede sumar. finalmente, se realiza la multiplicación matricial de la atención y V para obtener la salida.
En la fórmula,representarGrupo de capas de convolución,Representa el módulo msf. Finalmente, se fusionan las características locales y globales extraídas, y el módulo pasa por la acumulación de capas yUna capa de alimentación avanzada compuesta por una capa de convolución para calcular la salida final.
En la fórmula,Indica el peso que se puede aprender,representarOperación de convolución,representarOperación de convolución,Representa la salida después de la fusión de características. V es un mapa de características extraído a través de módulos de convolución y msf, que no puede suprimir completamente el ruido de fondo debido a la falta de información global. Sin embargo, después de combinarse con el modelado de atención global, la matriz de características obtenida por la multiplicación de la matriz contiene información global, lo que puede guiar eficazmente la extracción de las características del objetivo.
El módulo LF puede reducir la atención a la información de fondo y aumentar la atención a los edificios de teleobservación, mejorando así la precisión de la extracción de edificios. Esta combinación no solo conserva detalles locales, sino que también aprovecha al máximo la información contextual global, lo que hace que el módulo LF se desempeñe bien en escenarios complejos de teledetección.

2.3 módulo de integración interactiva

Para resaltar aún más la información de las características de contexto global, se propone un módulo if de fusión interactiva (fusión interactiva) para reemplazar la capa de conexión de salto en la estructura tradicional de Códec para retener más información de contexto de la capa de codificación y decodificación. comoFig. 5Como se muestra, el módulo if captura la Dependencia de largo alcance entre píxeles aprendiendo características de detalle de bajo nivel y características semánticas de alto nivel. Específicamente, durante el proceso de fusión de características, el módulo if modela la Dependencia de larga distancia entre píxeles y objetos a través de las características semánticas implícitas de cada canal exportado, que pueden usarse como mapeo de objetos específicos, y hay interrelaciones entre diferentes características semánticas. De esta manera, el módulo if puede codificar la información de contexto global para aprovechar racionalmente la interdependencia entre los mapas de características y mejorar la capacidad de expresión de características, capturando así eficazmente la relación entre el edificio en la imagen de teleobservación y su Fondo circundante. El módulo de fusión interactiva no solo fortalece la retención de detalles de las características locales, sino que también realiza el modelado colaborativo entre el Fondo del edificio de teleobservación y los objetos del edificio a través del modelado global, mejorando significativamente la precisión de la extracción del edificio.
figure

Fig. 5 Interactive fusion module

En primer lugar, se utiliza el emparejamiento adaptativo avgpool2d para el mapa de características.Se realiza la operación, de la cual C es el número total de canales, y H y W son la altura y anchura características, respectivamente.
Después de eso, se utiliza la operación de estimulación ( C → C / r, C / R → c, R = / / I > 4) para remodelar las características avanzadas..), reduciendo al mismo tiempo la cantidad de parámetros de red. entreySon (relu) y normalización por lotes (lote).yRepresenta las operaciones de incentivos de C C C / r y C / r respectivamente.
Finalmente, las características entre canales se logran mediante una suma ponderada con pesos de características de bajo nivel, en la queRepresenta la multiplicación elemento por elemento, yRepresenta las características de bajo nivel en el decodificador.
Con el fin de mejorar la discernibilidad entre el objetivo y el fondo, se presta más atención a la información espacial. En primer lugar, sí.Realizar la operación de incentivo (((('i > C C → C / r y r = 4), y luego agregarla con las operaciones de Pool promedio (pavg) y Pool máximo (pmax). entreEs una operación de convolución.RepresentanteDespués de la convolución.
Las características espaciales se logran mediante una suma ponderada con pesos de características avanzadas, en la queRepresenta la multiplicación elemento por elemento, yRepresenta las características avanzadas en el codificador.

3 experimentos y análisis

3.1 conjuntos de datos

Para verificar la superioridad de la red propuesta, se seleccionaron tres conjuntos de datos públicos de edificios de teleobservación para realizar una amplia gama de experimentos, incluido el conjunto de datos de edificios de la wha.Ji等,2019), Massachusetts Building data set..Mnih,2013) y el conjunto de datos de ejemplos de edificios urbanos típicos de China..吴开顺 等,2021). Antes del entrenamiento, todas las imágenes importadas se normalizan primero, y luego se Voltean aleatoriamente, se difuminan Gauss y se mejoran los datos a su vez. Los detalles de los tres conjuntos de datos son los siguientes:
(1) el conjunto de datos del edificio Massachusetts contiene 151 imágenes aéreas del área de Boston con una resolución espacial de 1 m, cubriendo Escenas urbanas y suburbanas de unos 340 km 2 aproximadamente. Estas imágenes tienen un tamaño de 1500 × 1500 píxeles. Los conjuntos de datos oficiales se dividen en conjuntos de entrenamiento (137 imágenes), conjuntos de verificación (4 imágenes) y conjuntos de prueba (10 imágenes). Para facilitar el entrenamiento del modelo, estas imágenes se recortaron en trozos pequeños de 256 × 256 píxeles adecuados para la entrada de la red, generando 4.932 imágenes de entrenamiento, 144 imágenes de verificación y 360 imágenes de prueba.
(2) el conjunto de datos de edificios de la WHA contiene 8.189 imágenes (4.736 para entrenamiento, 1.036 para verificación y 2.416 para pruebas), con una resolución espacial de 0,3 m y una cobertura de más de 450 km 2 e incluye unos 22.000 edificios. Para facilitar el entrenamiento, las imágenes se recortaron a trozos pequeños de 256 × 256 píxeles adecuados para la entrada de la red, obteniendo 18.944 imágenes de entrenamiento, 4.144 imágenes de verificación y 9.664 imágenes de prueba.
(3) el conjunto de datos de ejemplos de edificios urbanos típicos de China cubre varias ciudades típicas de China (incluyendo beijing, shanghai, Shenzhen y wuhan), con una resolución espacial de 0,29 M. la fuente de datos se basa en imágenes satelitales autoproclamadas y contiene un total de 63.886 ejemplos arquitectónicos marcados con refinamiento, con una cobertura geográfica de unos 120 km 2 < sup] (de los cuales 5.985 se utilizan para entrenamiento y 1.275 para pruebas). La resolución de cada imagen es de 500 x 500 píxeles. Para facilitar el entrenamiento, la imagen se redujo a un pequeño bloque de 256 × 256 píxeles adecuado para la entrada de la red, obteniendo 23.940 imágenes de entrenamiento y 5.100 imágenes de prueba.

3.2 Indicadores de evaluación

Para una evaluación amplia y completa de la red propuesta, se seleccionaron cuatro indicadores: comparación de intersección (iu), f1, precisión (precisión) y tasa de retiro (llamada). Entre ellos, tp, FPS y FN en la fórmula indican verdadero positivo, falso positivo y falso negativo, respectivamente.
Todos los experimentos relacionados se llevaron a cabo en el entorno pytorch 2.01 (cuda 11.7) en la GPU NVIDIA GeForce RTX 4070, equipada con 12 GB de memoria. En la etapa de entrenamiento, se selecciona el optimizador SGD y se utiliza la estrategia de coseno para ajustar la tasa de aprendizaje. Para garantizar la equidad y consistencia de los experimentos, en el conjunto de datos de la WHA y el conjunto de datos de Massachusetts y el conjunto de datos de ejemplo de edificios urbanos típicos de china, la red propuesta se compara con otras redes (incluida u2net..Qin等,2020), Swin-Transformer(Liu等,2021), MANet(Li等,2022), HD-Net(Li等,2024b), RS-Mamba(Zhao等,2024)) los parámetros se establecen de la siguiente manera: la tasa de aprendizaje inicial es de 0,05, el tamaño del lote es de 6 y el número de rondas de entrenamiento (epoch) es de 500.

3.3 análisis de resultados

3.3.1 experimentos de ablación

Para explorar la efectividad de los módulos y componentes propuestos en flgf - unet, este artículo realiza una amplia gama de experimentos en el conjunto de datos massachusetts. En los primeros cuatro grupos de experimentos de ablación de flgf - unet, la selección del número de canales se basó en C = 16, mientras que el quinto grupo de experimentos de ablación se utilizó para verificar el impacto de la selección de canales. En la siguiente sección se proporcionará un análisis detallado.
(1) validez del módulo. Para explorar la efectividad de los módulos propuestos en flgf - unet, este artículo realiza amplios experimentos en el conjunto de datos arquitectónicos massachusetts, verificando sucesivamente los efectos del módulo de atención residual (ra), el módulo de fusión lineal (lf) y el módulo de fusión interactiva (if), comoTable 1Se muestra. Los experimentos muestran que cuando se añade el módulo LF a la red, el rendimiento de la red se mejora, lo que indica que el módulo LF puede manejar eficazmente las características profundas de la red. Bajo la acción del módulo de fusión interactiva, las características de bajo nivel pueden guiar el espacio de aprendizaje de características de alto nivel y las relaciones semánticas canal por canal, mejorando así significativamente la precisión de extracción. La incorporación de módulos LF o if por sí sola puede mejorar el rendimiento de flgf - unet, mientras que cuando se combinan los módulos LF e if, el efecto de División se mejora aún más para verificar la complementariedad estructural de los módulos LF e if.

Table 1 Module validity

RALFIFIoUF1PR
71.1283.1284.0282.24
71.5983.4584.5982.35
71.7583.5582.9684.16
73.2784.5784.9884.17
Fig. 6Muestra los resultados de visualización de edificios de teledetección en diferentes redes en el conjunto de datos massachusetts. El módulo ra constituye la red de referencia del flgf - unet. Cuando hay más interferencia acústica en el fondo, la red utiliza la excelente capacidad de supresión de ruido del módulo LF para evitar eficazmente la detección errónea. Flgf - unet primero mejora las características del objetivo a través del módulo LF para evitar la pérdida del objetivo; A continuación, se refina a través del módulo if para detectar eficazmente edificios de teledetección muy pequeños, lo que hace que los resultados de la segmentación sean más precisos. Cuando solo se utilizan módulos LF o if, debido a la extracción e integración insuficientes de características, hay agujeros y falsos y omisiones en los resultados de la extracción del edificio. Cuando se añaden los módulos LF e if al mismo tiempo, los resultados de la segmentación muestran que las imágenes extraídas del edificio son más etiquetadas, lo que reduce en gran medida los problemas anteriores.
figure

Fig. 6 Visualization of different networks on the Massachusetts dataset

(2) validez del módulo LF. Los resultados del estudio de ablación del módulo LF realizado en el conjunto de datos Massachusetts son los siguientes:Table 2Se muestra. La línea 2 indica el efecto después de eliminar ga en el módulo lf, cuando el módulo LF solo conserva la capacidad de extracción de características locales; La línea 3 es el resultado de mantener solo la capacidad de extracción de características globales. En comparación con la línea de base, el rendimiento de ambas variantes ha mejorado, pero no ha alcanzado el rendimiento del módulo LF completo. La línea 4 muestra una mejora significativa en el rendimiento de la red después del uso del módulo LF completo, lo que indica que estos dos módulos semilla juegan un papel único en el módulo LF y mejoran conjuntamente el rendimiento general de la red.

Table 2 LF module effectiveness

方法IoUF1PrecisionRecall
baseline71.1283.1284.0282.24
MSF71.3983.3084.3682.27
GA71.2283.1984.2281.18
MSF+GA71.5983.4584.5982.35
(3) validez del codificador. comoTable 3Se muestra que después de reemplazar el módulo ra en la primera capa del codificador por el módulo lf, el rendimiento de la red disminuyó significativamente. Debido a la falta de información semántica clara y el bajo ruido de las imágenes de teledetección, el módulo LF se comprime por dimensiones al calcular la matriz de atención. Cuando se utilizan directamente complejas imágenes de teledetección originales como entrada, el módulo LF es vulnerable a la interferencia al calcular la matriz de atención, transmitiendo así información global errónea. Por lo tanto, en primer lugar, se utiliza el módulo de atención residual para extraer las características preliminares de la imagen de teledetección, eliminando parte del ruido de fondo y haciendo que el mapa de características importado al módulo LF interfiera menos. Los experimentos han demostrado que el módulo LF tiene un mejor efecto en el procesamiento de mapas característicos que el procesamiento directo de imágenes de edificios originales.

Table 3 Encoder validity

RAIoUF1PR
N71.2983.2484.0482.45
Y71.5883.4484.3782.52
(4) selección de aprendizaje de supervisión. Debido a que el efecto del Aprendizaje supervisado de una sola rama (solo para calcular la pérdida de salida al final de la red) es significativamente limitado, la razón fundamental es la atenuación insuficiente de la información y la optimización del gradiente en el proceso de transmisión de características profundas. La selección de la estrategia de aprendizaje de supervisión de muestreo superior en la tarea de segmentación de edificios de teledetección se debe principalmente a la pérdida de información semántica durante el proceso de muestreo inferior: las operaciones tradicionales de muestreo inferior filtrarán detalles de alta frecuencia debido a la reducción de la resolución, lo que hará que el mapa de características no se pueda alinear con la etiqueta original en el cálculo de la pérdida. Para resolver este problema, este trabajo utiliza el método de muestreo ascendente gt, a través de la inserción bilinear, para alinear y supervisar la etiqueta con el mapa de características de la capa intermedia a nivel de píxeles, reduciendo la pérdida media en 00147, y construye un mecanismo de supervisión profunda multiescala para inyectar señales de supervisión en diferentes etapas de muestreo superior del decodificador, restringiendo detalles de textura poco profundos) para garantizar la semántica global en profundidad. los datos experimentales muestran que la estrategia coordina efectivamente la expresión semántica multiescala y alivia los problemas comunes de similitud entre clases y sensibilidad a escala en las imágenes de teleobservación.
figure

Fig. 7 Supervised learning method

(5) selección de canales de red. comoTable 5Se muestra que la red se divide en C en función de las diferentes dimensiones de entrada i>T(C=16)、S(C=32)、B(C=64) Y l ( C = 128). Y se realizaron experimentos de ablación del número de canales en el conjunto de datos massachusetts. Estudiar el impacto de las diferentes dimensiones de entrada C en el rendimiento de la red, y finalmente seleccionar el número de canales C i > 64 como la mejor configuración.
Cuando C se establece en 16, 32 y 64, respectivamente, el rendimiento de la red mejora gradualmente. Sin embargo, este artículo encontró que cuando C se estableció en 128, el rendimiento disminuyó ligeramente.
Debido a que las imágenes de teledetección no tienen información semántica clara, cuando la dimensión de entrada es demasiado grande, afectará la desviación de inducción de la red, lo que hará que la red no pueda extraer eficazmente las características del objetivo. El rendimiento disminuyó ligeramente.

Table 4 Selection of supervised learning

Deep supervisionIoUF1PR
单分支监督72.9284.3484.6684.02
上采样监督73.2784.5784.9884.17
下采样监督73.1284.4784.8284.13

Table 5 Network channel selection

ChannelIoUF1PrecisionRecall
1673.2784.5784.9884.17
3274.7485.5485.8885.19
6475.4786.0286.4785.58
12873.8184.9385.8784.02

3.3.2 experimentos comparativos

Para verificar la efectividad de la red de este artículo, este artículo la compara con redes típicas y redes avanzadas en el conjunto de datos del edificio. Los resultados específicos de la comparación son los siguientes: u2net..Qin等,2020), Swin-Transformer(Liu等,2021), MANet(Li等,2022), HD-Net(Li等,2024b) y RS - mamba..Zhao等,2024), flgf - unet logra una mayor precisión en tres conjuntos de datos. U2net: extracción de características multiescala a través de estructuras en forma de u anidadas en dos etapas y módulos rsu, excelente rendimiento, adecuado para la extracción de bordes y detalles de edificios. Se utiliza para verificar las mejoras de flgf - unet en la extracción de características multiescala y la retención de detalles. Swin - transformer: captura de características globales utilizando mecanismos de autoatención, adecuados para escenas complejas y extracción de objetos a gran escala. Se utiliza para verificar la capacidad de flgf - unet para integrar información global y detalles locales. Manet: el mecanismo de atención múltiple se utiliza para mejorar la Dependencia del contexto, que es adecuado para la fusión de características multiescala y la extracción de precisión del edificio. Se utiliza para mostrar las mejoras de flgf - unet en la supresión de ruido y la mejora de detalles. HD - net: a través de la interacción multiescala de características de alta resolución, se resuelve el problema del acoplamiento de características generales y fronterizas y se mejora el rendimiento de extracción del edificio. Se utiliza para verificar las ventajas de flgf - unet en la interacción de características multiescala y el modelado global. RS - mamba: diseñado especialmente para la predicción intensiva de imágenes de teleobservación a gran escala, tiene un excelente rendimiento en el procesamiento de escenas complejas e imágenes de alta resolución. Se utiliza para evaluar la capacidad de extracción de flgf - unet en el procesamiento de imágenes de teleobservación a gran escala y escenas ricas en detalles.
(1) análisis del conjunto de datos del edificio massachusetts. Análisis cuantitativo:Table 6Enumera los resultados de la evaluación cuantitativa general de las diferentes redes en el conjunto de datos massachusetts. En comparación con otras redes sota, flgf - unet logra el mejor rendimiento. Las mayores diferencias entre las características de caracterización de edificios y no edificios conducen a una mayor distinción entre ellos. En concreto, en comparación con la red sota RS - mamba, la mejora en los indicadores de iot, f1, precisión y convocatoria fue del 0,49%, 0,32%, 0,13% y 0,48%, respectivamente, y el flgf - unet obtuvo una clara ventaja sobre otras redes, lo que demuestra que el método propuesto es más eficaz. Por el contrario, el flgf - unet propuesto extrae correctamente más edificios y, al mismo tiempo, obtiene menos predicciones erróneas. Esto se debe principalmente a los siguientes dos aspectos. Por un lado, la introducción de un módulo de fusión eficaz que aproveche las ventajas del módulo flgf - unet puede impulsar el aprendizaje en línea de más características. Por otro lado, la estrategia de fusión entre pisos ayudará a caracterizar mejor los edificios de diferentes escalas.

Table 6 Quantitative analysis of different networks on the Massachusetts dataset

NetworkIoUF1PrecisionRecall
U2Net74.7885.5786.2184.94
Swin-T74.6585.4885.9785.01
MANet73.6684.8384.9984.68
HD-Net74.8185.5986.1185.07
RS-Mamba74.9885.7086.3485.10
FLGF-UNet75.4786.0286.4785.58
Análisis visual: para comparar más intuitivamente el rendimiento de flgf - unet con otras redes sota, se visualizan los resultados extraídos de todas las redes, comoFig. 8Se muestra.Fig. 8Muestra los resultados cualitativos de flgf - unet y otras redes en el conjunto de datos del edificio massachusetts. Debido a la baja resolución de la imagen del conjunto de datos y la densa distribución de edificios, flgf - unet tiene un mejor rendimiento en el efecto de extracción. Por el contrario, u2net, swin - t, HD - Net y RS - Mamba presentan un claro fenómeno de vacío, mientras que flgf - unet evita este problema en gran medida gracias a una fusión de características más completa. Además, la extracción de u2net, swin - t, manet, HD - Net y RS - Mamba no fue ideal para hacer frente a la interferencia de objetos similares en edificios, mientras que el rendimiento de flgf - unet fue mejor. Esto se debe a su ventaja de integrar información local y global, lo que permite a flgf - unet distinguir con mayor precisión entre el edificio y los objetos de interferencia circundantes.
figure

Fig. 8 Visual analysis of different networks on the Massachusetts dataset

(2) análisis del conjunto de datos de construcción de la wha. Análisis cuantitativo:Table 7Se muestran los resultados de la evaluación cuantitativa general de diferentes redes en el conjunto de datos de construcción de la wha. En comparación con otras redes sota como RS - mamba, flgf - unet mostró el mejor rendimiento en varios indicadores. En concreto, el flgf - unet mejoró un 0,56%, un 0,31%, un 0,48% y un 0,13%, respectivamente, en los indicadores de iot, f1, precisión y convocatoria. Estas mejoras significativas muestran que flgf - unet mejora significativamente el efecto de extracción del edificio y verifica la superioridad de la red.
Análisis visual: en el conjunto de datos de construcción de la wha,Fig. 9Muestra seis conjuntos de ejemplos de visualización de todas las redes de comparación con las redes de este artículo. Cuando el edificio está bloqueado por árboles o perturbado por objetos similares, los resultados de extracción de cada red tienen ciertos errores, y la mayoría de las redes de comparación no pueden extraer completamente el contorno del edificio. Por el contrario, los resultados de extracción de flgf - unet están muy cerca de la etiqueta, lo que demuestra su capacidad para extraer edificios con precisión en entornos complejos. Frente a la oclusión del edificio, u2net, swin - t, manet, HD - Net y RS - Mamba no obtuvieron buenos resultados de extracción y no aprovecharon al máximo la información de contexto global. En concreto, el edificio de la sexta línea está bloqueado por árboles e perturbado por objetos similares, en comparación con flgf - unet, que puede extraer el edificio completo. Flgf - unet puede responder de manera más eficaz a tales escenarios complejos, mostrando las ventajas de aprovechar la información global.

Table 7 Quantitative analysis of different networks on the WHU dataset

NetworkIoUF1PrecisionRecall
U2Net90.4694.9995.1394.85
Swin-T90.0794.7895.1694.79
MANet89.5494.4893.9295.05
HD-Net90.4394.9795.1694.79
RS-Mamba90.7795.1694.7895.55
FLGF-UNet91.3395.4795.2695.68
figure

Fig.9 Visual analysis of different networks on the WHU dataset

(3) análisis del conjunto de datos de ejemplos de edificios urbanos típicos de china. Análisis cuantitativo:Table 8Muestra que en el conjunto de datos de ejemplo de edificios urbanos típicos de china, flgf - unet ha mejorado el 0,7%, el 0,45%, el 0,31% y el 0,59%, respectivamente, en comparación con las redes sota existentes como RS - mamba, y cuatro indicadores están a la vanguardia, verificando su capacidad de extracción precisa de edificios a través de la estrategia de fusión de Características globales y locales, demostrando aún más las ventajas de rendimiento del método.

Table 8 Quantitative analysis of different networks in typical urban building instance datasets in China

NetworkIoUF1PrecisionRecall
U2Net76.0786.4186.0286.80
Swin-T76.0186.3785.9586.68
MANet74.8885.6385.5185.75
HD-Net75.6986.1785.9586.35
RS-Mamba76.2386.5186.1186.92
FLGF-UNet76.9386.9686.4287.51
Análisis visual: en el conjunto de datos de ejemplos de edificios urbanos típicos de china,Fig. 10Se dan los resultados de comparación visual en este conjunto de datos. Los métodos existentes (como u2net, RS - mamba, etc.) tienen una detección errónea de la extracción de contornos arquitectónicos en áreas de oclusión de árboles. los casos de la primera línea muestran claramente la situación en la que los bordes de los edificios están bloqueados por árboles. los árboles cubren claramente algunos contornos de los edificios. los casos de las líneas 2 y 3 se centran en la interferencia de los edificios con diferentes elementos como plazas, contenedores y automóviles, lo que tiene un cierto impacto en la identificación precisa de los edificios. con la Asociación semántica global y el mecanismo de mejora de detalles locales, flgf - unet frena significativamente la interferencia y restaura los límites arquitectónicos completos. sus resultados de predicción coinciden muy bien con la etiqueta de autenticidad, lo que confirma el papel clave del modelado de contexto global en escenarios de oclusión complejos.
figure

Fig. 10 Visualization analysis of different networks in typical urban building instance datasets in China

(4) análisis de extracción de edificios en escenarios de interferencia entre la oclusión de árboles y objetos similares. Para evaluar la robustez del modelo en entornos complejos, este estudio seleccionó un conjunto de escenarios típicos de la WHA (interferencia geomorfológica), Massachusetts (oclusión vegetal) y el conjunto de datos de ciudades típicas chinas (interferencia de edificios adyacentes) para el análisis comparativo. Los experimentos muestran queFig. 11Se muestra que RS - Mamba tiene limitaciones significativas en varios escenarios de interferencia: cuando los altibajos geomorfológicos causan que el contorno del edificio sea inexistente, los resultados de su extracción son incompletos; En la imagen, el fenómeno de la detección de fugas en el área de oclusión de árboles es prominente; Las estructuras de techos similares en las zonas urbanas de alta densidad provocan inspecciones erróneas. Por el contrario, flgf - unet supera eficazmente los desafíos anteriores a través del mecanismo de modelado colaborativo global - local.
figure

Fig. 11 Visual comparison of building extraction under tree occlusion and similar object interference scenes

(5) análisis de la complejidad de la red.Table 10Muestra la comparación de flgf - unet con otras redes en los indicadores de parámetros (parámetros), flops, IOU y F1 en el conjunto de datos de la wha. Aunque la precisión de flgf - unet es superior a la de u2net (2020), swin - T (2021), Manet (2021), HD - Net (2024) y RS - Mamba (2024), su cantidad de parámetros y puntos flotantes son más altos. Este fenómeno se atribuye a su diseño de módulo central: el módulo de fusión lineal (lf) introduce cargas computacionales adicionales a través del módulo de extracción de características multiescala (msf) y el módulo de atención global (ga), aunque mejora la capacidad de caracterización de estructuras arquitectónicas complejas. Los experimentos han demostrado que la compensación entre precisión y complejidad entre flgf - unet verifica la necesidad de modelar el contexto global, pero también señala la dirección para la investigación posterior: optimizar la eficiencia del modelo manteniendo una alta precisión mediante la introducción de estrategias ligeras como la convolución dinámica y la poda de canales para satisfacer las necesidades reales de despliegue de Equipos de computación de borde de teleobservación.

Table 10 Analysis of different network complexities in the WHU dataset

ModelFLOPs/GParameters/MIoU/%F1%
U2Net37.844.090.4694.99
Swin-T66.866.090.0794.78
MANet13.535.989.5494.48
HD-Net50.314.790.4394.97
RS-Mamba94.227.990.7795.16
FLGF-UNet105.954.491.3395.47

4 Conclusiones

Este artículo propone una nueva red de segmentación semántica de imágenes de teleobservación flgf - unet. Al aplicar el módulo de atención residual a los codificadores y decodificadores, se evita efectivamente la desaparición del gradiente y se utiliza el módulo de atención para lograr una extracción eficiente de características; Al mismo tiempo, el módulo LF puede capturar tanto la información de fondo global como los detalles espaciales locales. El módulo LF realiza la extracción de características locales y globales a través del módulo MSF y el módulo ga, mejorando así las características de los edificios de teleobservación y suprimiendo el ruido. Además, para compensar la brecha semántica entre el codificador y el decodificador, se diseña el módulo de fusión interactiva if para codificar las características semánticas entre las representaciones de bajo y Alto nivel, mejorando aún más el contraste de la información contextual.
Para verificar la efectividad y versatilidad de flgf - unet, este artículo realiza experimentos en tres conjuntos de datos públicos: el conjunto de datos de construcción de la wha, el conjunto de datos de construcción de Massachusetts y el conjunto de datos de ejemplo de edificios urbanos típicos de china. Los resultados experimentales muestran que flgf - unet después del entrenamiento puede distinguir con precisión el primer plano y el fondo, y muestra un alto rendimiento en indicadores como iot, f1, llamada y precisión. Además, se compara con otras redes sota; Los resultados muestran que flgf - unet es significativamente mejor que la red existente en indicadores de rendimiento. Al mismo tiempo, a través de experimentos de ablación basados en el conjunto de datos arquitectónicos massachusetts, se verifica el papel e importancia de las estructuras secundarias y módulos clave de flgf - unet. Finalmente, este artículo discute la eficiencia de flgf - unet. Cabe señalar que, aunque el análisis de este artículo muestra que el flgf - unet es efectivo en las tareas actuales, todavía hay las siguientes limitaciones: el flgf - unet solo se prueba en las tareas de segmentación semántica de edificios de teleobservación en escenarios urbanos y montañosos, y aún no se ha verificado en otras tareas como la segmentación de carreteras y la Segmentación de parcelas.

References

  1. 1.
    Azad R, Heidari M, Wu Y L and Merhof D. 2022. Contextual attention network: transformer meets U-net//Proceedings of the 13th International Workshopon Machine Learning in Medical Imaging. Singapore: Springer: 377-386
  2. 2.
    Carion N, Massa F, Synnaeve G, Usunier N, Kirillov A and Zagoruyko S. 2020. End-to-end object detection with transformers//Proceedings of the 16th European Conference on Computer Vision. Glasgow: Springer: 213-229
  3. 3.
    Chen C F R, Fan Q F and Panda R. 2021. CrossVIT: cross-attention multi-scale vision transformer for image classification//Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision. Montreal: IEEE: 347-356
  4. 4.
    Ding L, Tang H and Bruzzone L. 2021. LANet: local attention embedding to improve the semantic segmentation of remote sensing images. IEEE Transactions on Geoscience and Remote Sensing, 59(1): 426-435
  5. 5.
    Fu J, Liu J, Tian H J, Li Y, Bao Y J, Fang Z W and Lu H Q. 2019. Dual attention network for scene segmentation//Proceedings of the 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE: 3141-3149
  6. 6.
    He X, Zhou Y, Zhao J Q, Zhang D, Yao R and Xue Y. 2022. Swin transformer embedding UNet for remote sensing image semantic segmentation. IEEE Transactions on Geoscience and Remote Sensing, 60: 4408715
  7. 7.
    Ji S P, Wei S Q and Lu M. 2019. Fully convolutional networks for multisource building extraction from an open aerial and satellite imagery data set. IEEE Transactions on Geoscience and Remote Sensing, 57(1): 574-586
  8. 8.
    Li G, Zhao S L, Li M, Zhou M L and Ying Z B. 2024a. IDP-Net: industrial defect perception network based on cross-layer semantic information guidance and context concentration enhancement. Engineering Applications of Artificial Intelligence, 130: 107677
  9. 9.
    Li R, Zheng S Y, Zhang C, Duan C X, Su J L, Wang L B and Atkinson P M. 2022. Multiattention network for semantic segmentation of fine-resolution remote sensing images. IEEE Transactions on Geoscience and Remote Sensing, 60: 5607713
  10. 10.
    Li Y X, Hong D F, Li C Y, Yao J and Chanussot J. 2024b. HD-Net: high-resolution decoupled network for building footprint extraction via deeply supervised body and boundary decomposition. ISPRS Journal of Photogrammetry and Remote Sensing, 209: 51-65
  11. 11.
    Liu Z, Lin Y T, Cao Y, Hu H, Wei Y X, Zhang Z, Lin S and Guo B N. 2021. Swin transformer: hierarchical vision transformer using shifted windows//Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision. Montreal: IEEE: 9992-10002
  12. 12.
    Long J, Shelhamer E and Darrell T. 2015. Fully convolutional networks for semantic segmentation//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. Boston: IEEE: 3431-3440
  13. 13.
    Mnih V. 2013. Machine Learning for Aerial Image Labeling. Toronto: University of Toronto (Canada).
  14. 14.
    Mou L C, Hua Y S and Zhu X X. 2020. Relation matters: relational context-aware fully convolutional network for semantic segmentation of high-resolution aerial images. IEEE Transactions on Geoscience and Remote Sensing, 58(11): 7557-7569
  15. 15.
    Qin X B, Zhang Z C, Huang C Y, Dehghan M, Zaiane O R and Jagersand M. 2020. U2-Net: going deeper with nested U-structure for salient object detection. Pattern Recognition, 106: 107404
  16. 16.
    Ronneberger O, Fischer P and Brox T. 2015. U-net: convolutional networks for biomedical image segmentation//Proceedings of the 18th International Conference on Medical Image Computing and Computer-Assisted Intervention-MICCAI 2015. Munich: Springer: 234-241
  17. 17.
    Song P F, Li J J, An Z Y, Fan H and Fan L W. 2023. CTMFNet: CNN and transformer multiscale fusion network of remote sensing urban scene imagery. IEEE Transactions on Geoscience and Remote Sensing, 61: 5900314
  18. 18.
    Wang L B, Fang S H, Meng X L and Li R. 2022. Building extraction with vision transformer. IEEE Transactions on Geoscience and Remote Sensing, 60: 5625711
  19. 19.
    Wang P Q, Chen P F, Yuan Y, Liu D, Huang Z H, Hou X D and Cottrell G. 2018. Understanding convolution for semantic segmentation//Proceedings of the 2018 IEEE Winter Conference on Applications of Computer Vision (WACV). Lake Tahoe: IEEE: 1451-1460
  20. 20.
    Zhang S, Jiang Y H, Wang C J, Tan M L, Du B and Tian F. 2024. S2PNet: an interactive learning framework for addressing spatial-spectral heterogeneity in H2 imagery classification. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 17: 18456-18473
  21. 21.
    Zhao H S, Shi J P, Qi X J, Wang X G and Jia J Y. 2017. Pyramid scene parsing network//Proceedings of the 2017 IEEE Conference on Computer Vision and Pattern Recognition. Honolulu: IEEE: 6230-6239
  22. 22.
    Zhao S J, Chen H, Zhang X L, Xiao P F, Bai L and Ouyang W L. 2024. RS-mamba for large remote sensing image dense prediction. IEEE Transactions on Geoscience and Remote Sensing, 62: 5633314
  23. 23.
    Wu K, Zheng D Y, Chen Y L, Zeng L Y, Zhang J H, Chai S H, Xu W J, Yang Y L, Li S W, Liu Y Y and Fang F. 2021. A dataset of building instances of typical cities in China. China Scientific Data, 6(1): 187-195

Leer el texto completo

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website