1 Introduction
L'objectif principal de l'extraction de bâtiments est de distinguer la forme d'un bâtiment à partir d'images de télédétection à haute résolution. Au cours des dernières décennies, des progrès remarquables ont été réalisés dans ce domaine, largement utilisé dans des domaines tels que la planification urbaine, la surveillance de la dynamique urbaine et la surveillance des catastrophes. Les premières recherches s'appuyaient principalement sur les caractéristiques architecturales marquées à la main (telles que la forme, les bords et les ombres) pour la classification secondaire, généralement considérées comme de bas niveau et fortement dépendantes des connaissances préalables. Pour apprendre de manière adaptative les caractéristiques de haut niveau à partir de grandes quantités de données (Wang等,2022), la technologie d'apprentissage en profondeur a été introduite dans l'extraction de bâtiments ces dernières années avec de bons résultats et est devenue un point chaud de la recherche.
Dans une approche d'apprentissage en profondeur, le réseau de neurones convolutifs CNN (Convolutional Neural Network) est largement utilisé pour diverses tâches de vision par ordinateur en tant que puissant réseau d'apprentissage caractéristique.Long等(2015)Basé sur CNN, le fully Convolutional Network (FCN) a l'avantage d'être capable d'accepter des images d'entrée de toute taille et de générer efficacement des sorties de taille correspondante. Par exemple,Ronneberger等(2015)Il est proposé un réseau U - net qui utilise un décodeur pour apprendre la corrélation spatiale des caractéristiques des images en phase de codage, améliorant ainsi considérablement les performances de segmentation. En outre,Qin等(2020)Concevoir u2net avec une structure en U imbriquée à deux niveaux, dans laquelle les blocs en U résiduels (rsu) sont capables d'extraire des champs sensoriels à différentes échelles, capturant ainsi plus d'informations contextuelles. Pour remédier à la Sous - utilisation des caractéristiques et à la fusion inadéquate des informations Multi - échelles,Li等(2022)Proposer un réseau Multi - attention (Manet) qui extrait les dépendances contextuelles à travers plusieurs modules d'attention efficaces.Li等(2024b)En outre, le réseau découplé haute résolution HD - net est proposé, en utilisant ses informations Multi - échelles pour interagir en parallèle, ce qui atténue considérablement les problèmes de couplage entre l'ensemble et les caractéristiques des frontières. Bien que le réseau CNN donne de bons résultats sur l'extraction des bâtiments, CNN n'est pas en mesure de tirer pleinement parti de l'information globale en raison des limitations de la conception du décodeur (Song等,2023). En outre, la segmentation sémantique des images de télédétection peut être effectuée efficacement en utilisant des informations contextuelles globales et des caractéristiques spatiales détaillées en raison de la présence d'un fond complexe et d'une grande quantité de bruit dans les images (Ding等,2021). Cependant, les réseaux CNN traditionnels sont encore insuffisants dans la segmentation sémantique des images de télédétection et doivent être améliorés davantage.
Pour remédier à cette limitation des réseaux CNN traditionnels, des mécanismes d'attention et des stratégies de fusion de caractéristiques Multi - échelles telles que le module de Pooling pyramidal sont utilisés (Zhao等,2017), stratégie de fusion de caractéristiques Multi - niveaux (Wang等,2018), module d'attention canalisée et d'attention positionnelle (Fu等,2019), module d'attention croisée (Chen等,2021). Cependant, les informations globales capturées par de telles méthodes ne sont pas capturées directement par codage à partir de la modélisation globale (He等,2022), mais constituées de caractéristiques locales capturées par le réseau CNN existant; Il est donc possible que les informations globales ne soient pas encore capturées (Mou等,2020). Transformer est capable de capturer des relations d'information globales dans le domaine du traitement du langage naturel (PNL), offrant une solution viable pour la segmentation sémantique. Par exemple,Carion等(2020)Conception d'une structure de transformation à deux branches dominée par la relation entre la cible de modélisation et l'arrière - plan global de l'image. En outre,Liu等(2021)Construisez swin transformer pour démontrer un énorme potentiel dans la classification des images et les tâches de prédiction intensives. Il est important de noter que, bien que transformer puisse capturer efficacement les dépendances à longue distance des caractéristiques globales, les informations sur les caractéristiques locales sont souvent ignorées. Pour segmenter efficacement les images de télédétection à l'aide de caractéristiques locales et globales, il est essentiel de concevoir un réseau combinant transformer et CNN pour capturer efficacement à la fois des informations globales et des détails spatiaux fins.Azad等,2022).Li等(2024a)Il est proposé un réseau léger d'extraction de caractéristiques globales locales, LLG - net (Lightweight local global Feature Extraction Network), dans lequel une combinaison efficace de blocs d'auto - attention et de blocs convolutifs garantit une convergence progressive des caractéristiques globales et locales à plusieurs niveaux.Zhang等(2024)Proposer un réseau de purification spatiale spectrale pour améliorer la précision de la classification, utiliser un module d'interconductivité global - local pour permettre l'interaction des caractéristiques au niveau de l'image - pixel, améliorer l'indexation de la zone spatiale des caractéristiques extraites et réduire l'hétérogénéité spatiale. La plupart des méthodes décrites ci - dessus utilisent la branche CNN pour extraire les caractéristiques locales et la branche transformer pour extraire les caractéristiques globales, puis fusionner du côté du décodeur, ce qui conduit souvent à une redondance sémantique dans la fusion de caractéristiques Multi - échelles et à une fusion insuffisante. Dans la dernière étude,Zhao等(2024)Une méthode de prévision intensive d'images de télédétection à grande échelle et à haute résolution basée sur la télédétection Mamba (RSM) a été spécialement conçue pour capturer le contexte global des images de télédétection de complexité linéaire, facilitant ainsi le traitement efficace des images de télédétection à grande échelle.
Compte tenu des limites de l'intégration adéquate des informations globales et locales, et afin de résoudre le problème de l'extraction incomplète résultant de la détection incomplète d'images de bâtiments par télédétection, d'inspections erronées, d'occultations par des arbres ou d'interférences avec des objets similaires, il a été proposé un réseau de caractérisation local - global fusionné, flgf - unet (Fusion of Local global features Network), qui intègre directement les informations locales et globales et acquiert les caractéristiques en parallèle grâce à une modélisation Multi - échelle et globale, de sorte que les représentations des caractéristiques à chaque étape du réseau disposent d'informations locales et globales, permettant une intégration plus naturelle et adéquate Des informations à différentes échelles et niveaux lors de l'extraction des caractéristiques.
L'extrémité encodeur du réseau flgf - unet utilise le module d'attention résiduelle RA (Residual attention) comme couche initiale pour extraire efficacement les caractéristiques superficielles et propose le module LF (Linear Fusion) comme colonne vertébrale pour capturer les détails spatiaux et les informations contextuelles globales. Le module LF contient des modules MSF (Multi - scale fusion) et GM (Global attention Modeling) pour extraire des informations locales et des informations contextuelles globales à différentes échelles, assurant l'intégrité des dépendances des caractéristiques et comblant ainsi les lacunes d'un seul module dans l'extraction des caractéristiques. L'extrémité du décodeur utilise également un module d'attention résiduelle pour fusionner plusieurs couches d'informations caractéristiques, améliorant ainsi la précision de l'extraction du bâtiment. En outre, le module interactive Fusion (IF) a été introduit entre les codecs pour combler le fossé sémantique et améliorer l'effet de fusion des détails spatiaux, du contexte global et des caractéristiques sémantiques. L'expérience a vérifié l'efficacité et l'universalité du flgf - unet sur le whu, l'ensemble de données de Massachusetts et l'ensemble de données d'exemples de bâtiments urbains typiques chinois.
2 fusion locale - réseau de caractéristiques globales
Les matériaux de toit des bâtiments sont variés et similaires à ceux des routes, des places, de la terre nue et d'autres matériaux. Par conséquent, sur les images de télédétection à haute résolution, les bâtiments et les routes, les places, la terre nue et d'autres objets sont facilement confondus spectralement. Mais la végétation, les ombres, les plans d'eau diffèrent beaucoup des caractéristiques spectrales des bâtiments. Les bâtiments sont relativement proches de la moyenne des routes, des places, de la terre nue. La variance du bâtiment est plus proche de celle de la route. Les bâtiments sont plus proches des contrastes de la route. En résumé, les bâtiments avec les routes, les places, la terre nue apparaissent dans une partie des caractéristiques texturées, avec une grande différence de texture avec les ombres, la végétation, les plans d'eau.
Étant donné que les bâtiments présentent des différences géométriques significatives à plusieurs échelles (par exemple, ainsi que des étendues de distribution dimensionnelle) et que leurs limites architecturales claires sont vulnérables aux perturbations environnementales complexes (par exemple, l ` occultation de la végétation ou l ` adhérence architecturale du quartier), cela impose une double exigence pour le modèle de segmentation: d ` une part, la capture des caractéristiques de contour au niveau du pixel par un mécanisme de perception des bords raffiné, et d ` autre part, la mise en place d ` un mécanisme d ` interaction de caractéristiques à plusieurs niveaux pour gérer les changements drastiques à l ` échelle cible. Flgf - unet conçoit de manière innovante des architectures de fusion bimodale linéaire - interactive pour de telles caractéristiques: les couches de fusion linéaire permettent un alignement progressif des caractéristiques à travers l'échelle grâce à des stratégies de pondération paramétrique des canaux pouvant être apprises, ce qui atténue efficacement les problèmes de désadaptation des caractéristiques causés par les sauts d'échelle des objectifs architecturaux; Le module de fusion interactive comble le fossé sémantique du processus de codage - décodage en établissant un mécanisme d'interaction attentionnelle bidimensionnelle espace - canal qui maintient la cohérence structurelle globale tout en améliorant la sensibilité aux détails locaux.
Flgf - unet architecture générale voirFig. 1Montré. L'encodeur est composé de 1 module ra et 4 modules LF et le décodeur est composé de 4 modules ra. Le module LF est composé de 3Composition de la couche Convolutive, du module MSF et du module ga. Flgf - unet utilise des modules if au lieu de connexions sautantes entre codeurs et décodeurs, permettant une fusion Multi - échelle entre les couches. Lorsque le diagramme caractéristique entre dans le module if, utilisez- Oui.L'image est d'abord suréchantillonnée de manière bi - linéaire, puis les canaux du diagramme caractéristique à basse résolution sont compressés pour supprimer les informations redondantes. Il est ensuite envoyé au module if pour décoder davantage les informations contextuelles, le module if réalisant une connexion transparente entre les codecs. Le degré de différence entre la sortie prédite du réseau et l'étiquette (GT) détermine la valeur de la perte. Cet article utilise la fonction sigmoid Iou Loss Loss pour le calcul. L'ajout d'une fonction de perte à ses 5 branches par flgf - unet peut superviser l'entraînement en réseau, en allant plus loin à partir de la représentation des caractéristiques du Graphe de caractéristiques agrégées. Lorsque la sortie de prédiction du réseau ne coïncide pas avec la taille de forme de GT, en tenant compte du cas où une perte sémantique se produirait après le Sous - échantillonnage de la sortie du réseau, la sortie de prédiction est suréchantillonnée de sorte que sa taille de forme soit la même que GT, puis la perte est calculée à l'aide de la fonction de perte. La branche de réseau suréchantillonnée peut lisser son bruit, la sortie du réseau est similaire à GT et la branche du diagramme caractéristique peut mieux superviser l'apprentissage.
2.1 Module d'attention résiduelle
Pour faire face à des problèmes tels que la disparition des gradients, l'extraction inadéquate des caractéristiques et l'allocation insuffisante des paramètres résultant de l'augmentation du nombre de couches du réseau, cet article propose un module d'attention résiduelle RA (Residual attention Module). Les principaux composants de ce module comprennent une structure de convolution résiduelle et un module d'attention tel queFig. 2Montré. Le traitement du module attention est effectué dans l'ordre suivant. Mapping des caractéristiquesComme entrée pour l'attention du canal, générant à son tour un diagramme d'attention 1 - DEt multiplie élément par élément avec x < / I > pour créer la caractéristique d'attention du canal x '< / I > . L'expression de l'attention du canal est la suivante:
La sortie de l'étape précédente x '< / I > est utilisée comme entrée pour l'attention spatiale, puis un diagramme d'attention spatiale bidimensionnel est généré.La multiplication élément par élément avec x '< / I > donne la caractéristique d'attention spatiale x < / I > "< / I >. Où σ < / I > représente la fonction sigmoid < / I > qui représente la multiplication élément par élément. L'expression de l'attention spatiale est la suivante:
2.2 module de fusion linéaire
La limitation des réseaux de neurones convolutifs traditionnels CNN (Convolutional Neural Network) dans le traitement des images de télédétection réside dans leur manque de capacité de modélisation globale, ne permettant que l'extraction de caractéristiques de zones locales de l'image, ce qui les rend vulnérables aux interférences sonores dans des contextes complexes. De plus, en raison de multiples opérations de sous - échantillonnage, les caractéristiques des bâtiments de télédétection dans les couches profondes du réseau peuvent être progressivement perdues, ce qui affecte la précision et l'intégrité de l'extraction des bâtiments. L'introduction de transformer ouvre de nouvelles possibilités d'extraction de bâtiments dans des images de télédétection, avec des mécanismes d'auto - Attention dotés de puissantes capacités de modélisation globale qui peuvent capturer efficacement les dépendances entre les caractéristiques distantes. Cependant, les bâtiments de télédétection ont des caractéristiques de frontières complexes, de formes variées et sont clairement perturbés par le contexte, et le simple recours à des caractéristiques globales est souvent insuffisant pour extraire les bâtiments avec précision. L'extraction des caractéristiques locales reste donc une partie indispensable du processus d'extraction des bâtiments de télédétection. Pour surmonter les limitations ci - dessus, un module de fusion linéaire peut être conçu voirFig. 3Il est montré qu'il existe à la fois des capacités de modélisation des caractéristiques globales et une représentation détaillée des caractéristiques locales pour améliorer la précision d'extraction et la robustesse des bâtiments dans les images de télédétection. Le module LF est composé de 3La couche Convolutive (capture de la sémantique contextuelle à l'intérieur d'un grand voisinage), le module MSF (Multi - scale fusion) de fusion Multi - échelle (qui peut supprimer les interférences d'information provenant de zones indépendantes, en insistant sélectivement sur les caractéristiques Multi - échelle) et le module ga (Global attention Modeling) d'attention globale (qui améliore l'information globale dans le diagramme de caractéristiques obtenu) sont composés. Le module de modélisation globale est responsable du calcul des matrices d'attention qui, en combinaison avec les opérations de remise en forme des caractéristiques et de convolution point par point, permettent une fusion plus efficace des caractéristiques globales et locales, en préservant les détails spatiaux. Donner une caractéristique d'entrée, respectivement parObtenu après convolutionet. Et puis ouietFaire un lifting, obteniret, puis le calcul et la mise en forme de q < / I > et K < / I > par l'intermédiaire de la couche de connexion complète donnentet. obtenez l'attention en multipliant matriciellement sur q < / I > et K < / I > . Enfin, faites attentionConvolution et softmax < / I > opérations pour obtenir l'attention de sortie. dontReprésente une Convolution point par point,Représente la couche de connexion complète. Le module permet d'apprendre et d'optimiser plus directement le poids de l'attention sur la position de la cible dans le diagramme caractéristique, en s'adaptant à la distribution spatiale complexe des objets dans les images de télédétection. En revanche, le transformateur peut perdre des informations spatiales locales lors de l'échange d'informations sur des blocs d'images, notamment en raison d'un manque de perception des détails au sein d'un seul bloc. La matrice d'attention est constamment optimisée pour apprendre à percevoir efficacement la position de la cible dans le diagramme caractéristique.
La valeur dans le module LF ( v < / I >) passe par 3Les couches convolutives et les modules de fusion Multi - échelles effectuent des calculs. Empiler 3Équivalent à unSensorial Wild, peut efficacement extraire des caractéristiques locales plus riches. CommeFig. 4Montré, le module MSF est capable d'acquérir des informations caractéristiques à différentes échelles, ce qui rend l'extraction des caractéristiques plus nuancée et précise. Les couches de convolution se complètent avec les modules MSF et se compensent mutuellement pour en extraire des caractéristiques plus fines. Cette conception structurelle améliore encore la capacité expressive des caractéristiques, contribuant à une meilleure réponse aux formes complexes des bâtiments et aux perturbations de fond.
Caractéristiques d'entrée données, calculé par les modules volume intégral et MSF séparémentet, puis seraetAdditionner pour obtenir. Enfin, effectuez une multiplication matricielle par attraction et v < / I > pour obtenir la sortie- Oui.
Dans la formule,ReprésentationGroupe de couches convolutives,Représente le module MSF. Enfin, les caractéristiques locales et globales extraites sont fusionnées, le module intégrant les couches de volume etCouche de convolution composée d'une couche d'alimentation avant pour calculer la sortie finale- Oui.
Dans la formule,Représente le poids qui peut être appris,ReprésentationOpérations de convolution,ReprésentationOpérations de convolution,Représente la sortie après fusion des caractéristiques. v < / I > est un diagramme caractéristique extrait par convolution et module MSF qui, faute d'informations globales, ne permet pas de supprimer complètement le bruit de fond. Cependant, combinée à la modélisation globale de l'attention, la matrice de caractéristiques obtenue par multiplication matricielle contient des informations globales permettant de guider efficacement l'extraction des caractéristiques de la cible.
Les modules LF peuvent réduire l'attention portée aux informations de fond et améliorer la concentration sur les bâtiments de télédétection, améliorant ainsi la précision de l'extraction des bâtiments. Cette combinaison préserve à la fois les détails locaux et tire pleinement parti des informations contextuelles globales, permettant au module LF d'exceller dans des scénarios de télédétection complexes.
2.3 module de fusion interactive
Pour mettre davantage en évidence les informations de caractérisation contextuelle globale, il est proposé un module de fusion interactive if (Interactive Fusion) qui remplace la couche de connexion saut dans une structure de codec traditionnelle pour conserver plus d'informations contextuelles des couches codeur et décodeur. CommeFig. 5Illustré, le module if capture les dépendances à longue portée entre pixels en apprenant les caractéristiques de détail de bas niveau par rapport aux caractéristiques sémantiques de haut niveau. En effet, le module if modélise la dépendance à longue distance entre un pixel et un objet au cours d'une fusion de caractéristiques au moyen de caractéristiques sémantiques implicites par chaque canal de sortie, qui peuvent être utilisées comme cartographie d'un objet particulier et pour lesquelles il existe une intercorrélation entre les différentes caractéristiques sémantiques. De cette manière, le module if est capable de coder des informations contextuelles globales afin d'exploiter rationnellement les interdépendances entre les diagrammes de caractéristiques, d'améliorer les capacités de représentation des caractéristiques et ainsi de capturer efficacement les relations entre les bâtiments et leur contexte environnant dans les images de télédétection. Le module de fusion interactive renforce non seulement la rétention des détails des caractéristiques locales, mais permet également une modélisation collaborative entre le fond du bâtiment et les objets du bâtiment grâce à la modélisation globale, améliorant considérablement la précision de l'extraction du bâtiment.
Premier avec adaptiveavgpool2dOn opère où c < / I > est le nombre total de canaux, h < / I >, W < / I > sont respectivement la hauteur et la largeur de la caractéristique.
Ensuite, les caractéristiques avancées sont remodelées à l'aide d'une opération d'excitation ( C → C / R, C / R → C, r = < / I > 4) (), tout en réduisant la quantité de paramètres réseau. Parmi lesquelsetSont respectivement (relu) et la normalisation par lots (Bn).etReprésente respectivement les opérations d'excitation c < / I > → C / R < / I > et C / R < / I > → c < / I >.
Enfin, la caractéristique Cross - canal est réalisée par une somme pondérée avec un poids caractéristique de bas niveau, dans laquelleReprésente la multiplication élément par élément, etReprésente une caractéristique de bas niveau dans le décodeur.
Pour améliorer la distinction entre les objectifs et le contexte, l'accent est mis davantage sur l'information spatiale. D'abord àLes opérations d'excitation (( c < / I > → C / R < / I >, r < / I > = 4) sont effectuées, puis agrégées à l'aide des opérations de Pooling moyen (pavg) et de Pooling maximal (Pmax). Parmi lesquelsC'est une opération de convolution.représentantAprès convolution- Oui.
Les caractéristiques spatiales sont réalisées par une somme pondérée avec un poids caractéristique de haut niveau, dans laquelleReprésente la multiplication élément par élément, etReprésente les caractéristiques de haut niveau dans l'encodeur.
3 expérimentation et analyse
3.1 ensembles de données
Pour vérifier la supériorité du réseau proposé, 3 ensembles de données de bâtiments de télédétection accessibles au public ont été sélectionnés pour des expériences approfondies, y compris l'ensemble de données de bâtiments whu (Ji等,2019), l'ensemble de données des bâtiments Massachusetts (Mnih,2013), et un ensemble de données d'exemples de bâtiments urbains typiques chinois (吴开顺 等,2021). Avant l'entraînement, toutes les images d'entrée sont d'abord normalisées, suivies successivement d'un retournement aléatoire, d'un flou gaussien et d'une amélioration des données. Les détails des 3 ensembles de données sont les suivants:
(1) l'ensemble de données sur les bâtiments de Massachusetts contient 151 images aériennes de la région de Boston avec une résolution spatiale de 1 m couvrant environ 340 km de scènes urbaines et suburbaines. Ces images ont toutes une taille de 1500 x 1500 pixels. L'ensemble de données officiel est divisé en un ensemble d'entraînement (137 images), un ensemble de vérification (4 images) et un ensemble de test (10 images). Pour faciliter l'entraînement du modèle, ces images ont été recadrées en petits blocs de 256 x 256 pixels adaptés à l'entrée réseau, générant 4932 images d'entraînement, 144 images de vérification et 360 images de test.
(2) l'ensemble de données whu sur les bâtiments contient 8 189 images (dont 4 736 pour la formation, 1 036 pour la validation et 2 416 pour les essais), avec une résolution spatiale de 0,3 m et une couverture de plus de 450 km 2 , contenant environ 22 000 bâtiments. Pour faciliter l'entraînement, les images ont été recadrées en petits blocs de 256 × 256 pixels adaptés à l'entrée réseau pour obtenir 18 944 images d'entraînement, 4 144 images de validation et 9 664 images de test.
(3) l'ensemble de données d'exemples de bâtiments urbains typiques de la Chine couvre plusieurs villes typiques de la Chine (y compris Beijing, Shanghai, Shenzhen et Wuhan) avec une résolution spatiale allant jusqu'à 0,29 M. les données proviennent d'images satellites accessibles au public et contiennent un total de 63 886 exemples de bâtiments finement notés couvrant une couverture géographique d'environ 120 km 2 (dont 5 985 pour la formation et 1 275 pour les tests). Chaque image a une résolution de 500×500 pixels. Pour faciliter l'entraînement, les images ont été recadrées en petits blocs de 256 x 256 pixels adaptés à l'entrée réseau pour obtenir 23 940 images d'entraînement et 5 100 images de test.
3.2 indicateurs d'évaluation
Pour une évaluation complète et exhaustive des réseaux proposés, quatre indicateurs ont été retenus: Iou, F1, précision et recall. Où TP, FP et FN dans la formule représentent respectivement un vrai positif, un faux positif et un faux négatif.
Toutes les expériences pertinentes ont été menées dans un environnement pytorch 2.01 (cuda 11.7) sur un GPU nVIDIA GeForce RTX 4070 équipé de 12 go de RAM. Pendant la phase d'entraînement, choisissez l'optimiseur SGD et utilisez une stratégie cosinus pour ajuster le taux d'apprentissage. Pour assurer l'équité et la cohérence de l'expérience, sur les ensembles de données whu et Massachusetts et sur les ensembles de données d'exemples de bâtiments urbains typiques de la Chine, les réseaux proposés sont comparés à d'autres réseaux (y compris u2net (Qin等,2020), Swin-Transformer(Liu等,2021), MANet(Li等,2022), HD-Net(Li等,2024b), RS-Mamba(Zhao等,2024)) ont tous les paramètres suivants: taux d'apprentissage initial de 0,05, taille de lot de 6 et nombre de tours d'entraînement (EPOCH) de 500.
3.3 analyse des résultats
3.3.1 expériences d'ablation
Afin d'explorer l'efficacité des modules et composants proposés dans flgf - unet, cet article a été largement expérimenté sur l'ensemble de données de Massachusetts. Dans les expériences d'ablation des 4 premiers groupes de flgf - unet, le nombre de canaux a été choisi en fonction de c < / I > = 16, et le groupe 5 a été utilisé pour vérifier l'effet de la sélection des canaux. Dans les sections suivantes, une analyse détaillée sera fournie.
(1) validité du module. Afin d'explorer l'efficacité des modules proposés dans flgf - unet, cet article a mené des expériences approfondies sur l'ensemble de données architecturales de Massachusetts, vérifiant successivement les effets du module d'attention résiduelle (RA), du module de fusion linéaire (LF) et du module de fusion interactive (IF), tels que:Table 1Montré. Des expériences ont montré que les performances du réseau sont améliorées lorsque des modules LF sont incorporés au réseau, ce qui suggère que les modules LF peuvent gérer efficacement les caractéristiques profondes du réseau. Sous l'action d'un module de fusion interactif, les caractéristiques de bas niveau sont capables de guider canal par canal les caractéristiques de haut niveau dans l'apprentissage des relations spatiales et sémantiques, améliorant ainsi considérablement la précision d'extraction. L'ajout de modules LF ou if seul améliore les performances du flgf - unet, tandis que l'utilisation combinée des modules LF et if augmente encore l'effet de segmentation, validant la complémentarité structurelle des modules LF et if.
Fig. 6Présentation des résultats visuels des bâtiments de télédétection de différents réseaux dans l'ensemble de données de Massachusetts. Le module ra constitue le réseau de base de flgf - unet. Lorsqu'il y a plus d'interférences de bruit en arrière - plan, le réseau utilise l'excellente capacité de suppression du bruit du module LF pour éviter efficacement les situations de détection incorrecte. Flgf - unet commence par une amélioration caractéristique de la cible par le module LF, empêchant la perte de la cible; Il a ensuite été affiné par le module if pour détecter efficacement de très petits bâtiments de télédétection, ce qui rend les résultats de segmentation encore plus précis. Lorsque seuls les modules LF ou if sont utilisés, des cavités apparaissent dans les résultats d'extraction du bâtiment, ainsi que des phénomènes d'inspection erronée et d'inspection manquée, car l'extraction et la fusion des caractéristiques ne sont pas suffisantes. Et lorsque les modules LF et if sont ajoutés en même temps, le résultat de la segmentation montre que l'image extraite du bâtiment est plus adaptée à l'étiquette, ce qui réduit considérablement les problèmes mentionnés ci - dessus.
(2) validité du module LF. Les résultats de l'étude d'ablation du module LF sur l'ensemble de données Massachusetts, tels queTable 2Montré. La ligne 2 représente l'effet après élimination de ga dans le module LF, auquel cas le module LF ne conserve que des capacités locales d'extraction des caractéristiques; La ligne 3 est le résultat après avoir conservé uniquement la capacité d'extraction des caractéristiques globales. Les performances des deux variantes ont été améliorées par rapport à la ligne de base, mais n'ont pas atteint les performances d'un module LF complet. La ligne 4 montre une amélioration significative de la performance du réseau après l'utilisation d'un module LF complet, montrant que ces deux sous - modules jouent chacun un rôle unique dans le module LF, travaillant ensemble pour améliorer la performance globale du réseau.
Table 2 LF module effectiveness
| 方法 | IoU | F1 | Precision | Recall |
|---|
| baseline | 71.12 | 83.12 | 84.02 | 82.24 |
| MSF | 71.39 | 83.30 | 84.36 | 82.27 |
| GA | 71.22 | 83.19 | 84.22 | 81.18 |
| MSF+GA | 71.59 | 83.45 | 84.59 | 82.35 |
(3) validité du codeur. CommeTable 3Comme on le voit, les performances du réseau diminuent considérablement après le remplacement du module ra par le module LF dans la première couche du codeur. Comme les images de télédétection manquent d'informations sémantiques claires et que les comparaisons Signal - bruit sont faibles, le module LF est compressé dimensionnellement lors du calcul de la matrice d'attention. Lorsque des images brutes complexes de télédétection sont utilisées directement en entrée, le module LF est vulnérable aux interférences lors du calcul de la matrice d'attention, délivrant ainsi des informations globales erronées. Ainsi, une extraction préalable des caractéristiques de l'image de télédétection est tout d'abord réalisée à l'aide d'un module d'attention résiduelle, éliminant une partie du fouillis de fond, de sorte que le diagramme caractéristique entrant dans le module LF est moins perturbé. Il a été démontré expérimentalement que le module LF fonctionne mieux avec le traitement des diagrammes caractéristiques que le traitement direct des images architecturales originales.
Table 3 Encoder validity
| RA | IoU | F1 | P | R |
|---|
| N | 71.29 | 83.24 | 84.04 | 82.45 |
| Y | 71.58 | 83.44 | 84.37 | 82.52 |
(4) Sélection des études supervisées. L'effet de l'apprentissage supervisé à une seule branche (perte calculée uniquement pour les sorties en fin de réseau) étant considérablement limité, la cause fondamentale réside dans l'atténuation insuffisante de l'information et l'optimisation insuffisante du gradient lors de la transmission des caractéristiques profondes. La sélection d'une stratégie d'apprentissage supervisée par suréchantillonnage dans une tâche de segmentation de bâtiments par télédétection est principalement due à un problème de perte d'informations sémantiques lors du sous - échantillonnage: les opérations de sous - échantillonnage traditionnelles filtrent les détails à haute fréquence en raison d'une résolution réduite, ce qui rend le diagramme caractéristique non aligné avec l'étiquette d'origine lors du calcul des pertes. Pour résoudre ce problème, cet article utilise la méthode de suréchantillonnage GT, la surveillance de l'alignement au niveau des pixels de l'étiquette avec le diagramme de caractérisation de la couche intermédiaire par Interpolation bilinéaire, ce qui réduit la valeur moyenne des pertes de 00147 et construit un mécanisme de surveillance en profondeur Multi - échelle pour injecter des signaux de surveillance à différentes étapes de suréchantillonnage du décodeur, les détails de texture de contrainte peu profonds), la sauvegarde en profondeur de la sémantique globale, et les données expérimentales montrent que la stratégie coordonne efficacement l'expression sémantique Multi - échelle, atténuant les problèmes de similitude interclasse et de sensibilité à l'échelle qui prévalent dans les images de télédétection.
(5) Sélection du canal réseau. CommeTable 5Illustré, le réseau est divisé en c < / I > selon différentes dimensions d'entrée i>T(C=16)、S(C=32)、B(C=64) Et l < / I > ( c < / I > = 128). Et une expérience d'ablation du nombre de canaux a été réalisée sur l'ensemble de données de Massachusetts. Etudier l'impact des différentes dimensions d'entrée c < / I > sur les performances du réseau, en choisissant finalement le nombre de canaux c < / I > = 64 comme configuration optimale.
Lorsque c < / I > est réglé sur 16, 32 et 64, respectivement, les performances du réseau augmentent progressivement. Mais cet article a constaté que les performances diminuaient légèrement lorsque c < / I > était défini sur 128.
Parce que les images de télédétection n'ont pas d'informations sémantiques explicites, lorsque les dimensions d'entrée sont trop grandes, cela affecte le biais inductif du réseau, ce qui rend le réseau incapable d'extraire efficacement les caractéristiques de la cible. Les performances diminuent légèrement.
Table 4 Selection of supervised learning
| Deep supervision | IoU | F1 | P | R |
|---|
| 单分支监督 | 72.92 | 84.34 | 84.66 | 84.02 |
| 上采样监督 | 73.27 | 84.57 | 84.98 | 84.17 |
| 下采样监督 | 73.12 | 84.47 | 84.82 | 84.13 |
Table 5 Network channel selection
| Channel | IoU | F1 | Precision | Recall |
|---|
| 16 | 73.27 | 84.57 | 84.98 | 84.17 |
| 32 | 74.74 | 85.54 | 85.88 | 85.19 |
| 64 | 75.47 | 86.02 | 86.47 | 85.58 |
| 128 | 73.81 | 84.93 | 85.87 | 84.02 |
3.3.2 expériences comparatives
Pour vérifier l'efficacité de ce réseau, cet article le compare à un réseau typique et à un réseau avancé dans un ensemble de données de bâtiment. Les résultats spécifiques de la comparaison sont les suivants: u2net (Qin等,2020), Swin-Transformer(Liu等,2021), MANet(Li等,2022), HD-Net(Li等,2024b) et RS - Mamba (Zhao等,2024), flgf - unet pour plus de précision dans 3 ensembles de données. U2net: extrayez des caractéristiques Multi - échelles grâce à des structures en U imbriquées à deux étages et à des modules rsu qui excellent et conviennent à l'extraction des bords et des détails des bâtiments. Utilisé pour vérifier les améliorations de flgf - unet dans l'extraction de caractéristiques Multi - échelles et la rétention de détails. Swin transformer: capture de caractéristiques globales avec un mécanisme d'auto - Attention adapté aux scènes complexes et à l'extraction d'objets à grande échelle. Utilisé pour vérifier la capacité de flgf - unet à fusionner les informations globales et les détails locaux. Manet: améliore la dépendance contextuelle avec des mécanismes multi - attentionnels, adaptés à la fusion de caractéristiques Multi - échelles et à l'extraction de précision de bâtiments. Utilisé pour montrer les améliorations apportées par flgf - unet dans la suppression du bruit et l'amélioration des détails. HD - net: améliore les performances d'extraction des bâtiments en résolvant le problème du couplage global avec les caractéristiques des limites grâce à une interaction Multi - échelle de caractéristiques haute résolution. Utilisé pour vérifier les avantages de flgf - unet sur l'interaction des caractéristiques Multi - échelles avec la modélisation globale. RS - Mamba: conçu pour la prédiction intensive d'images de télédétection à grande échelle, il offre d'excellentes performances dans le traitement de scènes complexes et d'images haute résolution. Utilisé pour évaluer les capacités d'extraction de flgf - unet dans le traitement d'images de télédétection à grande échelle et les scénarios riches en détails.
(1) Analyse des ensembles de données sur les bâtiments de Massachusetts. Analyse quantitative:Table 6Les résultats globaux des évaluations quantitatives des différents réseaux figurant sur l'ensemble de données de Massachusetts sont présentés. Par rapport aux autres réseaux Sota, flgf - unet offre des performances optimales. Les différences entre les caractéristiques des bâtiments et des non - bâtiments sont plus importantes, ce qui entraîne une plus grande différenciation entre eux. Plus précisément, avec une augmentation de 0,49%, 0,32%, 0,13%, 0,48% sur les indicateurs Iou, F1, Precision et recall par rapport au réseau Sota RS - Mamba, flgf - unet a obtenu un net avantage par rapport aux autres réseaux, ce qui indique une meilleure efficacité de la méthode proposée. En revanche, le flgf - unet proposé, extrait correctement plus de bâtiments tout en obtenant moins de fausses prédictions. Cela est principalement dû aux deux aspects suivants. D'une part, l'introduction d'un module de convergence efficace qui tire parti des avantages du module flgf - unet, ce qui peut pousser le réseau à apprendre plus de caractéristiques. D'autre part, une stratégie de fusion à travers les étages aidera à mieux caractériser les bâtiments à différentes échelles.
Table 6 Quantitative analysis of different networks on the Massachusetts dataset
| Network | IoU | F1 | Precision | Recall |
|---|
| U2Net | 74.78 | 85.57 | 86.21 | 84.94 |
| Swin-T | 74.65 | 85.48 | 85.97 | 85.01 |
| MANet | 73.66 | 84.83 | 84.99 | 84.68 |
| HD-Net | 74.81 | 85.59 | 86.11 | 85.07 |
| RS-Mamba | 74.98 | 85.70 | 86.34 | 85.10 |
| FLGF-UNet | 75.47 | 86.02 | 86.47 | 85.58 |
Analyse Visuelle: pour une comparaison plus intuitive des performances de flgf - unet avec d'autres réseaux Sota, Visualisez les résultats d'extraction de tous les réseaux tels queFig. 8Montré.Fig. 8Les résultats qualitatifs de flgf - unet avec d'autres réseaux sur l'ensemble de données des bâtiments de Massachusetts sont présentés. En raison de la faible résolution d'image de l'ensemble de données et de la distribution dense des bâtiments, flgf - unet excelle encore plus dans les effets d'extraction. En revanche, u2net, swin - t, HD - net et RS - Mamba présentent tous un phénomène de cavité prononcé, tandis que flgf - unet évite largement ce problème grâce à une fusion plus complète des caractéristiques. En outre, en réponse à des interférences d'objets similaires dans les bâtiments, ni u2net, swin - t, Manet, HD - net et RS - Mamba n'ont été optimisés pour l'extraction, tandis que flgf - unet a fait mieux. Grâce à son avantage de fusionner des informations locales et globales, flgf - unet peut distinguer plus précisément les bâtiments des objets perturbateurs qui les entourent.
(2) Analyse de l'ensemble de données du bâtiment whu. Analyse quantitative:Table 7Les résultats de l'évaluation quantitative globale des différents réseaux sont présentés sur l'ensemble de données du bâtiment whu. Par rapport à d'autres réseaux Sota, tels que RS - Mamba, flgf - unet a montré les meilleures performances pour chaque indicateur. Plus précisément, flgf - unet a augmenté de 0,56%, 0,31%, 0,48% et 0,13% sur les indicateurs Iou, F1, Precision et recall, respectivement. Ces élévations remarquables démontrent que flgf - unet améliore significativement l’efficacité de l’extraction des bâtiments, validant la supériorité de ce réseau.
Analyse Visuelle: sur l'ensemble de données du bâtiment whu,Fig. 9Un ensemble de 6 Exemples visuels montrant tous les réseaux de comparaison avec les réseaux de cet article. Dans les cas où les bâtiments sont ombragés par des arbres ou perturbés par des objets similaires, les résultats d'extraction de chaque réseau présentent une certaine erreur et la plupart des réseaux de comparaison ne parviennent pas à extraire complètement les contours des bâtiments. En revanche, les résultats d'extraction de flgf - unet sont très proches de l'étiquette, démontrant sa capacité à extraire avec précision des bâtiments dans des environnements complexes. L'extraction de u2net, swin - t, Manet, HD - net et RS - Mamba a été sous - efficace et n'a pas permis d'exploiter pleinement les informations contextuelles globales face à l'occultation des bâtiments. Plus précisément, les bâtiments de la sixième rangée sont ombragés par des arbres et perturbés par des objets similaires, contrairement au flgf - unet qui est capable d'extraire des bâtiments complets. Flgf - unet répond plus efficacement à ces scénarios complexes, démontrant ainsi l'avantage d'exploiter les informations globales.
Table 7 Quantitative analysis of different networks on the WHU dataset
| Network | IoU | F1 | Precision | Recall |
|---|
| U2Net | 90.46 | 94.99 | 95.13 | 94.85 |
| Swin-T | 90.07 | 94.78 | 95.16 | 94.79 |
| MANet | 89.54 | 94.48 | 93.92 | 95.05 |
| HD-Net | 90.43 | 94.97 | 95.16 | 94.79 |
| RS-Mamba | 90.77 | 95.16 | 94.78 | 95.55 |
| FLGF-UNet | 91.33 | 95.47 | 95.26 | 95.68 |
(3) Analyse d'un ensemble de données d'exemples de bâtiments urbains typiques en Chine. Analyse quantitative:Table 8Présenté sur un ensemble de données d'exemples de bâtiments urbains typiques en Chine, flgf - unet a amélioré l'Iou, le F1 - score, le Precision et le recall de 0,7%, 0,45%, 0,31% et 0,59% par rapport aux réseaux Sota existants tels que RS - Mamba, avec quatre indicateurs en tête, validant leur capacité d'extraction précise des bâtiments par le biais d'une stratégie de fusion de caractéristiques globale - locale, confirmant ainsi les avantages de la méthode.
Table 8 Quantitative analysis of different networks in typical urban building instance datasets in China
| Network | IoU | F1 | Precision | Recall |
|---|
| U2Net | 76.07 | 86.41 | 86.02 | 86.80 |
| Swin-T | 76.01 | 86.37 | 85.95 | 86.68 |
| MANet | 74.88 | 85.63 | 85.51 | 85.75 |
| HD-Net | 75.69 | 86.17 | 85.95 | 86.35 |
| RS-Mamba | 76.23 | 86.51 | 86.11 | 86.92 |
| FLGF-UNet | 76.93 | 86.96 | 86.42 | 87.51 |
Analyse Visuelle: sur un ensemble de données d'exemples de bâtiments urbains typiques en Chine,Fig. 10Les résultats de comparaison visuelle sur cet ensemble de données sont présentés. Les méthodes existantes (par exemple, u2net, RS - Mamba, etc.) pour l'extraction du contour du bâtiment dans la zone d'occultation des arbres, la première ligne de cas montre clairement les bords du bâtiment souffrent de l'occultation des arbres, les arbres couvrent clairement une partie du contour du bâtiment, les lignes de cas 2 et 3 mettent l'accent sur la situation dans laquelle le bâtiment est perturbé par différents éléments tels que les places, les conteneurs et les voitures, avec un certain impact sur l'identification précise du bâtiment, flgf - unet avec l'Association sémantique globale et le mécanisme d'amélioration des détails locaux, supprime considérablement les interférences et réduit les limites du bâtiment complet, ses résultats prédictifs sont fortement compatibles avec la notation de la vérité, confirmant le rôle clé de la modélisation contextuelle globale dans les scénarios d'occultation complexes.
(4) Analyse de l'extraction de bâtiments dans des scénarios d'occultation d'arbres avec des objets similaires. Pour évaluer la robustesse du modèle dans des environnements complexes, l'étude a comparé un ensemble de scénarios typiques à partir des ensembles de données whu (perturbations géomorphologiques), Massachusetts (occlusion de la végétation) et China typique Urban (perturbations des bâtiments adjacents). Des expériences ont montré queFig. 11Comme montré, RS - Mamba présente des limites significatives dans tous les types de scénarios de perturbation: les résultats de son extraction apparaissent incomplets lorsque le relief géomorphologique entraîne un flou des contours du bâtiment; Le phénomène d'inspection manquée dans la zone d'occultation des arbres dans l'image est proéminent; Des structures de toit similaires dans les zones urbaines à forte densité provoquent des tests erronés. En revanche, flgf - unet surmonte efficacement ces défis grâce à un mécanisme de modélisation Collaborative global - local.
(5) Analyse de la complexité du réseau.Table 10Montre la comparaison de flgf - unet avec d'autres réseaux sur les paramètres Parameters (Parameters), flops (flops), Iou et indicateurs F1 sur l'ensemble de données whu. Bien que flgf - unet soit plus précis que u2net (2020), swin - t (2021), Manet (2021), HD - net (2024) et RS - Mamba (2024), ses grandeurs paramétriques et ses virgules flottantes sont plus élevées. Ce phénomène est attribué à la conception de ses modules de base: le module de fusion linéaire (LF) introduit une charge de calcul supplémentaire tout en améliorant les capacités de caractérisation des structures architecturales complexes grâce au module MSF (Multi - scale Feature Extraction) et au module ga (Global attention). Les expériences ont montré que flgf - unet vérifie la nécessité d'une modélisation contextuelle globale avec un compromis entre la précision et la complexité, tout en indiquant la voie à suivre pour des études ultérieures - en optimisant l'efficacité du modèle tout en maintenant une haute précision grâce à l'introduction de stratégies légères telles que la convolution dynamique, le cisaillement de canal, etc., pour répondre aux besoins réels de déploiement des dispositifs de calcul de bord de télédétection.
Table 10 Analysis of different network complexities in the WHU dataset
| Model | FLOPs/G | Parameters/M | IoU/% | F1% |
|---|
| U2Net | 37.8 | 44.0 | 90.46 | 94.99 |
| Swin-T | 66.8 | 66.0 | 90.07 | 94.78 |
| MANet | 13.5 | 35.9 | 89.54 | 94.48 |
| HD-Net | 50.3 | 14.7 | 90.43 | 94.97 |
| RS-Mamba | 94.2 | 27.9 | 90.77 | 95.16 |
| FLGF-UNet | 105.9 | 54.4 | 91.33 | 95.47 |