Unüberwachte Domänenanpassung der semantischen Segmentierung von Fernerkundungsbildern durch Multi-Task-Kooperationslernen

  • role: First author第一作者
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

  • Email:1202321619@cug.edu.cn
  • Introduction:E-mail1202321619@cug.edu.cn
WANG Yu1,  
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

FENG Yuting1,  
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

GONG Sishi1,  
  • Affiliation:

    School of Surveying, Mapping and Information Engineering, West Yunnan University of Applied Sciences, Dali 671006, China

MAO Yanqin2,  
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

    Hubei Provincial Key Laboratory of Intelligent Geological Information Processing, Wuhan 430074, China

LI Shengwen13,  
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

    Hubei Provincial Key Laboratory of Intelligent Geological Information Processing, Wuhan 430074, China

FANG Fang13,  
  • role: Corresponding author通信作者
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

    Hubei Provincial Key Laboratory of Intelligent Geological Information Processing, Wuhan 430074, China

  • Email:zhoushunping@mapgis.com
  • Introduction:E-mail zhoushunping@mapgis.com
ZHOU Shunping13*

Resümee

Die semantische Segmentierung von Fernerkundungsbildern spielt eine wichtige Rolle bei der Landbedeckungs- und Nutzungs-Klassifikation, Stadtplanung und Veränderungserkennung. Die Domänenanpassungstechnologie als ein vielversprechendes unüberwachtes Lernverfahren hat die Entwicklung der semantischen Segmentierung von Fernerkundungsbildern maßgeblich vorangetrieben. Allerdings basieren bestehende Modelle noch auf dem Lernen einer einzelnen Aufgabe, wodurch die erlernten Segmentierungsmerkmale nicht ausreichend sind und komplexe Bereiche in Fernerkundungsbildern während des Segmentierungsprozesses schwer genau erkannt werden können. Zur Lösung dieses Problems wird in diesem Artikel ein Multi-Task-Learning-Domain-Adaption-Netzwerk MTLDANet vorgeschlagen, das durch kooperatives Lernen von semantischen Informationen und Höheninformationen in Fernerkundungsbildern die Lernfähigkeit der Segmentierungsmerkmale verbessert. Konkret werden dabei aufgabenspezifische semantische Merkmale und Höhenmerkmale in ein funktionsübergreifendes Assoziationslernmodul eingespeist, um latente Korrelationen zwischen den Aufgaben zu erschließen, wodurch eine stärkere aufgabenspezifische Merkmalsdarstellung erreicht wird. Zudem wird durch ein pseudoetikettgeführtes hybrides Konsistenzlernmodul die Qualität der Pseudoetiketten verbessert, um eine globale und lokale Ausrichtung zu realisieren. Darüber hinaus verstärkt ein entropiegeführtes klassenbasiertes Ausrichtungsmodul die Unterscheidbarkeit von schwer zu klassifizierenden Klassen. Schließlich wurden auf Basis der Datensätze ISPRS 2D und US3D vier Gruppen von domänenübergreifenden semantischen Segmentierungsexperimenten mit Fernerkundungsbildern durchgeführt. Die Ergebnisse zeigen, dass die vorgeschlagene Methode in verschiedenen komplexen domänenübergreifenden Szenarien bestehenden Domänenanpassungsmethoden deutlich überlegen ist.

Schlüsselwort

semantische Segmentierung; unüberwachte Domänenanpassung; Fernerkundungsbilder; Multi-Task-Lernen; Höheninformationen; semantische Informationen; Pseudoetiketten; Entropie

1 Einleitung

Die semantische Teilung von Fernerkundungsbildern ist der Prozess der Zuweisung von Pixel-Ebene-Tags auf bestimmte Objekte in einem Fernerkundungsbild, die als Grundlage für die Fernerkundungsbildinterpretationsaufgaben (Zhu等,2017bist eine wichtige Voraussetzung für Aufgaben wie Szenenverständnis, Geografie und 3D-Rekonstruktion (Kussul等,2017Wird in den Bereichen Stadtplanung, Umweltüberwachung, Katastrophenbewertung und -prognose weit verbreitet (Luo和Ji,2022)。 Mit dem schnellen Fortschritt in der Fernerkundungstechnologie wurde die Erfassung von Fernerkundungsbildern effizienter und einfacher, was die Anzahl und die Vielfalt der verfügbaren Daten erheblich erhöhte. Diese umfangreichen Datenressourcen umfassen nicht nur umfangreiche Bildproben, sondern kombinieren auch verschiedene Arten von Hilfsinformationen, die eine solide Grundlage für die Verbesserung der automatisierten Interpretation von Fernerkundungsbildern bilden.
Dank der kontinuierlichen Entwicklung des Deep Learning hat der Ansatz mit voller Überwachung signifikante Fortschritte bei der semantischen Aufteilung der Aufgaben erzielt. Insbesondere das erste End-to-End-Vollkonvolutionsnetzwerk (Long等,2015Die Entstehung von Convolutional Neral Networks (CNN) in der FernerkundungsbildverarbeitungMaggiori等,2017)。 Allerdings gibt es einige Probleme mit dem traditionellen CNN. Einerseits beinhaltet CNN in der Regel Pooling- und Upsampling-Operationen, die den Informationsverlust während des Poolings nicht wiederherstellen können, was zu einer verringerten räumlichen Auflösung des Charakterdiagrammes und einem Verlust von Detailinformationen führt; Auf der anderen Seite muss das Fernerkundungsbild als Eingabebild in die richtige Größe geschnitten werden, was zum Verlust von Kontextinformationen führt. Bestehende Forschung schlägt einige Möglichkeiten vor, diese Probleme zu lösen, zum Beispiel hat ABCNet eine bilaterale Struktur entwickelt, um räumliche Details und globale Hintergrundinformationen zu erfassen.Li等,2021a)。Zhang等(2020)Ein mehrmalige Kontextaggregationsnetzwerk wurde entworfen, das räumliche Relevanz mit einem Modul zur räumlichen Argumentation erlernt und adaptiven Raumpools verwendet, um Kontextinformationen zu aggregieren. E-D-Net verbessert effektiv das Problem der ungenauen Randvorhersage während der Gebäudeextraktion, indem es zwei Subnetze entwirft, die Randinformationen und Detailinformationen des Bildes jeweils erfassen und kombinieren.Zhu等,2021)。 Allerdings erfordert die oben genannte Methode der voll überwachten semantischen Spaltung eine große Anzahl schwer zugänglicher Pixel-Level-Tags, was eine praktische Anwendung erschwert. Darüber hinaus werden bei einem vollständig überwachten Ansatz Schulungs- und Testdaten in der Regel davon ausgegangen, dass sie aus derselben Verteilung stammen, und die Leistung des Modells wird erheblich beeinträchtigt, wenn es auf Daten in neuen Bereichen angewendet wird.
Um die Abhängigkeit des Modells von qualitativ hochwertigen Etiketten zu verringern und seine Generalisierungsfähigkeit zu verbessern, wurden Methoden der semantischen Trennung auf der Grundlage von UNSUPERVISITED DOMAIN ADAPTATION (UDA) weit geforscht. Das UDA-Modell ermöglicht eine hochpräzise Vorhersage, indem es das Wissen über die gekennzeichneten Quellendomendaten in eine nicht gekennzeichnete Zieldomäne überträgt. Die bestehenden UDA-Methoden sind hauptsächlich in vier Kategorien unterteilt: Generationsbasierte Methoden (Chang等,2019Konfrontationsbasierte Methoden (Zheng等,2022Antropiebasierte Methode (Vu等,2019aund Selbstausbildungsmethoden (Gao et al., 2021). Auf der Grundlage der oben genannten Methoden haben die Forscher verschiedene UDA-Strategien vorgeschlagen, um die Unterschiede zwischen den Domänen zu verringern. Zum Beispiel:Yao等(2021)Domain-Adaptive Framework in Kombination mit Anti-Entropie zur Verbesserung der Prognosegenauigkeit des Ziels;Xu等(2022)Generation von konfrontativen Netzwerken für die Kategoriewahrnehmung vorgeschlagen, um intra- und interklasse Unterschiede zwischen Quell- und Zieldomänen zu verringern;Zhang等(2022)Es wurde ein kursbasiertes, lokales bis globales, domain-übergreifendes adaptives Framework entwickelt, das die Merkmale von lokaler Semantik auf eine globale Struktur anpasst. Neben den oben genannten Methoden basiert die generierte Methode auf CycleGAN (Zhu等,2017a (und DualGAN)Yi等,2017So basiert das klassische Netzwerk auf der Ausrichtung der Datenverteilung auf Pixelebene. Zum Beispiel:Li等(2021b)Übersetzen Sie Bilder über DualGAN und fügen Sie mehrere schwache Überwachungseinschränkungen zum Splitting-Netzwerk hinzu, um die Genauigkeit der grenzüberschreitenden Splitting von Fernerkundungsbildern zu verbessern;Yan等(2022)Sie konzentrierten sich auf Pixel, denen keine pseudotags zugewiesen wurden, und entwickelten ein Netzwerk von durchschnittlichen Lehrern, um die Informationen aller Pixel effektiver zu nutzen. Allerdings ist die oben genannte Methode der Semantik-Spaltung, die auf einem einzigen optischen Bild basiert, die unbeaufsichtigte Domänenadaption, sehr schwierig bei der Identifizierung von homogenen und homogenen Phänomenen. Diese Schwierigkeiten begrenzen die Wirkung der adaptiven Teilung der Domain und machen sie anspruchsvoller.
Um die Einschränkungen eines einzelnen optischen Bildes zu überwinden, hat die Methode des Multitasking-Lernens in den letzten Jahren viel Aufmerksamkeit gewonnen. Die grundlegende Idee des Multitasking-Lernens besteht darin, dass verschiedene visuelle Aufgaben miteinander lernen können, um gemeinsam die Prognoseleistung zu optimieren. Häufige visuelle Aufgaben umfassen die semantische Trennung, Tiefenschätzung / Höhenschätzung (Cipolla等,2018 (Randprüfung)Song等,2020Gesetzliche Schätzung (Bhattacharjee等,2022 (Warten Sie. Durch die Einführung verschiedener Überwachungsinformationen für das Modelltraining können Fernerkundungsbilder weit verbreitet für Aufgaben wie die Vorhersage von Geländetypen, die Schätzung von Geländehöhen und die Erkennung von Gebäuderanden verwendet werden. Hierbei sind die Höheninformationen und die semantischen Informationen des Bodens eng verbunden, und in Fernerkundungsbildern sind die Höheninformationen stark mit der räumlichen Geometrie des Bodens verbunden, was zusätzliche Unterscheidungsinformationen für die Bodenkategorien liefert. Im Gegensatz dazu stützt sich die Randerkennung hauptsächlich auf die Randinformationen in den Bildern, die zwar helfen, die Grenzen eines Objekts zu unterscheiden, aber in komplexen Szenarien können einfache Randinformationen nicht ausreichen, um eine genaue Unterscheidung zwischen Artefaktkategorien zu ermöglichen. Viele Höhenunterschiede können die Klassifizierungsleistung des Modells erheblich verbessern, insbesondere in komplexen geographischen Umgebungen, in denen Höheninformationen dem Modell einen reichhaltigeren räumlichen Kontext bieten. Daher haben zahlreiche Studien versucht, zusätzliche Aufgaben wie Höhenabschätzung, Randerkennung und semantische Aufteilungsaufgaben für gemeinsames Training in einem Modell zu integrieren. Diese Methode soll das Modell indirekt helfen, Artefaktkategorien zu beurteilen, indem es Informationen aus anderen Aufgaben nutzt, was die Erkennung komplexer Gebiete verbessert. Zum Beispiel:Vu等(2019b)Durch das Hinzufügen von Rest-Hilfsblöcken auf der Basis von CNN zur Tiefenschätzung wurde ein Tiefenwahrnehmungsprognostik generiert, der die Genauigkeit der semantischen Teilung effektiv verbessert, indem die Ausgabeergebnisse beider Aufgaben kombiniert wurden.Kundu等(2019)Profilbasierte Content-Regularisation und Cross-Task-Destillation-Module wurden vorgeschlagen, um die Kohärenz der Aufgaben zu ermitteln und die Randerkennung, Tiefenschätzungen und semantische Segmentierungsvorhersagen zusammenzuarbeiten.Saha等(2021)Eine task-übergreifende Beziehungsschicht wird vorgeschlagen, um die Aufgabenabhängigkeiten für semantische Vorhersagen und Tiefenprognosen zu kodieren.Wang等(2021)Die Tiefenschätzungsaufgaben wurden als domeinspezifisch angesehen, daher nutzten sie die Tiefenunterschiede zwischen den Ausgaben der beiden Tiefendecoder, um die Schwierigkeit der Domänenadaption abzuschließen und die Pseudo-Tags der semantischen Spaltung zu verfeinern.Chen等(2018)Darüber hinaus wird darauf hingewiesen, dass die gemeinsame Lernpartition und hohe Schätzungsaufgaben die Aufmerksamkeit des Modells auf domänenspezifische Informationen wie Texturen, spektrale Informationen usw. schwächen können und sich stärker auf das Lernen von domänenspezifischen Informationen konzentrieren. Die derzeitige Methode der semantischen Trennung, die auf Multitasking-Lernen basiert, hat zwar gute Perspektiven, bleibt jedoch erheblich unzureichend. Erstens ist es schwierig, die Aufgabengewichte auszugleichen, und Unterschiede in den Beiträgen verschiedener Aufgaben können zu einer übermäßigen Dominanz einer Aufgabe führen und die Lerneffekte anderer Aufgaben beeinträchtigen. Zweitens muss die Präzision des Ausgrabens der Kohärenz zwischen den Aufgaben verbessert werden, und es ist immer noch eine Herausforderung, die Zusammenhänge zwischen den Aufgaben genau zu erfassen und zu nutzen. Darüber hinaus gibt es Schwierigkeiten beim Lernen von unveränderlichen Eigenschaften des Bereichs, da das Modell sich auf domain-spezifische Informationen wie Texturen und Spektren zu stark abhängt, was seine Generalisierungsfähigkeit beeinträchtigt. Die Gewinnung von robusten Feld-unabhängigen Merkmalen bleibt die größte Herausforderung der aktuellen Methode.
Zu diesem Zweck wird in diesem Artikel ein Framework für Multitasking-Collaborative Learning vorgeschlagen, das nicht überwacht wird. Dieser Artikel erlernt Höheninformationen durch Einführung von Höhenschätzungsaufgaben, nutzt aufgabenuntergreifendes Charakteristik-Assoziationslernen zur Synergieoptimierung der Charakteristikdarstellung verschiedener Aufgaben, nutzt pseudo-Label-geführtes Hybrid-Konsistenz-Lernen zur Verbesserung der Qualität von pseudo-Labels und fördert eine effektive Wissensmigration zwischen verschiedenen Bereichen. Schließlich wurde eine entropie-gestützte Methode zur Ausrichtung auf Kategorieebene verwendet, um die Unterscheidungsleistung des Modells für schwierige Kategoriemerkmale weiter zu verbessern. Diese Studie soll dazu beitragen, die Fähigkeit zur domänübergreifenden Generalisierung und Teilungsgenauigkeit von Modellen in komplexen Szenarien zu verbessern, um Anwendungen zur Fernerkundungsbildinterpretation zu unterstützen.

2 In diesem Artikel vorgeschlagene Methoden

2.1 Gesamtrahmen

Das Multi-Task Learning Domain Adaption Network (MTLDANet)Fig. 1gezeigt. Wo das optische Bild des Quelldomeins und das optische Bild des Zieldomänes das Modul für die Erstextraktion von Merkmalen eingeben, um die anfänglichen semantischen Merkmale und die anfänglichen Höhenmerkmale durch den Parameterteil-Encoder und die aufgabespezifischen Engpässe zu extrahieren; Das Lernmodul für Cross-Task-Feature-Associations kombiniert aufgabenspezifische semantische Merkmale und Höhenmerkmale durch kontinuierliche Cross-Feature-Enhancement-Einheiten, um die Darstellung von Merkmalen zu optimieren; Das Hybrid-Konsistenz-Lernmodul mit Pseudo-Etiketten führt die Zieldomänendaten in das Lehrmodell ein, um Pseudo-Etiketten zu generieren, um das Lernen des Schülermodells mit optimierten Pseudo-Etiketten zu überwachen, um die Datenverteilung von Quell- und Zieldomänen näher zu ziehen; Ein Entropie-gestütztes Klassenebene-Ausrichtungsmodul, das die Entropiewerte auf die Klassenebene-Ausrichtung mit feinen Partikelgrößen in den Splittierungsergebnissen gewichtet, um die Leistung eines domänenadaptiven Netzwerks zu verbessern.
figure

Fig. 1 A framework for domain adaptive semantic segmentation based on multi-task learning

2.2 Methode der Domänenadaptive Semantic Splitting

2.2.1 Lernmodul zur Zusammenhänge von Funktionen über Aufgaben hinweg

Studien haben gezeigt, dass Merkmale, die verschiedene Aufgaben verknüpfen, effektiv komplementäre Informationen in die ursprünglichen Merkmale integrieren können, um die Fähigkeit zur Darstellung von Merkmalen zu verbessern.Bhattacharjee等,2022)。 Um die Rolle des assoziierten Lernens zu maximieren, wurde in diesem Artikel ein task-übergreifendes Feature-assoziiertes Lernmodul erstellt, um die Feature-Darstellung verschiedener Aufgaben zu kreuzen. Das Modul besteht aus zwei Queraufmerksamkeitsverbesserungseinheiten, die hauptsächlich den Hohlraumpyramidenpooling ASPP (Atrous Spatial Pyramid Pooling), den Cross Attention Fusion Block CAFB (Cross Attention Fusion Block) und die Türsteuerungsstruktur umfassen.Fig. 2gezeigt.
figure

Fig. 2 Detailed structure of cross-task feature correlation learning

Zunächst einmal die ursprünglichen semantischen Merkmaleund hohe EigenschaftenGeben Sie in eine aufgabenspezifische ASPP ein, lernen Sie Informationen auf mehreren Skalen und verbessern Sie die Fähigkeit des Netzwerks, Kontexte zu erfassen. Anschließend wurden die Cross-Focus-Fusionsblöcke verwendet, um die bemerkenswerten Merkmale der Höhenmerkmale und der semantischen Merkmale vollständig zu erfassen und weitere adaptive Auswahl der komplementären Merkmale in die ursprünglichen Aufgabenzeichen zu integrieren, um optimierte Höhenmerkmale und semantische Merkmale zu erhalten. Der obige Prozess wird als Cross-Feature Enhancement Unit bezeichnet. In das Lernmodul Cross-Task Feature Associations wurden insgesamt zwei Cross-Feature Enhancement-Einheiten eingefügt, die jeweils Zwischenmerkmale für verschiedene Aufgaben generieren.undMit den endgültigen MerkmalenundWenn wir zum Beispiel die Aufgabe der semantischen Spaltung annehmen, können wir durch kontinuierliche Kreuzmerkmal-Verbesserungseinheiten das Netzwerk stärker auf komplementäre hochgradige Informationen konzentrieren und somit die semantische Darstellung von Merkmalen tiefer verfeinern. Um zu vermeiden, dass sich die Komplementarinformation in den Aufgabenspezifischen Merkmalen während des gemeinsamen Lernens von Merkmalen zu stark konzentriert und gleichzeitig das effektive Lernen der ursprünglichen Aufgabe ignoriert wird, behandelt dieser Artikel die ursprünglichen Merkmale.und mittlere MerkmaleDurch den Kanal verschmelzen und mit den endgültigen EigenschaftenZusammen in die Türsteuerungsstruktur eingegeben, um die ursprünglichen und ergänzenden Merkmale eng zu integrieren, um adaptive Fusionsmerkmale zu erzielenDie Fusionsformel ist wie folgt ausgedrückt:
in der FormRepräsentiert die Operation der Reduzierung der Kanäle, um die Anzahl der Kanäle auf die Hälfte der ursprünglichen zu reduzieren,Vertretung von Kanal-Fusionsvorgängen,die Aktivierungsfunktion,Represents the adaptive weight matrix.
Die detaillierte Struktur des Cross-Focus Fusion Blocks wieFig. 3gezeigt. Um sich möglichst auf wichtige Merkmale zu konzentrieren und das Lernen ohne relevantes Rauschen zu unterdrücken, werden die semantischen Merkmale und die Höhenmerkmale, die aus ASPP ausgegeben werden, durch das Channel Attention Module (CAM) durchgeführt.Hu等,2018Raumaufmerksamkeitsmodul (SAM)Woo等,2018), um bedeutende semantische Merkmale aus den Kanal- und Raumdimensionen zu integrierenund bemerkenswerte HöhenmerkmaleNachdem die Merkmale erhalten wurden, können Aufgabenmerkmale, Aufgabenmerkmale und Aufgabenmerkmale mit einer verschachtelten Gateway-Fusionsstruktur kreuzintegriert werden, um die Merkmale der verschiedenen Aufgaben vollständig zu verbessern. Bei einer semantischen Aufteilung kann der Prozess als
in der Form,Repräsentiert die Operation der Reduzierung der Kanäle, um die Anzahl der Kanäle auf die Hälfte der ursprünglichen zu reduzieren,Vertretung von Kanal-Fusionsvorgängen,Die Aktivierungsfunktion.
figure

Fig. 3 Detailed structure of the cross-attention fusion block

2.2.2 Blended Consistency Learning Modul für Pseudo-Labeling-Anleitung

Um die Migration von Ursprungsdomänenwissen zu Zieldomänen zu erleichtern, um der globalen Datenverteilung zu entsprechen, wird in diesem Artikel ein konsistentes Lernen auf der Grundlage einer gemischten Probe verwendet. Zunächst eine Zieldomäne-ProbeUsing ClassMix(Olsson等,2021 (Methode zur Mischung in die Source-Domain-Probe)Erzeugung neuer gemischter Proben durch DatenverbesserungenAnschließend werden gemischte Proben und Quellendomenproben auf dem Studentenmodell trainiert und Zieldomänenproben auf dem Lehrmodell trainiert. Das Lehrmodell aktualisiert die Parameter durch den exponentiell bewegenden Durchschnitt des Studentenmodells. Insbesondere wird eine gemischte Maske auf Basis des Grundwertes des Quelldomeins mit ClassMix generiert, ein Pseudo-Tag für den Zielbereich wird durch das Lehrmodell generiert, wobei der wahre Wert des Quelldomeins und das Pseudo-Ziel mit der gemischten Maske multipliziert werden, um ein gemischtes Tag zu bilden, das für die Überwachung des Schülermodells verwendet wird. Dieser Prozess führt spezifisches Wissen über den Zielbereich in das Studentenmodell ein, um das Modell auf den Zielbereich zu erweitern.
In diesem Prozess ist die Leistung des Studentenmodells in hohem Maße mit der Qualität der falschen Etiketten verbunden. Wenn es zu viele Pixel mit niedriger Vertrauenswürdigkeit in einem falschen Tag gibt, kann das Studentenmodell falsche Zieldomänen lernen. Wenn es zu wenig Informationen in pseudotags gibt, führt dies dazu, dass das Modell das Wissen über die Quelle erlernt. Es ist offensichtlich, dass mit zunehmender Anzahl von Iterationen die Fähigkeiten des Modells zunehmen. Um die Eigenschaften des Modells und die Qualität des Pseudo-Labels auszugleichen, wird in diesem Artikel eine einfache inkrementale Pseudo-Label-Screening-Strategie vorgeschlagen. Geben Sie eine MindestschwelleMaximale SchwelleGesamtzahl der IterationenAnzahl der aktuellen IterationenBestimmen Sie den aktuellen Schwellenwert mit der folgenden Formel und filtern Sie falsche Tags:
in der Form,gefälschte Etiketten nach dem Filtern,ist das ursprüngliche Pseudo-Tag der Zieldomäne,Repräsentation zur Generierung von gefälschten TagsPrognosewahrscheinlichkeitsdiagramm.
Sowohl die Aufgabe der Hochschätzung als auch die Aufgabe der semantischen Aufteilung beziehen sich auf charakteristische Informationen aus optischen Bildern, so dass die Prognoseergebnisse der Hochschätzung auch mit den semantischen Bildinformationen verbunden sind. Die Anpassungsschwierigkeit einer hochgeschätzten Aufgabe kann auf die Semantik übertragen werden (Wang等,2021Sie können als Strafgewicht auf den Kreuzentropieverlust einer gemischten Probe gewichtet werden, um das Netzwerk besser in die Richtung der Optimierung zu lenken. Verlust der semantischen Spaltung während des TrainingsHochgeschätzte VerlusteDefinieren Sie die Formel wie folgt:
in der Form,unddie Breite und Höhe des Bildes,Die Anzahl der Grundstücksklasse. Außerdemundist der entsprechende Grundwert der semantischen Spaltung und der hohen Schätzung,undEs handelt sich um die semantisch aufgeteilte Prognose für die Netzwerkausgabe und die hochgeschätzte Prognose.
Für gemischte Proben ist die gewichtete Partitionsverlustformel wie folgt:
in der Form,ist das hochadaptive Gewicht der gemischten Probe,eine gemischte Probe,Es sind falsche Etiketten für gemischte Proben.ist ein prognostisches Wahrscheinlichkeitsdiagramm für eine gemischte Probe,、undjeweils Wahrscheinlichkeitsdiagramm.Länge, Breite und Anzahl der Kanäle,undHöhenschätzungsklassifikator, der die Quell- und Zieldomäne repräsentiert,Repräsentiert den hohen Wahrheitswert der gemischten Probe.

2.2.3 Klassenebene-Ausrichtung durch Entropie

Die Entropiewerte können verwendet werden, um die Unsicherheit oder Zuverlässigkeit der Prognoseergebnisse zu bewerten. Die relevanten Studien zur Domänenadaption haben die wichtige Rolle der Entropiewerte ausreichend nachgewiesen (Saporta等,2020)(Xu等,2021)。 In der Regel sind die Vorhersagen für die Quellendomenprobe genauer, die Entropiewerte sind im Allgemeinen niedriger und die hohe Entropie ist im Allgemeinen an der semantischen Grenze zu erkennen. Die Prognosen für Zielgebiete weisen mehr Fehlerklassifizierung und Lärm auf, und die meisten Regionen weisen eine hohe Entropie auf. Somit kann ein Entropie-Diagramm sehr intuitiv die Unterschiede zwischen dem Ausgangs- und Zielbereich widerspiegeln. Um die semantische Ausrichtung von Quell- und Zieldomänen weiter zu erleichtern, wird in diesem Artikel ein entropie-gestütztes Klassenebene-Ausrichtungsmodul vorgeschlagen, das das Lernen von gemischten Proben überwacht.
Zunächst berechnet man den Durchschnittswert der Entropie jeder Klasse anhand des Entropiewertes und normalisiert ihn auf 0-1. Der Durchschnitt der Entropie jeder Klasse spiegelt die Kategorie wider, die in einer gemischten Probe schwer zu klassifizieren ist, und je höher der Wert, desto schwieriger die Anpassung dieser Klasse ist, desto weniger zuverlässig ist die Prognose für diese Klasse. Die Gewichtung der Differenz von 1 minus der Entropie-Mittelwerte pro Klasse auf das prognostische Wahrscheinlichkeitsdiagramm kann die Fälle verringern, in denen Landarten falsch als unzuverlässige Kategorien eingestuft werden. Da der Entropiewert die Ungenauigkeit der Prognose jedes Pixels widerspiegelt, kann er als Strafgewicht verwendet werden, um den Lernintensiv für schwierige Bereiche zu erhöhen. Durch das Hinzufügen von Entropie-Mittelwerten und Entropiewerten für jede Klasse zu Splittungsverlusten kann die Trennbarkeit der verschiedenen Kategorien auf semantischer Ebene verbessert werden. Dieser Verlust wird in diesem Artikel als gewichteter Entropieverteilungsverlust definiert.Die Berechnungsformel lautet wie folgt:
in der Form,repräsentiert das prognostische Wahrscheinlichkeitsdiagramm,、undjeweils Wahrscheinlichkeitsdiagramm.Länge, Breite und Anzahl der Kanäle,den Wert des Etiketts,Representative labelDie Anzahl der Pixel in der Kategorie c.

2.2.4 Netzwerktrainingsstrategien

Insbesondere besteht eine Iteration des gesamten End-to-End-Netzwerks aus drei Trainingsschritten.
Zunächst soll das Netzwerk mit dem wahren Wert des Etiketts optimiert werden, um die Fähigkeit des Netzwerks zur Darstellung der Merkmale von semantischen Informationen und Höheninformationen zu verbessern. Verwenden Sie den Grundwert und die Höhendaten des Quelldomeins und die Höhendaten des Zieldomeins als Überwachungsinformationen, berechnen Sie den Kreuzentropieverlust und den berHu-Verlust mit den entsprechenden Prognoseergebnissen wie folgt:
in der Form,Repräsentiert die Partition Verlust der Quelle Domain,undDie hohen geschätzten Verluste repräsentieren die Quelle-Domain-Probe und die gemischte Probe.undEs handelt sich um einen hohen Wahrheitswert für die Source-Domain-Probe und die Mixed-Probe.undRepräsentiert die erste Splittungsprognose und die endgültige Splittungsprognose.undist die ursprüngliche Schätzung der Höhe und die endgültige Schätzung der Höhe für die Quelle-Domain-Stichprobe,undEs handelt sich um eine anfängliche Höhenschätzung und eine endgültige Höhenschätzung für die gemischte Probe.
Secondly, by utilizing mixed pseudo labels to optimize the network, the learning of unlabeled samples is enhanced through mixed consistency learning, promoting global alignment between the source and target domains. Using mixed pseudo labels as supervisory information, the weighted cross entropy loss is calculated based on the semantic segmentation results of the mixed samples. The calculation method is as follows:
Schließlich wird das Netzwerk mit den Entropiewerten optimiert und die Entropiewerte auf die Prognoseergebnisse einer nicht markierten Probe gewichtet, um das Lernen von nützlichen Informationen im Netzwerk zu erleichtern. Verwenden Sie Pseudo-Tags als Überwachungsinformationen, berechnen Sie den gewichteten Kreuzentropieverlust mit dem Ergebnis der semantischen Spaltung nach der Gewichtung des Entropiewertes, der als Entropieverlust bezeichnet wirdDie Berechnung erfolgt wie folgt:
Durch die Integration der oben genannten Verluste kann ein Gesamtverlust erzielt werden:

3 Experimentelle Daten und Analyse

3.1 Datensatzeinleitung

Um die Wirksamkeit der vorgeschlagenen Methode zu bewerten, werden in diesem Artikel zwei Datensätze zur Validierung und Analyse verwendet.
Der Datensatz 1 ist der offene Datensatz ISPRS 2D, der von der International Society for Photometry and Remote Sensing im Rahmen des Wettbewerbs für 2D-Semantic Labeling zur Verfügung gestellt wurde.Rottensteiner等,2012 ), einschließlich der Datensätze von Potsdam und Vaihingen. wieFig. 4gezeigt. Der Potsdamer Datensatz enthält 38 hochauflösende Positivbild mit 6.000 x 6.000 und die entsprechenden qualitativ hochwertigen Partitionsmarkierungsbilder und DSM-Bilder, die in insgesamt 3 Mustern RGB, IRRG und RGB-IR verfügbar sind. In diesem Artikel werden Bilder aus dem IRRG- und RGB-Modus mit einer Bodenaufnahmeabstand von 5 cm verwendet. Bodenobjekte werden in einer der 6 Kategorien gekennzeichnet, nämlich Unruhe / Hintergrund, undurchsichtige Oberflächen, Autos, Bäume, niedrige Vegetation und Gebäude. Das Bild wurde in 4.598 512×512 Unterkarten geschnitten, von denen 2.904 markiert und 1.694 nicht markiert waren. Der Vaihingen-Datensatz enthält 33 hochauflösende Bilder von ca. 2000 x 2000, DSM und 6-Klassen-Markierungsbilder. Positivbild bietet nur den IRRG-Modus mit einer Bodenabgabe von 9 cm. Das Bild wurde in 1696 512 x 512-Unterkarten geschnitten, von denen 896 markiert und 800 nicht markiert sind.
figure

Fig. 4 Example of Potsdam and Vaihingen datasets

Der zweite Datensatz ist der massive Fernerkundungsdatensatz US3D, der vom DATA FUSION CONTEST 2019 vorgeschlagen wurde.Le等,2019Die Fernerfassungsdaten von Jacksonville, Florida, und Omaha, Nebraska, einschließlich RGB-optischer Bilder, AGL-Daten und entsprechender semantischer Etiketten, wurden bereitgestellt. AGL-Bilder zeigen die Höhe des Objekts über dem Boden an und können verwendet werden, um Höheninformationen zu extrahieren. Der US3D-Datensatz umfasst fünf Artefaktkategorien: Boden, Vegetation, Gebäude, Wasser und Hochbrücken. Die Datensätze sind nach Region in gekennzeichnete und nicht gekennzeichnete Daten für Training und Tests unterteilt. Das Bild wurde in 512 x 512 Unterkarten geschnitten, Jacksonville hatte 2.112 gekennzeichnete und 1.948 nicht gekennzeichnete Bilder und Omaha hatte 3.588 gekennzeichnete und 3.484 nicht gekennzeichnete Bilder.Fig. 5Hier sind einige Beispiele für US3D-Daten.
figure
figure

Fig. 5 Example of US3D dataset

3.2 Bewertungsindikatoren

Im Experiment dieses Artikels, das F1_Score und IoU verwendet, um die Leistung der vorgeschlagenen Methode zu bewerten, ist F1_Score wie folgt definiert:
Bei mehreren semantischen Aufgaben, (True Positive) steht für die Anzahl der Pixel, bei denen sowohl der Prognosewert als auch der wahre Wert positiv sind. (False Positive) steht für die Anzahl der Pixel, deren wahrer Wert negativ ist, aber der vorhergesagte Wert positiv ist, und False Negative steht für die Anzahl der Pixel, deren vorhergesagte Wert negativ ist, aber der wahre Wert positiv ist.Die korrekte Probe repräsentiert den Anteil aller Prognosen als positive Probe, währendRepräsentiert den Anteil der richtigen Probe, die für alle realen Werte als positive Probe prognostiziert wurde,jaundDer gewichtete Durchschnitt kann die Stabilität des Modells messen.
Berechnet als Überlappungsverhältnis zwischen der vorhergesagten Teilung und dem tatsächlichen Teilungsergebnis, kann die Teilungsgenauigkeit des Modells gemessen werden. Die Berechnungsformel lautet wie folgt:

3.3 Experimente und Parameter

In diesem Artikel wird das DeeplabV2-Framework als gemeinsamer Encoder und aufgabespezifischer Decoder verwendet, dessen Rückgratnetzwerk das ResNet101-Netzwerk ist, das auf ImageNet vorgeschult wurde. Im ersten Feature-Extraktionsmodul besteht der aufgabespezifische Engpässe aus zwei 3×3-Konvolutionsblöcken und der erste Klassifizierer aus 1×1-Konvolutionsblöcken. Die Abtastungsraten für ASPP im aufgabenspezifischen Decoder sind [6, 12, 18, 24] und die Abtastungsraten für ASPP im taskübergreifenden Feature-Associated Learning sind [1, 4, 8, 12]. Das Trainingsprogramm für diese Methode basiert auf CorDA und die Datenverbesserung ist auf zufällige horizontale Flips, zufällige vertikale Flips, Farbstickungen und Gaussianische Rauschen eingestellt.
Die Netzwerkarchitektur dieses Artikels wurde auf dem gängigen PyTorch-Framework implementiert und alle Experimente wurden auf einer Arbeitsstation mit einer Grafikkarte von NVIDIA GeForce RTX 3090 und 24 GB Grafikspeicher ausgeführt. Während des Trainings wurde ein zufälliger Gradientenabfalloptimator mit Nesterov-Beschleunigung verwendet. Der Impuls wird auf 0,9 eingestellt, der Gewichtsverlust auf 5 x 10 -4 und die anfängliche Lernrate auf 2,5 x 10 -4 eingestellt. Die Partiengröße und die Epoche sind auf 2 bzw. 10 festgelegt. Die Mindestschwelle und die Höchstschwelle für das hybride Konsistenzlernen von Pseudo-Tags liegen bei 0,4 bzw. 0,6,undAlle auf 1 gesetzt.

3.4 Experimentelle Ergebnisse

3.4.1 Basismethode

Dieser Artikel führt einen experimentellen Vergleich zwischen der Source Only-Methode und vier fortschrittlichen UDA-Methoden, die auf Multitasking-Lernen basieren: Deep Sensing Domain Adaptive Network DADA (Vu等,2019bCTRL (Netzwerk für Aufgabenbeziehungen)Saha等,2021Adaptives Netzwerk MIDA (Chen等,2022 (und Korrelation Wahrnehmung Domäne adaptives Netzwerk CorDA)Wang等,2021)。 Das vorgeschlagene Multitask Learning Framework entfernt den Domain-Adaptive-Abschnitt und bildet ein Multitask Learning-Netzwerk. Die Source only-Methode trainiert die Quelldomänendaten in diesem Netzwerk und testet sie direkt auf der Zieldomäne, um Prognoseergebnisse zu erhalten. DADA unterstützt die semantische Trennung durch Tiefenprognose-Aufgaben und vereint eine reiche Darstellung von Tiefenmerkmalen, um die Trennungsleistung zu verbessern. CTRL schlägt eine task-übergreifende Beziehungsschicht vor, um die Abhängigkeiten von semantischen Vorhersagen und Tiefenprognose-Aufgaben zu kodieren und die Beziehungen zwischen verschiedenen semantischen Kategorien und Tiefenebenen durch die Technik der Tiefendiskretierung weiter zu lernen. MIDA präsentiert Funktionen Interaktionsmodule und Interaktionsinformationsaufmerksamkeitseinheiten, die potenzielle Beziehungen zwischen den beiden Aufgaben ausgraben. CorDA schlägt ein Modul zur Zuordnung von Funktionsmerkmalen für Aufgaben vor, um die Funktionsrelationen verschiedener Aufgaben zu lernen und die semantischen Pseudo-Tags für Ziele mit Tiefenunterschieden zu verfeinern.

3.4.2 Vergleich mit der Basismethode

Zur Prüfung der Gültigkeit dieser Methode in der Aufgabe der adaptiven Semantik-Spaltung von Fernerkundungsbildern ohne Aufsicht und ihrer Robustheit in verschiedenen Szenarien wurden vier Reihen von Experimenten an ISPRS2D-Datensätzen und US3D-Datensätzen durchgeführt. Die ISPRS2D-Datensätze unterscheiden sich erheblich im Erscheinungsbild, die Szenarien sind komplex; Der Unterschied zwischen den US3D-Datensätzen ist geringer. In den Experimenten mit ISPRS2D-Datensätzen wurden IRRG- und RGB-Bilder von Potsdam als Quelle- und Vaihingen als Ziel-Domäne verwendet. In Experimenten mit US3D-Datensätzen wechseln Jacksonville und Omaha als Zieldomäne und Quelldomäne ab. Die gekennzeichneten Daten für die Quelldomäne und die nicht gekennzeichneten Daten für die Zieldomäne werden zum Training verwendet, die gekennzeichneten Daten für die Zieldomäne werden zum Testen verwendet.
(1) Domainanpassung unter komplexen Szenarien – Potsdam IRRG → Vaihingen IRRG. Die Leistungsfähigkeit dieser Methode wurde durch ein grenzüberschreitendes Experiment am Potsdamer IRRG → Vaihingen IRRG bei unterschiedlichen geographischen Umgebungen und starken Erscheinungsverschiedenheiten von ähnlichen Geländen bewertet. wieTable 1gezeigt. Es ist ersichtlich, dass alle Methoden der Domänenadaption im Vergleich zu Source only eine höhere Genauigkeit erzielen. Insgesamt waren die durchschnittlichen F1_score und die durchschnittliche IoU dieser Methode 35,22% und 33,76% höher als Source only und erzielten die beste Genauigkeit in allen Artefaktenkategorien. Darüber hinaus verbessert die vorliegende Methode die Prädiktionskorrektheit von Mischwellen- oder Hintergrundklassen erheblich und verringert die Verwirrung der Klassifizierung von Artefakten mit großen Unterschieden zwischen den Klassen und anderen Artefakten.

Table 1 Quantitative results with Potsdam IRRG as source domain and Vaihingen IRRG as target domain /%

方法评估指标杂波或背景不透水面汽车树木低矮植被建筑总体
Source onlyF1_Score3.0054.8734.7169.7117.2063.4740.49
IoU1.5337.8021.0053.519.4046.4828.29
DADAF1_Score1.0468.7437.0670.6143.0869.2048.29
IoU0.5252.3722.7554.5727.4552.9035.10
CTRLF1_Score4.0270.2916.3868.9249.9975.8547.58
IoU2.0554.208.9252.5733.3261.1035.36
MIDAF1_Score16.5779.884.9671.5856.1087.0152.68
IoU9.0466.512.5455.7538.9977.0141.64
CorDAF1_Score7.2483.8048.2171.5463.2088.2960.38
IoU3.7672.1231.7655.6946.2079.0448.10
本文F1_Score70.2987.0364.4271.9968.6291.9375.71
IoU54.1977.0547.5156.2452.2385.0762.05
Visualisierungsergebnisse wieFig. 6Wie gezeigt, ist die Source only-Methode aufgrund mangelnder Domainanpassung in dichten Gebäude- und Schattenbereichen mit höherem Lärm und einer Vielzahl von Hintergrundklassen, die mit anderen Geländeklassifikationen verwechselt werden. Unter Domänenadaptivität ist es leichter, Wissen über Kategorien (z. B. Bäume) ohne feste Morphologie und mit geringen Unterschieden innerhalb der Klasse von der Quelle-Domäne in die Zieldomäne zu migrieren. Im Gegensatz dazu reduzierten die vier Basis-Ansätze zur Anwendungsbereichsanpassung die Klassifizierungsverwechslung zwischen Gebäuden, undurchsichtigen Flächen und Unruhen und verbesserten die Genauigkeit der Erkennung kleiner Ziele. Allerdings sind diese Methoden immer noch von Hybriden beeinflusst, was zu falschen Prognosen führt. Im Gegensatz dazu sind die Vorhersagen der vorliegenden Methode genauer und reduzieren die Klassifizierungsverwechslung zwischen verschiedenen Artefakten erheblich, insbesondere in Grenzgebieten. Trotz der geringfügigen Verzerrungen des Gebäudes in den ursprünglichen Bildern und der Verschleierung durch Bäume generierte diese Methode die klarsten architektonischen Konturen und identifizierte erfolgreich kleine Ziele wie niedrige Vegetation. Unter Schatteninterferenz kompensiert diese Methode den Mangel an spektralen Informationen durch die Kombination von Höheninformationen, reduziert den Schatteneinfluss erheblich und erzielt die beste Leistung. Darüber hinaus ist die vorliegende Methode bei der Erkennung verschiedener Arten von Geländen, insbesondere kleiner Ziele und Grenzen, ausgezeichnet. Insgesamt kombiniert diese Methode Multitasking-Charakteristik-Informationen effektiv, reduziert Spektrum-verursachte Klassifizierungsfehler und liefert die zuverlässigsten Teilungsergebnisse.
figure

Fig. 6 Partial visualization of segmentation results for the Potsdam IRRG to Vaihingen IRRG experiment

(2) Domainanpassung in komplexen Szenarien – Potsdam RGB → Vaihingen IRRG. Durch ein domain-übergreifendes Experiment von Potsdam RGB → Vaihingen IRRG wurde die Leistung dieser Methode unter starken Unterschieden in der geographischen Umgebung und den Bildmustern bewertet. Aufgrund der Bildunterschiede zwischen dem Ursprungs- und dem Zielbereich wird die Karte eines ähnlichen Geländes kompliziert, was die Ausrichtung der Domäne erschwert. wieTable 2Wie gezeigt, mit zunehmender Domain-Lücke verringern sich andere fortschrittliche Methoden in Bezug auf die Genauigkeit von Source only, möglicherweise aufgrund unterschiedlicher Schwerpunkte bei der domänenadaptiven Verarbeitung. Zum Beispiel hat die CTRL-Methode die höchste Genauigkeit in der Baumklasse, aber die niedrigste Genauigkeit in der Automobilklasse; MIDA und Corda haben eine geringere Präzision in der Baumklasse. Im Gegensatz dazu verringert die vorliegende Methode die negativen Auswirkungen der Domain-Lücke auf die Leistung durch die ausdrückliche Konstruktion der Korrelation von Semantik- und Höheninformationen und die Einschränkung der Feinkorngrößenausrichtung. Die Ergebnisse zeigten, dass diese Methode den besten durchschnittlichen F1_Score von 61,67% und eine durchschnittliche IoU von 48,02% unter allen Methoden erzielte und die beste Leistung in allen 5 Artefakten erzielte. Obwohl die Präzision der Baumklasse der vorliegenden Methode niedriger ist, wurde die Klassifikationsverwirrung zwischen Bäumen und niedriger Vegetationsgenauigkeit durch das Ausgleichen verringert und die Wirksamkeit bei komplexen Aufgaben der grenzüberschreitenden Trennung gezeigt.

Table 2 Quantitative results with Potsdam RGB as source domain and Vaihingen IRRG as target domain /%

方法评估指标杂波或背景不透水面汽车树木低矮植被建筑总体
Source onlyF1_Score1.2962.2438.5256.5516.3562.5439.58
IoU0.6545.1823.8639.428.9145.4827.25
DADAF1_Score2.4465.2827.3366.3232.7162.7842.81
IoU1.2348.4615.8349.6119.5545.7530.07
CTRLF1_Score0.6768.0310.0073.1633.5169.7442.52
IoU0.3451.565.2657.6820.1353.5531.42
MIDAF1_Score10.7368.6739.6614.0651.3383.1044.59
IoU5.6752.2924.737.5734.5271.0932.64
CorDAF1_Score5.0270.7554.061.3849.2274.6842.52
IoU2.5854.7437.040.7032.6559.5931.22
本文F1_Score24.9480.8165.2249.9958.1090.9761.67
IoU14.2567.8148.3933.3240.9483.4448.02
Visualisierungsergebnisse wieFig. 7Wie gezeigt, ist die Source only-Methode schwierig, Gebäude und undurchsichtige Oberflächen zu unterscheiden, kann aber Bäume besser erkennen. Andere Domänenadaptive Baseline-Methoden verbesserten die Klassifizierung von Gebäuden und undurchsichtigen Oberflächen, aber es gab immer noch Lärm an den Grenzen, insbesondere in großen Gebäuden und Schattenbereichen. Im Gegensatz dazu ist diese Methode deutlich besser als andere Methoden und die Prognose der Ergebnisse hat eine bessere Kontextbeziehung und verringert die Fehlerklassifizierung. Diese Methode ermöglicht die genaue Identifizierung von Gebäudekonturen sowie die genaue Identifizierung von Vegetations- und Nicht-Vegetationsgebieten, insbesondere bei der Positionierung und Prognose kleiner Ziele. Die Gesamtergebnisse deuten darauf hin, dass diese Methode die Genauigkeit von Bäumen und niedrigen Vegetationsklassen effektiv identifiziert und ausgewogen hat, während andere Methoden nur bei einer bestimmten Klasse besser funktionieren, was möglicherweise auf eine erhöhte Domainlücke zurückzuführen ist. Insgesamt erzielt diese Methode die besten Trennergebnisse auf den meisten Artefakten und nutzt die Höheninformationen effektiv, um die Zweideutigkeit der spektralen Informationen zu optimieren und sich an verschiedene Szenarien der Anpassung der Domäne anzupassen.
figure

Fig. 7 Partial visualization of segmentation results from Potsdam RGB to Vaihingen IRRG experiment

(3) Domain-Anpassung unter einfachen Szenen – Omaha → Jacksonville. Die Leistung dieser Methode wurde durch ein grenzüberschreitendes Experiment in Omaha → Jacksonville bewertet, wenn die geographische Umgebung unterschiedlich ist, aber die Geographie ähnlich aussieht. wieTable 3Die allgemeine Genauigkeit von DADA und CTRL und die Genauigkeit der meisten Kategorien ist niedriger als die Source only-Methode. Dies deutet darauf hin, dass bei der Domänenadaption in einfachen Szenarien eine unangemessene Verbesserungsrichtung negative Migration oder Überanpassung auftreten kann, was zu einer Leistungseinnahme führt. Andere fortschrittliche Methoden unterscheiden sich nicht sehr von Source only in der Genauigkeit, was darauf hindeutet, dass die Verbesserungen durch Domain-Adaptive-Methoden in einfachen Szenarien begrenzt sind. Unter allen Methoden erzielt diese Methode immer noch die höchste Leistung und ist in den Kategorien Boden, Vegetation und Gebäude besser als andere Methoden. Aufgrund der zu geringen Stichprobenzahl der Kategorien Gewässer und Hochbrücken in Omaha, die sich in dieser Methode auf das komplementäre Lernen von Semantik und Höheninformation konzentrieren, ist es schwierig, die Zusammenhänge zwischen Semantik und Höheninformation bei einer geringen Stichprobenzahl vollständig zu lernen, so dass die Methode in beiden Kategorien leicht unzureichend erkennbar ist.

Table 3 Quantitative results with Omaha as source domain and Jacksonville as target domain

方法评估指标地面植被建筑水域高架桥总体
Source onlyF1_Score84.5074.0375.2285.6233.6870.61
IoU73.1558.7760.2874.8620.2557.46
DADAF1_Score82.4868.6469.4587.5912.6864.17
IoU70.1852.2653.2077.926.7752.06
CTRLF1_Score82.6466.9469.9785.7410.8163.22
IoU70.4150.3253.8175.045.7251.06
MIDAF1_Score85.6473.9075.4483.0139.5171.50
IoU74.8858.6160.5770.9624.6257.93
CorDAF1_Score85.4875.5778.7990.6621.5870.42
IoU74.6460.7465.0082.9212.0959.08
本文F1_Score85.8976.6979.5189.2528.2671.92
IoU75.2762.1965.9980.5816.4660.10
Visualisierungsergebnisse wieFig. 8Wie gezeigt, kann die Source only-Methode bei der domänelosen Anpassung die Kontextbeziehung besser aufrechterhalten, aber bei der Vorhersage unregelmäßiger Formen ist sie leicht mit dem umliegenden Gelände verwechselt, insbesondere bei der Klassifizierung von Geländen und Boden, und kleine Ziele sind leicht zu überspringen. Bei den DADA- und CTRL-Methoden sind die Prognosen für das Gelände schlechter als bei der Source only-Methode, Hochbrücken mit geringer Probenmenge können sehr leicht mit Bodenklassen mit ähnlichem Spektrum verwechselt werden, und Gebäude und Gewässer sind weniger korrekt und vollständig als bei der Source only-Methode. Die MIDA- und CorDA-Methoden leisten sich auf allen Arten von Geländen gut, aber es gibt immer noch viele Leckagen und unvollständige Vorhersagen in Bezug auf die Vegetation und die Architektur. Im Gegensatz dazu zeigte die in diesem Artikel vorgeschlagene Methode eine bessere Leistung auf allen Arten von Geländen und reduzierte die Leckage- und Fehlerprüfung kleiner Zielobjekte. Gleichzeitig zeigt diese Methode eine glattere und regelmäßigere Geländeform, insbesondere die Gebäudegrenzen. Insgesamt kann diese Methode auch in Szenarien mit geringer Schwierigkeit der Domainanpassung die beste Leistung erzielen und die Trennung von Gebäuden und Vegetation erheblich verbessern, was beweist, dass die vorgeschlagene Methode eine starke Allgemeinheit hat und weit verbreitet in verschiedenen Szenarien der Domainanpassung verwendet werden kann.
figure

Fig. 8 Visualization of segmentation results for the Omaha to Jacksonville experiment

(4) Domain-Anpassung unter einfachen Szenen – Jacksonville → Omaha. Die Leistung dieser Methode wurde durch ein grenzüberschreitendes Experiment in Jacksonville → Omaha bewertet, wenn die geographische Umgebung unterschiedlich ist, aber die Geographie ähnlich aussieht. wieTable 4Wie gezeigt, ähnlich wie das Experiment von Omaha → Jacksonville, hatten DADA und CTRL eine geringere Genauigkeit als die Source only-Methode, während diese Methode den besten F1_Score von 67,83% und den besten durchschnittlichen IoU von 52,98% erhielt und eine bessere Genauigkeit in den meisten Artefaktenkategorien erzielte. Es ist bemerkenswert, dass diese Methode die Trennleistung von Hochbrücken erheblich verbessert hat, obwohl die Genauigkeit dieser Methode bei Boden-, Vegetations- und Wasserklassen etwas unter der optimalen Genauigkeit liegt. Dies deutet darauf hin, dass diese Methode im Vergleich zu anderen Methoden eine stärkere Fähigkeit zur Charakteristik und Domänenmigration für kleine Stichproben hat.

Tabel 4 Quantitative results with Jacksonville as source domain and Omaha as target domain /%

方法评估指标地面植被建筑水域高架桥总体
Source onlyF1_Score88.0155.9472.4145.0833.0458.90
IoU78.5838.8356.7529.1019.7944.61
DADAF1_Score88.6555.7668.9852.5428.3058.85
IoU79.6138.6652.6535.6316.4844.61
CTRLF1_Score88.6458.4570.1342.9732.0658.45
IoU79.5941.3054.0027.3719.0944.27
MIDAF1_Score89.9060.4575.3647.1844.6263.50
IoU81.6643.3260.4730.8728.7249.01
CorDAF1_Score90.2258.4475.1056.4450.5366.15
IoU82.1741.2860.1439.3133.8151.34
本文F1_Score90.1058.0275.8455.1660.0567.83
IoU81.9840.8761.0838.0942.9152.98
Visualisierungsergebnisse wieFig. 9gezeigt. Die Source only Methode funktioniert insgesamt gut, wenn es keine Domänenadaption gibt, aber es gibt eine Klassifikationsverwirrung zwischen dem Boden und anderen Objekten. Nach dem Hinzufügen der Domänenadaption gab es trotz teilweise reduzierter Verwirrung immer noch große Baufehlerprüfungen, kleine Gebäudeklebungen und unvollständige Erkennung von Hochbrücken. Beobachtungen ergaben, dass Klassifikationsverwirrung hauptsächlich in Gebieten auftritt, in denen hohe Unterschiede auftreten, in denen andere Methoden weiterhin anfällig für Fehler sind. Im Gegensatz dazu können die vorliegenden Methoden die Lage und Form von Gebäuden genau vorhersagen, insbesondere in dichten kleinen Gebäudegebieten, in denen Gebäude weniger haftbar sind. Insgesamt ist die Landgrenze der vorliegenden Methode glatter und hat eine gute Trennleistung auf allen Arten von Landflächen erhalten. Diese Ergebnisse zeigen, dass die in diesem Artikel vorgeschlagenen Methoden bessere Vorteile haben.
figure

Fig. 9 Visualization of segmentation results for the Jacksonville to Omaha experiment

3.5 Experimente und Diskussionen

3.5.1 Verschmelzungsexperimente

Um die Wirksamkeit der verschiedenen Module in dieser Methode zu prüfen, wurden verschiedene Module für die Disfusionsstudie an der Ausgangslinie kombiniert. Entfernen Sie zunächst die CFCL-, PMCL- und ECA-Module aus dem MTLDANet-Framework und setzen Sie die Domain-Adaption-Methode als Baseline auf ein Modell, das mit der CorDA-Methode übereinstimmt. Verschiedene Kombinationen von Experimenten wieTable 5Wie gezeigt, kann die Basismethode einen durchschnittlichen IoU von 49,27% und einen durchschnittlichen F1_Score von 61,42% erzielen. Dies deutet darauf hin, dass die Einführung eines Multitasking-Learning-Frameworks tatsächlich eine effektive Nutzung von Höheninformationen zur Verbesserung der Semantik ermöglichen kann. Anschließend wurden ein Cross-Task-Feature-Associated Learning-Modul (+CFCL) zur Basislinie hinzugefügt, um die Validität des kombinierten Höhe- und Semantikmerkmals für das Modell zu verifizieren, ein Hybrid Consistency Learning-Modul (+PMCL) mit detaillierter struktureller Anleitung von Pseudo-Etiketten für verschiedene Fusionstürsteuerungsstrukturen hinzugefügt, um Verbesserungen im Pseudo-Etiketten- und Konsistenzlernen zu verifizieren, und ein Entropy-Guided Class-Level Alignment-Modul (+ECA), um ihren Beitrag zur Domänenanpassung zu verifizieren.

Table 5 Quantitative results of ablation experiments /%

方法CFCLPMCLECA平均F1_Score平均IoU
Baseline61.4249.27
+CFCL64.6751.81
+PMCL67.5752.92
+ECA69.7555.31
+CFCL、PMCL71.5259.41
+ECA、PMCL70.4456.01
+ECA、CFCL69.1956.48
Ours75.7162.05
wieTable 5Das Hinzufügen der drei Module allein zur Basislinie lieferte eine durchschnittliche IoU von 51,81%, 52,92% und 55,31%. Es kann gesehen werden, dass die Verbesserung der Verbindungen zwischen Höhenmerkmalen und semantischen Merkmalen dazu beitragen kann, die Erkennung der Semantik des Modells zu verbessern, das Konsistenzlernen von hochzuverlässigen Zieldomänenproben und Quelldomänenproben kann eine gute Migration von Quelldomänenwissen fördern, und die Förderung der Ausrichtung auf Klassenebene von Quelldomänen und Zieldomänen unter der Führung von Entropieinformationen kann die Leistung der grenzüberschreitenden Teilung erheblich verbessern. Nach dem Hinzufügen des CFCL-Moduls (+CFCL, PMCL) oder des ECA-Moduls (+ECA, PMCL) auf der PMCL-Basis war die durchschnittliche IoU um 6,49% bzw. 3,09% höher als "+PMCL". Darüber hinaus ist die durchschnittliche IoU mit dem ECA-Modul (+ECA, +CFCL) auf der CFCL-Basis um 4,67% höher als bei "+CFCL". Dieser Gewinn zeigt weiter, dass verschiedene Module zusammenarbeiten können, um eine höhere Genauigkeit zu erzielen. Darüber hinaus hat die Methode, die alle Module hinzufügt, nämlich MTLDANet, die Trennpräzision erheblich verbessert, wobei die durchschnittliche IoU und der durchschnittliche F1_Score um 12,78% bzw. 14,29% höher als die Ausgangswerte sind. Dies zeigt, dass die Konzentration auf das stark korrelierte Lernen zwischen den verschiedenen Aufgaben und die feine Granularausrichtung zwischen den verschiedenen Domänen die Leistung der domänübergreifenden semantischen Trennung effektiver verbessern können.

3.5.2 Auswirkungen unterschiedlicher integrierter Türkontrollstrukturen im taskübergreifenden Feature-Associated Learning

Im Lernmodul Cross-Task Feature Associations besteht der Schlüsselpunkt darin, wie man die Zusammenhänge zwischen aufgabenspezifischen Merkmalen, aufgabenspezifischen Merkmalen und aufgabenspezifischen Merkmalen effektiv lernt, um die Repräsentationsfähigkeit verschiedener aufgabenspezifischer Merkmale vollständig zu verbessern und zu optimieren. Abhängig von verschiedenen Kombinationsmethoden werden in diesem Unterabschnitt drei Fusionstürsteuerungsstrukturen festgelegt, nämlich die Fusionstürsteuerungsstruktur nach der Fusion, die verschachtelte Fusionstürsteuerungsstruktur und die parallele Fusionstürsteuerungsstruktur. Beispielsweise die Integration von Höhenmerkmalen in die semantischen Merkmale, spezifische Strukturen wieFig. 10gezeigt. Diese drei Strukturen werden jeweils in ein Lernmodul für Cross-Task-Feature-Associations eingefügt.Table 6Die quantitativen Ergebnisse sind aufgeführt.
figure
figure
figure
figure

Fig.10 Detailed structure of different fusion gating structures

Table 6 Quantitative results using different fusion gating structure models /%

融合门控结构类型平均F1_Score平均IoU
合并后融合门控结构70.5756.73
本文嵌套融合门控结构74.0360.55
并列融合门控结构63.1251.57
vonTable 6Die beste Fusionsstruktur ist eine verschachtelte Fusionstürsteuerung mit einem durchschnittlichen IoU von 60,55% und einem durchschnittlichen F1_Score von 74,03%. Die zweite ist die Fusionstürsteuerung nach der Fusion, und die parallele Fusionstürsteuerung hat die schlechteste Leistung. Dies zeigt ausreichend, dass unterschiedliche Türsteuerungsstrukturen die Wirksamkeit von Lernmodulen beeinflussen können, die aufgabenuntergreifende Merkmale assoziieren. In verschiedenen Strukturen können verschachtelte integrierte Torsteuerungsstrukturen die Komplementarität verschiedener Aufgaben voll ausnutzen, um die Funktionsinformationen über verschiedene Aufgaben feiner zu integrieren und somit die Prognosegenauigkeit zu verbessern.
Fig. 11Verschiedene Output-Charakteristiken und Prognoseergebnisse von einigen Proben wurden in diesem Diagramm visualisiert. Modelle, die verschiedene Fusionsstrukturen verwenden, haben eine ähnliche Trennpräzision auf Bäumen, niedriger Vegetation, Autos und anderen Boden, hauptsächlich aufgrund einiger Klassifikationsverwirrung zwischen Unruhen, Gebäuden und undurchsichtigen Oberflächen. Zum Beispiel ist die PrognoseeingabeprobeFig. 11Wenn der mittlere wahre Wert ein Bereich mit Unruhen ist, ist die Fusionsmodulstruktur nach der Fusion sowohl auf der undurchsichtigen Oberfläche als auch auf der Unruhe deutlich, so dass die Ergebnisse zeigen, dass die Unruhe falsch als undurchsichtige Oberfläche klassifiziert wurde. Parallel-Fusion-Tür-Kontrolle-Struktur ist in der undurchsichtigen Oberfläche Charakteristik ist deutlicher, so dass in den Prognoseergebnissen die Wellen völlig falsch als undurchsichtige Oberfläche klassifiziert werden. Die Prognose-Eingangsprobe 2Fig. 11Wenn der mittlere wahre Wert die undurchsichtige Oberfläche ist, haben sich in den Schattenbereichen die Fusionsmodulstrukturen nach der Fusion und die parallele Fusionstürsteuerungsstruktur für die Gebäudetechnik bemerkenswert entwickelt, so dass es eine falsche Aufteilung in Gebäude gibt. Insgesamt ist das Modell mit verschachtelten Fusionstürsteuerungsstrukturen am besten prognostiziert, um Wellen und undurchlässige Oberflächen besser zu unterscheiden und Gebäude mit ähnlichem Spektrum und undurchlässige Oberflächen genau zu identifizieren, was Schattenstörungen verringert. Dies kann darauf zurückzuführen sein, dass aufgabenspezifische Merkmale, aufgabenspezifische Merkmale und aufgabenübergreifende Merkmale unterschiedlich wichtig sind für die semantische Aufteilung von Aufgaben, daher kann die schichtmäßige Verfeinerung von Aufgabenzeichen durch verschachtelte, integrierte Türkontrollstrukturen die effektive Kombination verschiedener Merkmale mit aufgabenspezifischen Merkmalen Schicht für Schicht erleichtern.
figure
figure

Fig. 11 Visualization of the output feature maps generated by different fusion gating structures

3.5.3 Auswirkungen der Anzahl von Feature-Enhancement-Einheiten im Cross-Task-Feature-Associated Learning

Ein weiterer Schlüsselfaktor, der die Leistung von Lernmodulen beeinflusst, die sich über Aufgaben hinweg mit Feature-Associations beziehen, ist die Cross-Feature-Enhancement-Einheit. Um die optimale Leistung des Cross-Task-Feature-Associated Learning-Moduls zu erzielen, wurden drei Gruppen von Experimenten durchgeführt, in denen die Anzahl der Cross-Feature-Enhanced-Einheiten auf 1, 2 und 3 festgelegt wurde.Table 7gezeigt. Es ist zu sehen, dass der durchschnittliche F1_Score und die durchschnittliche IoU einen Trend zeigen, der zunimmt und abnimmt, wenn die Anzahl der Kreuzverstärkungseinheiten allmählich steigt, mit der optimalen Genauigkeit bei einer Anzahl von 2.

Table 7 Quantitative results for models with different numbers of cross-feature enhancement units /%

交叉特征增强单元数量平均F1_Score平均IoU
162.0950.45
2(本文)74.0360.55
365.1753.91
Zur weiteren Analyse der Auswirkungen der Anzahl der unterschiedlichen Cross-Characteristic-Verbesserungseinheiten,Fig. 12Es werden einige häufige Fehlerbeispiele dargestellt. Es kann gesehen werden, dass untere Gebäude leicht als undurchsichtige Oberflächen eingestuft werden können, wenn die Anzahl der Kreuzcharakteristikverstärkungseinheiten 1 beträgt, und undurchsichtige Oberflächen leicht falsch als 杂lle und niedrige Vegetation eingestuft werden. Dies kann darauf zurückzuführen sein, dass eine einzelne Kreuzmerkmal-Verbesserungseinheit nicht gut in der Lage ist, hochdimensionale Höhenmerkmale und hochdimensionale semantische Merkmale zu integrieren, was zu verwirrenden Ergebnissen führt, wenn spektrale Informationen komplex sind und Höheninformationen selten vorhergesagt werden. Während die Anzahl der Kreuzmerkmal-Verbesserungseinheiten bei 3 lag, waren die Baumvorsagen genauer, aber Gebäude wurden mit der Klassifizierung der niedrigen Vegetation verwechselt und es gab eine größere Fehlerklassifizierung. Diese Klassifikationsverwirrung tritt in der Regel in Gebieten auf, in denen Höhenwerte nicht offensichtlich sind, was wahrscheinlich darauf zurückzuführen ist, dass zu viele Kreuzmerkmal-Verbesserungseinheiten zu viele Höhenmerkmale in die semantischen Merkmale integrieren, so dass unwesentliche Höheninformationen in komplexen Szenarien die semantische Information irreführen. Bei einer Zahl von 2 kombiniert das Modell signifikante Informationen aus verschiedenen Aufgaben vollständig, um die Fähigkeit des Modells zur Darstellung von Merkmalen zu verbessern und die prognostische Leistung in komplexen Szenarien am besten zu erzielen. Insgesamt ist die Komplementarität zwischen den hochdimensionalen Merkmalen aus der Semantik und der hohen Aufgabe bei zu wenigen Einheiten nicht stark aufgebaut, während das Modell die Komplementaritätsinformationen für verschiedene Aufgaben übermäßig ausbeutet und die Aufmerksamkeit auf die ursprüngliche Aufgabe schwächt. Beide Fälle beeinflussen die Prognose der endgültigen semantischen Informationen. Das optimale Gleichgewicht kann erreicht werden, wenn die Anzahl der Kreuzmerkmal-Verbesserungen 2 beträgt.
figure

Fig. 12 Visualization results of the model using different numbers of cross-feature enhancement units

3.5.4 Auswirkungen der Probenmischung im gemischten Konsistenzlernen

Im hybriden Konsistenzlernen können unterschiedliche Probenmischungsmethoden die Robustheit und Störungsbeständigkeit des Modells beeinflussen. Die Methode der regionalen Mischung bezieht sich auf die Unterteilung des Bildes in Bereiche der gleichen Größe, gemischtes Bild aus Bildern aus dem Quell- und Zielbereich basierend auf der Spazierung der regionalen Maske, wieFig. 13gezeigt. Die regionale Mischung setzt sechs Regionalmasken ein und wählt während des Trainings zufällig eine beliebige Spleifform aus. Bei der Kategoriemischung werden die Hälfte der Kategorien aus allen Klassen des Quelldomänenbildes zufällig ausgewählt, die durch Pixel aus dem gleichen Bereich des Zieldomänenbildes ersetzt werden.Fig. 13gezeigt. Um eine optimale Probenmischung zu erhalten, setzen Sie die Mischung im Mixed Consistency Learning jeweils für die regionale Mischung und die kategorische Mischung ein, um 2 Gruppen von Experimenten durchzuführen:Table 8Die quantitativen Ergebnisse werden dargestellt. Es ist zu sehen, dass Modelle, die eine kategorische Mischung verwenden, die optimale Gesamtleistung erzielen und die Genauigkeit auf jedem Geländetyp besser ist als Modelle, die eine regionale Mischung verwenden. Dies deutet darauf hin, dass die Klassenmischung eine bessere Robustheit hat und die Migration von Quelldomänenwissen zu Zieldomänen besser erleichtert. Insbesondere war die Genauigkeit von Modellen, die eine kategorische Mischung verwendeten, bei Geländen mit geringen Unterschieden innerhalb von Autos, Bäumen und niedriger Vegetation um etwa 10% höher als bei Modellen, die eine regionale Mischung verwendeten, und bei Geländen mit großen Unterschieden innerhalb anderer Klassen um etwa 5% höher. Dies zeigt weiter, dass die Verwendung von Klassenmischungen allgemein die Erkennungsfähigkeit verschiedener Artefakte optimiert und eine genauere Trennung von Artefakten mit kleinen Unterschieden innerhalb der Klassen fördert.

Table 8 Quantization results of different mixing methods /%

方法评估指标杂波或背景不透水面汽车树木低矮植被建筑总体
区域混合F1_Score71.1783.8438.3364.0959.9488.6767.67
IoU55.2472.1723.7147.1642.7979.6453.45
类别混合(本文)F1_Score75.3586.7549.9172.1068.2791.7774.03
IoU60.4576.5933.2656.3751.8284.7960.55
figure
figure

Fig. 13 Illustration of the mixing process for the regional mixing approach and the category mixing approach

3.5.5 Hyperparametrische Empfindlichkeitsanalyse

Um den Einfluss verschiedener Hyperparameterwerte auf die Modellleistung zu untersuchen, wird in diesem AbschnittundDie Werte 0,1, 0,5 und 1,0 sind festgelegt und die ErgebnisseTable 9undTable 10Wenn festgelegtfür 0,5,Wenn man von 0,1 auf 1 ändert, kann man eine allmähliche Steigerung der Gesamtgenauigkeit sehen.Maximale Genauigkeit für 1 Uhr. Die Fähigkeit zur grenzüberschreitenden Trennung und die Fähigkeit zur Höhenvorhersage werden dabei allmählich ausgewogen. Im Detail betrachtet, mit dem Gewicht der geschätzten Aufgaben auf hoher Höhe, ist am bemerkenswertesten die starke Steigerung der Genauigkeit der Mischwellenklasse und die schnelle Abnahme der Genauigkeit der Automobilklasse. Dies kann darauf zurückzuführen sein, dass die Verbesserung der Höheninformationen für die Trennung erheblich unterschiedlicher und leicht zu verwechselnder Klassifizierung geeigneter ist, während die Hinzufügung von Höheninformationen für Fahrzeuge mit kleinen Höhenwerten und geringen Erscheinungsveränderungen die semantische Erkennung schwächt.

Table 9 Quantization results for different (=0.5) /%

评估指标杂波或背景不透水面汽车树木低矮植被建筑总体
0.1F1_Score6.6086.4768.8372.3566.8691.8365.49
IoU3.4176.1652.4856.6850.2384.8953.98
0.5F1_Score48.8686.3765.7971.3367.0291.5971.83
IoU32.3276.0249.0255.4550.3984.4757.95
1.0F1_Score75.3586.7549.9172.1068.2791.7774.03
IoU60.4576.5933.2656.3751.8284.7960.55

Table 10 Quantization results for different (=1) /%

评估指标杂波或背景不透水面汽车树木低矮植被建筑总体
0.1F1_Score57.2086.5757.6572.8668.3391.6172.37
IoU40.0576.3340.5057.3151.8984.5258.43
0.5F1_Score75.3586.7549.9172.1068.2791.7774.03
IoU60.4576.5933.2656.3751.8284.7960.55
1.0F1_Score77.6987.0056.1768.0068.3291.9874.86
IoU63.5277.0039.0551.5351.8985.1461.36
Wennfestgelegt auf 1,Bei einer Veränderung von 0,1 auf 1 kann eine Steigerung der Gesamtgenauigkeit von 58,43% auf 61,36% beobachtet werden und die optimale Leistung bei einem Wert von 1 erzielt werden. Im Detail sinkt die Genauigkeit der Klassen von Autos, Bäumen und niedriger Vegetation mit relativ kleinen Unterschieden innerhalb der Klasse allmählich ab, während die Genauigkeit der anderen Klassen mit großen Unterschieden innerhalb der Klasse allmählich steigt. Dies kann darauf zurückzuführen sein, dass die Entropiewerte empfindlicher für die Gebiete mit hoher Entropie sind, d. h. Kategorien, die schwieriger vorherzusagen sind. Daher mitSteigend neigen die Modelle eher dazu, die Erkennungsfähigkeit der Domain zu verbessern, um sich an schwierige Gelände anzupassen.

3.5.6 Analyse der Schwellenwerte für falsche Etiketten

Um die Zuverlässigkeit der Zieldomänenprobe im hybriden Konsistenzlernen zu verbessern, wurde ein pseudotagged-Schwellenmechanismus eingeführt. Mit zunehmender Anzahl der Trainings steigt die Schwelle für Pseudo-Etiketten allmählich von der niedrigsten Schwelle auf die höchste. Um die Auswirkungen verschiedener Schwellenbereiche auf die Modellleistung zu überprüfen, wurden die Mindestschwellen auf 0,2, 0,3 und 0,4 festgelegt, während die Höchstschwelle von 0,6 auf 0,9 im Abstand von 0,1 erhöht wurde, was insgesamt 12 Gruppen von Experimenten bildete. Durchschnittliche F1_Score und durchschnittliche IoU für jede Gruppe von ExperimentenFig. 14gezeigt. Wenn der Mindestwert 0,4 und der Höchstwert 0,6 liegt, erzielt das Modell die optimale Leistung. Es ist leicht, unzuverlässige Proben einzuführen, wenn die Mindestschwelle zu niedrig ist, während eine zu hohe Höchstschwelle zu einer zu geringen Probenmenge führen kann, die zu lernen ist, um die negativen Auswirkungen beider Situationen nur besser zu unterdrücken, wenn die Schwelle im mittleren Bereich liegt; Es gibt keine eindeutige Regelmäßigkeit der Leistung in verschiedenen Schwellenbereichen. Im Allgemeinen ist die Leistung des Modells besser, wenn die Mindestschwelle höher als 0,3 ist, die Höchstschwelle nicht größer als 0,7 ist und die Differenz zwischen der Höchstschwelle und der Mindestschwelle nicht größer als 0,3 ist.
figure
figure

Fig. 14 Matrix of quantization results for different threshold ranges

3.5.7 Analyse der Komplexität des Modells

Um die Effizienz des Modells quantitativ zu beurteilen, werden die Modellparameter und die berechneten FLOPs (floating-point operations per second) als Indikatoren verwendet, um die Komplexität des Modells bei der gleichen Eingangsbildgröße (512 x 512 Pixel) zu testen. Das Ergebnis wieTable 11gezeigt. Die Methode zeigt eine deutliche Verbesserung bei FLOPS im Vergleich zur MIDA-Methode. Obwohl diese Methode sowohl die Anzahl der Parameter als auch die FLOPs höher waren als die Corda-Methode, zeigte diese Methode eine bessere Trennleistung in vier domainübergreifenden Experimenten. Insgesamt hat diese Methode ein besseres Gleichgewicht zwischen Präzision und Effizienz erreicht.

Table 11 Number of parameters and FLOPs for the test models

方法模型参数量/MFLOPs/GB
DADA46.58402.42
CTRL47.13203.10
MIDA50.341691.78
CorDA46.50400.62
Ours57.54453.79

4 Schlussfolgerungen

Dieser Artikel schlägt eine Methode zur adaptiven semantischen Spaltung von Fernerkundungsbildern ohne überwachte Domäne für Multitasking-Lernen vor. Diese Methode verbessert gemeinsam die Erkenntnis des Modells von „homogenen“, „homogenen“ und hochdifferenzierten Orten durch das Lernen von Höhenschätzungsaufgaben und die Integration mit semantischen Informationen in Kombination mit einem Multitasking-Lerngrahwerk. Die Höheninformation bietet dem Modell zusätzliche räumliche Merkmale, während das Multitasking-Framework die Darstellung semantischer Merkmale verbessert, die beide in Synergie wirken, um die Zweideutigkeit von Spektrum- und räumlichen Informationen zu lindern und die Leistung des Modells in komplexen grenzüberschreitenden Szenarien zu verbessern. Insbesondere verbessert die Methode die Darstellungsfähigkeit von semantischen Merkmalen durch den Aufbau von Aufgabenrelevanzen über Aufgabenzeichen hinweg. Das hybride Konsistenz-Lernen mit Pseudo-Label-Optimierung fördert die Migration von Ursprungsdomänenwissen zu Zieldomänen, und die entropie-gestützte Ausrichtung auf Klassenebene verstärkt die Aufmerksamkeit auf schwierige Klassifizierungen und fördert die Aggregation und Trennung von Homogenen. Diese Methode kann effektiv die Klassifikationsverwirrung von isogenen und isogenen Fremdkörpern verbessern und die Fehlerklassifizierung von Gebieten mit hohen Wertunterschieden erheblich verringern. Diese Methode führte vier Reihen von Experimenten an den Standard-Datensätzen ISPRS 2D und US3D durch und zeigte, dass die Methode bei Geotope-Klassifizierungsaufgaben ausgezeichnet ist, insbesondere im Multi-Task-Learning-Rahmen, und ihre Leistung deutlich besser als andere bestehende Methoden ist.

References

  1. 1.
    Bhattacharjee D, Zhang T, Süsstrunk S and Salzmann M. 2022. MulT: an end-to-end multitask learning transformer//Proceedings of the 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE: 12021-12031
  2. 2.
    Chang W L, Wang H P, Peng W H and Chiu W C. 2019. All about structure: adapting structural information across domains for boosting semantic segmentation//Proceedings of the 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE: 1900-1909
  3. 3.
    Chen L C, Papandreou G, Kokkinos I, Murphy K and Yuille A L. 2018. DeepLab: semantic image segmentation with deep convolutional nets, Atrous convolution, and fully connected CRFs. IEEE Transactions on Pattern Analysis and Machine Intelligence, 40(4): 834-848
  4. 4.
    Chen H Y, Zhang H Y, Yang G Y and Li S Y. 2022. A Mutual Information Domain Adaptation Network for Remotely Sensed Semantic Segmentation. IEEE Transactions on Geoscience and Remote Sensing, 60: 1-16 .
  5. 5.
    Cipolla R, Gal Y and Kendall A. 2018. Multi-task learning using uncertainty to weigh losses for scene geometry and semantics//Proceedings of the 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE: 7482-7491
  6. 6.
    Gao L, Zhang L F and Zhang Q. 2021. Addressing domain gap via content invariant representation for semantic segmentation//Proceedings of the 39th AAAI Conference on Artificial Intelligence: Palo Alto: AAAI Press: 7528-7536
  7. 7.
    Hu J, Shen L and Sun G. 2018. Squeeze-and-excitation networks//Proceedings of the 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE: 7132-7141
  8. 8.
    Kundu J N, Lakkakula N and Radhakrishnan V B. 2019. UM-adapt: unsupervised multi-task adaptation using adversarial cross-task distillation//Proceedings of the 2019 IEEE/CVF International Conference on Computer Vision. Seoul: IEEE: 1436-1445
  9. 9.
    Kussul N, Lavreniuk M, Skakun S and Shelestov A. 2017. Deep learning classification of land cover and crop types using remote sensing data. IEEE Geoscience and Remote Sensing Letters, 14(5): 778-782
  10. 10.
    Le Saux B, Yokoya N, Hänsch R and Brown M. 2019. Data fusion contest 2019 (DFC2019)[EB/OL].
  11. 11.
    Li R, Zheng S Y, Zhang C, Duan C X, Wang L B and Atkinson P M. 2021a. ABCNet: attentive bilateral contextual network for efficient semantic segmentation of Fine-Resolution remotely sensed imagery. ISPRS Journal of Photogrammetry and Remote Sensing, 181: 84-98
  12. 12.
    Li Y S, Shi T, Zhang Y J, Chen W and Wang Z B and Li H. 2021b. Learning deep semantic segmentation network under multiple weakly-supervised constraints for cross-domain remote sensing image semantic segmentation. ISPRS Journal of Photogrammetry and Remote Sensing, 175: 20-33
  13. 13.
    Long J, Shelhamer E and Darrell T. 2015. Fully convolutional networks for semantic segmentation//Proceedings of the 2015 IEEE Conference on Computer Vision and Pattern Recognition. Boston: IEEE: 3431-3440
  14. 14.
    Luo M Y and Ji S P. 2022. Cross-spatiotemporal land-cover classification from VHR remote sensing images with deep learning based domain adaptation. ISPRS Journal of Photogrammetry and Remote Sensing, 191: 105-128.
  15. 15.
    Maggiori E, Tarabalka Y, Charpiat G and Alliez P. 2017. Convolutional neural networks for large-scale remote-sensing image classification. IEEE Transactions on Geoscience and Remote Sensing, 55(2): 645-657.
  16. 16.
    Olsson V, Tranheden W, Pinto J and Svensson L. 2021. ClassMix: segmentation-based data augmentation for semi-supervised learning//Proceedings of the 2021 IEEE Winter Conference on Applications of Computer Vision. Waikoloa: IEEE: 1369-1377
  17. 17.
    Rottensteiner F, Sohn G, Jung J, Gerke M, Baillard C, Benitez S and Breitkopf U. 2012. The ISPRS benchmark on urban object classification and 3D building reconstruction//ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences. Melbourne: ISPRS: 293-298
  18. 18.
    Saha S, Obukhov A, Paudel D P, Kanakis M, Chen Y H, Georgoulis S and Van Gool L. 2021. Learning to relate depth and semantics for unsupervised domain adaptation//Proceedings of the 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE: 8193-8203
  19. 19.
    Saporta A, Vu T H, Cord M and Pérez P. 2020. ESL: entropy-guided self-supervised learning for domain adaptation in semantic segmentation. arXiv preprint arXiv: 2006.08658
  20. 20.
    Song X, Zhao X, Fang L J, Hu H W and Yu Y Z. 2020. EdgeStereo: an effective multi-task learning network for stereo matching and edge detection. International Journal of Computer Vision, 128(4): 910-930
  21. 21.
    Vu T H, Jain H, Bucher M, Cord M and Pérez P. 2019a. ADVENT: adversarial entropy minimization for domain adaptation in semantic segmentation//Proceedings of the 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE: 2512-2521 [DOI: 10.1109/CVPR.2019.00262].
  22. 22.
    Vu T H, Jain H, Bucher M, Cord M and Pérez P P. 2019b. Dada: depth-aware domain adaptation in semantic segmentation//Proceedings of the 2019 IEEE/CVF International Conference on Computer Vision. Seoul: IEEE: 7363-7372
  23. 23.
    Wang Q, Dai D X, Hoyer L, Van Gool L and Fink O. 2021. Domain adaptive semantic segmentation with self-supervised depth estimation//Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision. Montreal: IEEE: 8495-8505
  24. 24.
    Woo S, Park J, Lee J Y and Kweon I S. 2018. CBAM: convolutional block attention module//Proceedings of the 15th European Conference on Computer Vision (ECCV). Munich: Springer: 3-19
  25. 25.
    Xu H Q, Yang M, Deng L Y, Qian Y Q and Wang C X. 2021. Neutral cross-entropy loss based unsupervised domain adaptation for semantic segmentation. IEEE Transactions on Image Processing, 30: 4516-4525
  26. 26.
    Xu Q S, Yuan X and Ouyang C J. 2022. Class-aware domain adaptation for semantic segmentation of remote sensing images. IEEE Transactions on Geoscience and Remote Sensing, 60: 4500317
  27. 27.
    Yan L, Fan B, Xiang S M and Pan C H. 2022. CMT: cross mean teacher unsupervised domain adaptation for VHR image semantic segmentation. IEEE Geoscience and Remote Sensing Letters, 19: 6002205
  28. 28.
    Yao X D, Wang Y D, Wu Y L and Liang Z Y. 2021. Weakly-supervised domain adaptation with adversarial entropy for building segmentation in cross-domain aerial imagery. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 14: 8407-8418
  29. 29.
    Yi Z L, Zhang H, Tan P and Gong M L. 2017. DualGAN: unsupervised dual learning for image-to-image translation//Proceedings of the 2017 IEEE International Conference on Computer Vision. Venice: IEEE: 2868-2876
  30. 30.
    Zhang B, Chen T and Wang B. 2022. Curriculum-style local-to-global adaptation for cross-domain remote sensing image segmentation. IEEE Transactions on Geoscience and Remote Sensing, 60: 5611412
  31. 31.
    Zhang J, Lin S F, Ding L and Bruzzone L. 2020. Multi-scale context aggregation for semantic segmentation of remote sensing images. Remote Sensing, 12(4): 701
  32. 32.
    Zheng A H, Wang M, Li C L, Tang J and Luo B. 2022. Entropy guided adversarial domain adaptation for aerial image semantic segmentation. IEEE Transactions on Geoscience and Remote Sensing, 60: 5405614
  33. 33.
    Zhu J Y, Park T, Isola P and Efros A A. 2017a. Unpaired image-to-image translation using cycle-consistent adversarial networks//Proceedings of the 2017 IEEE International Conference on Computer Vision. Venice: IEEE: 2242-2251
  34. 34.
    Zhu X X, Tuia D, Mou L C, Xia G S, Zhang L P, Feng X and Fraundorfer F. 2017b. Deep learning in remote sensing: a comprehensive review and list of resources. IEEE Geoscience and Remote Sensing Magazine, 5(4): 8-36
  35. 35.
    Zhu Y T, Liang Z L, Yan J W, Chen G and Wang X Q. 2021. E-D-net: automatic building extraction from high-resolution aerial images with boundary information. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 14: 4595-4606

Lesen Sie die ganze Passage

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website