1 citation
Les images hyperspectrales Hsi (Hyperspectral Image) sont présentées sous la forme de cubes tridimensionnels contenant de riches signatures spectrales et des informations spatiales complexes, largement utilisées dans le développement urbain.Baur等,2018), surveillance de l'environnement (Wang等,2016), et l'exploration minière (Siebels等,2020), des domaines tels que. La classification Hsi est l'une des tâches fondamentales et importantes pour mener à bien ces applications, dans le but d'attribuer une étiquette de catégorie unique à chaque pixel en fonction des caractéristiques spatiales et spectrales de Hsi. Les méthodes de classification Hsi comprennent généralement des modèles superficiels et des modèles profonds (Kong等,2024). Parmi ceux - ci, les méthodes peu profondes ont tendance à être difficiles à extraire les caractéristiques spectrales et spatiales complexes du Hsi. Pour ce faire, la méthode d'apprentissage profond est appliquée aux tâches de classification Hsi. Tels que:Hang等(2021)Un sous - réseau d'attention spectrale et un sous - réseau d'attention spatiale ont été construits respectivement en combinant un module d'attention et un réseau de neurones convolutifs CNN (Convolutional Neural Network);Zhang等(2018)Utiliser les CNN et les facteurs de poids de plusieurs régions pour apprendre les interactions contextuelles des Hsi et extraire ainsi des caractéristiques spectrales - spatiales plus discriminantes; En réponse au problème des CNN existants ignorant les informations complémentaires superficielles et profondes,Feng等(2019)En fusionnant plusieurs couches de signatures spatiales - spectrales et en pré - marquant les échantillons à haut niveau de confiance, les problèmes de sur - ajustement du CNN pendant l'entraînement ont été atténués.
Bien que le Deep Learning affiche d'excellentes performances dans les tâches de classification HSI, cela dépend souvent d'un grand nombre d'échantillons étiquetés. Cependant, l'étiquetage des échantillons Hsi nécessite beaucoup de temps et de coûts humains. Par conséquent, comment obtenir une classification Hsi de haute précision avec un petit nombre d'échantillons étiquetés est devenu l'un des points chauds de la recherche dans le domaine de la télédétection ces dernières années.朱传海等(2023)Proposer un réseau jumeau basé sur un espace de probabilité a posteriori taxonomique qui réduit la dépendance à l'échantillon en combinant des informations de probabilité a posteriori taxonomiques sur la couverture de surface.陈杰虎和汪西莉(2022)Utilisez des diagrammes pour modéliser les relations de similarité des images dans les espaces caractéristiques et lissez les caractéristiques des images de même catégorie à l'aide d'opérations de convolution de diagramme pour améliorer l'indexation de zone des caractéristiques des différentes catégories d'images. L'apprentissage par migration offre de nouvelles idées pour résoudre le problème de la rareté des échantillons étiquetés, qui vise à migrer les connaissances acquises à partir de tâches avec suffisamment d'échantillons étiquetés (domaines sources) vers des tâches avec moins d'échantillons étiquetés (domaines cibles). Cependant, en fonction des conditions atmosphériques, de l'humidité du sol, des paramètres du capteur et d'autres facteurs, il existe encore certaines différences de distribution entre les différents Hsi provenant du même capteur, ce qui affecte considérablement les performances du classificateur. Adaptation de domaine en tant que méthode classique d'apprentissage par migration, capable de mapper les données de deux domaines différents mais proches dans le même espace caractéristique, extrayant ainsi les caractéristiques invariantes de domaine des deux domaines et utilisées pour les tâches de classification (Deng等,2019). CommeZhao等(2022)L'information spatiale du Hsi est conservée à l'aide d'une fusion d'ordre fractionnaire, et l'alignement Spectral avec le Hsi est effectué à l'aide de données lidar, et enfin, les différences de distribution des caractéristiques spectrales - spatiales sont réduites par un réseau adaptatif de domaine.周莲等(2024)Proposer un module d'attention Collaborative pour guider le réseau vers l'information ciblée, améliorer les données des échantillons d'entraînement pour augmenter la taille de l'ensemble de données, et enfin construire des stratégies d'entraînement conjointes avec des branches d'apprentissage contrastées conçues pour améliorer la précision de la classification.Yu等(2021)Des réseaux basés sur la densité sont proposés et utilisés pour extraire des caractéristiques spectrales - spatiales discriminantes et réduire les différences de distribution entre les différents domaines à l'aide de l'apprentissage antagoniste.Zhong等(2020)Les distributions de probabilité Edge et conditionnelles des différents domaines sont d'abord adaptées par une méthode d'adaptation conjointe des distributions de probabilité, puis les paramètres du modèle formés sur le domaine source sont migrés vers le domaine cible et affinés.Ganin和Lempitsky(2014)La pensée basée sur l'apprentissage antagoniste propose un réseau antagoniste de domaine, Dann (Domain Adversarial Neural Networks), qui acquiert des caractéristiques d'Invariance de domaine par la confrontation d'un discriminateur de domaine avec un extracteur de caractéristiques. Cependant, l'approche de domaine ci - dessus suppose généralement que le domaine cible a un espace d'étiquetage commun avec le domaine source et ne peut pas classer les nouvelles classes de domaine cible qui ne sont pas vues.
Ces dernières années, un petit échantillon d'apprentissage FSL (few shot Learning) a été proposé et utilisé pour résoudre les problèmes mentionnés ci - dessus. L'apprentissage par petits échantillons est également souvent considéré comme un problème de migration du domaine source vers le domaine cible (Sun等,2019), mais contrairement aux méthodes traditionnelles d'adaptation de domaine, ses domaines source et destination n'ont pas besoin de partager le même espace d'étiquetage. L'apprentissage par petits échantillons est essentiellement une méthode de méta - apprentissage (Wang等,2021), en utilisant des stratégies d'apprentissage basées sur des tâches (méta - tâches) sur le domaine source pour obtenir des connaissances génériques (méta - connaissances), qui aident à classer les domaines cibles avec un ou plusieurs échantillons étiquetés. Plus récemment, l'apprentissage par petits échantillons a également été utilisé pour des tâches de classification d'images hyperspectrales. CommeLiu等(2019)Proposer une méthode de petit échantillon profond dfsl (Deep few shot Learning) en connectant les mécanismes résiduels (He等,2016Le res - 3D - CNN (Residual Three Dimensional convulsive Neural Network) est utilisé pour extraire des signatures spectrales spatiales profondes et apprendre un espace métrique à partir de quatre ensembles de données hyperspectrales de source en combinant un réseau prototype. Dans cet espace métrique, les échantillons des mêmes classes sont proches les uns des autres et les échantillons des différentes classes sont éloignés les uns des autres. En outre, SVM (support vector machine) est utilisé séparément lors des tests.Melgani和Bruzzone,2004) et le classificateur Nearest neighbour (plus proche voisin) font des prédictions sur les données de domaine cible non étiquetées.陈华杰等(2024)Proposer un algorithme d'apprentissage de migration inter - domaines basé sur l'ordre de corrélation des échantillons du domaine source. Les échantillons de domaine cible sont d'abord rétro - incorporés dans la tâche de classification de domaine source, les échantillons de domaine source sont triés par pertinence, puis une stratégie d'apprentissage conjoint auto - supervisé est utilisée pour introduire une branche auxiliaire de prédiction d'angle auto - supervisé dans le réseau de classification de domaine cible.
L'apprentissage par petits échantillons donne de bons résultats de classification avec peu d'échantillons étiquetés du domaine cible, mais suppose implicitement que les échantillons du domaine cible proviennent du même domaine que les échantillons du domaine source. Cependant, il existe souvent de grandes différences de distribution entre les échantillons de domaine source et les échantillons de domaine cible, et même des espaces de catégorie ne se chevauchent pas. En outre,Guo等(2020)Il a été noté qu'une partie de l'apprentissage des petits échantillons était moins efficace dans le traitement des tâches de petits échantillons entre domaines. Par conséquent, comment résoudre les différences de distribution de domaine dans l'apprentissage de petits échantillons devient un défi majeur. En réponse à cette question,Li等(2022)Dcfsl (Deep Cross Domain few shot) est une méthode d'apprentissage à petits échantillons qui utilise l'adaptation conditionnelle au domaine (cdan) Tout en apprenant des méta - connaissances.Long等,2018) réduire les différences de caractérisation entre les deux domaines et utiliser les données hyperspectrales d'un seul domaine source pour effectuer des prédictions sur les 4 autres données de domaine cible. Cependant, un alignement excessif entre domaines peut nuire aux performances d'apprentissage des petits échantillons, et pour résoudre ce problème, un réseau de découplage est utilisé pour découpler les caractéristiques de l'échantillon en Invariants de domaine et caractéristiques spécifiques au domaine. Utilisez uniquement les caractéristiques invariantes du domaine pour les tâches de classification de petits échantillons, en évitant autant que possible l'impact des caractéristiques spécifiques du domaine.
Dans cette optique, afin d'atténuer les problèmes de dégradation des performances de généralisation des modèles causés par les différences de distribution Hsi entre domaines et d'améliorer la précision de la classification des petits échantillons, cet article propose une nouvelle méthode de classification des petits échantillons Hsi entre domaines basée sur le dcpn (disentangled confidence prototype Network). Tout d'abord, l'acquisition des caractéristiques spectrales - spatiales profondes du Hsi à l'aide du CNN résiduel 3D et la séparation fonctionnelle des caractéristiques de profondeur à l'aide d'un réseau de découplage; Ensuite, un échantillon de l'ensemble de requêtes à haut niveau de confiance est filtré et un prototype de catégorie plus fiable est calculé; Enfin, l'utilisation combinée des prototypes de catégorie d'origine avec les prototypes de catégorie de confiance élevée permet une classification plus précise des petits échantillons. Des méthodes telles que l'apprentissage avec de petits échantillons existants ont été validées expérimentalement sur six ensembles de données Hsi accessibles au public afin de fournir une réserve technique efficace pour les défis tels que la rareté des échantillons étiquetés dans la traduction intelligente des images de télédétection et le décalage de domaine.
2 découplage du réseau de prototypes de confiance
Ensemble de données du domaine sourceEnsemble de données du domaine cibleContient respectivementetUne catégorie. L'ensemble de données du domaine cible peut être divisé en ensembles d'échantillons étiquetés selon que l'échantillon possède ou non une étiquetteEt ensembles d'échantillons non étiquetés- Oui.Utilisé pour la méta - formation, tandis que le modèle estLa précision de la classification est le résultat de l'évaluation du dcpn. Cependant,Pas assez pour constituer un ensemble de support et de requêtes pour les tâches de petit échantillon du domaine cible, donc dansTirer 5 échantillons étiquetés par classe et ajouter un bruit gaussien aléatoire pour l'expansion des données Composition- Oui.
Le dcpn se compose de deux parties: le Meta - Training et le Meta - test. Parmi eux, le programme de méta - formation est commeFig. 1Montré. Il se compose principalement de tâches de petit échantillon inter - domaines de domaine source et de tâches de petit échantillon inter - domaines de domaine cible. Introduction avec l'exemple d'une tâche de petit échantillon inter - domaines de domaine source, principalement en 3 étapes:
(1) Utilisation d'échantillons de domaine source pour constituer des méta - tâches, où les méta - tâches sont prises en charge par un ensemble de supportsEt ensembles de requêtesComposition. En outre, l'étiquetage des ensembles de données à partir du domaine cibleSélection aléatoire de plusieurs échantillons pour constituer l'ensemble d'échantillons du domaine cible. extraire séparément les caractéristiques embarquées du Hsi à l'aide de l'extracteur de caractéristiquesEt,et.ensuite, les caractéristiques intégrées sont entrées dans le réseau découplé, extrayant les caractéristiques invariantes du domaine des deux domaines séparémentEt,Et,Et caractéristiques spécifiques au domaineEt,Et,;
(2) Envoyer les caractéristiques invariantes du domaine de l'ensemble de support du domaine source et de l'ensemble de requêtes dans un réseau prototype de confiance pour calculer les pertes d'apprentissage de petits échantillonsSélectionnez un échantillon d'ensemble de requêtes avec un haut niveau de confiance combiné avec le calcul de l'ensemble de support pour obtenir un prototype corrigé. En calculant et en réduisant la distance de type européen du Centre de la catégorie des ensembles de soutien à ce prototype;
(3) envoie les Invariants de domaine et les caractéristiques spécifiques de domaine des domaines source et destination au classificateur de domaine, calcule la perte de confusion de domaineEt perte de discrimination de domainePhases de test telles queFig. 2Montré, tout d'abord, l'extraction avec un extracteur de caractéristiques pré - formé et un réseau de découplageetCaractéristiques invariantes du domaineEt,Et utiliser le classificateur nn après tous les échantillons non étiquetés restantsFaites des prévisions de catégorie.
2.1 extraction des caractéristiques
Les blocs de proximité régionaux de Hsi sont extraits en tant qu'échantillons d'entrée et les pixels sont traités simultanément le long de l'axe spatial et Spectral à l'aide de 3D - CNN, ce qui permet d'extraire les caractéristiques spectrales spatiales plus discriminantes de Hsi. L'ensemble de support du domaine source est
Dans la formule,,Représente le nombre de catégories d'ensembles de soutien,Représente le nombre d'échantillons notés par classe,Est long / large,Représente la dimension spectrale de l'ensemble de données du domaine source.
L'ensemble de requêtes de domaine source est
Dans la formule,Représente le nombre d'échantillons non étiquetés, les échantillons de support set et de Query set ne coïncident pas.
L'ensemble de données du domaine cible est
Dans la formule,,Représente la dimension spectrale des données du domaine cible,Pour partir deNombre d'échantillons de domaine cible tirés au hasard dans.
Pour que les dimensions spectrales des données du domaine source et du domaine cible soient cohérentes, les données des deux domaines sont prétraitées séparément à l'aide de la couche de mappage du domaine source et de la couche de mappage du domaine cible. Où les couches de mappage sont toutes implémentées par 2D - CNN et le processus de mappage est le suivant:
Dans la formule,etCartographier les noyaux convolutifs des couches, respectivement pour les domaines source et destination,Pour les opérations de convolution. Les caractéristiques de la sortie sont alors, dontDimension spectrale unifiée après traitement par la couche de cartographie pour les deux domaines. Par la suite, l'extraction caractéristique de la sortie de la couche de cartographie est réalisée avec un résidu de profondeur 3D - CNN, ce qui conduit à une signature embarquée.Et,et. où la couche de cartographie et le résidu de profondeur 3D - CNN forment ensemble l'extracteur de caractéristiques,Dimensions caractéristiques.
2.2 découplage du réseau
Les différences de distribution qui existent entre les données d'entraînement et les données d'essai peuvent entraîner une diminution de la généralisation des méthodes d'apprentissage pour un petit échantillon. Pour résoudre ce problème, la méthode commune consiste à aligner la distribution des domaines source et destination. Cependant, cette pratique conduit inévitablement à un alignement des caractéristiques spécifiques du domaine. En outre, comme la catégorie de domaine cible ne coïncide pas avec le domaine source, l'alignement des caractéristiques spécifiques du domaine affecte la capacité du modèle à généraliser sur le domaine cible. Ainsi, les caractéristiques spécifiques au domaine dans les caractéristiques peuvent être séparées, en utilisant uniquement les caractéristiques invariantes du domaine pour la classification de petits échantillons, réduisant ainsi les effets négatifs d'un alignement excessif de la distribution du domaine. CommeLiu等(2018)Pour la première fois, une combinaison de méthodes d'adaptation de domaine et d'idées de découplage a permis d'atteindre le but de la migration des connaissances entre domaines en découplant les caractéristiques du domaine source en caractéristiques invariantes du domaine et caractéristiques spécifiques du domaine. Cao et al. (2018) indiquent que les réseaux neuronaux profonds produisent des caractéristiques hautement couplées qui doivent être découplées en différentes caractéristiques potentielles pour les rendre plus explicatives.Fu等(2021)Les caractéristiques potentielles du découplage sont extraites à l'aide de la partie de codage de deux codeurs automatiques variants, et cet article prend la configuration de cet article pour décomposer les caractéristiques profondément intégrées du Hsi en caractéristiques invariantes de domaine et caractéristiques spécifiques de domaine, afin dePar exemple:
1er encodeurPour extraire les caractéristiques invariantes du domaine, dont la formule de calcul est
2ème encodeurPour extraire des caractéristiques spécifiques au domaine, dont la formule de calcul est
Dans la formule,etParamètres des deux codeurs respectivement. Après cette caractéristique découplage du réseau obtient finalement les caractéristiques invariantes de domaine de l'ensemble de support de domaine source, de l'ensemble de requête de domaine source et du domaine de destinationTheEt,Et les caractéristiques spécifiques du domaineEt,Et,- Oui.etLes dimensions des caractéristiques invariantes du domaine et des caractéristiques spécifiques du domaine, respectivement.
2.3 réseau de prototypes de confiance
Utilisation des caractéristiques invariantes du domaineetCalculer la perte de classification d'un petit échantillon, chaque prototype de classe étant la moyenne des caractéristiques de chaque classe d'échantillon de l'ensemble de support, la formule de calcul est la suivante:
Dans la formule,Support pour le domaine source setNombre d'échantillons de classe,Représentée comme étant laPrototype de classe. Prototype réseau Computing Query set SampleDistance entre les prototypes de classe individuels et calculer la distribution de classe pour chaque échantillon de jeu de requête. AlorsAppartient à laLa formule de calcul des probabilités pour une classe est la suivante:
Dans la formule,Formule de calcul de la distance de type européen,Pour le nombre total de catégories de l'ensemble de soutien. Selon l'échantillon de l'ensemble de requêtesEt des étiquettes authentiquesProbabilité logarithmique négative, la perte de classification de tous les échantillons de l'ensemble de requêtes est exprimée en
La classification des petits échantillons repose sur les échantillons notés des ensembles de support. Par conséquent, il peut y avoir un biais dans les prototypes de catégorie calculés lorsque les échantillons de notation sont rares. Par conséquent, cet article utilise un réseau de prototypage de confiance pour attribuer des poids aux échantillons de jeu de requêtes non étiquetés afin de recalculer les prototypes de cette classe. Alors lePrototype modifié de la classeLe processus de calcul est le suivant:
Dans la formule,Le niveau de confiance de l'échantillon représentant l'ensemble de support est toujours de 1.Montrer le soutien episodeEnsemble d'échantillons de classes.Représentant un échantillon d'ensemble de requêtes avec un haut niveau de confiance, les critères de sélection sont les suivants:
Dans la formule,Pour le seuil de confiance, seuls les échantillons de l'ensemble de requêtes dont le niveau de confiance est supérieur à ce seuil participent式(8)Calcul, si une classe n'a pas d'échantillon de confiance élevée, continuer à utiliser式(5)Prototype dans. Calcule la somme des distances ohrenheit entre les prototypes alignés de toutes les classes et les prototypes de l'ensemble de support:
2.4 classification des domaines
Classificateur de domaineMappez les caractéristiques en scores sur les deux domaines et l'une des tâches de classification de domaine consiste à confondre le classificateur de domaine avec les caractéristiques invariantes du domaine, en calculant les pertes de confusion de domaine:
Dans la formule,Pour le paramètre classificateur de domaine,Et,etÉtiquettes invariantes de domaine pour l'ensemble de support de domaine source, l'ensemble de requête de domaine source et l'échantillon de domaine cible, respectivement, dont la valeur de chaque ligne est définie sur,La fonction est calculée pour la perte de divergence Kullback - Leibler. Classificateur de domaine une autre tâche vise à rendre les caractéristiques spécifiques du domaine reconnaissables par le classificateur de domaine, alors la formule de calcul de la perte discriminante de domaine est la suivante:
Dans la formule,Et,etDes étiquettes discriminantes de domaine respectivement pour l'ensemble de support de domaine source, l'ensemble de requête de domaine source et l'échantillon de domaine cible,etToutes les valeurs sont mises à 1,Toutes les valeurs sont 0,Pour la fonction entropie croisée.
2.5 fonction Objectif
La fonction objectif total de la tâche petit échantillon du domaine source est
Dans la formule,Et,Et,etEst le coefficient des pertes individuelles,Représente la perte totale de tâches de petit échantillon entre domaines du domaine source. Ensuite, la tâche de petit échantillon du domaine de destination est similaire au domaine source, la fonction de destination totale du dcpn est
Fonction objectif total式(13)Et (14) sont mis à jour alternativement jusqu'à ce que le modèle converge.
3 configuration expérimentale et analyse des résultats
3.1 Introduction aux ensembles de données
Pour vérifier la validité de la méthode dcpn, sélectionnez 6 ensembles de données Hsi exposés, y compris UP(University of Pavia)、PC(Pavia Center)、IP(Salinas、Indian Pines)、Chikusei Et (whu - Hi - Longkou) LK pour les expériences. Sélectionnez Chikusei avec le plus grand nombre de catégories d'objets comme jeu de données de domaine source et les 5 autres comme jeu de test de domaine cible (Li等,2022). L'ensemble de données Chikusei a été capturé le 29 juillet 2014 à l'aide du capteur d'imagerie headwall hyperspec - vnir - C de Tsukiji, au Japon, couvrant les zones urbaines et agricoles et contenant 19 Catégories d'objets et 128 bandes. Longueur d'onde 343 - 1018 nm, totalUn pixel, la résolution spatiale est de 2,5 m, les catégories détaillées et les informations d'échantillon telles queFig. 3Montré.
L'ensemble de données up a été capturé par le capteur Rosis à l'Université de Pavie, en Italie, avecUn pixel avec une résolution spatiale de 1,3 M, après élimination du bruit, de l'atmosphère et de l'absorption de l'eau et des bandes superposées, 103 bandes restantes sont utilisées pour l'expérience, avec des longueurs d'onde de 430 à 860 nm, contenant 9 catégories d'objets, des catégories détaillées et des informations d'échantillon telles queFig. 4Montré.
L'ensemble de données PC a été capturé par le capteur Rosis d'une ville du nord de l'ItalieComposition de pixels, résolution spatiale de 1,3 M, contient 102 bandes, longueur d'onde de 430 à 806 nm, jeu de données PC contient 9 catégories d'objets, section PC d'interception expérimentale pour l'expérience, catégories détaillées et informations d'échantillon telles queFig. 5Montré.
L'ensemble de données IP a été collecté en 1992 par le spectrographe AVIRIS sur des clichés du Nord - ouest de l'Indiana, aux États - Unis. Après élimination des bandes bruitées, l'ensemble de données IP comprend 200 bandes de longueur d'onde de 40 à 2500 nm, dontUn pixel avec une résolution spatiale de 20 M. cette image est principalement utilisée pour la recherche pertinente en agriculture et comprend un total de 16 catégories, des catégories détaillées et des informations d'échantillon telles queFig. 6Montré.
L'ensemble de données Salinas a été capturé à l'aide du capteur AVIRIS dans la vallée de Salinas, en Californie, aux États - Unis, couvrant un spectre de 400 à 2500 nm.Pixels avec un total de 204 bandes pour la classification, cet ensemble de données contient 16 objets avec une résolution spatiale de 3,7 M, des catégories détaillées et des informations d'échantillon telles queFig. 7Montré.
Ensemble de données LK, capturé par une caméra hyperspectrale embarquée sur une zone agricole de la ville de Longkou, Province du Hubei. Cet ensemble de données contient 270 bandes spectrales,Un total de 9 catégories de pixels avec une résolution spatiale de 0463 M, des catégories détaillées et des informations d'échantillon telles queFig. 8Montré.
3.2 configuration expérimentale
Pour vérifier la validité de la méthode dcpn, sélectionnez 6 ensembles de données Hsi réels. Sélectionnez Chikusei avec le plus grand nombre de catégories d'objets comme domaine source et les 5 ensembles de données restants comme domaine cible. Toutes les expériences ont été réalisées sur des ordinateurs équipés d’un processeur Intel Core i7 - 6850k, d’une nVIDIA GeForce GTX 1080 TI et de 32 go de RAM, en utilisant le Framework pytorch pour Python 3.6 et la plate - forme MATLAB 2017a. Quatre indicateurs de performance ont été sélectionnés pour l'expérience: précision de classification par catégorie, précision de classification globale (OA), coefficient de Kappa et précision de classification moyenne (aa). Chaque expérience a été réalisée indépendamment 10 fois et moyenne.
7 Méthodes de classification ont été sélectionnées pour la comparaison, la méthode de classification superficielle (SVM), la méthode d'apprentissage profond (res - 3D - CNN), la méthode d'adaptation de domaine (Dann et cdan), la méthode d'apprentissage par petits échantillons (dfsl + SVM et dfsl + nn) et la méthode d'apprentissage par petits échantillons inter - domaines (dcfsl). Pour SVM et res - 3D - CNN, utilisezEn tant qu'ensembles d'entraînement, dfsl + SVM et dfsl + nn se réfèrent à la configuration de dfsl, constituent Chikusei, Houston, Botswana et Kennedy Space Center comme domaines sources, délaissant les catégories de moins de 200 échantillons et sélectionnant 100 bandes pour garantir la cohérence dimensionnelle des données d'entrée. Pour les méthodes d'adaptation de domaine Dann et cdan, le domaine source est aligné sur le dcpn etEn tant qu'échantillon sans étiquette de domaine cible pour l'alignement de distribution à deux domaines.
Prenons par exemple la tâche de petit échantillon inter - domaines du domaine source, pour garantir un nombre suffisant d'échantillons, abandonnerIl y a des classes avec des échantillons étiquetés inférieurs à 200 et, selon le paradigme du méta - apprentissage, à chaque entraînementTirage aléatoire moyenClasses, chaque classe tirée au hasardUn échantillon comme ensemble de support de domaine sourceEt tiré au hasard dans le reste de l'échantillonUn échantillon comme ensemble de requête de domaine source. Ordre,,. À partir deParmi 128 échantillons choisis aléatoirement pour constituer un ensemble de données sans étiquette pour le domaine cible. La longueur et la largeur Hsi de l'entrée sont 9. Les paramètres de petit échantillon inter - domaines du domaine cible sont les mêmes que ci - dessus.
Structure de réseau d'extraction de caractéristiques telle queFig. 9Représenté, il est composé d'une couche de mappage, de deux blocs résiduels, de deux couches de Pooling maximal et d'une couche de volume intégral. Conv2d est la couche de cartographie 2D - CNN, dont le but est de faire correspondre les dimensions spectrales des domaines source et cible à la même dimension. Cartographier le noyau convolutif de la coucheEt,Les paramètres sont déterminés par les données d'entrée. Conv signifie que la taille estLa couche de volume 3D, Pooling signifie la couche de Pooling maximale, avec des pas de. la sortie estEt,etLe réseau de découplage est constitué d'un codeur à 2 couches, FC1 pour extraire les caractéristiques génériques, fc21a et fc22a pour extraire les caractéristiques invariantes du domaine et fc21b et fc22b pour extraire les caractéristiques spécifiques du domaine. Un classificateur de domaine est constitué d'une couche de connexion complète et Dropout. Sélectionnez Adam comme optimiseur et le nombre d'itérations d'entraînement est de 10 000.
Autres paramètres hyper tels queTable 1Montré.
Table 1 Hyperparameter settings on different datasets
| 数据集 | | | | 学习率 | | | | |
|---|
| UP | 100 | 80 | 40 | 0.010 | 0.3 | 1.0 | 1.0 | 1.0 |
| PC | 100 | 80 | 40 | 0.010 | 0.2 | 1.0 | 1.0 | 1.0 |
| IP | 90 | 80 | 40 | 0.003 | 0.3 | 1.0 | 1.0 | 1.0 |
| Salinas | 120 | 128 | 32 | 0.003 | 0.3 | 0.8 | 1.0 | 0.6 |
| LK | 60 | 100 | 50 | 0.010 | 0.0 | 0.5 | 0.1 | 0.1 |
3.3 résultats expérimentaux et analyses
Les tableaux 2 à 6 présentent les résultats comparatifs des performances de classification des classificateurs SVM, res - 3D - CNN, Dann, cdan, dfsl + SVM, dfsl + nn et dcfsl (méthode décrite ici) sur 5 ensembles de données, respectivement:
(1) les méthodes d'adaptation de domaine Dann et cdan classent certaines catégories avec moins de précision que SVM, ce qui indique que pour les domaines source et cible où les catégories ne coïncident pas, un alignement excessif des caractéristiques peut réduire la précision de la classification;
(2) en cas de pénurie d'échantillons étiquetés dans le domaine cible, la stratégie d'apprentissage des tâches utilisée dans la méthode d'apprentissage à petit échantillon peut aider le modèle à acquérir des méta - connaissances génériques générales, ce qui lui permet d'obtenir une plus grande précision dans l'identification de nouvelles classes que d'autres méthodes;
(3) La méthode d'apprentissage inter - domaines à petit échantillon dcfsl permet d'obtenir une plus grande précision de classification sur le domaine cible par rapport à la méthode d'apprentissage à petit échantillon. En effet, la méthode prend en compte les différences de distribution entre les domaines source et cible, en rapprochant les distributions des domaines source et cible tout en apprenant la méta - connaissance que le domaine source peut migrer, acquérant ainsi un modèle plus généralisé;
(4) dcpn a obtenu l'OA la plus élevée sur tous les ensembles de données en raison de sa capacité à découpler les caractéristiques de profondeur extraites du réseau profond pour obtenir des caractéristiques invariantes et spécifiques au domaine, ainsi qu'à réduire l'écart de distribution entre les domaines source et cible en combinaison avec un classificateur de domaine. Dans le même temps, le dcpn calcule les prototypes de correction en filtrant les échantillons de l'ensemble de requêtes avec un niveau de confiance élevé, de sorte que les prototypes de correction et les prototypes de l'ensemble de support sont constamment rapprochés au cours de la formation, évitant ainsi dans une certaine mesure les problèmes de désalignement prédictif des échantillons de l'ensemble de requêtes en raison d'un nombre insuffisant d'échantillons étiquetés de l'ensemble de support;
(5) Le dcpn prend beaucoup de temps sur tous les ensembles de données, principalement en raison de: d'une part, l'utilisation de la convolution 3D par dcpn apporte une plus grande complexité de calcul tout en augmentant la capacité du réseau à extraire les signatures spectrales - vides Hsi brutes; D'autre part, le cadre de méta - apprentissage comprend la formation et les tests inter - tâches, ainsi que la formation et les tests intra - tâches. Un grand nombre d'échantillons de test sur les tâches d'entraînement a conduit à un dcpn plus long.
Table 2 Comparison of classification results by different methods on the UP dataset
| 类别 | SVM | Res-3D-CNN | DANN | CDAN | DFSL+SVM | DFSL+NN | DCFSL | DCPN |
|---|
| 柏油路面/% | 61.94 | 99.90 | 73.12 | 75.45 | | 80.95 | 73.18 | 73.32 |
| 草地/% | 55.84 | | 69.60 | 90.36 | 66.41 | 82.17 | 89.19 | 94.79 |
| 碎石路面/% | | 49.95 | 40.88 | 41.45 | 50.53 | 50.57 | 52.20 | 55.25 |
| 树木/% | 85.88 | 84.67 | 91.83 | 90.19 | | 91.73 | 98.20 | 88.95 |
| 金属板屋顶/% | 99.10 | 98.58 | 86.64 | 97.76 | | | 98.51 | 100.00 |
| 裸地/% | 63.08 | 21.54 | 56.35 | 86.00 | 72.47 | 63.81 | | 64.51 |
| 沥青/% | 87.77 | 81.21 | 56.45 | 75.09 | 78.04 | | 78.94 | 79.85 |
| 砖/% | 71.63 | 46.59 | 69.92 | 70.17 | 66.06 | 57.98 | | 86.65 |
| 阴影/% | 100.00 | 94.37 | 100.00 | 97.88 | | 99.79 | 99.68 | 99.47 |
| OA/% | 64.44 | 70.15 | 69.60 | 73.30 | 73.98 | 77.83 | | 84.65 |
| AA/% | 75.61 | 68.66 | 71.64 | 71.02 | 79.54 | 78.82 | 82.98 | |
| Kappa | 0.5600 | 0.5969 | 0.6200 | 0.6400 | 0.6700 | 0.7100 | | 0.8000 |
| 耗时/s | 5.31 | | 939.03 | 997.31 | 1976.14 | 1991.89 | 1357.80 | 2118.96 |
Table 3 Comparison of classification results by different methods on the PC dataset
| 类别 | SVM | Res-3D-CNN | DANN | CDAN | DFSL+SVM | DFSL+NN | DCFSL | DCPN |
|---|
| 水体/% | 100.00 | | 98.11 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 |
| 树木/% | 71.93 | 91.25 | 89.73 | 94.23 | | 92.52 | 90.49 | 90.49 |
| 草地/% | 76.43 | 67.52 | 42.59 | 53.09 | 80.41 | 81.54 | | 96.93 |
| 砖瓦地/% | 98.03 | 96.96 | 76.25 | 95.74 | | 99.95 | 99.25 | 98.78 |
| 裸露土地/% | 87.57 | 83.65 | 74.22 | 76.09 | 86.00 | 87.05 | | 99.30 |
| 草地/% | 95.20 | 97.26 | 93.08 | 94.99 | 95.75 | 94.26 | | 99.01 |
| 沥青路面/% | 90.66 | 95.22 | 60.27 | 90.71 | 97.41 | 97.97 | | 97.47 |
| 砖块/% | 88.14 | 99.28 | 25.06 | 52.23 | 47.48 | 62.03 | 98.85 | |
| 阴影/% | | 99.70 | 92.20 | 99.46 | 98.98 | 99.07 | 99.76 | 100.00 |
| OA/% | 95.23 | 96.03 | 86.13 | 92.05 | 94.41 | 95.19 | | 99.13 |
| AA/% | 89.77 | 92.30 | 72.39 | 84.06 | 88.75 | 90.56 | | 97.88 |
| Kappa | 0.9287 | 0.9401 | 0.7933 | 0.8811 | 0.9161 | 0.9278 | | 0.9870 |
| 耗时/s | 4.63 | | 1257.74 | 1309.38 | 2262.87 | 2302.59 | 1463.87 | 2379.79 |
Table 4 Comparison of classification results by different methods on the IP dataset
| 类别 | SVM | Res-3D-CNN | DANN | CDAN | DFSL+SVM | DFSL+NN | DCFSL | DCPN |
|---|
| 苜蓿/% | 68.29 | 87.80 | 39.02 | 97.56 | | | 97.56 | 97.56 |
| 非犁耕玉米地/% | | 14.97 | 6.39 | 27.48 | 22.56 | 26.07 | 22.35 | 45.82 |
| 少犁耕玉米地/% | 43.15 | 25.58 | 26.18 | 27.76 | 35.88 | 38.42 | 54.18 | |
| 玉米地/% | 43.53 | 33.19 | 42.24 | 53.45 | 78.02 | 87.93 | | 83.19 |
| 草地/牧地/% | 76.15 | 51.88 | 55.65 | 60.25 | 74.27 | 83.26 | 75.31 | |
| 草地/树木/% | 75.72 | | 50.07 | 85.93 | 94.62 | 88.96 | | 89.52 |
| 草地/修剪过的牧地/% | | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 |
| 干草堆/% | 73.78 | 81.40 | 90.06 | 97.46 | 94.29 | 94.93 | 92.39 | |
| 燕麦/% | | | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 |
| 非犁耕的大豆地/% | 44.57 | 57.70 | 54.19 | | 56.26 | 61.63 | 54.40 | 65.25 |
| 少犁耕的大豆地/% | 47.43 | 58.24 | 38.65 | 28.82 | 65.06 | 64.53 | | 76.29 |
| 清理过的大豆地/% | 31.29 | 38.61 | 37.59 | 31.29 | 34.69 | 34.52 | 50.34 | |
| 小麦/% | 92.00 | 98.00 | 96.50 | | 97.50 | 98.50 | 100.00 | 95.50 |
| 森林/% | 42.29 | 70.56 | 73.20 | 67.22 | 85.95 | 68.33 | 85.16 | |
| 建筑/草地/树木/机器/% | 23.62 | 27.30 | 57.22 | 54.86 | | 67.19 | 79.79 | 62.47 |
| 石钢塔/% | 84.09 | 96.59 | 94.32 | 88.64 | 100.00 | 96.59 | | |
| OA/% | 50.77 | 52.56 | 45.43 | 49.31 | 62.47 | 61.36 | | 69.92 |
| AA/% | 61.65 | 64.07 | 39.45 | 67.62 | 75.53 | 75.38 | | 78.83 |
| Kappa | 0.4473 | 0.4689 | 0.6007 | 0.4383 | 0.5758 | 0.5682 | | 0.6574 |
| 耗时/s | 1.18 | | 706.47 | 714.87 | 1898.06 | 1902.09 | 2240.70 | 5465.74 |
Table 5 Comparison of classification results by different methods on the Salinas dataset
| 类别 | SVM | Res-3D-CNN | DANN | CDAN | DFSL+SVM | DFSL+NN | DCFSL | DCPN |
|---|
| 西兰花-幼苗期1/% | | 87.80 | 98.35 | 95.96 | 94.91 | 98.25 | 100.00 | 100.00 |
| 西兰花-幼苗期2/% | 98.90 | 14.97 | 96.35 | 90.38 | 99.62 | 98.23 | | 99.81 |
| 休耕地/% | 78.59 | 25.58 | 37.85 | 78.44 | 88.33 | 90.92 | | 97.46 |
| 休耕地-粗犁/% | 98.63 | 33.19 | 100.00 | 99.71 | 99.42 | | | 99.78 |
| 休耕地-平整/% | 98.02 | 51.88 | 88.25 | | 93.04 | 94.09 | 94.46 | 94.20 |
| 残茬地/% | 97.27 | 89.93 | 99.34 | | 99.49 | 100.00 | 100.00 | 100.00 |
| 芹菜/% | 99.05 | 100.00 | 97.82 | 95.75 | 99.22 | 99.55 | 99.05 | |
| 葡萄-未整形/% | 60.78 | 81.40 | 14.26 | 56.54 | 52.09 | 71.97 | 66.97 | |
| 葡萄园-裸地/发育土壤/% | 98.61 | 93.33 | 99.08 | | 91.59 | 88.74 | 98.69 | 99.90 |
| 玉米-衰老期伴生杂草/% | 82.19 | 57.70 | 22.36 | 65.84 | 40.02 | 87.81 | | 83.50 |
| 罗马生菜-生长4周/% | 91.72 | 58.24 | 68.96 | 83.35 | 97.65 | 97.08 | 99.72 | |
| 罗马生菜-生长5周/% | 100.00 | 38.61 | 85.43 | 91.10 | | 99.12 | 100.00 | 99.27 |
| 罗马生菜-生长6周/% | 98.68 | 98.00 | 97.04 | 97.15 | 98.68 | 99.78 | | 98.02 |
| 罗马生菜-生长7周/% | 88.92 | 70.56 | 98.31 | 94.37 | 98.03 | 98.22 | 99.34 | |
| 葡萄园-自然生长/% | 37.56 | 27.30 | | 61.79 | 85.21 | 74.38 | 75.35 | 77.35 |
| 葡萄园-垂直架式/% | 91.84 | 96.59 | 83.96 | 86.57 | 89.62 | 97.23 | 100.00 | |
| OA/% | 80.22 | 82.51 | 69.90 | 80.22 | 81.88 | 87.62 | | 90.35 |
| AA/% | 88.71 | 91.72 | 79.38 | 78.10 | 80.03 | 93.45 | | 95.03 |
| Kappa | 0.7809 | 0.8065 | 0.6709 | 0.8690 | | 0.8628 | 0.8702 | 0.8929 |
| 耗时/s | 6.47 | | 735.72 | 757.09 | 1976.79 | 2030.75 | 2338.01 | 5372.43 |
Table 6 Comparison of classification results by different methods on the LK dataset
| 类别 | SVM | Res-3D-CNN | DANN | CDAN | DFSL+SVM | DFSL+NN | DCFSL | DCPN |
|---|
| 玉米/% | 86.39 | 98.67 | 94.20 | | 97.42 | 98.00 | 99.93 | 98.81 |
| 棉花/% | 42.68 | 93.56 | 39.46 | 26.97 | 92.39 | 72.17 | | 98.29 |
| 芝麻/% | 73.40 | 11.43 | | 84.57 | 77.36 | 78.12 | 93.03 | 82.85 |
| 阔叶大豆/% | 64.58 | 89.37 | 62.40 | 55.10 | 70.15 | 75.20 | 81.58 | |
| 窄叶大豆/% | 54.97 | 89.56 | 68.55 | 75.95 | 77.23 | | 98.46 | 95.88 |
| 大米/% | 85.80 | 83.12 | 72.37 | 79.63 | | 92.39 | 95.66 | 91.91 |
| 水体/% | 99.95 | 99.97 | | | 98.34 | 99.78 | | 99.94 |
| 道路和房屋/% | 49.28 | 50.32 | 35.82 | 64.02 | | 66.64 | 94.41 | 82.68 |
| 混合杂草/% | 62.88 | 63.73 | 63.11 | 49.75 | | 67.94 | 90.95 | 72.32 |
| OA/% | 79.55 | 91.06 | 79.32 | 77.54 | 87.49 | 87.97 | | 93.85 |
| AA/% | 68.88 | 75.52 | 69.32 | 67.26 | 86.51 | 82.96 | 94.66 | |
| Kappa | 0.7419 | 0.8829 | 73.92 | 0.7180 | 0.8414 | 0.8458 | | 0.9199 |
| 耗时/s | 12.86 | | 2335.09 | 2411.93 | 2338.78 | 2407.39 | 1677.83 | 2629.08 |
Pour une comparaison plus intuitive des effets de classification des différentes méthodes de classification sur chaque ensemble de données, figureFig. 10–Fig. 14Diagramme d'effet de classification sur différents ensembles de données. Comme on le sait, le dcpn proposé permet d'obtenir des rendus taxonomiques plus fluides et plus détaillés sur tous les ensembles de données.
Prenez par exemple l'ensemble de données Indian Pines, commeFig. 12Montré. Par rapport à d'autres méthodes, le dcpn est caractérisé par des erreurs de notation sur quelques catégories (par exemple, les forêts, etc.), résultant d'une sélection hyperparamétrique non optimale du dcpn. Il est bien connu que la recherche hyperparamétrique optimale basée sur la méthode DL est difficile à mettre en œuvre, tandis que dcpn ajoute une perte de mélange de domaine, une perte de discrimination de domaine et une perte de distance entre les prototypes d'alignement et les prototypes d'ensemble de support, en plus des objectifs d'apprentissage dcfsl, ce qui introduit également des hyperparamètres supplémentaires tout en améliorant la capacité de discrimination du modèle par rapport à la capacité de migration. Néanmoins, le dcpn est toujours en mesure d'obtenir des résultats de classification similaires ou supérieurs à ceux des autres méthodes dans la plupart des catégories. Si d'autres méthodes peuvent diviser par erreur plus de champs de soja défrichés en champs de soja moins labourés et en champs de soja non labourés; Diviser par erreur plus de champs de soja peu labourés en champs de maïs non labourés; Diviser par erreur plus de prairies / arbres en meules et forêts; Divisez par erreur plus de champs de maïs non labourés, moins de champs de maïs labourés, des champs de soja non labourés et des champs de soja défrichés en champs de soja moins labourés. En outre, l'utilisation du dcpn a permis d'obtenir des résultats de classification nettement supérieurs à ceux d'autres méthodes comparatives dans des catégories telles que les prairies sur l'ensemble de données up, les vignobles sur l'ensemble de données Salinas - sol nu / sol en développement, le soja à feuilles larges sur l'ensemble de données LK.
En outre, cet article organise des expériences d'ablation pour vérifier l'effet des différents composants du dcpn sur les performances taxonomiques, telles queTable 7Montré. ParTable 7Peut savoir:
Table 7 Comparison of OA on the five datasets in ablation studies of different loss functions
| 数据集 | DCPN(w/ FSL) | DCPN(w/FSL and FC) | DCPN(w/FSL and FS) | DCPN |
|---|
| UP | 82.52 | 80.50 | 81.03 | 83.49 |
| PC | 97.13 | 97.71 | 97.71 | 98.66 |
| IP | 66.57 | 68.08 | 68.59 | 69.08 |
| Salinas | 87.96 | 88.40 | 89.57 | 91.46 |
| LK | 93.79 | 92.68 | 91.78 | 93.85 |
La méthode dcpn a obtenu l'OA la plus élevée sur tous les ensembles de données par rapport à plusieurs autres scénarios. D'une part, dcpn a obtenu un mélange de caractéristiques de différents domaines sur l'espace de caractéristiques invariantes du domaine construit et une différenciation des caractéristiques sur l'espace de caractéristiques spécifiques du domaine à l'aide de pertes FC et FS, ce qui a permis d'atteindre le découplage des caractéristiques et l'objectif d'aligner uniquement les caractéristiques invariantes du domaine, ce qui a atténué les problèmes de migration négative résultant de l'alignement des caractéristiques spécifiques du domaine; D'autre part, en minimisantL'alignement entre les prototypes de catégorie d'origine et les prototypes de catégorie à haut niveau de confiance est réalisé, ce qui atténue le problème de la réduction de la précision de la classification due au décalage des prototypes de catégorie.
3.4 hyperparamètresetAnalyse des effets sur la précision de la classification
Pour valider les hyperparamètresEt,Impact sur la performance de la classification dcpn avec des expériences d'analyse paramétrique sur 5 ensembles de données HSI, avec des résultats tels queFig. 15Montré. Visible:
(1) trop grandeImplique un rapprochement excessif des prototypes modifiés et du Centre de catégorie de l'ensemble de soutien pendant la formation; Trop petitCela indique que les ensembles de requêtes sont classés principalement en fonction du Centre de catégories d'ensembles de support pendant la formation. Des valeurs trop grandes ou trop petites peuvent entraîner une baisse de l'OA;
(2) sur tous les ensembles de données, avecL'augmentation de l'OA montre approximativement une tendance à la hausse puis à la baisse. C'est parce que, trop petitLa prise de valeur entraîne un apprentissage insuffisant des méta - connaissances sur le domaine source, trop grandIl en résulte un sur - ajustement du modèle au domaine source.
Variety, la plage de paramètre recommandée est,- Oui.
4 Conclusion
En réponse au problème de la dégradation de la précision de la classification causée par la difficulté de l'apprentissage par petits échantillons basé sur le méta - apprentissage à répondre efficacement aux différences de division de domaine au cours de la phase de formation, et au problème de la dégradation des performances de classification causée par des prédictions inexactes de prototypes de catégories dans un réseau de prototypes, cet article propose une méthode de classification inter - domaines de petits échantillons d'images hyperspectrales basée sur un réseau de prototypes de confiance découplés. Les principales conclusions sont les suivantes: (1) Utiliser un réseau découplé pour obtenir des caractéristiques non invariantes du domaine et des caractéristiques spécifiques du domaine, en n'effectuant que de petites tâches de classification d'échantillons des caractéristiques invariantes du domaine, réduisant ainsi les effets négatifs des caractéristiques spécifiques du domaine; (2) proposer un réseau de prototypes de confiance qui attribue un poids correspondant aux échantillons non étiquetés de l'ensemble de requêtes afin de recalculer les prototypes pour chaque catégorie et de collaborer avec le Centre de catégorie d'échantillon de l'ensemble de support original pour effectuer conjointement une tâche de classification de haute qualité des petits échantillons. Les résultats expérimentaux sur des ensembles de données Hsi réels montrent que l'utilisation de la méthode présentée ici permet d'obtenir une plus grande précision de classification inter - domaines, ainsi que des résultats de classification plus lisses et plus détaillés. Étant donné que les images hyperspectrales acquises sont souvent influencées par des facteurs tels que les conditions atmosphériques, l'équipement d'acquisition, etc., sur la base de la méthode de cet article, comment obtenir des caractéristiques génériques et spécifiques au domaine plus robustes est une question qui mérite d'être explorée.