1 Introducción
La imagen hiperespectral HSI (hyperspectral image) se presenta en forma de cubo tridimensional, contiene características espectrales ricas e información espacial compleja, y es ampliamente utilizada en el desarrollo urbano.Baur等,2018) vigilancia ambientalWang等,2016) y exploración de minerales..Siebels等,2020) y otros campos. La clasificación HSI es una de las tareas básicas e importantes para llevar a cabo estas aplicaciones, con el objetivo de asignar etiquetas de categoría únicas a cada píxel en función de las características espaciales y espectrales del hsi. Los métodos de clasificación HSI suelen incluir modelos poco profundos y modelos profundos..Kong等,2024). Entre ellos, los métodos poco profundos a menudo son difíciles de extraer las complejas características espectrales y espaciales del hsi. Con este fin, se aplica el método de aprendizaje profundo a las tareas de clasificación hsi. Por ejemplo:Hang等(2021)La subred de atención espectral y la subred de atención espacial se construyen combinando el módulo de atención y la red neuronal de convolución CNN (red neuronal volátil), respectivamente;Zhang等(2018)Utilizando CNN y factores de peso de varias regiones, se aprende la información de interacción contextual del hsi, extrayendo así características espectrales y espaciales más discriminatorias; En respuesta al problema de que las CNN existentes ignoran la información complementaria superficial y profunda,Feng等(2019)Al fusionar las características espaciales y espectrales de varias capas y preetiquetar las muestras de alta confianza, se alivia el problema del Sobreajuste de CNN durante el entrenamiento.
Aunque el aprendizaje profundo ha demostrado un excelente rendimiento en las tareas de clasificación hsi, a menudo depende de un gran número de muestras de etiquetado. Sin embargo, etiquetar las muestras HSI requiere mucho tiempo y costos humanos. Por lo tanto, cómo utilizar un pequeño número de muestras marcadas para lograr una clasificación HSI de alta precisión se ha convertido en uno de los puntos calientes de investigación en el campo de la teleobservación en los últimos años.朱传海等(2023)Se propone una red gemela basada en el espacio de probabilidad posterior a la clasificación, que reduce la Dependencia de las muestras combinando la información de probabilidad posterior a la clasificación de la cubierta superficial.陈杰虎和汪西莉(2022)Se utiliza un gráfico para modelar la relación de similitud de las imágenes en el espacio de características y una operación de convolución gráfica para suavizar las características de la misma categoría de imágenes para mejorar la diferenciación de las características de las diferentes categorías de imágenes. El aprendizaje de migración proporciona una nueva idea para resolver el problema de la escasez de muestras de etiquetado, que tiene como objetivo migrar el conocimiento aprendido de las tareas con muestras de etiquetado suficientes (dominio fuente) a las tareas con menos muestras de etiquetado (dominio objetivo). Sin embargo, debido a las condiciones atmosféricas, la humedad del suelo, los parámetros del sensor y otros factores, incluso los diferentes HSI del mismo sensor todavía tienen ciertas diferencias de distribución, lo que afecta en gran medida el rendimiento del clasificador. La adaptación de dominio, como método clásico de aprendizaje migratorio, permite mapear datos de dos campos diferentes pero similares al mismo espacio característico, extrayendo así características invariantes de dominio de dos campos y utilizándolos para tareas de clasificación..Deng等,2019). comoZhao等(2022)La información espacial de HSI se conserva mediante fusión de orden decimal, y los datos de radar láser se comparan espectralmente con hsi, y finalmente se reducen las diferencias de distribución de las características espectrales y espaciales a través de redes adaptativas de dominio.周莲等(2024)Se propone un módulo de atención colaborativa para guiar la información de los objetivos de atención de la red y mejorar los datos de las muestras de entrenamiento para ampliar el tamaño del conjunto de datos. finalmente, se construye una estrategia de entrenamiento conjunto a través de la rama de aprendizaje comparativo diseñada para mejorar la precisión de la clasificación.Yu等(2021)Se propone una red basada en la densidad y se utiliza para extraer características espectrales - espaciales discriminatorias y reducir las diferencias de distribución entre diferentes campos con la ayuda del aprendizaje de confrontación.Zhong等(2020)En primer lugar, se adapta la distribución de probabilidad de borde y la distribución de probabilidad condicional en diferentes campos a través del método adaptativo de distribución de probabilidad conjunta, y luego se migran los parámetros del modelo entrenados en el dominio fuente al dominio objetivo y se ajustan bien.Ganin和Lempitsky(2014)Sobre la base de la idea del aprendizaje de confrontación, se propone una red de confrontación de campo Dann (red neuronal de confrontación de dominio), que obtiene características inmutables de campo a través de la confrontación entre el discriminador de campo y el extractor de características. Sin embargo, los métodos de dominio anteriores generalmente asumen que el dominio objetivo y el dominio fuente tienen un espacio de etiqueta común y no pueden clasificar nuevas categorías de dominio objetivo no vistas.
En los últimos años, el aprendizaje de muestras pequeñas FSL (few show learning) se ha planteado y utilizado para resolver los problemas anteriores. El aprendizaje de muestras pequeñas también se considera generalmente un problema de migración del dominio de origen al dominio de destino.Sun等,2019), pero a diferencia de los métodos tradicionales de adaptación de dominio, sus dominios de origen y destino no necesitan compartir el mismo espacio de etiqueta. El aprendizaje de muestras pequeñas es esencialmente un método de meta - APRENDIZAJE..Wang等,2021), al utilizar estrategias de aprendizaje basadas en tareas (metatareas) en el dominio fuente para obtener conocimientos generales (metaconocimientos), se ayuda a clasificar el dominio objetivo con solo una o varias muestras marcadas. Recientemente, el aprendizaje de muestras pequeñas también se ha utilizado en tareas de clasificación de imágenes hiperespectrales. comoLiu等(2019)Se propone el método de muestra pequeña profunda dfsl (deep few show learning), mediante el mecanismo de conexión residual..He等,2016) la introducción de 3D - CNN para formar una red de convolución residual tridimensional profunda res - 3D - CNN (red neuronal evolutiva tridimensional virtual) para extraer características espectrales espaciales profundas y aprender un Espacio métrico de cuatro conjuntos de datos hiperespectrales de dominio fuente mediante la combinación de redes prototipo. En este espacio métrico, las muestras similares se acercan entre sí y las muestras de diferentes categorías se alejan entre sí. Además, se utilizan máquinas vectoriales de soporte (máquinas vectoriales de soporte) para las pruebas.Melgani和Bruzzone,2004) y los clasificadores Nearest Neighbor predicen los datos de dominio de destino no marcados.陈华杰等(2024)Se propone un algoritmo de aprendizaje de migración entre dominios basado en la clasificación de correlación de muestras en el dominio Fuente. En primer lugar, las muestras del dominio objetivo se agregan inversamente a la tarea de clasificación del dominio fuente, las muestras del dominio fuente se ordenan por correlación, y luego se utiliza la estrategia de aprendizaje conjunto de autosupervisión para introducir ramas auxiliares de predicción desde el punto de vista de autosupervisión en la red de clasificación del dominio objetivo.
El aprendizaje de muestras pequeñas ha logrado buenos resultados de clasificación cuando las muestras de etiquetado del dominio objetivo son escasas, pero asume implícitamente que las muestras del dominio objetivo provienen del mismo campo que las muestras del dominio Fuente. Sin embargo, las muestras de dominio fuente y las muestras de dominio objetivo a menudo tienen grandes diferencias de distribución, e incluso el espacio de categoría no se superpone. Además,Guo等(2020)Se señala que el aprendizaje de algunas muestras pequeñas es menos eficaz en el procesamiento de tareas de muestras pequeñas entre dominios. Por lo tanto, cómo resolver el problema de las diferencias de distribución de dominio en el aprendizaje de muestras pequeñas se ha convertido en un gran desafío. En respuesta a este problema,Li等(2022)Se propone un método de aprendizaje de muestras pequeñas entre dominios profundos dcfsl (deep Cross domain few show), que utiliza condiciones para contrarrestar la red cdan (adaptación de dominio adaptativo) mientras aprende metaconocimiento.Long等,2018) reducir las diferencias características entre los dos campos y utilizar datos hiperespectrales de un solo dominio de fuente para predecir los datos restantes de los cuatro campos objetivo. Sin embargo, la alineación excesiva entre dominios puede dañar el rendimiento de aprendizaje de las muestras pequeñas. para resolver este problema, se utilizan redes de desacoplamiento para desacoplar las características de las muestras en características invariantes de dominio y características específicas de dominio. Solo se utilizan características invariantes de dominio para tareas de clasificación de muestras pequeñas para evitar el impacto de características específicas de dominio en la medida de lo posible.
En vista de esto, con el fin de aliviar el problema de la disminución del rendimiento de generalización del modelo debido a las diferencias en la distribución HSI entre dominios y mejorar la precisión de la clasificación de muestras pequeñas, este trabajo propone un prototipo de red de confianza desacoplada dcpn (disentangled confidence prototipe network) como un nuevo método de clasificación de muestras pequeñas entre dominios hsi. En primer lugar, las características espectrales y espaciales profundas de HSI se obtienen utilizando CNN residual 3D y las características de profundidad se separan funcionalmente con la ayuda de redes desacopladas; Luego, se seleccionan muestras de conjuntos de consultas de alta confianza y se calculan prototipos de categorías más confiables; Por último, se utiliza de manera integral el prototipo de categoría original y el prototipo de categoría de alta confianza para lograr una clasificación más precisa de muestras pequeñas. Los métodos existentes, como el aprendizaje de pequeñas muestras, se verifican experimentalmente en seis conjuntos de datos HSI públicos, con el fin de proporcionar una reserva técnica efectiva para desafíos como la escasez de muestras marcadas y el desplazamiento de dominio en la interpretación inteligente de imágenes de teleobservación.
2 red prototipo de confianza desacoplada
Conjunto de datos del dominio de origenConjunto de datos del dominio objetivoContiene por separadoyCategorías. Según si la muestra está etiquetada, el conjunto de datos del dominio objetivo se puede dividir en un conjunto de muestras etiquetadas.Y conjuntos de muestras sin etiqueta.Se utiliza para el entrenamiento de meta, mientras que el modelo está enLa precisión de clasificación en es el resultado de la evaluación de dcpn. Sin embargo,No es suficiente para formar un conjunto de soporte y un conjunto de consultas para tareas de muestra pequeña en el dominio objetivo, por lo queEn cada categoría, se toman cinco muestras de etiquetado y se añade ruido Gauss aleatorio para ampliar la composición de los datos..
Dcpn consta de dos partes: metaentrenamiento y metaprueba. Entre ellos, el flujo de entrenamiento de yuan es comoFig. 1Se muestra. Se compone principalmente de pequeñas muestras entre dominios en el dominio fuente y pequeñas tareas de muestras entre dominios en el dominio objetivo. Tomando como ejemplo la tarea de muestra pequeña entre dominios en el dominio fuente, se divide principalmente en los siguientes tres pasos:
(1) utilizar muestras del dominio fuente para formar metatareas, en las que las metatareas son apoyadas por conjuntosY conjuntos de consultasComposición. Además, marcar el conjunto de datos desde el campo de destinoSelección aleatoria de varias muestras en el dominio objetivo para formar un conjunto de muestras en el dominio objetivo. extracción de características incrustadas de HSI por extracción de características,yPosteriormente, las características incrustadas se introducen en la red de desacoplamiento para extraer las características invariantes de dominio de los dos dominios, respectivamente.,,Características específicas del dominio de suma,,V;
(2) enviar las características invariables del dominio del conjunto de soporte del dominio fuente y el conjunto de consulta a la red de prototipos de confianza para calcular la pérdida de aprendizaje de muestras pequeñasSe seleccionan muestras de conjuntos de consulta con alta confiabilidad y se combinan con cálculos de conjuntos de soporte para obtener prototipos revisados. Calcular y reducir la distancia Europea entre el Centro de categoría del conjunto de soporte y el prototipoV;
(3) enviar el dominio inmutable y las características específicas del dominio del dominio de origen y el dominio de destino al clasificador de dominio para calcular la pérdida de confusión del dominioPérdida de discriminación de dominio de suma; fase de prueba comoFig. 2Se muestra que, en primer lugar, se utiliza un extractor de características previamente entrenado y una extracción de red desacoplada.yCaracterísticas invariables del dominio,Y después de usar el clasificador nn para todas las muestras no marcadas restantesHacer predicciones de categoría.
2.1 extracción de características
Se extraen bloques vecinos cercanos de la región de HSI como muestras de entrada y se utilizan 3D - CNN para procesar los píxeles simultáneamente a lo largo del eje espacial y el eje espectral, extrayendo así características espaciales - espectrales más discriminatorias de hsi. El conjunto de soporte del dominio de origen es
En la fórmula,,Expresando el número de categorías de conjuntos de apoyo,Indica el número de muestras marcadas en cada tipo,Es largo / ancho,Representa la dimensión espectral del conjunto de datos del dominio Fuente.
El conjunto de consultas del dominio de origen es
En la fórmula,Indica el número de muestras sin etiqueta, y las muestras de conjuntos de soporte y conjuntos de consulta no coinciden.
El conjunto de datos del dominio objetivo es
En la fórmula,,Representa la dimensión espectral de los datos del dominio objetivo,ParaNúmero de muestras del dominio objetivo seleccionadas al azar en.
Para que las dimensiones espectrales de los datos del dominio de origen y el dominio de destino sean consistentes, los datos de los dos dominios se preprocesan aquí utilizando la capa de mapeo del dominio de origen y la capa de mapeo del dominio de destino, respectivamente. Entre ellos, las capas de mapeo son implementadas por 2d - cnn, y el proceso de mapeo es el siguiente:
En la fórmula,ySon los núcleos de convolución del dominio fuente y el dominio objetivo, respectivamente,Es una operación de convolución. Entonces la salida se caracteriza porEntre ellosEs la dimensión espectral unificada de los dos campos procesada por la capa de mapeo. Posteriormente, se utiliza 3D - CNN residual de profundidad para extraer las características de la salida de la capa de mapeo, obteniendo así las características incrustadas.,yEntre ellos, la capa de mapeo y el residual de profundidad 3D - CNN forman conjuntamente un extractor de características.,Es la dimensión característica.
2.2 redes desacopladas
Las diferencias de distribución entre los datos de entrenamiento y los datos de prueba pueden conducir a una disminución de la capacidad de generalización de los métodos de aprendizaje de muestras pequeñas. Para resolver este problema, el método común es la distribución de los dominios de origen y destino homogéneos. Sin embargo, este enfoque inevitablemente conducirá a la alineación de características específicas del dominio. Además, debido a que la categoría del dominio objetivo no coincide con el dominio fuente, la alineación de las características específicas del dominio afectará la capacidad de generalización del modelo en el dominio objetivo. Por lo tanto, las características específicas del dominio en las características se pueden separar, utilizando solo las características invariables del dominio para clasificar pequeñas muestras, reduciendo así el impacto negativo de la alineación excesiva de la distribución del dominio. comoLiu等(2018)Por primera vez, combinando el método de adaptación de dominio y el pensamiento de desacoplamiento, se logra el propósito de la migración de conocimiento entre dominios desacoplando las características del dominio de origen en características invariables de dominio y características específicas de dominio. Cao y otros (2018) señalan que las redes neuronales profundas generan características altamente acopladas y que es necesario desacoplar las características en diferentes características potenciales para hacerlas más explicativas.Fu等(2021)Utilizando la parte de Codificación de dos codificadores automáticos variables para extraer las características potenciales del desacoplamiento, este artículo adopta la configuración del artículo para descomponer las características de incrustación profunda del HSI en características invariantes de dominio y características específicas de dominio paraComo ejemplo:
Primer codificadorSe utiliza para extraer las características invariables del dominio, y su fórmula de cálculo es
Segundo codificadorSe utiliza para extraer características específicas del dominio, y su fórmula de cálculo es
En la fórmula,ySon los parámetros de los dos codificadores. Después de esta red de desacoplamiento de características, finalmente se obtienen las características invariables del dominio del conjunto de soporte del dominio de origen, el conjunto de consulta del dominio de origen y el dominio de destino.,,Y características específicas del dominio,,.ySe trata de características invariables de dominio y dimensiones características específicas de dominio, respectivamente.
2.3 redes de prototipos de confianza
Aprovechando las características invariables del dominioySe calcula la pérdida de clasificación de muestras pequeñas, cada tipo de prototipo es el promedio que soporta las características de cada tipo de muestra, y la fórmula de cálculo es la siguiente:
En la fórmula,Conjunto de soporte de dominio de origenNúmero de muestras de la clase,Expresado como No.Prototipo de clase. Muestra del conjunto de consultas de computación de red prototipoA la distancia entre los prototipos de cada clase, y se calcula la distribución de la clase de cada muestra del conjunto de consultas. EntoncesPertenece al númeroLa fórmula de cálculo de probabilidad de la clase es la siguiente:
En la fórmula,Es la fórmula de cálculo de la distancia europea,Es el número total de categorías del conjunto de soporte. Muestra según el conjunto de consultasY etiquetas realesProbabilidad de logaritmo negativo, la pérdida de clasificación de todas las muestras del conjunto de consultas se expresa como
La clasificación de muestras pequeñas depende de las muestras etiquetadas que admiten conjuntos. Por lo tanto, cuando hay pocas muestras de etiquetado, el prototipo de categoría calculado puede tener desviaciones. Por lo tanto, este artículo utiliza una red de prototipos de confianza para asignar pesos a muestras de conjuntos de consultas no marcadas para volver a calcular los prototipos de esta clase. Entonces No.Prototipo revisado de claseEl proceso de cálculo es el siguiente:
En la fórmula,La confianza de la muestra que representa el conjunto de soporte siempre es 1.Expresa su apoyo.Conjunto de muestras de clase.Representa una muestra de conjunto de consultas con alta confianza, y los criterios de selección son los siguientes:
En la fórmula,Como umbral de confianza, solo participan muestras de conjuntos de consultas con una confianza superior a este umbral.式(8)Cálculo, si no hay una muestra de alta confianza en una determinada categoría, continúe usando式(5)Prototipo en. Calcular la suma de las distancias euclidianas entre los prototipos de alineación de todas las categorías y los prototipos de conjuntos de soporte:
2.4 clasificación de dominios
Clasificador de dominioMapear las características en puntuaciones en dos campos, una de las tareas de clasificación de dominio es utilizar el clasificador de dominio de confusión de características invariables de dominio para calcular la pérdida de confusión de dominio:
En la fórmula,Es el parámetro de clasificación de dominio,,yLas etiquetas invariantes de dominio son el conjunto de soporte de dominio de origen, el conjunto de consulta de dominio de origen y la muestra de dominio de destino, y el valor de cada línea se establece en,Es la función de cálculo de la pérdida de dispersión de Kullback - leibler. Otra tarea del clasificador de dominio está diseñada para que las características específicas del dominio puedan ser reconocidas por el clasificador de dominio, por lo que la fórmula de cálculo de la pérdida de identificación de dominio es la siguiente:
En la fórmula,,ySon el conjunto de soporte del dominio de origen, el conjunto de consulta del dominio de origen y las etiquetas de identificación del dominio de la muestra del dominio de destino.yTodos los valores se establecen en 1,Todos los valores son 0,Es una función de entropía cruzada.
2.5 función objetivo
La función objetivo total de la tarea de muestra pequeña en el dominio fuente es
En la fórmula,,,yEs el coeficiente de cada pérdida,Indica la pérdida total de tareas de muestras pequeñas entre dominios en el dominio Fuente. Entonces, la tarea de muestra pequeña del dominio objetivo es similar al dominio fuente, entonces la función objetivo total de dcpn es
Función objetivo total式(13)Y (14) se actualizan alternativamente hasta que el modelo converja.
3 configuración experimental y análisis de resultados
3.1 Introducción al conjunto de datos
Para verificar la efectividad del método dcpn, se seleccionaron seis conjuntos de datos HSI públicos, incluidos UP(University of Pavia)、PC(Pavia Center)、IP(Salinas、Indian Pines)、Chikusei Y (wha - Hi - longkou) LK realizaron experimentos. Elija chikusei, que tiene la categoría de figura más alta, como conjunto de datos de dominio fuente, y los cinco conjuntos de datos restantes como conjunto de prueba de dominio objetivo..Li等,2022). El conjunto de datos chikusei fue fotografiado el 29 de julio de 2014 con el sensor de imagen headwall hyperspec - vnir - C en la ciudad japonesa de tsukigami, cubriendo áreas urbanas y agrícolas, con 19 categorías de características y 128 bandas. Longitud de onda 343 - 1018 nm, totalPíxeles, resolución espacial de 2,5 m, categorías detalladas e información de la muestra comoFig. 3Se muestra.
El conjunto de datos up fue fotografiado por sensores Rosis en la Universidad de pavia, italia, yPíxeles, con una resolución espacial de 1,3 m, 103 bandas restantes para experimentos tras eliminar las bandas de ruido, absorción atmosférica y de agua y superposición, con una longitud de onda de 430 - 860 nm, contienen 9 categorías de características, categorías detalladas e información de la muestra comoFig. 4Se muestra.
El conjunto de datos de PC fue fotografiado en ciudades del Norte de Italia a través de sensores rosis, y fue fotografiado porConsta de cuatro píxeles, con una resolución espacial de 1,3 m, contiene 102 bandas y una longitud de onda de 430 - 806 nm. el conjunto de datos de PC contiene 9 categorías de características. el experimento intercepta la parte de PC para el experimento. las categorías detalladas y la información de la muestra son comoFig. 5As shown.
El conjunto de datos IP fue fotografiado y recopilado por el espectrómetro AVIRIS en el noroeste de indiana, Estados unidos, en 1992. Después de eliminar la banda ruidosa, el conjunto de datos IP consta de 200 bandas, con una longitud de onda de 40 - 2500 nm, incluyendoPíxeles con una resolución espacial de 20 M. la imagen se utiliza principalmente en estudios relacionados con la agricultura, con un total de 16 categorías, categorías detalladas e información de la muestra comoFig. 6Se muestra.
El conjunto de datos de Salinas fue fotografiado por sensores AVIRIS en el valle de salinas, california, Estados unidos, con una cobertura espectral de 400 - 2500 nm, conPíxeles, un total de 204 bandas para la clasificación, el conjunto de datos contiene 16 características con una resolución espacial de 3,7 m, categorías detalladas e información de la muestra comoFig. 7Se muestra.
El conjunto de datos LK fue fotografiado por una cámara hiperespectral aerotransportada en una zona agrícola de la ciudad de longkou, Provincia de hubei. El conjunto de datos contiene 270 bandas espectrales,Un total de 9 categorías de píxeles, con una resolución espacial de 0463 m, categorías detalladas e información de la muestra comoFig. 8Se muestra.
3.2 configuración experimental
Para verificar la efectividad del método dcpn, se seleccionaron seis conjuntos de datos HSI reales. Elija chikusei, que tiene la categoría de figura más grande, como dominio fuente, y los cinco conjuntos de datos restantes como dominio objetivo. Todos los experimentos se realizaron en computadoras con configuración de hardware de la CPU Intel Core i7 - 6850k, NVIDIA GeForce GTX 1080 ti y 32 GB de memoria, utilizando el marco pytorch de Python 3.6 y la plataforma MATLAB 2017a. En el experimento se seleccionaron cuatro indicadores de rendimiento, a saber: precisión de clasificación de categoría, precisión de clasificación general (oa), coeficiente Kappa y precisión media de clasificación (aa). Cada experimento se realizó 10 veces de forma independiente y se tomó el promedio.
Se seleccionaron siete métodos de clasificación para la comparación, el método de clasificación poco profunda (svm), el método de aprendizaje profundo (res - 3D - cnn), el método de adaptación de dominio (dann y cdan), el método de aprendizaje de muestras pequeñas (dfsl + SVM y dfsl + nn) y el método de muestras pequeñas entre dominios (dcfsl). Para SVM y res - 3D - cnn, se utilizaComo conjunto de entrenamiento, dfsl + SVM y dfsl + nn se refieren a la configuración de dfsl, formando chikusei, houston, Botswana y Kennedy Space Center en el dominio fuente, abandonando las categorías de menos de 200 muestras y seleccionando 100 bandas para garantizar la consistencia de las dimensiones de los datos de entrada. Para los métodos de adaptación de dominio Dann y cdan, el dominio fuente es consistente con dcpn yComo muestra sin etiqueta del campo objetivo, se utiliza para la alineación de la distribución de dos campos.
Tomando como ejemplo la tarea de muestra pequeña entre dominios en el dominio fuente, para garantizar un número suficiente de muestras, se abandona.Hay clases marcadas con menos de 200 muestras y, de acuerdo con el paradigma de aprendizaje de meta, en cada entrenamientoExtracción aleatoria mediaClase, extracción aleatoria de cada claseMuestras como conjuntos de soporte de dominio fuenteY se toma al azar en el resto de las muestrasMuestras como conjuntos de consultas de dominio fuente. orden,,. deSe seleccionaron 128 muestras al azar para formar un conjunto de datos sin etiqueta en el dominio objetivo.. El HSI importado tiene 9 de largo y 9 de ancho. La configuración de la pequeña muestra entre dominios del dominio objetivo es la misma que la anterior.
La estructura de la red de extracción de características es comoFig. 9Se muestra que consta de una capa de mapeo, dos bloques residuales, dos capas máximas de Pool y una capa de rollo. Conv2d es una capa de mapeo 2d - cnn, con el objetivo de mapear las dimensiones espectrales del dominio fuente y el dominio objetivo a la misma dimensión. Núcleo de convolución de capa de mapeo,Los parámetros están determinados por los datos de entrada. Conv indica que el tamaño esEn la capa de rollo 3d, pooling indica la capa máxima de pooling, con un paso de. La salida es,y. La red desacoplada consta de dos capas de codificadores, de los cuales fc1 se utiliza para extraer características universales, fc21a y fc22a se utilizan para extraer características invariables de dominio, y fc21b y fc22b se utilizan para extraer características específicas de dominio. El clasificador de dominio consta de una capa de conexión completa y dropout. Adam fue seleccionado como optimizador y el número de iteraciones de entrenamiento fue de 10000.
Otros parámetros superparámetros se establecen comoTable 1Se muestra.
Table 1 Hyperparameter settings on different datasets
| 数据集 | | | | 学习率 | | | | |
|---|
| UP | 100 | 80 | 40 | 0.010 | 0.3 | 1.0 | 1.0 | 1.0 |
| PC | 100 | 80 | 40 | 0.010 | 0.2 | 1.0 | 1.0 | 1.0 |
| IP | 90 | 80 | 40 | 0.003 | 0.3 | 1.0 | 1.0 | 1.0 |
| Salinas | 120 | 128 | 32 | 0.003 | 0.3 | 0.8 | 1.0 | 0.6 |
| LK | 60 | 100 | 50 | 0.010 | 0.0 | 0.5 | 0.1 | 0.1 |
3.3 resultados y análisis experimentales
La tabla 2 - 6 muestra los resultados de comparación del rendimiento de clasificación de los clasificadores svm, res - 3D - cnn, dann, cdan, dfsl + svm, dfsl + nn y dcfsl (método de este artículo) en cinco conjuntos de datos, que se pueden ver:
(1) los métodos de adaptación de dominio Dann y cdan tienen una precisión de clasificación inferior a la de SVM para algunas categorías, lo que indica que para los campos de origen y objetivo donde las categorías no coinciden, las características de alineación excesiva reducirán la precisión de clasificación;
(2) en el caso de la escasez de muestras de etiquetado de dominio objetivo, en comparación con otros métodos, las estrategias de aprendizaje de tareas utilizadas en los métodos de aprendizaje de muestras pequeñas pueden ayudar al modelo a aprender metaconocimientos generales, lo que puede obtener una mayor precisión de reconocimiento de nuevas categorías;
(3) en comparación con el método de aprendizaje de muestras pequeñas, el método de aprendizaje de muestras pequeñas entre dominios dcfsl ha logrado una mayor precisión de clasificación en el dominio objetivo. Esto se debe a que el método tiene en cuenta las diferencias de distribución entre el dominio fuente y el dominio objetivo, acercando la distribución del dominio fuente y el dominio objetivo mientras aprende el metaconocimiento migrable del dominio fuente, obteniendo así un modelo más generalizado;
(4) dcpn logró el oa más alto en todos los conjuntos de datos porque dcpn puede desvincular las características de profundidad extraídas de la red profunda para obtener características invariantes de dominio y específicas de dominio, y combinar clasificadores de dominio para reducir la brecha de distribución entre el dominio de origen y el dominio de destino. Al mismo tiempo, dcpn calcula y corrige el prototipo seleccionando muestras de conjuntos de consulta con mayor confianza, lo que hace que el prototipo de corrección y el prototipo de conjuntos de soporte se acerquen constantemente durante el entrenamiento, evitando así en cierta medida el problema de la imprecisión de la muestra de conjuntos de consulta debido a la escasez de muestras marcadas de conjuntos de soporte;
(5) en todos los conjuntos de datos, el tiempo de dcpn es más alto, principalmente debido a: por un lado, dcpn utiliza convolución 3d, lo que mejora la capacidad de la red para extraer las características espaciales y espectrales originales de hsi, pero también trae una mayor complejidad computacional; Por otro lado, el marco de meta - aprendizaje incluye entrenamiento y pruebas entre tareas, así como entrenamiento y pruebas dentro de la tarea. Un gran número de muestras de prueba en las tareas de entrenamiento han llevado a un mayor tiempo de dcpn.
Table 2 Comparison of classification results by different methods on the UP dataset
| 类别 | SVM | Res-3D-CNN | DANN | CDAN | DFSL+SVM | DFSL+NN | DCFSL | DCPN |
|---|
| 柏油路面/% | 61.94 | 99.90 | 73.12 | 75.45 | | 80.95 | 73.18 | 73.32 |
| 草地/% | 55.84 | | 69.60 | 90.36 | 66.41 | 82.17 | 89.19 | 94.79 |
| 碎石路面/% | | 49.95 | 40.88 | 41.45 | 50.53 | 50.57 | 52.20 | 55.25 |
| 树木/% | 85.88 | 84.67 | 91.83 | 90.19 | | 91.73 | 98.20 | 88.95 |
| 金属板屋顶/% | 99.10 | 98.58 | 86.64 | 97.76 | | | 98.51 | 100.00 |
| 裸地/% | 63.08 | 21.54 | 56.35 | 86.00 | 72.47 | 63.81 | | 64.51 |
| 沥青/% | 87.77 | 81.21 | 56.45 | 75.09 | 78.04 | | 78.94 | 79.85 |
| 砖/% | 71.63 | 46.59 | 69.92 | 70.17 | 66.06 | 57.98 | | 86.65 |
| 阴影/% | 100.00 | 94.37 | 100.00 | 97.88 | | 99.79 | 99.68 | 99.47 |
| OA/% | 64.44 | 70.15 | 69.60 | 73.30 | 73.98 | 77.83 | | 84.65 |
| AA/% | 75.61 | 68.66 | 71.64 | 71.02 | 79.54 | 78.82 | 82.98 | |
| Kappa | 0.5600 | 0.5969 | 0.6200 | 0.6400 | 0.6700 | 0.7100 | | 0.8000 |
| 耗时/s | 5.31 | | 939.03 | 997.31 | 1976.14 | 1991.89 | 1357.80 | 2118.96 |
Table 3 Comparison of classification results by different methods on the PC dataset
| 类别 | SVM | Res-3D-CNN | DANN | CDAN | DFSL+SVM | DFSL+NN | DCFSL | DCPN |
|---|
| 水体/% | 100.00 | | 98.11 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 |
| 树木/% | 71.93 | 91.25 | 89.73 | 94.23 | | 92.52 | 90.49 | 90.49 |
| 草地/% | 76.43 | 67.52 | 42.59 | 53.09 | 80.41 | 81.54 | | 96.93 |
| 砖瓦地/% | 98.03 | 96.96 | 76.25 | 95.74 | | 99.95 | 99.25 | 98.78 |
| 裸露土地/% | 87.57 | 83.65 | 74.22 | 76.09 | 86.00 | 87.05 | | 99.30 |
| 草地/% | 95.20 | 97.26 | 93.08 | 94.99 | 95.75 | 94.26 | | 99.01 |
| 沥青路面/% | 90.66 | 95.22 | 60.27 | 90.71 | 97.41 | 97.97 | | 97.47 |
| 砖块/% | 88.14 | 99.28 | 25.06 | 52.23 | 47.48 | 62.03 | 98.85 | |
| 阴影/% | | 99.70 | 92.20 | 99.46 | 98.98 | 99.07 | 99.76 | 100.00 |
| OA/% | 95.23 | 96.03 | 86.13 | 92.05 | 94.41 | 95.19 | | 99.13 |
| AA/% | 89.77 | 92.30 | 72.39 | 84.06 | 88.75 | 90.56 | | 97.88 |
| Kappa | 0.9287 | 0.9401 | 0.7933 | 0.8811 | 0.9161 | 0.9278 | | 0.9870 |
| 耗时/s | 4.63 | | 1257.74 | 1309.38 | 2262.87 | 2302.59 | 1463.87 | 2379.79 |
Table 4 Comparison of classification results by different methods on the IP dataset
| 类别 | SVM | Res-3D-CNN | DANN | CDAN | DFSL+SVM | DFSL+NN | DCFSL | DCPN |
|---|
| 苜蓿/% | 68.29 | 87.80 | 39.02 | 97.56 | | | 97.56 | 97.56 |
| 非犁耕玉米地/% | | 14.97 | 6.39 | 27.48 | 22.56 | 26.07 | 22.35 | 45.82 |
| 少犁耕玉米地/% | 43.15 | 25.58 | 26.18 | 27.76 | 35.88 | 38.42 | 54.18 | |
| 玉米地/% | 43.53 | 33.19 | 42.24 | 53.45 | 78.02 | 87.93 | | 83.19 |
| 草地/牧地/% | 76.15 | 51.88 | 55.65 | 60.25 | 74.27 | 83.26 | 75.31 | |
| 草地/树木/% | 75.72 | | 50.07 | 85.93 | 94.62 | 88.96 | | 89.52 |
| 草地/修剪过的牧地/% | | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 |
| 干草堆/% | 73.78 | 81.40 | 90.06 | 97.46 | 94.29 | 94.93 | 92.39 | |
| 燕麦/% | | | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 | 100.00 |
| 非犁耕的大豆地/% | 44.57 | 57.70 | 54.19 | | 56.26 | 61.63 | 54.40 | 65.25 |
| 少犁耕的大豆地/% | 47.43 | 58.24 | 38.65 | 28.82 | 65.06 | 64.53 | | 76.29 |
| 清理过的大豆地/% | 31.29 | 38.61 | 37.59 | 31.29 | 34.69 | 34.52 | 50.34 | |
| 小麦/% | 92.00 | 98.00 | 96.50 | | 97.50 | 98.50 | 100.00 | 95.50 |
| 森林/% | 42.29 | 70.56 | 73.20 | 67.22 | 85.95 | 68.33 | 85.16 | |
| 建筑/草地/树木/机器/% | 23.62 | 27.30 | 57.22 | 54.86 | | 67.19 | 79.79 | 62.47 |
| 石钢塔/% | 84.09 | 96.59 | 94.32 | 88.64 | 100.00 | 96.59 | | |
| OA/% | 50.77 | 52.56 | 45.43 | 49.31 | 62.47 | 61.36 | | 69.92 |
| AA/% | 61.65 | 64.07 | 39.45 | 67.62 | 75.53 | 75.38 | | 78.83 |
| Kappa | 0.4473 | 0.4689 | 0.6007 | 0.4383 | 0.5758 | 0.5682 | | 0.6574 |
| 耗时/s | 1.18 | | 706.47 | 714.87 | 1898.06 | 1902.09 | 2240.70 | 5465.74 |
Table 5 Comparison of classification results by different methods on the Salinas dataset
| 类别 | SVM | Res-3D-CNN | DANN | CDAN | DFSL+SVM | DFSL+NN | DCFSL | DCPN |
|---|
| 西兰花-幼苗期1/% | | 87.80 | 98.35 | 95.96 | 94.91 | 98.25 | 100.00 | 100.00 |
| 西兰花-幼苗期2/% | 98.90 | 14.97 | 96.35 | 90.38 | 99.62 | 98.23 | | 99.81 |
| 休耕地/% | 78.59 | 25.58 | 37.85 | 78.44 | 88.33 | 90.92 | | 97.46 |
| 休耕地-粗犁/% | 98.63 | 33.19 | 100.00 | 99.71 | 99.42 | | | 99.78 |
| 休耕地-平整/% | 98.02 | 51.88 | 88.25 | | 93.04 | 94.09 | 94.46 | 94.20 |
| 残茬地/% | 97.27 | 89.93 | 99.34 | | 99.49 | 100.00 | 100.00 | 100.00 |
| 芹菜/% | 99.05 | 100.00 | 97.82 | 95.75 | 99.22 | 99.55 | 99.05 | |
| 葡萄-未整形/% | 60.78 | 81.40 | 14.26 | 56.54 | 52.09 | 71.97 | 66.97 | |
| 葡萄园-裸地/发育土壤/% | 98.61 | 93.33 | 99.08 | | 91.59 | 88.74 | 98.69 | 99.90 |
| 玉米-衰老期伴生杂草/% | 82.19 | 57.70 | 22.36 | 65.84 | 40.02 | 87.81 | | 83.50 |
| 罗马生菜-生长4周/% | 91.72 | 58.24 | 68.96 | 83.35 | 97.65 | 97.08 | 99.72 | |
| 罗马生菜-生长5周/% | 100.00 | 38.61 | 85.43 | 91.10 | | 99.12 | 100.00 | 99.27 |
| 罗马生菜-生长6周/% | 98.68 | 98.00 | 97.04 | 97.15 | 98.68 | 99.78 | | 98.02 |
| 罗马生菜-生长7周/% | 88.92 | 70.56 | 98.31 | 94.37 | 98.03 | 98.22 | 99.34 | |
| 葡萄园-自然生长/% | 37.56 | 27.30 | | 61.79 | 85.21 | 74.38 | 75.35 | 77.35 |
| 葡萄园-垂直架式/% | 91.84 | 96.59 | 83.96 | 86.57 | 89.62 | 97.23 | 100.00 | |
| OA/% | 80.22 | 82.51 | 69.90 | 80.22 | 81.88 | 87.62 | | 90.35 |
| AA/% | 88.71 | 91.72 | 79.38 | 78.10 | 80.03 | 93.45 | | 95.03 |
| Kappa | 0.7809 | 0.8065 | 0.6709 | 0.8690 | | 0.8628 | 0.8702 | 0.8929 |
| 耗时/s | 6.47 | | 735.72 | 757.09 | 1976.79 | 2030.75 | 2338.01 | 5372.43 |
Table 6 Comparison of classification results by different methods on the LK dataset
| 类别 | SVM | Res-3D-CNN | DANN | CDAN | DFSL+SVM | DFSL+NN | DCFSL | DCPN |
|---|
| 玉米/% | 86.39 | 98.67 | 94.20 | | 97.42 | 98.00 | 99.93 | 98.81 |
| 棉花/% | 42.68 | 93.56 | 39.46 | 26.97 | 92.39 | 72.17 | | 98.29 |
| 芝麻/% | 73.40 | 11.43 | | 84.57 | 77.36 | 78.12 | 93.03 | 82.85 |
| 阔叶大豆/% | 64.58 | 89.37 | 62.40 | 55.10 | 70.15 | 75.20 | 81.58 | |
| 窄叶大豆/% | 54.97 | 89.56 | 68.55 | 75.95 | 77.23 | | 98.46 | 95.88 |
| 大米/% | 85.80 | 83.12 | 72.37 | 79.63 | | 92.39 | 95.66 | 91.91 |
| 水体/% | 99.95 | 99.97 | | | 98.34 | 99.78 | | 99.94 |
| 道路和房屋/% | 49.28 | 50.32 | 35.82 | 64.02 | | 66.64 | 94.41 | 82.68 |
| 混合杂草/% | 62.88 | 63.73 | 63.11 | 49.75 | | 67.94 | 90.95 | 72.32 |
| OA/% | 79.55 | 91.06 | 79.32 | 77.54 | 87.49 | 87.97 | | 93.85 |
| AA/% | 68.88 | 75.52 | 69.32 | 67.26 | 86.51 | 82.96 | 94.66 | |
| Kappa | 0.7419 | 0.8829 | 73.92 | 0.7180 | 0.8414 | 0.8458 | | 0.9199 |
| 耗时/s | 12.86 | | 2335.09 | 2411.93 | 2338.78 | 2407.39 | 1677.83 | 2629.08 |
Para comparar más intuitivamente el efecto de clasificación de diferentes métodos de clasificación en cada conjunto de datos, la imagenFig. 10- -Fig. 14Es un mapa de efectos de clasificación en diferentes conjuntos de datos. A partir de la imagen, se puede ver que el dcpn propuesto puede lograr un mapa de efectos de clasificación más suave y detallado en todos los conjuntos de datos.
Tomemos como ejemplo el conjunto de datos de India pines, comoFig. 12Se muestra. En comparación con otros métodos, el fenómeno de la puntuación errónea de dcpn en algunas categorías (como bosques, etc.) es mayor, lo que se debe a la selección no óptima de superparámetros de dcpn. Como todos sabemos, la búsqueda óptima de superparámetros basada en el método dl es difícil de lograr, y dcpn añade pérdidas mixtas de dominio, pérdidas de discriminación de dominio y pérdidas de distancia entre el prototipo de alineación y el prototipo del conjunto de soporte sobre la base de los objetivos de aprendizaje dcfsl, lo que también introduce superparámetros adicionales al tiempo que mejora La capacidad de identificación y migración del modelo. Sin embargo, el dcpn sigue siendo capaz de lograr resultados de clasificación similares o mejores que otros métodos en la mayoría de las categorías. Por ejemplo, otros métodos pueden dividir erróneamente más tierras de soja limpiadas en tierras de soja menos aradas y tierras de soja no aradas; Dividir más tierras de soja con menos arado en campos de maíz sin arado por error; Dividir más pastizales / árboles en pastizales secos y bosques por error; Los campos de maíz no arados, los campos de maíz menos arados, los campos de soja no arados y los campos de soja limpiados se dividen erróneamente en campos de soja menos arados. Además, el uso de dcpn puede lograr resultados de clasificación significativamente mejores que otros métodos de comparación en categorías como pastizales en el conjunto de datos up, viñedos en el conjunto de datos Salinas - suelos desnudos / en desarrollo, soja de hoja ancha en el conjunto de datos lk, etc.
Además, en este trabajo se organizaron experimentos de ablación para verificar los efectos de los diferentes componentes del dcpn en las propiedades de clasificación, comoTable 7Se muestra. porTable 7Se puede ver:
Table 7 Comparison of OA on the five datasets in ablation studies of different loss functions
| 数据集 | DCPN(w/ FSL) | DCPN(w/FSL and FC) | DCPN(w/FSL and FS) | DCPN |
|---|
| UP | 82.52 | 80.50 | 81.03 | 83.49 |
| PC | 97.13 | 97.71 | 97.71 | 98.66 |
| IP | 66.57 | 68.08 | 68.59 | 69.08 |
| Salinas | 87.96 | 88.40 | 89.57 | 91.46 |
| LK | 93.79 | 92.68 | 91.78 | 93.85 |
El dcpn logró el oa más alto en todos los conjuntos de datos en comparación con varios otros métodos. por un lado, con la ayuda de la pérdida de FC y la pérdida de fs, el dcpn logró la mezcla de características en los diferentes campos en el espacio de características invariantes de dominio construido, así como la distinción de características en el espacio de características específicas de dominio, logrando así el desacoplamiento de las características y el objetivo de alinear solo las características invariantes de dominio, aliviando así el problema de migración negativa causado por la alineación de características específicas de dominio; Por otro lado, minimizandoSe logra la alineación entre el prototipo de categoría original y el prototipo de categoría de alta confianza, aliviando así el problema de la reducción de la precisión de clasificación causada por el desplazamiento del prototipo de categoría.
3.4 superparámetrosyAnálisis del impacto en la precisión de la clasificación
Para verificar los superparámetros,Efecto sobre el rendimiento de clasificación de dcpn, se llevaron a cabo experimentos de análisis de parámetros en cinco grupos de conjuntos de datos hsi, y los resultados fueron comoFig. 15Se muestra. Se puede ver:
(1) demasiado grandeSignifica acercar excesivamente el prototipo de corrección y el Centro de categoría del conjunto de soporte durante el entrenamiento; Demasiado pequeñoMuestra que durante el entrenamiento, los conjuntos de consulta se clasifican principalmente de acuerdo con el Centro de categoría de conjuntos de soporte. Los valores demasiado grandes o demasiado pequeños provocarán una disminución de oa;
(2) en todos los conjuntos de datos, conCon el aumento, oa muestra aproximadamente una tendencia al alza primero y luego a la baja. Esto se debe a que, demasiado pequeñoEl valor dará lugar a un aprendizaje insuficiente y excesivo del metaconocimiento en el dominio Fuente.Esto hará que el modelo se ajuste demasiado al dominio Fuente.
En resumen, se recomienda establecer el rango de parámetros en,.
4 Conclusiones
En respuesta a la dificultad del aprendizaje de muestras pequeñas basado en el aprendizaje de meta para hacer frente eficazmente a la disminución de la precisión de clasificación causada por las diferencias en el campo en la etapa de entrenamiento, y el problema de la disminución del rendimiento de clasificación causada por la predicción inexacta de prototipos de clase en la red de prototipos, Este trabajo propone un método de clasificación de muestras pequeñas entre dominios de imágenes hiperespectrales basado en la red de prototipos de confianza desacoplada. Las principales conclusiones son las siguientes: (1) utilizar la red de desacoplamiento para obtener características invariables sin dominio y características específicas del dominio, y solo realizar tareas de clasificación de muestras pequeñas de características invariables del dominio, reduciendo así el impacto negativo de las características específicas del dominio; (2) se propone una red de prototipos de confianza, que asigna los pesos correspondientes a las muestras de conjuntos de consulta sin marcar para volver a calcular los prototipos de cada categoría y colabora con el Centro de categorías de muestras de conjuntos de soporte originales para completar tareas de clasificación de muestras pequeñas de alta calidad. Los resultados experimentales en conjuntos de datos HSI reales muestran que el método propuesto en este artículo puede obtener una mayor precisión de clasificación entre dominios y resultados de clasificación más suaves y detallados. Dado que las imágenes hiperespectrales obtenidas a menudo se ven afectadas por las condiciones atmosféricas, los equipos de adquisición y otros factores, sobre la base del método de este artículo, cómo obtener características más robustas comunes y específicas del dominio es un tema digno de discusión.