Método de detecção detalhada de alvos em imagens de sensoriamento remoto baseado em cabeça dupla de classificação

  • role: First author第一作者
  • Affiliation:

    School of Electronic Information, Hunan First Normal University, Changsha 410205, China

  • Email:0201zhangfeng@163.com
  • Introduction:E-mail0201zhangfeng@163.com
ZHANG Feng1,  
  • role: Corresponding author通信作者
  • Affiliation:

    School of Electronic Information, Hunan First Normal University, Changsha 410205, China

    College of Artificial Intelligence and Software, Nanning University, Nanning 530299, China

  • Email:tengshuhua1979@sohu.com
  • Introduction:E-mailtengshuhua1979@sohu.com
TENG Shuhua12*,  
  • Affiliation:

    Hunan Normal University of Medicine, Changsha 410081, China

HAN Xing3,  
  • Affiliation:

    College of Electronic Science and Technology, National University of Defense Technology, Changsha 410073, China

WANG Yingqian4,  
  • Affiliation:

    College of Electronic Science and Technology, National University of Defense Technology, Changsha 410073, China

WANG Xueying4

Resumo

A maior disponibilidade de imagens de sensoriamento remoto de alta resolução tornou a detecção detalhada de alvos em imagens de sensoriamento remoto uma importante área de pesquisa nos campos do sensoriamento remoto e da visão computacional. Para enfrentar os problemas de aproveitamento insuficiente de dados semelhantes, a influência de rótulos incorretos na precisão do modelo e a dificuldade em distinguir categorias semelhantes na detecção detalhada de alvos em imagens de sensoriamento remoto, este artigo propõe um método de detecção detalhada baseado em uma cabeça dupla de classificação. Primeiramente, para resolver o problema do uso ineficiente de dados semelhantes, propõe-se uma cabeça dupla de classificação, onde diferentes cabeças são treinadas em diferentes conjuntos de dados, permitindo que dados semelhantes com definições de categoria diferentes participem conjuntamente do treinamento, melhorando significativamente a precisão do modelo. Em segundo lugar, para lidar com o ruído em rótulos de treinamento, foi projetado um método de filtragem de rótulos incorretos baseado em predição, que reduz o impacto de rótulos incorretos no treinamento do modelo. Por fim, para o problema da grande variação intra-classe e da pequena variação inter-classe na detecção detalhada de alvos, foi definida uma perda de entropia cruzada com margem, que melhora a precisão do modelo ao aumentar as fronteiras de classificação. Experimentações nos conjuntos de dados do concurso de detecção detalhada de objetivos em sensoriamento remoto e FAIR1M mostraram que o método proposto melhora significativamente a precisão e a robustez da detecção detalhada de alvos em imagens de sensoriamento remoto. O código foi disponibilizado como código aberto em https://github.com/zf020114/DCH.

Palavras-chave

sensoriamento remoto;aprendizado profundo;detecção detalhada de alvos;detecção direcionada de alvos;cabeça dupla de classificação;filtragem de rótulos incorretos;perda de entropia cruzada com margem

1 Introdução

Com o rápido desenvolvimento da tecnologia de detecção remota e a melhoria do desempenho de equipamentos de hardware, como plataformas de imagem, a resolução de imagens de satélite chegou ao nível de Yami. O rápido aumento do número de satélites em órbita fornece um enorme recurso de dados para a detecção de alvos por imagens de teleobservação (李德仁 等,2017)。 As imagens de teleobservação de alta resolução são imagens de alta resolução da superfície da Terra obtidas através de plataformas como satélites e aeronaves de alta resolução. Essas imagens apresentam alta clareza, alta redução de cores e alta precisão geométrica, permitindo obter informações detalhadas sobre a superfície da Terra através de imagens de teleobservação de alta pontuação, fornecendo suporte a dados básicos para várias aplicações de sistemas de informação geográfica. A disponibilidade de imagens de teledetecção de alta resolução aumentou significativamente, tornando o reconhecimento de detecção refinada de alvos de imagens de teledetecção uma direção de pesquisa importante na tecnologia de teledetecção e no campo da visão por computador.姚艳清 等,2021罗会兰和陈鸿坤,2020肖进胜 等,2022)。 As imagens de teleobservação de alta pontuação têm características como vários tipos de alvos, grande número de alvos, orientação variável do alvo e ângulo único de imagem. Além disso, diferentes plataformas, iluminação diferente, condições climáticas diferentes, parâmetros atmosféricos diferentes, etc., podem afetar a aquisição de imagens de teledetecção. Estes fatores tornam a detecção de alvos de imagem de alta pontuação de teledetecção mais difícil e desafiadora do que a detecção de alvos de imagem natural.
A detecção de alvos de refinamento de imagens de teledetecção é principalmente refletida em dois aspectos: um é o refinamento da forma de representação do alvo. O alvo na imagem de detecção remota tem uma direção arbitrária, a caixa retangular horizontal na detecção de alvo geral é difícil de representar com precisão a posição e o alcance do objeto a ser detectado, portanto, a detecção refinada do alvo da imagem de detecção remota precisa projetar um modelo de detecção baseado em uma caixa retangular rotativa, usando uma caixa retangular rotativa compacta envolvendo o alvo para representar o alvo a ser detectado, melhorando a capacidade de posicionamento preciso do alvo.张磊 等,2022)。 Segundo, a classificação dos objetivos. Detecção refinada identifica necessidades de tarefas e identifica subclasses em alvos convencionais com diferenças menores entre classes. Embora a área de detecção de alvos de imagens de teledetecção tenha sido desenvolvida, alguns conjuntos de dados comuns de imagens de teledetecção como DOTA (Xia等,2018)、 DIOR(Li等,2020 (e FAIR1M)Sun等,2022Melhores resultados foram obtidos, mas ainda existem os seguintes problemas na detecção de alvos refinados de imagens de teledetecção:
1) Utilização semelhante de dados. Os modelos de alta precisão exigem conjuntos de dados em grande escala, mas as marcações manuais em grande escala e de alta precisão tendem a exigir custos enormes, o que torna difícil continuar a expandir o tamanho dos conjuntos de dados de treinamento. Ao mesmo tempo, muitas vezes existem grandes conjuntos de dados semelhantes que são maiores do que os conjuntos de dados coletados e rotulados de acordo com as necessidades específicas da tarefa. Para modelos baseados em aprendizagem profunda, as categorias que precisam distinguir um número maior em uma escala de dados menor enfrentarão problemas de dados de treinamento insuficientes e os métodos atuais de detecção sofisticados não podem usar conjuntos de dados semelhantes de forma eficaz, o que afetará significativamente a precisão do modelo. Pouco trabalho está sendo feito para estudar como construir uma estrutura de rede para que a rede possa treinar não apenas com o conjunto de treinamento da tarefa, mas também com outros dados semelhantes.
2) Problemas de rotulagem errada. A rotulagem artificial refinada em massa inevitavelmente apresentará alguns erros de rotulagem que afetarão a precisão do modelo, e o campo atual de detecção de alvos de imagens de detecção remota não tem estudos suficientes sobre como lidar adequadamente com rotulagens erradas e reduzir o impacto das rotulagens erradas no treinamento do modelo.
3) Problemas de classificação. Detecção de objetos de imagem de detecção remota é diferente da tarefa comum de reconhecimento de detecção de imagem, na imagem de detecção remota, os diferentes subclasses de aeronaves e navios têm uma alta semelhança (como contorno, estrutura, etc.), o que resulta em uma detecção de aeronaves e navios de alta dificuldade. Ao mesmo tempo, imagens de teledetecção óptica de alta resolução oferecem informações características ricas em texturas, cores, formas e outras, ao mesmo tempo em que introduzem uma grande quantidade de informações redundantes, resultando em um fundo de imagem extremamente complexo.
Para isso, este estudo propõe um método de detecção de alvos de refinamento de imagens de detecção remota baseado em cabeçalhos de classes duplas para resolver os problemas de utilização inadequada de dados semelhantes presentes na detecção de alvos de refinamento de imagens de detecção remota, rotulagem errada que afeta a precisão do modelo e dificuldade de distinguir categorias semelhantes. Usando cabeçalhos de detecção de classificação dupla, diferentes cabeçalhos de classificação treinam diferentes conjuntos de dados, permitindo que as categorias definam diferentes dados semelhantes juntos para participar do treinamento e, em seguida, usar eficazmente dados semelhantes; Desenhar um método de filtragem de rótulos errados baseado em previsões que reduza o impacto de rótulos errados no treinamento do modelo; Define uma perda de entropia cruzada de margem que aumenta a precisão do modelo aumentando os limites de classificação. Este artigo avalia experimentalmente o modelo proposto com o objetivo de fornecer uma maneira eficaz de usar conjuntos de dados semelhantes para melhorar a precisão da detecção de alvos de imagens de detecção remota.

2 Métodos de pesquisa

Detecção de refinamento de alvo de imagem de detecção remota se manifesta principalmente em dois aspectos: um é o refinamento do modo de representação, o uso de caixas retangulares rotativas para representar o alvo detectado, mas a representação de parâmetros comuns de caixas retangulares rotativas em condições de fronteira produz mutações, causando instabilidade de treinamento; A segunda é a refinação das categorias de detecção, permitindo que o modelo detecte categorias de alvo mais refinadas. No entanto, para distinguir categorias finas, é necessário extrair características mais distintivas. Ao mesmo tempo, as categorias mais finas apresentam requisitos mais altos para os marcadores, inevitavelmente ocorrerá o fenômeno de erros de rotulagem de categorias.

2.1 Refinecimento da forma de representação

As imagens de detecção remota existentes têm sido melhoradas para os métodos de detecção de alvos, principalmente com base em um quadro de detecção de alvos comum (张省 等,2022)。 Atualmente, a maioria dos trabalhos de detecção de alvos de refinamento de imagens de detecção remota se concentra no refinamento de formas de representação, tais métodos usam caixas retangulares rotativas para representar alvos (张磊 等,2022)。 RRPN(Rotation Region Proposal Networks)(Ma等,2018O método introduziu pela primeira vez caixas rotativas na rede de detecção e, gerando um grande número de quadros rotativos para detecção direcionada, propôs uma rede de recomendação de área rotativa que usa 6 ângulos, 3 escalas e 3 proporções de largura e comprimento em cada posição para gerar 54 quadros rotativos. O método também usa o pooling RRol para extrair as características da área, mas o raciocínio é mais lento devido à geração de quadros de âncora excessivos. R2CNN(Jiang等,2018em Faster RCNNRen等,2015Com base em isso, o Pooling de Área de Interesse (ROI) é usado para extrair características de área de interesse (ROI) em múltiplas escalas, ao mesmo tempo em que se prevê o horizonte do alvo e as caixas giratórias. RoI Transformer(Ding等,2018Use um módulo de conversão leve para converter uma quadra de ancoragem horizontal gerada por RPN em uma quadra de ancoragem direcional e extrair características de direção constante usando o módulo RRoI Warping para melhorar a expressão de características. Oriented RCN(Xie等,2021Usando o retângulo externo do quadrângulo e o desvio com a parte superior e direita do retângulo externo para representar a área recomendada (Proposal), em seguida, a área recomendada orientada é gerada diretamente usando a RPN orientada, e, finalmente, as características são extraídas através da unificação de áreas rotativas (Rotated RoIAlign) e a classificação e regressão são executadas através da cabeça de detecção orientada. EIRNet(Han等,2022A Rede de Fusão de Características Intensas (DFF-Net) com duas direções de fusão foi projetada para maximizar o uso de informações de múltiplas camadas, reduzir a redundância de informações e permitir a detecção e o reconhecimento refinados de navios em imagens de teledetecção de alta pontuação.
Os métodos de detecção direcionada sem quadros de âncora evitam uma série de problemas causados ​​por quadros de âncora. BBAVectors(Yi等,2021Primeiro, detecte o ponto central do alvo e, em seguida, obtenha o retângulo rotativo através da regressão aos vetores de percepção da borda (BBAVectors) da caixa circundante. PolarDet(Zhao等,2021em CenterNet)Zhou等,2019A base é o ponto central de regressão, o desvio do ponto central, o ângulo polar e o diâmetro dos quatro vértices, um lado mais curto e quatro proporções polares. Oriented RepPoints(Li等,2022Usando pontos adaptativos para representar alvos direcionais, é possível capturar informações geométricas de alvos em qualquer direção. DARDet(Zhang等,2021A caixa de detecção de rotação é obtida predizindo cinco parâmetros e viés da caixa de rotação em cada posição do gráfico de características por regressão iterativa. O Oriented-DETR usa pontos e eixos para representar alvos de teledetecção, que separam a posição e a rotação, resolvendo o problema de incontinuidade de perda comum nas abordagens tradicionais baseadas em quadros de fronteira.Zhao等,2024)。

2.2 Refineamento das categorias de teste

Há também trabalho parcial para melhorar a precisão da detecção de alvos de imagens de detecção remota, extraindo características mais sofisticadas. Como os alvos de teledetecção são direcionais arbitrários, mas a maioria das redes neurais profundas são sensíveis à direção e as características extraídas pelo mesmo alvo em diferentes direções são diferentes, extrair características de invariência de rotação ou características mais distintivas do alvo pode melhorar a precisão de detecção do modelo. S2Anet(Han等,2021bPrimeiro, use o módulo de alinhamento de características (FAM) para extrair as características alinhadas com a quadra de ancoragem rotativa e, em seguida, use o módulo de detecção direcional (ODM) para gerar ambas as características que são sensíveis à direção e à orientação ao mesmo tempo para aliviar os problemas de incoerencia de classificação e posicionamento na detecção de alvos direcionados. ReDet(Han等,2021aUsando uma rede de espinha dorsal com invariabilidade de direção para extrair características de invariabilidade de direção e usando o módulo de alinhamento de área recomendada de invariabilidade de direção (RiRoI Align) para extrair características de invariabilidade de direção adaptativamente, melhorando a precisão da detecção direcionada ao alvo. O ARC propõe um módulo de convolução rotativa adaptativa que extrai características de alvo em diferentes direções em diferentes imagens através de núcleos de convolução rotativa adaptativa.Pu等,2023), Large Selective Kernel Network(LSKNet)(Li等,2023Uma nova rede de espinha dorsal foi projetada para alcançar o efeito de uma grande convolução de núcleo de tamanho 23 x 23, primeiro usando a convolução comum de tamanho 5 x 5 em combinação com a convolução de expansão de tamanho 7 x 7, tornando assim a rede de extração de características com grande senso selvagem. Em seguida, uma rede de seleção de módulos foi projetada em combinação com a função Sigmoid usando a convolução 2D comum, que permitiu que a rede selecionasse dinamicamente convoluções de diferentes tamanhos de campo de sensação para diferentes alvos de detecção, melhorando a resolução de características da rede espinhal para obter melhores resultados de detecção. A STD propôs um novo método chamado de desacoplamento de transformação espacial, que oferece uma solução simples e eficaz para a detecção de alvos de teledetecção usando transformadores de visão.Yu等,2024)。 Como as categorias a serem detectadas são mais finas, o ruído é inevitavelmente introduzido durante a marcação de alvos de teledetecção. Para reduzir o impacto do rótulo errado no modelo, Generalized Cross Entropy Loss(Zhang等,2018Perda de entropia cruzada simétrica (Wang等,2019A capacidade de manter uma melhor consistência estatística em ambientes de ruído aumenta a robustez do modelo. Co-teaching(Han等,2018 (e co-ensino)Yu等,2019Aprenda um com o outro usando dois ou mais modelos de rede, treinando por meio da triagem de amostras inconsistentes nos resultados da previsão, evitando assim a sobreadaptação do modelo aos dados de ruído.Hu等(2022)Uma estratégia para corrigir o treinamento maximizado foi proposta e um filtro diferencial de probabilidade foi projetado para filtrar e corrigir rótulos errados, melhorando a precisão do modelo sob rótulos ruidosos.

3 Métodos de pesquisa

Respondendo aos problemas críticos na detecção de alvos de refinamento de imagens de detecção remota mencionados acima, este artigo propõe um método de detecção de alvos de refinamento de imagens de detecção remota de alta pontuação baseado em cabeçalhos de classe duplos. Em primeiro lugar, um novo cabeçalho de classificação dupla é proposto para permitir que conjuntos de dados semelhantes participem do treinamento do modelo durante todo o período; Em segundo lugar, um módulo de filtragem de rótulos errados baseado em previsão foi proposto para filtrar rótulos errados de acordo com a confiança de previsão durante o treinamento; Finalmente, a função de perda de entropia cruzada Margin é definida para aumentar as fronteiras de classificação em classificações finas. Abaixo, a estrutura básica deste método é dada, com base nessa base, para apresentar os três métodos acima.

3.1 Quadro básico

Como o desempenho do algoritmo de detecção de alvos em duas fases é geralmente melhor na detecção de alvos pequenos do que o algoritmo de alvos em fase única, em combinação com a presença de um grande número de alvos pequenos em imagens de alta resolução de detecção remota, o algoritmo de detecção de alvos rotativos em duas fases Orientado R-CNN (Xie等,2021 (Quadro de base).Fig. 1O quadro geral da R-CNN orientada. O método obtém 4 pontos angulares do alvo, previndo o desvio do topo da caixa candidata em relação ao topo da caixa horizontal e ao ponto médio da direita com base na caixa cercada horizontalmente, com alta precisão de detecção e velocidade de raciocínio rápida. Além disso, o contexto circundante pode fornecer informações importantes sobre a forma, direção e outras características do alvo, e a identificação bem-sucedida de objetos tende a depender do seu contexto, por isso este estudo utilizou a LSKNet.Li等,2023servir como rede de espinha dorsal para uma detecção mais eficaz de alvos de teledetecção.
figure

Fig. 1 Overall framework of oriented R-CNN

3.2 Cabeça de teste de classificação dupla

Há alguns conjuntos de dados públicos na maioria das tarefas de detecção de alvos refinados de detecção remota, que são semelhantes aos conjuntos de dados de treinamento, com cenários de imagem semelhantes e alvos semelhantes, mas as etiquetas de categoria do alvo são definidas de forma diferente e os graus de refinamento da etiqueta de categoria são diferentes. O conjunto de dados de competição de detecção de objetivos refinados contém dois conjuntos de dados semelhantes (conjunto de treinamento e conjunto de dados de referência), como exemplos:Fig. 2mostrado. Atualmente, a principal estratégia de uso de dados semelhantes é pré-treinar com conjuntos de dados semelhantes e inicializar os parâmetros do modelo usando o modelo pré-treinado. Essa abordagem apenas usa um modelo de treinamento de conjuntos de dados semelhantes como parâmetros inicializadores para o segundo treinamento, e os conjuntos de dados de referência não estão realmente envolvidos no treinamento, o que torna o uso dos dados menos eficiente e não aproveita o valor dos dados semelhantes. Para conjuntos de dados semelhantes, o mesmo alvo pode pertencer a categorias diferentes nos dois conjuntos de dados acima devido às suas definições diferentes de categorias de alvo, e se forçarmos a fusão de dois conjuntos de dados, ocorrerá uma situação em que o mesmo alvo pertence a categorias diferentes, o que pode enganar durante o treinamento de rede. Assim, embora seus cenários e objetivos sejam semelhantes, ainda não é possível combinar o treinamento. Enquanto os cabeçalhos de classificação dupla podem resolver esse problema, supondo que as redes de detecção sejam treinadas separadamente em dois conjuntos de dados com definições de categoria semelhantes, as características de classificação necessárias para distinguir entre perspectiva e contexto e diferentes categorias devem ser semelhantes em ambos os ramos de classificação do modelo de detecção. Se uma estrutura razoável for projetada para que o modelo possa treinar dois conjuntos de dados simultaneamente, os dados em conjuntos de dados diferentes otimizarão as características de classificação na mesma direção, e conjuntos de dados semelhantes aumentarão a precisão do modelo. Com base nas hipóteses acima, este artigo apresenta um novo tipo de cabeçalho de classificação dupla, em que cabeçalhos de classificação diferentes são treinados para conjuntos de dados diferentes, permitindo que diferentes definições de categorias de dados semelhantes participem do treinamento do modelo ao longo do tempo.Fig. 3Foram dados os esquemas dos cabeçalhos de teste comuns existentes e dos cabeçalhos de teste de dupla classificação apresentados neste artigo.
figure

Fig. 2 Sample image of the fine-grained object detection competition dataset

figure
figure

Fig. 3 The comparisons the dual classification detection head proposed in this paper with the ordinary detection head

O cabeçalho de classe duplo adiciona uma camada de conexão completa (class2) adicional após a característica da última camada do ramo de classificação para realizar a tarefa de classificação do conjunto de dados de referência, com a camada de conexão completa adicionada compartilhando a característica de classificação com a camada de conexão completa da classificação original. Durante a fase de treinamento, a previsão da categoria e os valores verdadeiros filtrados pelo número de categoria, a previsão da categoria pertencente ao conjunto de treinamento original e os valores verdadeiros correspondentes serão calculados separadamente para uma perda de classificação, a previsão da categoria obtida pertencente ao conjunto de dados de referência e os valores verdadeiros correspondentes serão calculados para outra perda de classificação, e a soma de duas perdas de classificação será a perda de classificação final.
Na fase de raciocínio, ignore diretamente a camada de ligação completa adicionada e emita apenas a previsão de categoria do cabeçalho de classificação original. Esta abordagem é capaz de aproveitar ao máximo o modelo de treinamento de dados semelhantes, para a rede de detecção original, os dados de referência estão envolvidos no treinamento de todas as camadas, exceto a camada de conexão completa da última camada, dados semelhantes foram aproveitados adequadamente, aliviando eficazmente o problema da insuficiência de dados e também melhorando a precisão do modelo. Este método pode ser usado para treinamento comum de qualquer conjunto de dados semelhante, e é igualmente aplicável para tarefas como classificação de alvos, detecção de alvos, segmentação de instâncias, segmentação semântica, e promete ser um método comum para uso de dados semelhantes. Como o método ignora diretamente os cabeçalhos de classificação adicionais durante a fase de raciocínio, não há nenhum impacto na velocidade de raciocínio do modelo.

3.3 Filtro de rótulos errados

A rotulagem artificial de alta precisão em massa frequentemente apresenta alguns erros de rotulagem. A rede de detecção otimiza os parâmetros da rede na direção oposta para encaixar os rótulos errados, o que afetará significativamente o desempenho geral da rede e, portanto, reduzirá o impacto dos rótulos errados no treinamento da rede. Normalmente, redes treinadas são capazes de prever corretamente a categoria de alvo e obter maior confiança. Este artigo baseia-se em um módulo de filtragem de etiquetas erradas baseado em previsões. Este módulo é usado antes do cálculo da perda de classificação durante a fase de treinamento da rede, principalmente para filtrar uma pequena quantidade de marcações confusas de categorias que surgem durante o processo de imagem de teleobservação de marcações reais. A pontuação de categoria obtida primeiro no treinamento para o raciocínio é obtida pela operação SoftMax adicional para obter a categoria e a confiança do objetivo, e se a categoria de previsão for diferente da etiqueta de valor verdadeiro e a confiança for superior a um determinado limiar, a etiqueta é considerada um rótulo errado, e este artigo filtrará a previsão correspondente e o valor verdadeiro após o rótulo errado para calcular a perda de classificação.
O processo de filtragem de etiquetas é o seguinte:Fig. 4mostrado,Fig. 4A etiqueta é considerada um rótulo errado se o valor médio é de categoria 0, a previsão é de categoria 1 e a confiança é de 0,9 (assumindo que o limiar dado seja de 0,88) e 0,9 é superior ao limiar de filtragem dado. Ao definir diferentes limiares de filtragem para controlar a proporção de alvos de filtragem, este método filtra a maioria das etiquetas erradas, reduzindo o impacto das etiquetas erradas no treinamento do modelo. Ao mesmo tempo, o método não afetará o treinamento da rede na fase inicial, porque durante essa fase, o ramo de classificação da rede começa a treinar com a inicialização aleatória, quando a rede está longe de convergir e, após a operação SoftMax, a confiança de categoria prevista geralmente está abaixo do limiar de confiança definido pelo módulo de filtro.
figure

Fig.4 Diagram of error label filtering

Este método é muito versátil e pode ser usado para filtrar etiquetas erradas em tarefas como classificação de alvos, detecção de alvos e segmentação de instâncias, aumentando a precisão do modelo. Como o método apenas adiciona uma operação SoftMax adicional após a previsão de rede, tem pouco impacto na velocidade de treinamento do modelo e não afeta a velocidade de raciocínio do modelo.

3.4 Perda de entropia cruzada de margem

Em tarefas de detecção de alvos genéricos, os algoritmos se concentram mais no design de funções de perda de ramificações de regressão, ignorando a classificação de funções de perda de ramificações. Devido à falta de tração para a necessidade de detecção de alvos finas, a partir do RCNN mais rápido (Ren等,2015Detecção de rede para o DINO mais próximoZhang等,2022Redes de detecção quase sempre usam perda de entropia cruzada como função de perda de um ramo de classificação. No entanto, a detecção de alvos finos tem muitas categorias de alvos, pequenas diferenças entre classes e grandes diferenças dentro da classe, e a perda de entropia cruzada tradicional não pode atender às necessidades de detecção fina. Aproveite a ideia de SVM para melhorar a precisão da detecção aumentando as fronteiras de classificação para diferentes categorias. Referência ao Reconhecimento Facial ArcFaceDeng等,2019A função de perda, juntamente com a margem angular, puni o ângulo entre a característica de profundidade e seu peso correspondente de forma agregada, aumentando simultaneamente a tensão intra-classe e as diferenças entre classes. De acordo com isso, este artigo calcula a perda de entropia cruzada no treinamento por meio da dedução artificial do valor de previsão da rede da amostra positiva do item constante e, em seguida, apresenta a função de perda de entropia cruzada Margin, a fórmula comum de cálculo da perda de entropia cruzada é a seguinte:
no estilo,indica que pertence aoprofundidade da classe,ePeso e viés para a última camada toda a camada de conexão,eRepresenta o número de categorias e o número de alvos nessa categoria em um lote de treinamento, respectivamente. A fórmula para a função de perda de entropia cruzada é
no estilo,Indica que a amostra é positiva e que Δ é constante (o melhor Δ é selecionado pelo resultado do conjunto de validação). Perda de entropia cruzada da margem aumenta o esquema de limite de classificação comoFig. 5mostrado. O verde e o laranja representam duas categorias, respectivamente, com linhas traçadas como fronteiras de decisão de classificação, e depois de adicionar a margem (ou seja, a Δ), a fronteira de classificação da categoria é artificialmente ampliada, o que facilitará a identificação das subclasses. Essa abordagem aumenta as fronteiras de classificação entre as diferentes categorias, dando ao modelo uma melhor capacidade de classificação fina. Como este método melhora apenas o ramo de classificação, ele pode ser usado com maior versatilidade para outras tarefas que exigem classificações finas, incluindo tarefas como a detecção de caixas horizontais e a divisão de instâncias. Ao mesmo tempo, o método apenas melhora a função de perda na fase de treinamento e, portanto, não afeta a velocidade de raciocínio do modelo.
figure
figure

Fig. 5 Schematic diagram of classification boundary between traditional cross-entropy and Margin cross-entropy

4 Resultados experimentais e análise

4.1 Introdução ao conjunto de dados experimentais

O conjunto de dados da competição de detecção de alvos refinados é um conjunto de dados lançado na pista de detecção de alvos refinados baseada em imagens de nível sub-americano no Desafio Nacional de Big Data e Inteligência Computacional de 2023. A fonte de dados é uma imagem de fusão de carga de luz visível de satélite 4D High View (resolução espacial 0,5 m). O conjunto de dados inclui três partes: um conjunto de treinamento, um conjunto de teste e dados de referência. O conjunto de treinamento e o conjunto de teste contêm 98 tipos de alvos de aeronaves e navios, com 8.000 e 3.000 imagens, respectivamente; O conjunto de dados de referência contém 39 categorias de alvos de granulado grosso, com 11.000 imagens, todas com tamanhos de 1024 x 1024, a posição do alvo é composta por oito valores de coordenadas de quatro pontos angulares.Fig. 2mostrado.
FAIR1M(Sun等,2022É um conjunto de dados em grande escala para a detecção e identificação de alvos finas de imagens de detecção remota. O conjunto de dados inclui 37 categorias de alvos finas. Por exemplo, dividir as aeronaves em modelos específicos Boeing 737, Boeing 747, Boeing 777, Boeing 787, Airbus 220, Airbus 321, Airbus 330, Airbus 350, C919 e ARJ21, dividindo os navios em navios de carga líquida, navios de carga seca, navios de pesca, navios de cruzeiro, rebocadores e navios de engenharia. O conjunto de dados contém mais de um milhão de alvos com marcas sofisticadas, distribuidos em vários ângulos, contendo 15.000 imagens de teledetecção, cada imagem com tamanhos na faixa de 1.000 x 1.000 a 10.000 x 10.000 pixels e resolução espacial de 0,3 a 0,8 m, usando a versão 2.0 do conjunto de dados no experimento, usando conjuntos de treinamento e validação para treinar o modelo e validar a precisão do algoritmo, respectivamente, e usando o conjunto de dados DOTA como conjunto de dados de referência.
DOTA(Xia等,2018É um conjunto de dados para a detecção de alvos de imagens aéreas em grande escala, incluindo aeronaves, navios, tanques de armazenamento, campos de beisebol, campos de tênis, campos de basquete, pistas terrestres, portos, pontes, veículos grandes, veículos pequenos, helicópteros, cruzamentos circulares, campos de futebol e campos de basquete. O conjunto de dados contém 2.866 imagens de satélite ou aéreas, cada imagem com tamanhos na faixa de 800 x 800 a 4.000 x 4.000 pixels e 180.000 objetos de diferentes dimensões, direções e formas, usando o DOTA como referência para o FAIR1M.

4.2 Indicadores e parâmetros de avaliação experimental

Este experimento usou a precisão média (mAP) para medir o desempenho da detecção com um limiar de IoU de 0,5. Quando a intersecção da caixa de fronteira do alvo com o valor verdadeiro é maior do que o IoU limiar e a etiqueta de classe prevista é correta, o resultado do teste é considerado verdadeiramente positivo (TP).
Os ambientes experimentais incluem: CPU Intel i7 13700K, GPU NVIDIA GeForce RTX3090Ti. Para sistemas Ubuntu 20.04, este código é baseado na caixa de ferramentas MMRotate.
Em todos os experimentos, o otimizador de Gradiente Aleatório (SGD) foi usado, a taxa de aprendizagem foi definida para 0,001, o momentum para 0,9, a decadência de peso para 0,0001, o tamanho do lote para 8, e outras configurações com o Oriented R-CNN na caixa de ferramentas MMRotate.Xie等,2021As configurações padrão da rede são consistentes. Em um experimento de defundação, a fim de acelerar o progresso experimental e verificar o efeito do modelo de rede o mais rápido possível, este artigo usa a pequena LSKNet-t como rede espinhal de extração de características, o modelo treina um total de 12 rodas (epoch), a rede de fusão de características usa pirâmides de características (FPN), usando apenas uma flip horizontal simples como método de expansão de dados. No Fair1MSun等,2022O LSKNet-s é usado como rede espinhal no conjunto de dados. Em um experimento de comparação de desempenho, a fim de melhorar a precisão do modelo com melhor comparação com outros métodos, este artigo usa o LSKNet-s como rede espinha dorsal, configurações de treinamento são as mesmas que o experimento de comparação de desempenho de outros métodos, ou seja, a forma como a expansão de dados adicionada para a rotação da imagem e treinar 24 rodadas. No processo de raciocínio, filtre o fundo usando o limiar de confiança predefinido de 0,02 e filtre as caixas de detecção excessivas usando a inibição de valores rotativos não extremamente grandes (R-NMS) com o limiar de 0,1. A velocidade de raciocínio é obtida quando o tamanho do lote é 1.

4.3 Experiência de fusão

4.3.1 Experimento de cabeça de teste de dupla classificação

Os cabeçalhos de classes duplos podem resolver problemas com a utilização de conjuntos de dados semelhantes e, portanto, melhorar a precisão do modelo. ComoTable 1Como mostrado, a introdução de cabeças de detecção de classificação dupla com base no modelo de base, uma vez que o projeto é capaz de aproveitar plenamente o conjunto de dados de referência para participar no treinamento, equivale a aumentar o tamanho do conjunto de dados e, ao mesmo tempo, é mais favorável à formação de características de classificação estáveis, uma vez que o conjunto de dados de referência não possui confusão de categoria artificial. Assim, após a adição de cabeçalhos de classificação dupla, a precisão do modelo no conjunto de dados da competição aumentou de 58,4% inicial para 72,4%, aumentando significativamente a precisão em 14%.

Table 1 Comparison of average accuracy of different models and methods on the fine-grained object detection competition dataset

模型和方法参训数据集mAP(50)
基线模型训练集58.4
基线模型+双分类头训练集+参考集72.4
基线模型+双分类头+错误标签过滤训练集+参考集73.7
基线模型+双分类头+错误标签过滤+ Margin交叉熵损失训练集+参考集74.7
Devido ao tamanho do conjunto de dados FAIR1M, existem 37 categorias de alvos sofisticados, incluindo mais de um milhão de alvos de teledetecção com marcação sofisticada; O conjunto de dados DOTA como conjunto de dados de referência é pequeno, com apenas 15 categorias com mais de 180.000 marcações. As abordagens anteriores não conseguiam treinar dois conjuntos de dados juntos para melhorar a precisão do modelo. Usando o cabeçalho de classe dupla apresentado neste artigo, é possível adicionar o conjunto de dados DOTA como conjunto de dados de referência ao processo de treinamento. Devido às diferenças no tamanho dos dados e na precisão das etiquetas, a melhoria da precisão geral do modelo seria limitada, em teoria, mesmo que o conjunto de dados DOTA pudesse ser treinado. ComoTable 2No conjunto de dados FAIR1M, após a adição de cabeçalhos de classificação dupla, o modelo ainda melhora a precisão de detecção em 0,4%, graças à capacidade de aproveitar plenamente as informações do conjunto de dados DOTA.

Table 2 Comparison of average accuracy of different models and methods on the FAIR1M dataset

模型方法参训数据集mAP(50)
基线模型FAIR1M40.6
基线模型+双分类头FAIR1M + DOTA41.0
基线模型+双分类头+Margin交叉熵损失FAIR1M + DOTA41.3

4.3.2 Experimento do módulo de filtragem de etiquetas erradas

O módulo de filtragem de rótulos errados melhora a precisão do modelo reduzindo o impacto de rótulos errados no treinamento. ComoTable 1Como mostrado, após a adição do módulo de filtragem de etiquetas erradas, a precisão do modelo no conjunto de dados da competição continuou aumentando de 72,4% para 73,7%, o que representa um aumento de 1,3%. Como o conjunto de dados FAIR1M não tem confusão artificial de rótulos, o problema do rótulo errado não é visível e, portanto, o módulo de filtragem de rótulo errado não é usado nesse conjunto de dados.
O módulo de filtragem de etiquetas varia de acordo com o limiar de filtragem e a proporção de etiquetas erradas filtradas também varia. Precisão do modelo em conjuntos de dados de competição sob diferentes limiares de filtragem comoTable 3Como mostrado na tabela, os diferentes limiares de filtragem têm um grande impacto no desempenho do modelo, obtendo a melhor precisão no conjunto de dados de competição quando o limiar de filtragem é tomado de 0,9. À medida que o limiar de filtragem diminui gradualmente, as etiquetas que atendem às condições de filtragem aumentam gradualmente, as etiquetas filtradas aumentam gradualmente, mais etiquetas erradas são filtradas, e a precisão do modelo aumenta gradualmente. Ao continuar a reduzir o limiar de filtragem, algumas etiquetas corretas também são filtradas neste momento e, portanto, a precisão do modelo diminui gradualmente.

Table 3 The influence of filtering threshold α on the accuracy of the model on the fine-grained object detection competition dataset

过滤阈值模型精度mAP(50)/%
0.8673.2
0.8773.8
0.8872.9
0.9074.7
0.9574.1
0.9874.1

4.3.3 Experimento de perda de entropia cruzada de margem

A perda de entropia cruzada da margem força a rede a ampliar os limites de decisão de classificação durante o treinamento, aumentando a precisão da detecção do modelo. ComoTable 1Como mostrado, a precisão do modelo no conjunto de dados da competição continuou aumentando de 73,7% para 74,7% após a perda de entropia cruzada Margin. ComoTable 2A precisão do modelo no conjunto de dados FAIR1M continuou aumentando de 41,0% para 41,3%, um aumento de 0,3%.
O modelo de base, juntamente com a estrutura de cabeçalho de classe dupla e o módulo de filtragem de etiquetas, detecta redes sob diferentes limiares de fronteira com precisão comoTable 4Como mostrado, pode ser visto que o limiar da função de perda Δ tem um grande impacto na precisão do modelo, quando Δ é menor, a distância do limite de classificação é pequena, neste momento a melhoria limitada da precisão do modelo. Com o aumento de Δ, as fronteiras de classificação se expandem gradualmente e a precisão do modelo aumenta gradualmente para obter a melhor precisão quando Δ é 0,12 no conjunto de dados de competição de detecção de objetivos refinados. Ao continuar a aumentar Δ, o modelo continuou a ampliar as fronteiras da classificação e a precisão da detecção diminuiu. Detecção de redes sob diferentes limites de precisão no conjunto de dados FAIR1M comoTable 5Como mostrado, após a adição da perda de entropia cruzada Margin, a precisão da detecção aumentou em 0,3% e a melhor precisão é obtida quando Δ é de 0,10.

Table 4 The influence of margin threshold Δ on the accuracy of the model on the fine-grained object detection competition dataset

边界阈值Δ模型精度mAP(50)/%
0.1173.6
0.1274.7
0.1374.4
0.1573.8

Table 5 The influence of Margin threshold Δ on the accuracy of the model on the FAIR1M dataset

边界阈值Δ模型精度mAP(50)/%
0.0941.1
0.1041.3
0.1141.1
0.1240.7

4.4 Experimento de comparação de desempenho

Realize experimentos de comparação de desempenho em competições de detecção de objetivos refinados e em conjuntos de dados FAIR1M.

4.4.1 Resultados experimentais no conjunto de dados de competição de detecção de objetivos refinados

Table 6Para a precisão deste método no conjunto de dados da competição, pode ser visto que a precisão da detecção do método proposto neste artigo melhorou significativamente, aumentando a precisão da detecção de 58,4% para 74,7%, o que representa uma melhoria total de 16,3%. O estudo reduziu ligeiramente a velocidade de raciocínio, de 29,9 frames por segundo para 25,7 frames por segundo, depois de usar uma rede de espinha dorsal maior, enquanto a precisão de raciocínio aumentou para 76,5% usando 1312 x 1312 pixels, reduzindo a velocidade para 18,1 frames por segundo, e o modelo ainda teve uma melhor visão em tempo real. Esta abordagem do artigo usou uma rede de espinha dorsal menor e menos habilidades de treinamento para conquistar o primeiro lugar na pista de detecção de alvos sofisticada baseada em imagens de sub-escala no Desafio Nacional de Big Data e Inteligência Computacional de 2023, superando todas as outras equipes. Essas equipes tentaram usar muitos métodos de detecção, usando redes espinhais maiores e muitas técnicas de treinamento. Como a marca de valor verdadeiro do conjunto de testes de repetição ainda não foi publicada, não é possível obter a precisão de outros métodos neste conjunto de dados, mas a concorrência mostrou que este método possui a maior precisão e velocidade de raciocínio mais rápida.

Table6 Experimental results of different methods on the fine-grained object detection competition dataset

模型方法骨干网络图片尺寸/像素mAP(50)/%推理速度(FPS)
基线模型LSKNet-t102458.436.3
基线模型+双分类头LSKNet-t102472.436.3
基线模型+双分类头+错误标签过滤LSKNet-t102473.736.3
基线模型+双分类头+错误标签过滤+ Margin交叉熵损失LSKNet-t102474.736.3
基线模型+双分类头+错误标签过滤+ Margin交叉熵损失LSKNet-s102475.736.2
基线模型+双分类头+错误标签过滤+ Margin交叉熵损失LSKNet-s131276.518.1
Os resultados do teste visual deste método no conjunto de dados da competição são os seguintes:Fig. 6Como mostrado, as diferentes cores das caixas de detecção no gráfico representam diferentes categorias. O método apresentado neste artigo pode melhorar de forma estável a precisão do modelo e obter os melhores resultados no conjunto de dados da competição, o que ilustra completamente a eficácia deste método. Seja para aeronaves pequenas ou navios densamente colocados, este método permite uma detecção precisa.
figure

Fig.6 Sample object detection results of our method on the fine-grained object detection competition dataset

4.4.2 Resultados experimentais no conjunto de dados FAIR1M

Table 7Para comparar este método com outros métodos de detetor de alvo rotativo no conjunto de dados FAIR1M. A precisão e a velocidade de outros métodos são visíveis como os resultados obtidos usando as configurações padrão baseadas no conjunto de dados DOTA na plataforma MMRotate, treinando no conjunto de treinamento FAIR1M e testando no conjunto de validação. Devido à grande ocupação, STD(Yu等,2024Só é possível treinar com imagens de 800 x 800 pixels. porTable 7Este método obteve simultaneamente uma precisão subalta de 41,3% e uma velocidade máxima de inferência de 29,1 quadros por segundo. Como outros algoritmos de contraste podem inicializar parâmetros de treinamento apenas com um modelo pré-treinado no conjunto de dados DOTA, e este algoritmo pode participar diretamente do treinamento usando os dados DOTA, este algoritmo melhora a precisão do modelo.

Table 7 Experimental results of different methods on the FAIR1M dataset

模型方法骨干网络图片尺寸/像素mAP(50)/%推理速度(FPS)
S2Anet(Han 等,2021b)ResNet50102429.821.1
R3Det(Yang 等,2019)ResNet50102416.223.6
ROI Transformer(Ding等,2018)ResNet50102433.223.6
Gliding Vertex (Xu等,2021)ResNet50102430.426.7
ReDet(Han等,2021a)Re-ResNet50102434.88.8
Oriented RCNN(Xie等,2021)ResNet50102436.125.8
STD(Yu等,2024)LSKNet-s80041.72.2
LSKNet(Li等,2023)LSKNet-s102440.629.1
本文方法LSKNet-s102441.329.1
Os resultados do teste visualizado no conjunto de dados FAIR1M sãoFig. 7mostrado. As diferentes cores da caixa de detecção no gráfico representam diferentes categorias de alvos, pode ser visto se os vários alvos no conjunto de dados ou para vários tipos de instalações rodoviárias e vários tipos de locais, este método pode alcançar a detecção precisa e obter melhores resultados de teste, o que ilustra completamente a eficácia deste método.
figure

Fig. 7 Detection results of this method on the competition dataset

5 Conclusões

Para resolver problemas com a detecção de alvos de refinamento de imagens de detecção remota, este artigo apresenta uma estrutura de cabeçalho de classe dupla e compara e valida os métodos apresentados neste artigo com modelos e métodos existentes. As principais conclusões são as seguintes:
(1) A cabeça de detecção de classificação dupla apresentada neste artigo treina diferentes conjuntos de dados por meio de diferentes ramos, resolvendo o problema de que a detecção de alvos de refinamento de imagens de teledetecção não pode usar dados semelhantes de forma eficaz;
(2) o método de filtragem de rótulos errados baseado em previsão pode reduzir o impacto de rótulos errados no treinamento do modelo;
(3) Perda de entropia cruzada de margem, melhorando a precisão do modelo aumentando os limites de classificação;
(4) Experimentos com conjuntos de dados de competição de detecção de objetivos refinados, conjuntos de dados FAIR1M e conjuntos de dados DOTA demonstraram que os métodos apresentados neste documento melhoraram significativamente a precisão e a robustez da detecção do modelo.
Ao mesmo tempo, o cabeçalho de classificação dupla apresentado neste artigo também tem certas limitações, para conjuntos de treinamento relativamente pequenos, há uma maior melhoria de desempenho após a adição de treinamento comum de conjuntos de dados semelhantes. No entanto, para os conjuntos de treinamento de maior tamanho de dados em si, a melhoria no desempenho não foi significativa, mesmo quando um treinamento conjunto de dados semelhante foi adicionado (apenas 0,4% no conjunto de dados FAIR1M). Além disso, o módulo de filtragem de etiquetas erradas apresentado neste artigo só pode filtrar etiquetas com localização errada em casos de confusão de categorias de etiquetas. Em pesquisas futuras, continuaremos a estudar mais métodos de reutilização de dados semelhantes e métodos de filtragem de marcações erradas de localização para melhorar ainda mais a precisão da detecção de alvos de imagens de detecção remota.

References

  1. 1.
    Deng J K, Guo J, Xue N N and Zafeiriou S. 2019. ArcFace: additive angular margin loss for deep face recognition//Proceedings of the 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Long Beach: IEEE: 4685-4694
  2. 2.
    Ding J, Xue N, Long Y, Xia G S and Lu Q K. 2018. Learning RoI transformer for oriented object detection in aerial images//Proceedings of the 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Long Beach: IEEE: 2844-2853
  3. 3.
    Han B, Yao Q M, Yu X R, Niu G, Xu M, Hu W H, Tsang I W and Sugiyama M. 2018. Co-teaching: robust training of deep neural networks with extremely noisy labels//Proceedings of the Proceedings of the 32nd International Conference on Neural Information Processing Systems. Montréal: Curran Associates Inc.: 8536-8546
  4. 4.
    Han J M, Ding J, Xue N and Xia G S. 2021a. ReDet: a rotation-equivariant detector for aerial object detection//Proceedings of the 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE: 2785-2794
  5. 5.
    Han J M, Ding J, Li J and Xia G S. 2021b. Align deep features for oriented object detection. IEEE Transactions on Geoscience and Remote Sensing, 60: 5602511
  6. 6.
    Han Y Q, Yang X Y, Pu T and Peng Z M. 2022. Fine-grained recognition for oriented ship against complex scenes in optical remote sensing images. IEEE Transactions on Geoscience and Remote Sensing, 60: 5612318
  7. 7.
    Hu Z B, Gao K, Zhang X D, Wang J W, Wang H and Han J W. 2022. Probability differential-based class label noise purification for object detection in aerial images. IEEE Geoscience and Remote Sensing Letters, 19: 6509705
  8. 8.
    Jiang Y Y, Zhu X Y, Wang X B, Yang S L, Li W, Wang H, Fu P and Luo Z B. 2018. R2CNN: rotational region CNN for arbitrarily-oriented scene text detection//Proceedings of the 24th International Conference on Pattern Recognition. Beijing: IEEE: 3610-3615
  9. 9.
    Li D R, Wang M, Shen X and Dong Z P. 2017. From earth observation satellite to earth observation brain. Geomatics and Information Science of Wuhan University, 42(2): 143-149
  10. 10.
    Li K, Wan G, Cheng G, Meng L Q and Han J W. 2020. Object detection in optical remote sensing images: a survey and a new benchmark. ISPRS Journal of Photogrammetry and Remote Sensing, 159: 296-307
  11. 11.
    Li W T, Chen Y J, Hu K X and Zhu J K. 2022. Oriented RepPoints for aerial object detection//Proceedings of the 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE: 1819-1828
  12. 12.
    Li Y X, Hou Q B, Zheng Z H, Chen M M, Yang J and Li X. 2023. Large selective kernel network for remote sensing object detection//Proceedings of the 2023 IEEE/CVF International Conference on Computer Vision (ICCV). Paris: IEEE: 16748-16759
  13. 13.
    Luo H L and Chen H K. 2020. Survey of object detection based on deep learning. Acta Electronica Sinica, 48(6): 1230-1239
  14. 14.
    Ma J Q, Shao W Y, Ye H, Wang L, Wang H, Zheng Y B and Xue X Y. 2018. Arbitrary-oriented scene text detection via rotation proposals. IEEE Transactions on Multimedia, 20(11): 3111-3122
  15. 15.
    Pu Y F, Wang Y R, Xia Z F, Han Y Z, Wang Y L, Gan W H, Wang Z D, Song S J and Huang G. 2023. Adaptive rotated convolution for rotated object detection//Proceedings of the 2023 IEEE/CVF International Conference on Computer Vision (ICCV). Paris: IEEE: 6566-6577
  16. 16.
    Ren S Q, He K M, Girshick R and Sun J. 2015. Faster R-CNN: towards real-time object detection with region proposal networks//Proceedings of the 29th International Conference on Neural Information Processing Systems. Montreal: MIT Press: 91-99
  17. 17.
    Sun X, Wang P J, Yan Z Y, Xu F, Wang R P, Diao W H, Chen J, Li J H, Feng Y C, Xu T, Weinmann M, Hinz S, Wang C and Fu K. 2022. FAIR1m: a benchmark dataset for fine-grained object recognition in high-resolution remote sensing imagery. ISPRS Journal of Photogrammetry and Remote Sensing, 184: 116-130
  18. 18.
    Wang Y S, Ma X J, Chen Z Y, Luo Y, Yi J F and Bailey J. 2019. Symmetric cross entropy for robust learning with noisy labels//Proceedings of the 2019 IEEE/CVF International Conference on Computer Vision (ICCV). Seoul: IEEE: 322-330
  19. 19.
    Xia G S, Bai X, Ding J, Zhu Z, Belongie S, Luo J B, Datcu M, Pelillo M and Zhang L P. 2018. DOTA: a large-scale dataset for object detection in aerial images//Proceedings of the 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE: 3974-3983
  20. 20.
    Xiao J S, Zhang S H, Chen Y H, Wang Y F and Yang L H. 2022. Remote sensing image object detection based on bidirectional feature fusion and feature selection. Acta Electronica Sinica, 50(2): 267-272
  21. 21.
    Xie X X, Cheng G, Wang J B, Yao X W and Han J W. 2021. Oriented R-CNN for object detection//Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision. Montreal: IEEE: 3500-3509
  22. 22.
    Xu Y C, Fu M T, Wang Q M, Wang Y K, Chen K, Xia G S and Bai X. 2021. Gliding vertex on the horizontal bounding box for multi-oriented object detection. IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(4): 1452-1459
  23. 23.
    Yang X, Yan J C, Feng Z M and He T. 2019. R3Det: refined single-stage detector with feature refinement for rotating object//Proceedings of the 39th AAAI Conference on Artificial Intelligence. Washington: AAAI Press: 3163-3171
  24. 24.
    Yao Y Q, Cheng G, Xie X X and Han J W. 2021. Optical remote sensing image object detection based on multi-resolution feature fusion. National Remote Sensing Bulletin, 25(5): 1124-1137
  25. 25.
    Yi J R, Wu P X, Liu B, Huang Q Y, Qu H and Metaxas D. 2021. Oriented object detection in aerial images with box boundary-aware vectors//Proceedings of the 2021 IEEE Winter Conference on Applications of Computer Vision. Waikoloa: IEEE: 2149-2158
  26. 26.
    Yu H T, Tian Y J, Ye Q X and Liu Y F. 2024. Spatial transform decoupling for oriented object detection//Proceedings of the 39th AAAI Conference on Artificial Intelligence. Vancouver: AAAI Press: 6782-6790
  27. 27.
    Yu X R, Han B, Yao J C, Niu G, Tsang I and Sugiyama M. 2019. How does disagreement help generalization against label corruption,Proceedings of the 36th International Conference on Machine Learning. Long Beach: PMLR: 7164-7173
  28. 28.
    Zhang F, Wang X Y, Zhou S L and Wang Y Q. 2021. DARDet: a dense anchor-free rotated object detector in aerial images. IEEE Geoscience and Remote Sensing Letters, 19: 8024305
  29. 29.
    Zhang H, Li F, Liu S L, Zhang L, Su H, Zhu J, Ni L M and Shum H Y. 2023. DINO: DETR with improved denoising anchor boxes for end-to-end object detection Proceedings of the International Conference on Learning Representations(ICLR) Kigali City [DOI: 10.48550/arXiv.2203.03605] Zhang L, Zhang Y S, Yu Y, Ma Y Z and Jiang H G. 2022. Survey on object detection in tilting box for remote sensing images. National Remote Sensing Bulletin, 26(9): 1723-1743
  30. 30.
    Zhang S, Li S S, Wei G F, Zhang X N and Gao J W. 2022. Refined multi-scale feature-oriented object detection of the remote sensing images. National Remote Sensing Bulletin, 26(12): 2616-2628
  31. 31.
    Zhang Z L and Sabuncu M R. 2018. Generalized cross entropy loss for training deep neural networks with noisy labels//Proceedings of the 32nd International Conference on Neural Information Processing Systems. Montréal: Curran Associates Inc.: 8792-8802
  32. 32.
    Zhao P B, Qu Z S, Bu Y J, Tan W M and Guan Q Y. 2021. PolarDet: a fast, more precise detector for rotated target in aerial images. International Journal of Remote Sensing, 42(15): 5831-5861
  33. 33.
    Zhao Z Y, Xue Q L, He Y H, Bai Y F, Wei X and Gong Y H. 2024. Projecting points to axes: oriented object detection via point-axis representation//Proceedings of the 18th European Conference on Computer Vision–ECCV 2024. Milan: Springer: 161-179
  34. 34.
    Zhou X Y, Wang D Q and Krähenbühl P. 2019. Objects as points. arXiv preprint arXiv: 1904.07850

Leia o texto completo

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website