マルチタスク協調学習に基づく教師なしドメイン適応リモートセンシング画像セマンティックセグメンテーション

  • role: First author第一作者
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

  • Email:1202321619@cug.edu.cn
  • Introduction:E-mail1202321619@cug.edu.cn
WANG Yu1,  
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

FENG Yuting1,  
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

GONG Sishi1,  
  • Affiliation:

    School of Surveying, Mapping and Information Engineering, West Yunnan University of Applied Sciences, Dali 671006, China

MAO Yanqin2,  
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

    Hubei Provincial Key Laboratory of Intelligent Geological Information Processing, Wuhan 430074, China

LI Shengwen13,  
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

    Hubei Provincial Key Laboratory of Intelligent Geological Information Processing, Wuhan 430074, China

FANG Fang13,  
  • role: Corresponding author通信作者
  • Affiliation:

    School of Computer Science, China University of Geosciences (Wuhan), Wuhan 430078, China

    Hubei Provincial Key Laboratory of Intelligent Geological Information Processing, Wuhan 430074, China

  • Email:zhoushunping@mapgis.com
  • Introduction:E-mail zhoushunping@mapgis.com
ZHOU Shunping13*

サマリー

リモートセンシング画像のセマンティックセグメンテーションは、土地被覆および利用分類、都市計画、変化検出などの分野で重要な役割を果たしている。ドメイン適応技術は、有望な教師なし学習手法として、リモートセンシング画像のセマンティックセグメンテーションの発展を大きく促進してきた。しかし、既存のモデルは単一タスクに基づく学習を行っており、学習されたセグメンテーション特徴が不十分であり、セグメンテーション過程でリモートセンシング画像の複雑な領域を正確に認識することが困難である。これを解決するために、本論文ではマルチタスク学習ドメイン適応セマンティックセグメンテーションネットワークMTLDANet(Muti-Task Learning Domain Adaption Network)を提案する。本ネットワークは、リモートセンシング画像におけるセマンティック情報と標高情報を協調学習することで、セグメンテーション特徴の学習能力を向上させる。具体的には、本手法はタスク固有のセマンティック特徴と標高特徴をタスク間特徴関連学習モジュールに入力し、タスク間の潜在的相関を掘り下げることで、より強力なタスク固有特徴表現を獲得し、疑似ラベル指導の混合一貫性学習モジュールにより疑似ラベルの品質を向上させ、グローバルおよびローカルな整合を実現する。さらに、エントロピー誘導型クラスレベル整合モジュールにより、分類が難しいクラスの区別性もさらに強化される。最後に、ISPRS 2DおよびUS3Dデータセットに基づき、4組のクロスシーンリモートセンシング画像セマンティックセグメンテーション実験を行った。その結果、本手法が複数の複雑なクロスドメインシナリオにおいて既存のドメイン適応手法よりも著しく優れていることが示された。

キーワード

セマンティックセグメンテーション; 教師なしドメイン適応; リモートセンシング画像; マルチタスク学習; 標高情報; セマンティック情報; 疑似ラベル; エントロピー

1はじめに

リモートセンシング画像の意味分割は、リモートセンシング画像中の特定の地物に対して、画素レベルのラベルを割り当てるプロセスであり、これを基礎とするリモートセンシング画像の解釈タスク(Zhu等,2017b)は、シーン理解、地物検出、3 D再構築などのタスクを行うための重要な前提(Kussul等,2017)、都市計画、環境モニタリング、災害評価と予測などの分野に広く応用されている(Luo和Ji,2022)。リモートセンシング技術の急速な進歩に伴い、リモートセンシング画像の収集はより効率的で便利になり、利用可能なデータの数と種類が大幅に増加した。これらの豊富なデータリソースには、大量の画像サンプルだけでなく、さまざまなタイプの補助情報が融合されており、リモートセンシング画像自動翻訳タスクの向上に強固な基礎を築いています。
深学習の継続的な発展の恩恵を受け、全監督方法は意味分割タスクを顕著な進展を遂げた。特に、最初のエンドツーエンドフル畳み込みネットワーク(Long等,2015)の出現は、リモートセンシング画像処理におけるコンボリューションニューラルネットワークCNN(Convolutional Neral Networks)の広範な応用(Maggiori等,2017)。しかし、伝統的なCNNにはいくつかの問題がある。一方、CNNは通常、プール化とアップサンプリング動作を含み、アップサンプリングはプール化過程における情報損失を回復できず、特徴図の空間解像度低下と詳細情報の喪失を招いた、一方、リモートセンシング画像は、入力画像として適切なサイズに裁断する必要があり、コンテキスト情報の損失を招く。既存の研究では、これらの問題を解決するためのいくつかの方法が提案されています。例えば、ABCNetは空間詳細とグローバル背景情報(Li等,2021a)。Zhang等(2020)空間推論モジュールを使用して空間相関を学習し、適応空間プールを使用してコンテキスト情報を集約するマルチスケールコンテキスト集約ネットワークを設計した。E-D-Netは、2つのサブネットワークを設計することにより、画像のエッジ情報と詳細情報をそれぞれキャプチャし、両者を融合させ、建物抽出中のエッジ予測の不正確な問題(Zhu等,2021)。しかしながら、上記の全監視に基づくセマンティック分割方法は、入手困難な画素レベルラベルを大量に必要とし、実用化に困難をもたらした。また、全監督の方法では、トレーニングデータとテストデータは通常、同じ分布から来ていると仮定し、モデルが新しい分野のデータに適用されると、その性能は著しく低下する。
モデルの高品質ラベルへの依存を減らし、その汎化能力を向上させるために、無監督ドメイン適応UDA(Unsupervised Domain Adaptation)に基づく意味分割方法が広く注目され、研究されている。UDAモデルは、ラベル付きソースドメインデータの知識をラベルなしターゲットドメインに移行することで、高精度な予測を実現します。既存のUDA方法は主に4種類に分類される:生成に基づく方法(Chang等,2019)、対抗に基づく方法(Zheng等,2022)、エントロピーに基づく方法(Vu等,2019a)と自己訓練方法(Gaoなど、2021)を含む。上述の方法に基づいて、研究者たちはドメイン間の差異を縮小するために様々なUDA戦略を提案した。たとえば、Yao等(2021)対抗エントロピーを結合してドメイン適応フレームワークを構築し、目標の予測精度を高める、Xu等(2022)ソースドメインとターゲットドメインのクラス内とクラス間の差異を減らすために、クラス知覚の生成対抗ネットワークを提案した、Zhang等(2022)では、カリキュラムベースのローカル-グローバルドメイン間適応フレームワークを開発し、ローカルセマンティックからグローバル構造にフィーチャーを調整します。上記の方法に加えて、生成された方法に基づいてCycleGAN(Zhu等,2017a)とDualGAN(Yi等,2017)などの古典的なネットワークに基づいて、ピクセルレベルでデータ分布を整列します。たとえば、Li等(2021b)DualGANによって画像を翻訳し、分割ネットワークに複数の弱監督制約を追加することで、リモートセンシング画像のドメイン間分割精度を向上させ、Yan等(2022)偽ラベルが割り当てられていないピクセルに焦点を当て、すべてのピクセルの情報をより効果的に利用するために交差平均教師ネットワークを開発しました。しかし、上述した単一光学映像に基づく無監督領域適応の意味分割方法は、同物異スペクトル、同スペクトル異物の現象を識別するのに非常に困難である。このような困難は、ドメイン適応分割の効果を制限し、より困難なものにする。
为了克服单一光学影像的局限性,近年来,多任务学习的方法受到了广泛关注。多任务学习的基本思想是不同视觉任务之间可以相互协同学习,共同优化预测性能。常见的视觉任务包括语义分割、深度估计/高程估计(Cipolla等,2018)、エッジ検出(Song等,2020)、法線推定(Bhattacharjee等,2022)などがあります。各種監督情報を導入してモデル訓練を行うことにより、リモートセンシング画像は、地物種別の予測、地物高さの推定、建物のエッジの検出などのタスクに広く使用できる。ここで、地物の高さ情報と意味情報は密接に関連しており、リモートセンシング画像では、標高情報は地物の空間幾何学と強い関連を持っており、地物カテゴリに対する追加の判別情報を提供することができる。対照的に、エッジ検出は主に画像中の境界情報に依存しており、物体の境界を区別するのに役立つが、複雑なシーンでは、単純なエッジ情報は地物カテゴリを正確に区別するのに不足する可能性がある。多くの地物の高度差はモデルの分類性能を著しく向上させることができ、特に複雑な地理環境では、高度情報はモデルにより豊富な空間コンテキストを提供する。そのため、多くの研究は、高距離推定、エッジ検出などの補助タスクと意味分割タスクを同じモデルに統合して共同訓練を行うことを試みている。この方法は、他のタスクの情報を利用して、モデルが地物カテゴリを判断するのを間接的に支援することにより、複雑な領域に対するモデルの鑑別能力を向上させることを目的としている。たとえば、Vu等(2019b)CNNに基づいて残差補助ブロックを加えて深さ推定を行い、2つのタスクの出力結果を融合することで深さ感知予測図を生成し、意味分割の精度を効果的に向上させた。Kundu等(2019)輪郭に基づく内容正則化とタスク横断蒸留モジュールを提案してタスクの一致性を掘り起こし、協力してエッジ検出、深さ推定と意味分割予測を完成した。Saha等(2021)意味予測と深さ予測のタスク依存関係を符号化するためのタスク依存層を提案した。Wang等(2021)深さ推定タスクには領域固有性があると考えられているため、彼らは2つの深さデコーダ出力の深さの違いを利用してドメイン適応の難しさを推定し、さらに意味分割の偽ラベルを細分化する。Chen等(2018)さらに、共同学習意味分割と高距離推定タスクは、テクスチャ、スペクトル情報などのドメイン特定情報に対するモデルの関心を弱め、ドメイン不変情報の学習に集中することができることを指摘した。現在のマルチタスク学習に基づくセマンティック分割方法は良好な見通しを示しているが、依然として顕著な不足がある。まず、タスクの重みのバランスがとりにくく、異なるタスクの貢献の違いはあるタスクが過度に主導し、他のタスクの学習効果を損なう可能性がある。次に、タスク間の一貫性のあるマイニング精度を向上させる必要があり、タスク間の関連をどのように正確に捉え、利用するかは課題があります。また、領域不変特徴の学習にも困難があり、モデルはテクスチャやスペクトルなどの領域固有情報に過度に依存しやすく、その汎化能力に影響を与えます。堅牢な領域に依存しない特徴を抽出することは、現在の方法が直面している主な課題である。
そのため、本文はマルチタスク協同学習の無監督ドメイン適応意味分割フレームワークを提案した。本文は高距離推定タスクを導入することによって高距離情報を学習し、タスク間の特徴関連学習を利用して異なるタスクの特徴表現を共同で最適化し、偽ラベル指導の混合一貫性学習を採用して偽ラベル品質の向上を実現し、異なるドメイン間の有効な知識移転を促進する。最後に、エントロピー誘導のクラスレベル整列方法を採用し、モデルの難分クラス特徴の判別性能をさらに改善した。本研究は複雑なシーンにおけるモデルのドメイン間汎化能力と分割精度を向上させ、リモートセンシング映像の翻訳応用に技術的支持を提供することを期待する。

2本文の提案方法

2.1全体フレームワーク

本論文で提案するマルチタスク学習に基づくドメイン適応意味分割フレームワークMTLDAnet(Muti-Task Learning Domain Adaption Network)、例えばFig. 1を参照してください。ここで、ソースドメイン光学映像とターゲットドメイン光学映像は初期特徴抽出モジュールに入力され、パラメータ共有エンコーダとタスク特定ボトルネックを通じて初期意味特徴と初期標高特徴を抽出する、タスク間特徴関連学習モジュールは、連続する交差特徴強化ユニットを介してタスク固有の意味特徴と標高特徴を交差結合し、特徴表現を最適化する、ダミータグガイダンスのハイブリッド一貫性学習モジュールはターゲットドメインデータを教師モデルに入力してダミータグを生成し、最適化されたダミータグを用いて学生モデルのハイブリッドサンプルに対する学習を監督し、ソースドメインとターゲットドメインのデータ分布を近づける、エントロピーブートのカテゴリレベル位置合わせモジュールは、分割結果にエントロピー値を重み付けして細粒度のカテゴリレベル位置合わせを指示し、ドメイン適応ネットワークのパフォーマンスを向上させる。
figure

Fig. 1 A framework for domain adaptive semantic segmentation based on multi-task learning

2.2ドメイン適応セマンティック分割方法

2.2.1タスク横断フィーチャー関連学習モジュール

関連研究では、関連する異なるタスクの特徴が、特徴表現能力を向上させるために相補的な情報を元の特徴に効果的に組み込むことができることが確認されている(Bhattacharjee等,2022)。関連学習の役割を最大化するために、本文は異なるタスクの特徴表現を交差強化するために、タスク横断特徴関連学習モジュールを構築した。このモジュールは、主に空洞空間ピラミッドプール化ASPP(Atrous Spatial Pyramid Pooling)、交差注意力融合ブロックCAFB(Cross Attention Fusion Block)、およびゲート構造(例えばFig. 2を参照してください。
figure

Fig. 2 Detailed structure of cross-task feature correlation learning

まず、元のセマンティックフィーチャーをおよび標高フィーチャータスク固有のASPPに入力し、マルチスケール情報を学習し、ネットワークがコンテキストをキャプチャする能力を強化します。その後、交差注意力融合ブロックは、標高特徴と意味特徴の顕著な特徴を十分に捕捉し、さらに相補特徴を適応的に選択して元のタスク特徴に溶け込み、最適化された標高特徴と意味特徴を得るために使用される。以上のプロセスをクロスフィーチャー拡張ユニットと呼びます。タスク横断フィーチャー関連学習モジュールには、2つの交差フィーチャー拡張ユニットが挿入され、それぞれ異なるタスクの中間フィーチャーが生成されます和最終フィーチャー和。セマンティック分割タスクを例にとると、連続的なクロスフィーチャー拡張ユニットにより、ネットワークが補完的な標高情報に注目するようになり、セマンティックフィーチャー表現をより階層的に細分化することができる。特徴連携学習の過程で任務特定特徴中の相補的な情報に過度に注目しないようにするため、同時に原始任務の有効な学習を無視して、本文は原始特徴をと中間フィーチャーチャネルを介してマージし、最終フィーチャーとゲート構造に一緒に入力して、元のフィーチャーと相補的なフィーチャーを緊密に統合して、適応融合フィーチャーを取得します。この融合操作は、次のように式で表される。
式中チャネルの次元下げ操作を表し、チャネル数を元の半分に減らし、チャネルマージ操作を表し、はアクティブ化関数であり、適応重み行列を表します。
交差注意力融合ブロックの詳細な構造は、Fig. 3を参照してください。重要な特徴にできるだけ焦点を当て、無関係ノイズの学習を抑制するために、ASPPから出力されたセマンティック特徴と標高特徴は、チャネル注意力CAM(Channel Attention Module)(Hu等,2018)と空間的注意力SAM(Spatial Attention Module)(Woo等,2018)を使用して、チャネル次元と空間次元から有意な意味的特徴を統合および顕著な標高特性。顕著な特徴が得られた後、ネストされたゲート制御融合構造を用いて、異なるタスクの特徴表現を十分に強化するために、タスクの顕著な特徴、およびタスクにまたがる顕著な特徴を交差統合する。セマンティック分割タスクの場合、このプロシージャは
式中、チャネルの次元下げ操作を表し、チャネル数を元の半分に減らし、チャネルマージ操作を表し、はアクティブ化関数です。
figure

Fig. 3 Detailed structure of the cross-attention fusion block

2.2.2疑似タグ・アドバイザのハイブリッド一貫性学習モジュール

ソースドメイン知識のターゲットドメインへの移行を促進してグローバルデータ分布に一致させるために、本文は混合サンプルに基づく一貫性学習を採用した。まず、ターゲットドメインサンプルをClassMix(Olsson等,2021)の方式でソースドメインサンプルに混入、データ拡張による新しい混合サンプルの生成。その後、学生モデルで混合サンプルとソースドメインサンプルを訓練し、教師モデルでターゲットドメインサンプルを訓練する。教師モデルは、学生モデルの指数移動平均によってパラメータを更新する。具体的には、ソースドメインの地表真値に基づいてClassMix方式で混合マスクを生成し、教師モデルを通じてターゲットドメインの偽ラベルを生成し、ソースドメイン真値とターゲット偽ラベルと混合マスクを掛け合わせて混合ラベルを形成し、混合ラベルは学生モデルを監督するために使用される。このプロセスは、モデルをターゲットドメインに普及させるために、ターゲットドメインの特定の知識を学生モデルに導入することができます。
以上の過程で、学生モデルの性能は偽ラベルの品質の高さと相関している。偽ラベルに低信頼度のピクセルが多すぎると、学生モデルが間違ったターゲットドメイン知識を学習することになります。偽ラベルに情報が少なすぎると、モデルがソースドメインの知識を学習する傾向になります。反復回数が増えるにつれて、モデルの特徴表現能力が徐々に強化されることは明らかである。モデルの特徴表示能力と偽ラベル品質をバランスさせるために、本文は簡単な増分式偽ラベルフィルタリング戦略を提案した。最小しきい値の指定、最大しきい値合計反復回数と現在の反復回数を選択し、次の式によって現在のしきい値を決定し、疑似ラベルをフィルタします。
式中、はフィルタされた偽ラベルであり、はターゲットドメインの元の偽ラベルであり、代表擬似ラベルの生成の予測確率図である。
高距離推定タスクとセマンティック分割タスクはいずれも光学画像から特徴情報を取得するため、高距離推定の予測結果も画像セマンティック情報と相関する。高距離推定タスクの適応難易度はセマンティック(Wang等,2021)を使用して、ネットワークの最適化方向をより良く指導するために、混合サンプルのクロスエントロピー損失にペナルティ重みとして重み付けすることができる。訓練中にセマンティック分割損失および高距離推定損失式を次のように定義します。
式中、和画像の幅と高さをそれぞれ表し、は地物カテゴリの数です。さらに、和は意味分割と標高推定の対応する地表真値であり、和ネットワーク出力の意味分割予測値と高距離推定予測値である。
混合サンプルの場合、加重分割損失の式は次のとおりです。
式中、は、混合サンプルの高度な適応ウェイトであり、は混合サンプルであり、混合サンプルの偽ラベルであり、混合サンプルの予測確率図であり、、和それぞれ確率図の長さ、幅、チャンネル数、和ソースドメインとターゲットドメインをそれぞれ表す標高推定分類器、混合サンプルの高距離真値を表します。

2.2.3エントロピーブートのカテゴリレベルの配置

エントロピー値は、予測結果の不確実性または信頼性を評価するために使用することができる。ドメイン適応の関連研究はエントロピー値の重要な役割を十分に証明した(Saporta等,2020)(Xu等,2021)。通常、ソースドメインサンプルの予測結果はより正確で、エントロピー値は一般的に低く、高エントロピーは一般的に意味境界に現れる。ターゲットドメインの予測結果には、より多くの誤分類とノイズがあり、ほとんどの領域で高エントロピーを示しています。したがって、エントロピーマップはソースドメインとターゲットドメインの違いを視覚的に反映することができる。ソースドメインとターゲットドメインのセマンティック上の位置合わせをさらに促進するために、本論文では、混合サンプルの学習を監視するためのエントロピー誘導のクラスレベル位置合わせモジュールを提案した。
まず、エントロピー値から各エントロピー平均値を算出し、0〜1に正規化します。各クラスのエントロピー平均値は、混合サンプル中の分類が困難なクラスを反映し、その値が高いほどクラスの適応難易度が高い、すなわちクラスの信頼性が低いと予測される。1から各エントロピー平均値を減算した差分値を予測確率図に重み付けすることで、地物を信頼できないカテゴリに誤って分類することを減らすことができる。エントロピー値は各画素の予測不正確性を反映するため、これを罰重みとして、難分類領域の学習力を高めることができる。各種類のエントロピー平均値とエントロピー値を分割損失に加えることにより、セマンティックレベルで異なるカテゴリの分離性を強化することができる。本文ではこの損失を重み付けエントロピー分割損失と定義する。計算式は次のとおりです。
式中、予測確率図を表し、、和それぞれ確率図の長さ、幅、チャンネル数、ラベル値を表し、代表ラベルのクラスcに属するピクセル数。

2.2.4ネットワークトレーニング戦略

具体的には、エンド・ツー・エンドネットワーク全体の1回の反復は、3つのトレーニングステップから構成される。
まず、タグ真値を利用してネットワークを最適化し、意味情報と標高情報に対するネットワークの特徴表示能力を向上させる。ソースドメインの地上真値と標高データ、ターゲットドメインの標高データを監視情報として使用し、対応する予測結果と交差エントロピー損失とberHu損失を計算し、計算方法は以下の通り:
式中、ソースドメインの分割損失を表し、和ソースドメインサンプルと混合サンプルのそれぞれを表す高距離推定損失。和それぞれ、ソースドメインサンプルと混合サンプルの高距離真値です。和初期分割予測と最終分割予測の結果を表します。和はソースドメインサンプルの初期高距離推定予測と最終高距離推定予測であり、和混合サンプルの初期高距離推定予測と最終高距離推定予測である。
次に、ハイブリッド疑似タグを利用してネットワークを最適化し、ハイブリッド一貫性学習を通じてネットワークの非タグサンプルの学習を強化し、ソースドメインとターゲットドメインのグローバルな位置合わせを促進する。混合疑似ラベルを監視情報として使用し、混合サンプルの意味分割結果と重み付け交差エントロピー損失を計算する。計算方法は以下の通り:
最後に、エントロピー値を利用してネットワークを最適化し、エントロピー値をマークされていないサンプルの予測結果に重み付けし、ネットワークの有用な情報の学習を促進する。監視情報として疑似タグを用い、エントロピー値に重み付けされたセマンティック分割結果と重み付け交差エントロピー損失を計算し、エントロピー損失と記す、次のように計算されます。
以上の損失を統合することで、全体的な損失を得ることができます。

3実験データ結果と分析

3.1データセットの概要

提案した方法の有効性を評価するために、本文は2組のデータセットを用いて検証と分析を行った。
第1セットのデータセットは、国際写真測量・リモートセンシング学会が2 D意味表記コンテストで提供した公開データセットISPRS 2 Dデータセット(Rottensteiner等,2012)、PotsdamデータセットとVaihingenデータセットを含む。如Fig. 4を参照してください。Potsdamデータセットは38枚の6000×6000の高解像度正射影映像とその対応する高品質分割マーキング画像とDSM画像を含み、RGB、IRRGとRGB-IRの計3種類のモードを提供し、本文ではIRRGとRGBモードの画像を使用し、地上サンプリング距離は5 cmである。地上物体は6つのカテゴリの1つ、すなわち雑波/背景、不透過水面、自動車、樹木、低植生と建築にマーキングされている。画像は4598枚の512×512のサブ図に裁断され、そのうち2904枚はマークがあり、1694枚はマークがない。Vaihingenデータセットには約2000×2000の高解像度画像、DSM、6種類のマークアップ画像33枚が含まれており、正射画像はIRRGモードのみを提供し、地上サンプリング距離は9 cmである。画像は512×512のサブ図1696枚に裁断され、そのうち896枚はマークがあり、800枚はマークがない。
figure

Fig. 4 Example of Potsdam and Vaihingen datasets

2組目のデータセットは、DATA FUSION CONTEST 2019が提案した大規模リモートセンシングデータセットUS 3 D(Le等,2019)を提供し、米国フロリダ州ジャクソンビル市とネブラスカ州オマハ市の関連リモートセンシングデータを提供し、RGB光学画像、地上高(AGL)データと対応するセマンティックタグを含む。AGL画像は、物体が地面より上の高さを示し、標高情報を抽出するために使用することができる。US3 Dデータセットの地物カテゴリには、地上、植生、建築、水域、高架橋の5種類がある。データセットは、トレーニングやテストのために領域ごとにラベル付きデータとラベルなしデータに分割されます。画像は512×512サイズのサブマップにカットされ、ジャクソンビル市には2112枚のタグ付き画像と1948枚のタグなし画像があり、オマハ市には3588枚のタグ付き画像と3484枚のタグなし画像がある。Fig. 5US3 Dのいくつかのデータ例を示した。
figure
figure

Fig. 5 Example of US3D dataset

3.2評価指標

本論文の実験では、F 1 _ ScoreとIoUを用いて提案方法の性能を評価し、F 1 _ Scoreの定義は以下の通りである:
式中、多種類の意味分割タスクに対して、(True Positive)は予測値と真の値が共に正のクラスの画素数を表し、(False Positive)は、真の値が負のクラスであるが予測値が正のクラスの画素数を表し、False Negativeは予測値が負のクラスであるが真の値が正のクラスの画素数を表す。すべての予測が正のサンプルに占める予測の正しいサンプルの割合を表し、すべての真の値が正のサンプルに占める予測が正しいサンプルの割合を表し、はい和の加重平均値を測定し、モデルの安定性を測定することができる。
予測分割と実際の分割結果との間の重複割合として計算され、モデルの分割精度を測定することができます。計算式は次のとおりです。

3.3実験及びパラメータの設定

本文はDeeplabV 2フレームワークを共有エンコーダとタスク特定デコーダとして採用し、そのバックボーンネットワークはImageNet上で事前訓練されたResNet 101ネットワークである。初期特徴抽出モジュールでは、タスク特定のボトルネックは2つの3×3の畳み込みブロックからなり、初期分類器は1×1の畳み込みブロックからなる。タスク特定デコーダにおけるASPPのサンプリングレートは[6,12,18,24]であり、タスク横断特徴関連学習におけるASPPのサンプリングレートは[1,4,8,12]である。本方法のトレーニングプログラムはCorDAに基づいており、データ強化方式はランダム水平反転、ランダム垂直反転、色ジッタ、ガウスノイズに設定されている。
本文のネットワークアーキテクチャは主流のPyTorchフレームワーク上で実現され、すべての実験はグラフィックスモデルがNVIDIA GeForce RTX 3090、グラフィックスメモリが24 GBのワークステーション上で実行された。訓練では、Nesterov加速を伴うランダム勾配降下最適化器を用いた。運動量を0.9、重み減衰を5×10-4、初期学習率を2.5×10-4に設定します。バッチサイズとepochはそれぞれ2と10に設定されています。擬似タグ混合一貫性学習の最低閾値と最高閾値はそれぞれ0.4と0.6であり、和いずれも1に設定されています。

3.4実験結果

3.4.1ベースライン方法

本文はソースドメイン(Source Only)方法と4種類の最先端マルチタスク学習に基づくUDA方法をベースラインとして実験比較を展開する:深さ感知ドメイン適応ネットワークDADA(Vu等,2019b)、クロスタスク関係ネットワークCTRL(Saha等,2021)、相互情報ドメイン適応ネットワークMIDA(Chen等,2022)と関連性知域適応ネットワークCorDA(Wang等,2021)。提案したマルチタスク学習フレームワークはドメイン適応部分を取り除き、マルチタスク学習ネットワークを形成する。Source onlyメソッドは、ネットワーク上でソースドメインデータを訓練し、予測結果を得るためにターゲットドメイン上で直接テストします。DADAは深さ予測タスク支援意味分割を通じて、深さ特徴の豊富な特徴表示を融合し、分割性能を向上させる。CTRLは、意味予測と深さ予測タスクの依存関係を符号化するためのタスク間関係層を提案し、深さ離散化技術を通じて異なる意味カテゴリと深さ階層の関係をさらに学習する。MIDAは特徴対話モジュールと対話情報注意ユニットを提案し、2つのタスク間の潜在関係を掘り起こす。CorDAはタスク特徴関連モジュールを提案し、異なるタスクの特徴相関性を学習し、深さ差異で目標の意味偽ラベルを細分化する。

3.4.2ベースライン方法との比較結果

リモートセンシング画像の無監督領域適応意味分割タスクにおける本方法の有効性と異なるシーンにおけるロバスト性を検証するために、本文はISPRS 2 DデータセットとUS3 Dデータセットに4組の実験を行った。ISPRS 2 Dデータセットの地物の外観の違いが顕著で、シーンが複雑である、一方、US3 Dデータセットの地物の外観の違いは小さい。ISPRS 2 Dデータセットの実験では、それぞれPotsdamのIRRG映像とRGB映像をソースドメイン、Vaihingenをターゲットドメインとした。US3 Dデータセットの実験では、ジャクソンビルとオマハがターゲットドメインとソースドメインとして交互に使用された。ソースドメインのラベル付きデータとターゲットドメインのラベルなしデータはトレーニングに使用され、ターゲットドメインのラベル付きデータはテストに使用されます。
(1)複雑なシーンでのドメイン適応――Potsdam IRRG→Vaihingen IRRG。地理環境が異なり、同種の地物の外観に大きな差がある場合の本文の方法の性能をPotsdam IRRG→Vaihingen IRRGのドメイン横断実験を通じて評価した。如Table 1を参照してください。本文の方法はSource onlyと比べて、すべてのドメイン適応方法が高い精度を得ていることがわかる。全体的に、本文の方法の平均F 1 _ scoreと平均IoUはそれぞれSource only 35.22%と33.76%より高く、すべての地物類の中で最適な精度を得た。また、本文の方法はスプリアスまたは背景クラスの予測正確率を大幅に向上させ、クラス間の差が大きい地物と他の地物の分類混同を減少させた。

Table 1 Quantitative results with Potsdam IRRG as source domain and Vaihingen IRRG as target domain /%

方法评估指标杂波或背景不透水面汽车树木低矮植被建筑总体
Source onlyF1_Score3.0054.8734.7169.7117.2063.4740.49
IoU1.5337.8021.0053.519.4046.4828.29
DADAF1_Score1.0468.7437.0670.6143.0869.2048.29
IoU0.5252.3722.7554.5727.4552.9035.10
CTRLF1_Score4.0270.2916.3868.9249.9975.8547.58
IoU2.0554.208.9252.5733.3261.1035.36
MIDAF1_Score16.5779.884.9671.5856.1087.0152.68
IoU9.0466.512.5455.7538.9977.0141.64
CorDAF1_Score7.2483.8048.2171.5463.2088.2960.38
IoU3.7672.1231.7655.6946.2079.0448.10
本文F1_Score70.2987.0364.4271.9968.6291.9375.71
IoU54.1977.0547.5156.2452.2385.0762.05
可視化の結果Fig. 6示されているように、ドメイン適応能力が不足しているため、Source onlyメソッドは密集した建築領域と影領域での予測結果のノイズが大きく、他の地物分類と混同される背景クラスが多数存在している。ドメイン適応がない場合は、固定形態がなく、クラス内の差が少ないカテゴリ(樹木など)の知識をソースドメインからターゲットドメインに移行しやすくなります。対照的に、ドメイン適応を適用する4つのベースライン方法は、建築、不透過水面、およびスプリアス間の分類混同を低減し、小さな目標の識別精度を向上させる。しかし、これらの方法は依然としてスプリアスクラスの影響を受けており、誤った予測結果を招いている。対照的に、本文の方法の予測結果はより正確で、異なる地物間の分類の混同を大幅に減少し、特に境界領域で優れている。元の画像では建物がわずかにねじれていたり、木に遮られていたりしていますが、本文の方法は依然として最もはっきりした建物の輪郭を生成し、低植生などの小さな目標を識別することに成功しました。陰影干渉の下で、本文の方法は標高情報を結合することによってスペクトル情報の不足を補い、陰影の影響を著しく低減し、最適な性能を得た。また、本論文の方法は各種の地物、特に小さな目標と境界の識別に優れている。全体的に言えば、本文の方法はマルチタスク特徴情報を効果的に融合し、スペクトルによる分類ミスを減らし、最も信頼できる分割結果を提供した。
figure

Fig. 6 Partial visualization of segmentation results for the Potsdam IRRG to Vaihingen IRRG experiment

(2)複雑なシーンでのドメイン適応――Potsdam RGB→Vaihingen IRRG。Potsdam RGB→Vaihingen IRRGのドメイン横断実験を通じて、地理環境と画像モードの違いが大きい場合の本文の方法の表現を評価した。ソースドメインとターゲットドメインのイメージングの違いにより、同種の地物マッピングが複雑になり、ドメインの位置合わせの難しさが増しています。如Table 2示されているように、ドメイン適応処理の注目点が異なる可能性があるため、ドメインギャップが大きくなるにつれて、他の先進的な方法とSource onlyの精度の違いが小さくなります。例えば、CTRL法は樹木類で最も精度が高いが、自動車類では最も精度が低い、一方、MIDAとCorDAは樹木類では精度が悪い。対照的に、本文の方法は意味と標高情報の相関性を明示的に構築し、細粒度の整列を制約することによって、性能に対するドメインギャップの負の影響を減少させた。その結果、本文の方法はすべての方法の中で最適な平均F 1 _ Scoreが61.67%であり、平均IoUが48.02%であり、5種類の地物の中で最も優れていることを示した。本文の方法の樹木類の精度は低いが、樹木と低い植生類の精度をバランスさせることにより、両者の分類の混同を減少させ、複雑なドメイン間分割タスクにおける有効性を示した。

Table 2 Quantitative results with Potsdam RGB as source domain and Vaihingen IRRG as target domain /%

方法评估指标杂波或背景不透水面汽车树木低矮植被建筑总体
Source onlyF1_Score1.2962.2438.5256.5516.3562.5439.58
IoU0.6545.1823.8639.428.9145.4827.25
DADAF1_Score2.4465.2827.3366.3232.7162.7842.81
IoU1.2348.4615.8349.6119.5545.7530.07
CTRLF1_Score0.6768.0310.0073.1633.5169.7442.52
IoU0.3451.565.2657.6820.1353.5531.42
MIDAF1_Score10.7368.6739.6614.0651.3383.1044.59
IoU5.6752.2924.737.5734.5271.0932.64
CorDAF1_Score5.0270.7554.061.3849.2274.6842.52
IoU2.5854.7437.040.7032.6559.5931.22
本文F1_Score24.9480.8165.2249.9958.1090.9761.67
IoU14.2567.8148.3933.3240.9483.4448.02
可視化の結果Fig. 7示したように、Source only方法は建物と不透過水面を区別することは難しいが、樹木を識別することはできる。他のドメイン適応ベースライン法により、建物と不透過水面の分類が改善されますが、境界にはノイズが残っています。特に大きな建物と影の領域ではノイズが発生しています。対照的に、本文の方法は他の方法より著しく優れており、予測結果はより良いコンテキスト関係を持ち、誤り分類を減少させた。本文の方法は建築物の輪郭及び植生と非植生区の正確な識別を正確に識別し、特に小さい目標の位置付けと予測に優れている。全体的な結果により、本文の方法は樹木区を効果的に識別し、樹木と低い植生類の精度をバランスさせることができ、その他の方法はある種類だけでよく表現され、これは増大した領域格差による誤った知識移転の可能性がある。総じて言えば、本文の方法は大部分の地物上で最適な分割結果を得て、高距離情報を有効に利用してスペクトル情報の曖昧性を最適化して、各種のドメインに適応してシーンに適応する。
figure

Fig. 7 Partial visualization of segmentation results from Potsdam RGB to Vaihingen IRRG experiment

(3)簡単なシーンでのドメイン適応――Omaha→Jacksonville。地理環境は異なるが地物の外観が似ている場合の本方法の性能をOmaha→Jacksonvilleのドメイン横断実験により評価した。如Table 3示されているように、DADAとCTRLの全体的な精度とほとんどのカテゴリの精度はSource onlyメソッドよりも低い。これは、単純なシーンでのドメイン適応では、不適切な改善方向に負の移行やオーバーフィットが発生し、パフォーマンスが低下することを示しています。他の先進的な方法とSource onlyの精度の差はそれほど大きくなく、これは簡単なシーンでのドメイン適応方法による改善が限られていることを示している。すべての方法の中で、本文の方法は依然として最高の性能を得て、そして地面、植生と建築の種類の上ですべてその他の方法より優れています。オマハの水域と高架橋類のサンプル数が少なすぎるため、本文の方法は意味と高距離情報の相補的な学習に重点を置いており、サンプル量が少ない場合、意味と高距離情報のマッピング関係を十分に学習することが困難であるため、この2種類の方法の識別能力はやや不足している。

Table 3 Quantitative results with Omaha as source domain and Jacksonville as target domain

方法评估指标地面植被建筑水域高架桥总体
Source onlyF1_Score84.5074.0375.2285.6233.6870.61
IoU73.1558.7760.2874.8620.2557.46
DADAF1_Score82.4868.6469.4587.5912.6864.17
IoU70.1852.2653.2077.926.7752.06
CTRLF1_Score82.6466.9469.9785.7410.8163.22
IoU70.4150.3253.8175.045.7251.06
MIDAF1_Score85.6473.9075.4483.0139.5171.50
IoU74.8858.6160.5770.9624.6257.93
CorDAF1_Score85.4875.5778.7990.6621.5870.42
IoU74.6460.7465.0082.9212.0959.08
本文F1_Score85.8976.6979.5189.2528.2671.92
IoU75.2762.1965.9980.5816.4660.10
可視化の結果Fig. 8図示されているように、ドメイン適応なしの場合、Source only方法はコンテキスト関係を良好に維持することができるが、形状が不規則な地物を予測する際には、周囲の地物と混同しやすく、特に地物と地面が分類される際には、小さな目標が検査漏れやすい。DADAとCTRL法では、地物の予測結果はSource only法より悪く、サンプル量の少ない高架橋は類似のスペクトルを持つ地上類と混同しやすく、建物と水域の検出正確率と完全度はSource only法に及ばない。MIDAとCorDAの方法は各種類の地物によく表れているが、細部から見ると、植生類と建築類は依然として検査漏れと予測不備が多い。これに対して、本文で提案した方法は各種類の地物に対して比較的に良い性能を示し、小さい目標物体に対する検査漏れと検査間違いを減少した。同時に、本文の方法はより滑らかでより整然とした地物形状、特に建物の境界を示した。全体的に見ると、本文の方法はドメイン適応難易度が低いシーンでも最適な性能を得ることができ、建築と植生の分割を著しく改善し、提案した方法の汎化能力が強く、各種ドメイン適応シーンに広く使用できることを証明した。
figure

Fig. 8 Visualization of segmentation results for the Omaha to Jacksonville experiment

(4)簡単なシーンでのドメイン適応――Jacksonville→Omaha。地理環境は異なるが地物の外観が似ている場合の本文の方法の性能をJacksonville→Omahaのドメイン横断実験により評価した。如Table 4示したように、Omaha→Jacksonvilleの実験と同様に、DADAとCTRLの精度はSource onlyの方法より低く、本文の方法は67.83%の最適F 1 _ Scoreと52.98%の最適平均IoUを獲得し、多数の地物カテゴリで良い精度を得た。注目すべきは、本方法は高架橋の分割性能を大幅に向上させ、地上、植生、水域類において本方法の精度は最適精度よりやや低いが。これは、他の方法に比べて、本方法は小サンプルに対してより強い特徴表現能力とドメイン移行能力を持っていることを示している。

Tabel 4 Quantitative results with Jacksonville as source domain and Omaha as target domain /%

方法评估指标地面植被建筑水域高架桥总体
Source onlyF1_Score88.0155.9472.4145.0833.0458.90
IoU78.5838.8356.7529.1019.7944.61
DADAF1_Score88.6555.7668.9852.5428.3058.85
IoU79.6138.6652.6535.6316.4844.61
CTRLF1_Score88.6458.4570.1342.9732.0658.45
IoU79.5941.3054.0027.3719.0944.27
MIDAF1_Score89.9060.4575.3647.1844.6263.50
IoU81.6643.3260.4730.8728.7249.01
CorDAF1_Score90.2258.4475.1056.4450.5366.15
IoU82.1741.2860.1439.3133.8151.34
本文F1_Score90.1058.0275.8455.1660.0567.83
IoU81.9840.8761.0838.0942.9152.98
可視化の結果Fig. 9を参照してください。ドメイン適応がない場合、Source onlyメソッドは全体的に良好であるが、地面と他の地物の間に分類の混同がある。ドメイン適応に加入すると、一部の混同が減少したにもかかわらず、大型建築の誤検出、小型建築の癒着、高架橋の認識不全が残っている。観察によると、分類混同は主に高度差が明らかな領域で発生し、その他の方法はこれらの領域でもエラーが発生しやすいことが分かった。対照的に、本文の方法は建物の位置と形状を正確に予測することができて、特に密集した小型建築区域では、建物の癒着が少ない。全体的に言えば、本文の方法の地物境界は更に平滑で、各種類の地物の上ですべて良好な分割性能を維持した。これらの結果は、本論文で提案した方法がより良い利点を持っていることを示している。
figure

Fig. 9 Visualization of segmentation results for the Jacksonville to Omaha experiment

3.5アブレーション実験及び討論

3.5.1アブレーション試験

本文の方法における異なるモジュールの有効性を検証するために、ベースラインに異なるモジュールを組み合わせてアブレーション研究を行った。まず、MTLDAnetフレームワーク上のCFCL、PMCL、ECAモジュールを除去し、CorDAメソッドと一致するモデルをベースライン(Baseline)としてドメイン適応メソッドを設定します。異なる組み合わせのアブレーション実験の結果Table 5に示すように、ベースライン法は49.27%の平均IoUと61.42%の平均F 1 _ Scoreを取得できることが分かる。これは、マルチタスク学習フレームワークを導入することで、ハイレベル情報を効果的に利用して意味情報を強化することができることを示している。次に、タスク横断特徴関連学習モジュール(+CFCL)をベースラインにそれぞれ追加して、連合標高特徴とセマンティック特徴のモデルに対する有効性を検証し、偽ラベルの異なる融合ゲート構造の詳細構造指導を加えた混合一貫性学習モジュール(+PMCL)は最適化された偽ラベルと一致性学習の改善を検証し、エントロピー誘導を加えたクラスレベル整列モジュール(+ECA)はドメイン適応への貢献を検証した。

Table 5 Quantitative results of ablation experiments /%

方法CFCLPMCLECA平均F1_Score平均IoU
Baseline61.4249.27
+CFCL64.6751.81
+PMCL67.5752.92
+ECA69.7555.31
+CFCL、PMCL71.5259.41
+ECA、PMCL70.4456.01
+ECA、CFCL69.1956.48
Ours75.7162.05
Table 5示されているように、ベースラインに上記3つのモジュールを単独で加えると、それぞれ51.81%、52.92%、55.31%の平均IoUが提供されます。高距離特徴と意味特徴の連係を強化することはモデルの意味に対する識別能力を強化するのに役立ち、高信頼性の目標ドメインサンプルとソースドメインサンプルの一致性学習を強化することはソースドメイン知識の良好な移転を促進することができ、エントロピー情報の指導の下でソースドメインとターゲットドメインのカテゴリレベルの整列を促進することはドメイン間分割性能を大幅に向上させることができる。一方、PMCLにCFCLモジュール(+CFCL、PMCL)またはECAモジュール(+ECA、PMCL)を加えると、平均IoUはそれぞれ「+PMCL」より6.49%、3.09%高かった。また、CFCLにECAモジュール(+ECA、+CFCL)を加えると、平均IoUは「+CFCL」より4.67%高い。この利得は、より高い精度を得るために、異なるモジュール間で協働することができることをさらに証明している。また、すべてのモジュールを追加する方法、つまりMTLDAnetは分割精度を大幅に向上させ、平均IoUと平均F 1 _ Scoreはベースラインよりそれぞれ12.78%と14.29%高い。これは、異なるタスク間の緊密な関連学習と、異なるドメイン間の細粒度配置を同時に重視することで、ドメイン間の意味分割のパフォーマンスをより効果的に向上させることができることを示しています。

3.5.2タスク横断的特徴関連学習における異なる融合ゲート制御構造の影響

タスク横断フィーチャー関連学習モジュールでは、タスク固有のフィーチャー、タスク横断フィーチャー、タスク横断フィーチャー間の関連性を効果的に学習する方法が重要であり、異なるタスクフィーチャーの表示能力を十分に強化し、最適化することができます。異なる組み合わせ方式に基づき、本節では3種類の融合ゲート制御構造を設置し、それぞれ合併後の融合ゲート制御構造、ネスト融合ゲート制御構造、並列融合ゲート制御構造である。ハイレベルフィーチャーをセマンティックフィーチャーに組み込む例として、具体的な構造は次のとおりです。Fig. 10を参照してください。これら3つの構造をタスク横断特徴関連学習モジュールにそれぞれ挿入して実験を行い、Table 6に表示されているコード「RED」は変更できます。たとえば、REDの代わりに
figure
figure
figure
figure

Fig.10 Detailed structure of different fusion gating structures

Table 6 Quantitative results using different fusion gating structure models /%

融合门控结构类型平均F1_Score平均IoU
合并后融合门控结构70.5756.73
本文嵌套融合门控结构74.0360.55
并列融合门控结构63.1251.57
Table 6このように、最適な融合構造はネストされた融合ゲート制御構造であり、それぞれ60.55%の平均IoUと74.03%の平均F 1 _ Scoreを得た。次に、統合後にゲート構造を融合させ、並列融合ゲート構造の性能が最も悪い。これは、異なるゲート構造がタスクフィーチャー間の関連学習モジュールの有効性に大きく影響することを十分に示しています。異なる構造では、ネストされた融合ゲート制御構造は、異なるタスクの相補性を十分に掘り起こすことができ、それによってタスク横断の特徴情報をより細かく融合し、さらに予測精度を向上させることができる。
Fig. 11でいくつかのサンプルの各種出力特徴図と予測結果を可視化した。異なる融合構造を用いたモデルは、樹木、低い植生、自動車などの地物における分割精度が類似しており、主に雑波、建物、不透過水面の間にいくつかの分類混同が存在する。例えば、予測入力サンプルはFig. 11中真値がスプリアスの領域である場合、統合後の融合モジュール構造は不透過水面とスプリアス上の特徴図が比較的に顕著であるため、結果としてスプリアスが不透過水面に誤分類されていることが示された。また、並列融合ゲート制御構造は不透過水面類の特徴図でより顕著であるため、予測結果におけるスプリアスは完全に不透過水面に誤分類される。予測入力サンプルはFig. 11中真値が水面を透過しない領域の場合、影領域では、統合後の融合モジュール構造と並列融合ゲート構造のいずれも建物の特徴が顕著な場合があったため、建物に誤って分類される場合があった。全体的に見ると、ネストされた融合ゲート構造を用いたモデルの予測が最適で、スプリアスと不透過水面をよりよく識別することができ、そして類似のスペクトルを持つ建物と不透過水面を正確に識別し、影の干渉を減少させた。これは、タスク固有の特徴、タスク固有の特徴、およびタスク横断の顕著な特徴がセマンティック分割タスクに対して重要性が異なるため、ネスト融合ゲート構造によってタスク固有の特徴を階層的に細分化することで、階層的に異なる顕著な特徴とタスク固有の特徴の効果的な結合を促進することができるからである可能性がある。
figure
figure

Fig. 11 Visualization of the output feature maps generated by different fusion gating structures

3.5.3クロスタスクフィーチャー関連学習におけるクロスフィーチャー強化ユニット数の影響

タスク横断フィーチャー関連学習モジュールのパフォーマンスに影響を与えるもう1つの重要な要素は、クロスフィーチャー強化ユニットです。タスク横断特徴関連学習モジュールが最適な性能を得るために、交差特徴強化ユニットの数をそれぞれ1、2、3に設定して3組の実験を行い、量子化結果はTable 7を参照してください。クロスエンハンスメントユニットの数が徐々に増加するにつれて、平均F 1 _ Scoreと平均IoUはいずれも前後に増加する傾向を示し、数が2の場合に精度が最適であることがわかる。

Table 7 Quantitative results for models with different numbers of cross-feature enhancement units /%

交叉特征增强单元数量平均F1_Score平均IoU
162.0950.45
2(本文)74.0360.55
365.1753.91
異なる交差特徴強化ユニットの数の影響をさらに分析するために、Fig. 12に表示されます。交差特徴増強ユニット数が1の場合、低層建築物は不透水面に分類されやすく、不透水面は雑波と低植生に誤分類されやすいことがわかる。これは、単一の交差特徴強化ユニットが高次元高距離特徴と高次元意味特徴をうまく融合できず、スペクトル情報が複雑で高距離情報が少ない場合の予測結果が困惑するためである可能性がある。交叉特徴増強ユニットの数が3の場合、樹木予測はより正確になるが、建物は低植生分類と混同され、面積がより大きい誤った分類が発生する。これらの分類混同は通常、高度値が明らかでない領域に現れるが、これは、複雑なシーンで顕著ではない高度情報が意味情報を誤って導くように、過剰な交差特徴強化ユニットが意味特徴に高度特徴を組み込みすぎている可能性がある。数量が2の場合、モデルは異なるタスクからの顕著な情報を十分に結合し、モデルの特徴表示能力を強化し、複雑なシーンでの予測性能が最も優れている。全体的に、セル数が少なすぎると、セマンティックタスクとハイレベルタスクからの高次元フィーチャー間の相補的な構築力は強くありませんが、セル数が多すぎると、モデルは異なるタスクの相補的な情報を過度にマイニングし、元のタスクへの関心を弱めます。どちらの場合も最終的な意味情報の予測結果に影響します。交差フィーチャーの拡張数が2の場合、最適なバランスをとることができます。
figure

Fig. 12 Visualization results of the model using different numbers of cross-feature enhancement units

3.5.4混合一貫性学習におけるサンプル混合方式の影響

混合一貫性学習では、異なるサンプル混合方式がモデルのロバスト性と耐干渉性に影響を与える可能性がある。領域混合方式とは、画像を同じ大きさの領域に分割することであり、混合画像は、ソース領域とターゲット領域からの画像が領域マスクに基づいて分割され、例えばFig. 13を参照してください。領域混合には6種類の領域マスクが設置され、訓練中にランダムにいずれかのスプライス形式を選択した。カテゴリ混合方式では、ソースドメイン画像のすべてのクラスから半分のカテゴリをランダムに選択します。これらのカテゴリが存在する領域は、ターゲットドメイン画像の同じ領域のピクセルに置き換えられます。Fig. 13を参照してください。最適なサンプル混合方式を得るために、混合一貫性学習における混合方式をそれぞれ領域混合とカテゴリ混合に設定して2組の実験を行い、Table 8で量子化結果を示します。クラス混合を用いたモデルは最適な全体性能を得ており、領域混合を用いたモデルよりも各クラスの地物上の精度が優れていることがわかる。これは、カテゴリ混合方式がよりロバストであり、ソースドメイン知識のターゲットドメインへの移行をより容易にすることができることを示している。具体的には、種別混合を用いたモデルは、自動車、樹木、低植生のような部内差の小さい地物において、いずれも使用領域混合のモデルより10%程度精度が高く、その他の部内差の大きい地物において5%程度精度が高い。これはさらに、クラス混合を使用することで、異なる地物の識別能力を一般的に最適化することができ、クラス内の差異の少ない地物の正確な分割に有利であることを示している。

Table 8 Quantization results of different mixing methods /%

方法评估指标杂波或背景不透水面汽车树木低矮植被建筑总体
区域混合F1_Score71.1783.8438.3364.0959.9488.6767.67
IoU55.2472.1723.7147.1642.7979.6453.45
类别混合(本文)F1_Score75.3586.7549.9172.1068.2791.7774.03
IoU60.4576.5933.2656.3751.8284.7960.55
figure
figure

Fig. 13 Illustration of the mixing process for the regional mixing approach and the category mixing approach

3.5.5超パラメータ感受性解析

モデルのパフォーマンスに及ぼす異なる超パラメータ値の影響を調べるために、本節ではそれぞれ重み和の値を0.1、0.5、1.0に設定し、その量子化結果はTable 9Table 10を選択します。は0.5、0.1から1まで変化すると、全体的な精度が徐々に上昇することが見られ、1の場合に最適な精度が得られた。このプロセスでは、ドメイン間分割能力と高距離予測能力が徐々に均衡している。詳細には、高距離推定タスクの重みが増加するにつれて、最も顕著なのはノイズ類の精度が急激に上昇し、自動車類の精度が急速に低下したことである。これは、高距離情報の強化は、差異が顕著で混同された地物を分離することに有利であり、高さ値が小さく外観の変化が少ない自動車類では、高距離情報の加入はかえって意味認識能力を弱めるからである可能性がある。

Table 9 Quantization results for different (=0.5) /%

评估指标杂波或背景不透水面汽车树木低矮植被建筑总体
0.1F1_Score6.6086.4768.8372.3566.8691.8365.49
IoU3.4176.1652.4856.6850.2384.8953.98
0.5F1_Score48.8686.3765.7971.3367.0291.5971.83
IoU32.3276.0249.0255.4550.3984.4757.95
1.0F1_Score75.3586.7549.9172.1068.2791.7774.03
IoU60.4576.5933.2656.3751.8284.7960.55

Table 10 Quantization results for different (=1) /%

评估指标杂波或背景不透水面汽车树木低矮植被建筑总体
0.1F1_Score57.2086.5757.6572.8668.3391.6172.37
IoU40.0576.3340.5057.3151.8984.5258.43
0.5F1_Score75.3586.7549.9172.1068.2791.7774.03
IoU60.4576.5933.2656.3751.8284.7960.55
1.0F1_Score77.6987.0056.1768.0068.3291.9874.86
IoU63.5277.0039.0551.5351.8985.1461.36
当固定は1、0.1から1まで変化すると、全体の精度が58.43%から61.36%に向上し、値が1の場合に最適な性能が得られることがわかります。細部から見ると、クラス内の差が比較的小さい自動車、樹木、低植生類の精度は徐々に低下し、クラス内の差が大きい他のクラスの精度は徐々に上昇している。これは、エントロピー値が高エントロピー領域、すなわち予測難易度の高いカテゴリにより敏感であるためである可能性がある。したがって、高くなると、モデルはドメイン適応が難しい地物の識別能力を高める傾向があります。

3.5.6疑似ラベル閾値解析

ハイブリッド一貫性学習におけるターゲットドメインサンプルの信頼性を高めるために、疑似ラベル閾値機構を導入した。訓練回数が増加するにつれて、偽ラベル閾値は徐々に最低閾値から最高閾値に増加した。異なる閾値範囲がモデルの性能に与える影響を検証するために、最低閾値は0.2、0.3、0.4に設定され、最高閾値は0.6から0.9まで0.1の間隔で上昇し、12組の実験を構成した。各グループの実験の平均F 1 _ Score及び平均IoUは、例えばFig. 14を参照してください。見られるように、最低閾値は0.4、最高閾値は0.6の場合、モデルは最適な性能を取得した。最低閾値が低すぎると信頼できないサンプルを導入しやすく、最高閾値が高すぎると学習できるサンプル量が少なすぎる可能性があり、閾値が中間範囲にある場合にのみ、この2つの状況のマイナス影響をよりよく抑制することができる、異なる閾値範囲の性能表現には明確な規則性はない。一般的に、モデルのパフォーマンスは、最低しきい値が0.3を超え、最高しきい値が0.7を超えず、最高しきい値と最低しきい値の差が0.3を超えない場合に優れています。
figure
figure

Fig. 14 Matrix of quantization results for different threshold ranges

3.5.7モデル複雑度解析

モデルの効率を定量的に評価するために、本文はモデルパラメータ量と計算量FLOPs(floating-point operations per second)を指標として採用し、同じ入力画像サイズ(512×512画素)の下でモデル複雑度をテストした。結果は次のとおりです。Table 11を参照してください。MIDA法と比較して、本方法はFLOPS上で明らかな向上を示している。ベースライン方法の中で全体的な性能表現が最も良いCorda方法に比べて、本文方法のパラメータ量とFLOPsはそれぞれCorda方法より高いが、4つのドメイン横断実験の上で、本文方法はいずれもより良い分割性能を示した。総合的に、本文の方法は精度と効率の上で比較的に良いバランスを達成した。

Table 11 Number of parameters and FLOPs for the test models

方法模型参数量/MFLOPs/GB
DADA46.58402.42
CTRL47.13203.10
MIDA50.341691.78
CorDA46.50400.62
Ours57.54453.79

4結論

本文はマルチタスク学習のリモートセンシング画像無監督領域適応意味分割方法を提案した。この方法は高距離推定タスク中の高距離情報を学習し、意味情報と融合し、マルチタスク学習の枠組みを結合することにより、「同物異スペクトル」、「同スペクトル異物」と高度差異地物に対するモデルの識別能力を共に向上させた。高距離情報はモデルに追加の空間的特徴を提供し、マルチタスクフレームワークは意味的特徴の特徴付け能力を強化し、両者の協同作用は、スペクトルと空間情報の曖昧性を緩和し、複雑なドメイン横断シーンにおけるモデルの表現を向上させた。具体的には、方法はタスク特徴間の関連付けを通じてタスク相関を構築し、セマンティック特徴の特徴付け能力を強化する。擬似ラベル最適化の混合一貫性学習はソースドメイン知識の目標ドメインへの移行を推進し、エントロピー誘導のカテゴリレベルアラインメントは難分類地物への関心を強化し、同類集合と異類分離を促進した。この方法は有効に同物異スペクトルと同スペクトル異物の分類混同情況を改善することができて、そして大量に高さ値の差の大きい地物の誤った分類現象を減少しました。本文の方法は標準データセットISPRS 2 DとUS 3 D上で4組の実験を行った結果、この方法は地物分類任務の中で優れており、特にマルチタスク学習の枠組みの下で、その性能は他の既存方法より顕著に優れていることが分かった。

References

  1. 1.
    Bhattacharjee D, Zhang T, Süsstrunk S and Salzmann M. 2022. MulT: an end-to-end multitask learning transformer//Proceedings of the 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition. New Orleans: IEEE: 12021-12031
  2. 2.
    Chang W L, Wang H P, Peng W H and Chiu W C. 2019. All about structure: adapting structural information across domains for boosting semantic segmentation//Proceedings of the 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE: 1900-1909
  3. 3.
    Chen L C, Papandreou G, Kokkinos I, Murphy K and Yuille A L. 2018. DeepLab: semantic image segmentation with deep convolutional nets, Atrous convolution, and fully connected CRFs. IEEE Transactions on Pattern Analysis and Machine Intelligence, 40(4): 834-848
  4. 4.
    Chen H Y, Zhang H Y, Yang G Y and Li S Y. 2022. A Mutual Information Domain Adaptation Network for Remotely Sensed Semantic Segmentation. IEEE Transactions on Geoscience and Remote Sensing, 60: 1-16 .
  5. 5.
    Cipolla R, Gal Y and Kendall A. 2018. Multi-task learning using uncertainty to weigh losses for scene geometry and semantics//Proceedings of the 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE: 7482-7491
  6. 6.
    Gao L, Zhang L F and Zhang Q. 2021. Addressing domain gap via content invariant representation for semantic segmentation//Proceedings of the 39th AAAI Conference on Artificial Intelligence: Palo Alto: AAAI Press: 7528-7536
  7. 7.
    Hu J, Shen L and Sun G. 2018. Squeeze-and-excitation networks//Proceedings of the 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Salt Lake City: IEEE: 7132-7141
  8. 8.
    Kundu J N, Lakkakula N and Radhakrishnan V B. 2019. UM-adapt: unsupervised multi-task adaptation using adversarial cross-task distillation//Proceedings of the 2019 IEEE/CVF International Conference on Computer Vision. Seoul: IEEE: 1436-1445
  9. 9.
    Kussul N, Lavreniuk M, Skakun S and Shelestov A. 2017. Deep learning classification of land cover and crop types using remote sensing data. IEEE Geoscience and Remote Sensing Letters, 14(5): 778-782
  10. 10.
    Le Saux B, Yokoya N, Hänsch R and Brown M. 2019. Data fusion contest 2019 (DFC2019)[EB/OL].
  11. 11.
    Li R, Zheng S Y, Zhang C, Duan C X, Wang L B and Atkinson P M. 2021a. ABCNet: attentive bilateral contextual network for efficient semantic segmentation of Fine-Resolution remotely sensed imagery. ISPRS Journal of Photogrammetry and Remote Sensing, 181: 84-98
  12. 12.
    Li Y S, Shi T, Zhang Y J, Chen W and Wang Z B and Li H. 2021b. Learning deep semantic segmentation network under multiple weakly-supervised constraints for cross-domain remote sensing image semantic segmentation. ISPRS Journal of Photogrammetry and Remote Sensing, 175: 20-33
  13. 13.
    Long J, Shelhamer E and Darrell T. 2015. Fully convolutional networks for semantic segmentation//Proceedings of the 2015 IEEE Conference on Computer Vision and Pattern Recognition. Boston: IEEE: 3431-3440
  14. 14.
    Luo M Y and Ji S P. 2022. Cross-spatiotemporal land-cover classification from VHR remote sensing images with deep learning based domain adaptation. ISPRS Journal of Photogrammetry and Remote Sensing, 191: 105-128.
  15. 15.
    Maggiori E, Tarabalka Y, Charpiat G and Alliez P. 2017. Convolutional neural networks for large-scale remote-sensing image classification. IEEE Transactions on Geoscience and Remote Sensing, 55(2): 645-657.
  16. 16.
    Olsson V, Tranheden W, Pinto J and Svensson L. 2021. ClassMix: segmentation-based data augmentation for semi-supervised learning//Proceedings of the 2021 IEEE Winter Conference on Applications of Computer Vision. Waikoloa: IEEE: 1369-1377
  17. 17.
    Rottensteiner F, Sohn G, Jung J, Gerke M, Baillard C, Benitez S and Breitkopf U. 2012. The ISPRS benchmark on urban object classification and 3D building reconstruction//ISPRS Annals of the Photogrammetry, Remote Sensing and Spatial Information Sciences. Melbourne: ISPRS: 293-298
  18. 18.
    Saha S, Obukhov A, Paudel D P, Kanakis M, Chen Y H, Georgoulis S and Van Gool L. 2021. Learning to relate depth and semantics for unsupervised domain adaptation//Proceedings of the 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Nashville: IEEE: 8193-8203
  19. 19.
    Saporta A, Vu T H, Cord M and Pérez P. 2020. ESL: entropy-guided self-supervised learning for domain adaptation in semantic segmentation. arXiv preprint arXiv: 2006.08658
  20. 20.
    Song X, Zhao X, Fang L J, Hu H W and Yu Y Z. 2020. EdgeStereo: an effective multi-task learning network for stereo matching and edge detection. International Journal of Computer Vision, 128(4): 910-930
  21. 21.
    Vu T H, Jain H, Bucher M, Cord M and Pérez P. 2019a. ADVENT: adversarial entropy minimization for domain adaptation in semantic segmentation//Proceedings of the 2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE: 2512-2521 [DOI: 10.1109/CVPR.2019.00262].
  22. 22.
    Vu T H, Jain H, Bucher M, Cord M and Pérez P P. 2019b. Dada: depth-aware domain adaptation in semantic segmentation//Proceedings of the 2019 IEEE/CVF International Conference on Computer Vision. Seoul: IEEE: 7363-7372
  23. 23.
    Wang Q, Dai D X, Hoyer L, Van Gool L and Fink O. 2021. Domain adaptive semantic segmentation with self-supervised depth estimation//Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision. Montreal: IEEE: 8495-8505
  24. 24.
    Woo S, Park J, Lee J Y and Kweon I S. 2018. CBAM: convolutional block attention module//Proceedings of the 15th European Conference on Computer Vision (ECCV). Munich: Springer: 3-19
  25. 25.
    Xu H Q, Yang M, Deng L Y, Qian Y Q and Wang C X. 2021. Neutral cross-entropy loss based unsupervised domain adaptation for semantic segmentation. IEEE Transactions on Image Processing, 30: 4516-4525
  26. 26.
    Xu Q S, Yuan X and Ouyang C J. 2022. Class-aware domain adaptation for semantic segmentation of remote sensing images. IEEE Transactions on Geoscience and Remote Sensing, 60: 4500317
  27. 27.
    Yan L, Fan B, Xiang S M and Pan C H. 2022. CMT: cross mean teacher unsupervised domain adaptation for VHR image semantic segmentation. IEEE Geoscience and Remote Sensing Letters, 19: 6002205
  28. 28.
    Yao X D, Wang Y D, Wu Y L and Liang Z Y. 2021. Weakly-supervised domain adaptation with adversarial entropy for building segmentation in cross-domain aerial imagery. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 14: 8407-8418
  29. 29.
    Yi Z L, Zhang H, Tan P and Gong M L. 2017. DualGAN: unsupervised dual learning for image-to-image translation//Proceedings of the 2017 IEEE International Conference on Computer Vision. Venice: IEEE: 2868-2876
  30. 30.
    Zhang B, Chen T and Wang B. 2022. Curriculum-style local-to-global adaptation for cross-domain remote sensing image segmentation. IEEE Transactions on Geoscience and Remote Sensing, 60: 5611412
  31. 31.
    Zhang J, Lin S F, Ding L and Bruzzone L. 2020. Multi-scale context aggregation for semantic segmentation of remote sensing images. Remote Sensing, 12(4): 701
  32. 32.
    Zheng A H, Wang M, Li C L, Tang J and Luo B. 2022. Entropy guided adversarial domain adaptation for aerial image semantic segmentation. IEEE Transactions on Geoscience and Remote Sensing, 60: 5405614
  33. 33.
    Zhu J Y, Park T, Isola P and Efros A A. 2017a. Unpaired image-to-image translation using cycle-consistent adversarial networks//Proceedings of the 2017 IEEE International Conference on Computer Vision. Venice: IEEE: 2242-2251
  34. 34.
    Zhu X X, Tuia D, Mou L C, Xia G S, Zhang L P, Feng X and Fraundorfer F. 2017b. Deep learning in remote sensing: a comprehensive review and list of resources. IEEE Geoscience and Remote Sensing Magazine, 5(4): 8-36
  35. 35.
    Zhu Y T, Liang Z L, Yan J W, Chen G and Wang X Q. 2021. E-D-net: automatic building extraction from high-resolution aerial images with boundary information. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, 14: 4595-4606

続きを読む

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website