2本文の提案方法
2.1全体フレームワーク
本論文で提案するマルチタスク学習に基づくドメイン適応意味分割フレームワークMTLDAnet(Muti-Task Learning Domain Adaption Network)、例えばFig. 1を参照してください。ここで、ソースドメイン光学映像とターゲットドメイン光学映像は初期特徴抽出モジュールに入力され、パラメータ共有エンコーダとタスク特定ボトルネックを通じて初期意味特徴と初期標高特徴を抽出する、タスク間特徴関連学習モジュールは、連続する交差特徴強化ユニットを介してタスク固有の意味特徴と標高特徴を交差結合し、特徴表現を最適化する、ダミータグガイダンスのハイブリッド一貫性学習モジュールはターゲットドメインデータを教師モデルに入力してダミータグを生成し、最適化されたダミータグを用いて学生モデルのハイブリッドサンプルに対する学習を監督し、ソースドメインとターゲットドメインのデータ分布を近づける、エントロピーブートのカテゴリレベル位置合わせモジュールは、分割結果にエントロピー値を重み付けして細粒度のカテゴリレベル位置合わせを指示し、ドメイン適応ネットワークのパフォーマンスを向上させる。
2.2ドメイン適応セマンティック分割方法
2.2.1タスク横断フィーチャー関連学習モジュール
関連研究では、関連する異なるタスクの特徴が、特徴表現能力を向上させるために相補的な情報を元の特徴に効果的に組み込むことができることが確認されている(Bhattacharjee等,2022)。関連学習の役割を最大化するために、本文は異なるタスクの特徴表現を交差強化するために、タスク横断特徴関連学習モジュールを構築した。このモジュールは、主に空洞空間ピラミッドプール化ASPP(Atrous Spatial Pyramid Pooling)、交差注意力融合ブロックCAFB(Cross Attention Fusion Block)、およびゲート構造(例えばFig. 2を参照してください。
まず、元のセマンティックフィーチャーをおよび標高フィーチャータスク固有のASPPに入力し、マルチスケール情報を学習し、ネットワークがコンテキストをキャプチャする能力を強化します。その後、交差注意力融合ブロックは、標高特徴と意味特徴の顕著な特徴を十分に捕捉し、さらに相補特徴を適応的に選択して元のタスク特徴に溶け込み、最適化された標高特徴と意味特徴を得るために使用される。以上のプロセスをクロスフィーチャー拡張ユニットと呼びます。タスク横断フィーチャー関連学習モジュールには、2つの交差フィーチャー拡張ユニットが挿入され、それぞれ異なるタスクの中間フィーチャーが生成されます和最終フィーチャー和。セマンティック分割タスクを例にとると、連続的なクロスフィーチャー拡張ユニットにより、ネットワークが補完的な標高情報に注目するようになり、セマンティックフィーチャー表現をより階層的に細分化することができる。特徴連携学習の過程で任務特定特徴中の相補的な情報に過度に注目しないようにするため、同時に原始任務の有効な学習を無視して、本文は原始特徴をと中間フィーチャーチャネルを介してマージし、最終フィーチャーとゲート構造に一緒に入力して、元のフィーチャーと相補的なフィーチャーを緊密に統合して、適応融合フィーチャーを取得します。この融合操作は、次のように式で表される。
式中チャネルの次元下げ操作を表し、チャネル数を元の半分に減らし、チャネルマージ操作を表し、はアクティブ化関数であり、適応重み行列を表します。
交差注意力融合ブロックの詳細な構造は、Fig. 3を参照してください。重要な特徴にできるだけ焦点を当て、無関係ノイズの学習を抑制するために、ASPPから出力されたセマンティック特徴と標高特徴は、チャネル注意力CAM(Channel Attention Module)(Hu等,2018)と空間的注意力SAM(Spatial Attention Module)(Woo等,2018)を使用して、チャネル次元と空間次元から有意な意味的特徴を統合および顕著な標高特性。顕著な特徴が得られた後、ネストされたゲート制御融合構造を用いて、異なるタスクの特徴表現を十分に強化するために、タスクの顕著な特徴、およびタスクにまたがる顕著な特徴を交差統合する。セマンティック分割タスクの場合、このプロシージャは
式中、チャネルの次元下げ操作を表し、チャネル数を元の半分に減らし、チャネルマージ操作を表し、はアクティブ化関数です。
2.2.2疑似タグ・アドバイザのハイブリッド一貫性学習モジュール
ソースドメイン知識のターゲットドメインへの移行を促進してグローバルデータ分布に一致させるために、本文は混合サンプルに基づく一貫性学習を採用した。まず、ターゲットドメインサンプルをClassMix(Olsson等,2021)の方式でソースドメインサンプルに混入、データ拡張による新しい混合サンプルの生成。その後、学生モデルで混合サンプルとソースドメインサンプルを訓練し、教師モデルでターゲットドメインサンプルを訓練する。教師モデルは、学生モデルの指数移動平均によってパラメータを更新する。具体的には、ソースドメインの地表真値に基づいてClassMix方式で混合マスクを生成し、教師モデルを通じてターゲットドメインの偽ラベルを生成し、ソースドメイン真値とターゲット偽ラベルと混合マスクを掛け合わせて混合ラベルを形成し、混合ラベルは学生モデルを監督するために使用される。このプロセスは、モデルをターゲットドメインに普及させるために、ターゲットドメインの特定の知識を学生モデルに導入することができます。
以上の過程で、学生モデルの性能は偽ラベルの品質の高さと相関している。偽ラベルに低信頼度のピクセルが多すぎると、学生モデルが間違ったターゲットドメイン知識を学習することになります。偽ラベルに情報が少なすぎると、モデルがソースドメインの知識を学習する傾向になります。反復回数が増えるにつれて、モデルの特徴表現能力が徐々に強化されることは明らかである。モデルの特徴表示能力と偽ラベル品質をバランスさせるために、本文は簡単な増分式偽ラベルフィルタリング戦略を提案した。最小しきい値の指定、最大しきい値合計反復回数と現在の反復回数を選択し、次の式によって現在のしきい値を決定し、疑似ラベルをフィルタします。
式中、はフィルタされた偽ラベルであり、はターゲットドメインの元の偽ラベルであり、代表擬似ラベルの生成の予測確率図である。
高距離推定タスクとセマンティック分割タスクはいずれも光学画像から特徴情報を取得するため、高距離推定の予測結果も画像セマンティック情報と相関する。高距離推定タスクの適応難易度はセマンティック(Wang等,2021)を使用して、ネットワークの最適化方向をより良く指導するために、混合サンプルのクロスエントロピー損失にペナルティ重みとして重み付けすることができる。訓練中にセマンティック分割損失および高距離推定損失式を次のように定義します。
式中、和画像の幅と高さをそれぞれ表し、は地物カテゴリの数です。さらに、和は意味分割と標高推定の対応する地表真値であり、和ネットワーク出力の意味分割予測値と高距離推定予測値である。
混合サンプルの場合、加重分割損失の式は次のとおりです。
式中、は、混合サンプルの高度な適応ウェイトであり、は混合サンプルであり、混合サンプルの偽ラベルであり、混合サンプルの予測確率図であり、、和それぞれ確率図の長さ、幅、チャンネル数、和ソースドメインとターゲットドメインをそれぞれ表す標高推定分類器、混合サンプルの高距離真値を表します。
2.2.3エントロピーブートのカテゴリレベルの配置
エントロピー値は、予測結果の不確実性または信頼性を評価するために使用することができる。ドメイン適応の関連研究はエントロピー値の重要な役割を十分に証明した(Saporta等,2020)(Xu等,2021)。通常、ソースドメインサンプルの予測結果はより正確で、エントロピー値は一般的に低く、高エントロピーは一般的に意味境界に現れる。ターゲットドメインの予測結果には、より多くの誤分類とノイズがあり、ほとんどの領域で高エントロピーを示しています。したがって、エントロピーマップはソースドメインとターゲットドメインの違いを視覚的に反映することができる。ソースドメインとターゲットドメインのセマンティック上の位置合わせをさらに促進するために、本論文では、混合サンプルの学習を監視するためのエントロピー誘導のクラスレベル位置合わせモジュールを提案した。
まず、エントロピー値から各エントロピー平均値を算出し、0〜1に正規化します。各クラスのエントロピー平均値は、混合サンプル中の分類が困難なクラスを反映し、その値が高いほどクラスの適応難易度が高い、すなわちクラスの信頼性が低いと予測される。1から各エントロピー平均値を減算した差分値を予測確率図に重み付けすることで、地物を信頼できないカテゴリに誤って分類することを減らすことができる。エントロピー値は各画素の予測不正確性を反映するため、これを罰重みとして、難分類領域の学習力を高めることができる。各種類のエントロピー平均値とエントロピー値を分割損失に加えることにより、セマンティックレベルで異なるカテゴリの分離性を強化することができる。本文ではこの損失を重み付けエントロピー分割損失と定義する。計算式は次のとおりです。
式中、予測確率図を表し、、和それぞれ確率図の長さ、幅、チャンネル数、ラベル値を表し、代表ラベルのクラスcに属するピクセル数。
2.2.4ネットワークトレーニング戦略
具体的には、エンド・ツー・エンドネットワーク全体の1回の反復は、3つのトレーニングステップから構成される。
まず、タグ真値を利用してネットワークを最適化し、意味情報と標高情報に対するネットワークの特徴表示能力を向上させる。ソースドメインの地上真値と標高データ、ターゲットドメインの標高データを監視情報として使用し、対応する予測結果と交差エントロピー損失とberHu損失を計算し、計算方法は以下の通り:
式中、ソースドメインの分割損失を表し、和ソースドメインサンプルと混合サンプルのそれぞれを表す高距離推定損失。和それぞれ、ソースドメインサンプルと混合サンプルの高距離真値です。和初期分割予測と最終分割予測の結果を表します。和はソースドメインサンプルの初期高距離推定予測と最終高距離推定予測であり、和混合サンプルの初期高距離推定予測と最終高距離推定予測である。
次に、ハイブリッド疑似タグを利用してネットワークを最適化し、ハイブリッド一貫性学習を通じてネットワークの非タグサンプルの学習を強化し、ソースドメインとターゲットドメインのグローバルな位置合わせを促進する。混合疑似ラベルを監視情報として使用し、混合サンプルの意味分割結果と重み付け交差エントロピー損失を計算する。計算方法は以下の通り:
最後に、エントロピー値を利用してネットワークを最適化し、エントロピー値をマークされていないサンプルの予測結果に重み付けし、ネットワークの有用な情報の学習を促進する。監視情報として疑似タグを用い、エントロピー値に重み付けされたセマンティック分割結果と重み付け交差エントロピー損失を計算し、エントロピー損失と記す、次のように計算されます。
以上の損失を統合することで、全体的な損失を得ることができます。
3実験データ結果と分析
3.1データセットの概要
提案した方法の有効性を評価するために、本文は2組のデータセットを用いて検証と分析を行った。
第1セットのデータセットは、国際写真測量・リモートセンシング学会が2 D意味表記コンテストで提供した公開データセットISPRS 2 Dデータセット(Rottensteiner等,2012)、PotsdamデータセットとVaihingenデータセットを含む。如Fig. 4を参照してください。Potsdamデータセットは38枚の6000×6000の高解像度正射影映像とその対応する高品質分割マーキング画像とDSM画像を含み、RGB、IRRGとRGB-IRの計3種類のモードを提供し、本文ではIRRGとRGBモードの画像を使用し、地上サンプリング距離は5 cmである。地上物体は6つのカテゴリの1つ、すなわち雑波/背景、不透過水面、自動車、樹木、低植生と建築にマーキングされている。画像は4598枚の512×512のサブ図に裁断され、そのうち2904枚はマークがあり、1694枚はマークがない。Vaihingenデータセットには約2000×2000の高解像度画像、DSM、6種類のマークアップ画像33枚が含まれており、正射画像はIRRGモードのみを提供し、地上サンプリング距離は9 cmである。画像は512×512のサブ図1696枚に裁断され、そのうち896枚はマークがあり、800枚はマークがない。
2組目のデータセットは、DATA FUSION CONTEST 2019が提案した大規模リモートセンシングデータセットUS 3 D(Le等,2019)を提供し、米国フロリダ州ジャクソンビル市とネブラスカ州オマハ市の関連リモートセンシングデータを提供し、RGB光学画像、地上高(AGL)データと対応するセマンティックタグを含む。AGL画像は、物体が地面より上の高さを示し、標高情報を抽出するために使用することができる。US3 Dデータセットの地物カテゴリには、地上、植生、建築、水域、高架橋の5種類がある。データセットは、トレーニングやテストのために領域ごとにラベル付きデータとラベルなしデータに分割されます。画像は512×512サイズのサブマップにカットされ、ジャクソンビル市には2112枚のタグ付き画像と1948枚のタグなし画像があり、オマハ市には3588枚のタグ付き画像と3484枚のタグなし画像がある。Fig. 5US3 Dのいくつかのデータ例を示した。
3.2評価指標
本論文の実験では、F 1 _ ScoreとIoUを用いて提案方法の性能を評価し、F 1 _ Scoreの定義は以下の通りである:
式中、多種類の意味分割タスクに対して、(True Positive)は予測値と真の値が共に正のクラスの画素数を表し、(False Positive)は、真の値が負のクラスであるが予測値が正のクラスの画素数を表し、False Negativeは予測値が負のクラスであるが真の値が正のクラスの画素数を表す。すべての予測が正のサンプルに占める予測の正しいサンプルの割合を表し、すべての真の値が正のサンプルに占める予測が正しいサンプルの割合を表し、はい和の加重平均値を測定し、モデルの安定性を測定することができる。
予測分割と実際の分割結果との間の重複割合として計算され、モデルの分割精度を測定することができます。計算式は次のとおりです。
3.3実験及びパラメータの設定
本文はDeeplabV 2フレームワークを共有エンコーダとタスク特定デコーダとして採用し、そのバックボーンネットワークはImageNet上で事前訓練されたResNet 101ネットワークである。初期特徴抽出モジュールでは、タスク特定のボトルネックは2つの3×3の畳み込みブロックからなり、初期分類器は1×1の畳み込みブロックからなる。タスク特定デコーダにおけるASPPのサンプリングレートは[6,12,18,24]であり、タスク横断特徴関連学習におけるASPPのサンプリングレートは[1,4,8,12]である。本方法のトレーニングプログラムはCorDAに基づいており、データ強化方式はランダム水平反転、ランダム垂直反転、色ジッタ、ガウスノイズに設定されている。
本文のネットワークアーキテクチャは主流のPyTorchフレームワーク上で実現され、すべての実験はグラフィックスモデルがNVIDIA GeForce RTX 3090、グラフィックスメモリが24 GBのワークステーション上で実行された。訓練では、Nesterov加速を伴うランダム勾配降下最適化器を用いた。運動量を0.9、重み減衰を5×10-4、初期学習率を2.5×10-4に設定します。バッチサイズとepochはそれぞれ2と10に設定されています。擬似タグ混合一貫性学習の最低閾値と最高閾値はそれぞれ0.4と0.6であり、和いずれも1に設定されています。
3.4実験結果
3.4.1ベースライン方法
本文はソースドメイン(Source Only)方法と4種類の最先端マルチタスク学習に基づくUDA方法をベースラインとして実験比較を展開する:深さ感知ドメイン適応ネットワークDADA(Vu等,2019b)、クロスタスク関係ネットワークCTRL(Saha等,2021)、相互情報ドメイン適応ネットワークMIDA(Chen等,2022)と関連性知域適応ネットワークCorDA(Wang等,2021)。提案したマルチタスク学習フレームワークはドメイン適応部分を取り除き、マルチタスク学習ネットワークを形成する。Source onlyメソッドは、ネットワーク上でソースドメインデータを訓練し、予測結果を得るためにターゲットドメイン上で直接テストします。DADAは深さ予測タスク支援意味分割を通じて、深さ特徴の豊富な特徴表示を融合し、分割性能を向上させる。CTRLは、意味予測と深さ予測タスクの依存関係を符号化するためのタスク間関係層を提案し、深さ離散化技術を通じて異なる意味カテゴリと深さ階層の関係をさらに学習する。MIDAは特徴対話モジュールと対話情報注意ユニットを提案し、2つのタスク間の潜在関係を掘り起こす。CorDAはタスク特徴関連モジュールを提案し、異なるタスクの特徴相関性を学習し、深さ差異で目標の意味偽ラベルを細分化する。
3.4.2ベースライン方法との比較結果
リモートセンシング画像の無監督領域適応意味分割タスクにおける本方法の有効性と異なるシーンにおけるロバスト性を検証するために、本文はISPRS 2 DデータセットとUS3 Dデータセットに4組の実験を行った。ISPRS 2 Dデータセットの地物の外観の違いが顕著で、シーンが複雑である、一方、US3 Dデータセットの地物の外観の違いは小さい。ISPRS 2 Dデータセットの実験では、それぞれPotsdamのIRRG映像とRGB映像をソースドメイン、Vaihingenをターゲットドメインとした。US3 Dデータセットの実験では、ジャクソンビルとオマハがターゲットドメインとソースドメインとして交互に使用された。ソースドメインのラベル付きデータとターゲットドメインのラベルなしデータはトレーニングに使用され、ターゲットドメインのラベル付きデータはテストに使用されます。
(1)複雑なシーンでのドメイン適応――Potsdam IRRG→Vaihingen IRRG。地理環境が異なり、同種の地物の外観に大きな差がある場合の本文の方法の性能をPotsdam IRRG→Vaihingen IRRGのドメイン横断実験を通じて評価した。如Table 1を参照してください。本文の方法はSource onlyと比べて、すべてのドメイン適応方法が高い精度を得ていることがわかる。全体的に、本文の方法の平均F 1 _ scoreと平均IoUはそれぞれSource only 35.22%と33.76%より高く、すべての地物類の中で最適な精度を得た。また、本文の方法はスプリアスまたは背景クラスの予測正確率を大幅に向上させ、クラス間の差が大きい地物と他の地物の分類混同を減少させた。
Table 1 Quantitative results with Potsdam IRRG as source domain and Vaihingen IRRG as target domain /%
| 方法 | 评估指标 | 杂波或背景 | 不透水面 | 汽车 | 树木 | 低矮植被 | 建筑 | 总体 |
|---|
| Source only | F1_Score | 3.00 | 54.87 | 34.71 | 69.71 | 17.20 | 63.47 | 40.49 |
| IoU | 1.53 | 37.80 | 21.00 | 53.51 | 9.40 | 46.48 | 28.29 |
| DADA | F1_Score | 1.04 | 68.74 | 37.06 | 70.61 | 43.08 | 69.20 | 48.29 |
| IoU | 0.52 | 52.37 | 22.75 | 54.57 | 27.45 | 52.90 | 35.10 |
| CTRL | F1_Score | 4.02 | 70.29 | 16.38 | 68.92 | 49.99 | 75.85 | 47.58 |
| IoU | 2.05 | 54.20 | 8.92 | 52.57 | 33.32 | 61.10 | 35.36 |
| MIDA | F1_Score | 16.57 | 79.88 | 4.96 | 71.58 | 56.10 | 87.01 | 52.68 |
| IoU | 9.04 | 66.51 | 2.54 | 55.75 | 38.99 | 77.01 | 41.64 |
| CorDA | F1_Score | 7.24 | 83.80 | 48.21 | 71.54 | 63.20 | 88.29 | 60.38 |
| IoU | 3.76 | 72.12 | 31.76 | 55.69 | 46.20 | 79.04 | 48.10 |
| 本文 | F1_Score | 70.29 | 87.03 | 64.42 | 71.99 | 68.62 | 91.93 | 75.71 |
| IoU | 54.19 | 77.05 | 47.51 | 56.24 | 52.23 | 85.07 | 62.05 |
可視化の結果Fig. 6示されているように、ドメイン適応能力が不足しているため、Source onlyメソッドは密集した建築領域と影領域での予測結果のノイズが大きく、他の地物分類と混同される背景クラスが多数存在している。ドメイン適応がない場合は、固定形態がなく、クラス内の差が少ないカテゴリ(樹木など)の知識をソースドメインからターゲットドメインに移行しやすくなります。対照的に、ドメイン適応を適用する4つのベースライン方法は、建築、不透過水面、およびスプリアス間の分類混同を低減し、小さな目標の識別精度を向上させる。しかし、これらの方法は依然としてスプリアスクラスの影響を受けており、誤った予測結果を招いている。対照的に、本文の方法の予測結果はより正確で、異なる地物間の分類の混同を大幅に減少し、特に境界領域で優れている。元の画像では建物がわずかにねじれていたり、木に遮られていたりしていますが、本文の方法は依然として最もはっきりした建物の輪郭を生成し、低植生などの小さな目標を識別することに成功しました。陰影干渉の下で、本文の方法は標高情報を結合することによってスペクトル情報の不足を補い、陰影の影響を著しく低減し、最適な性能を得た。また、本論文の方法は各種の地物、特に小さな目標と境界の識別に優れている。全体的に言えば、本文の方法はマルチタスク特徴情報を効果的に融合し、スペクトルによる分類ミスを減らし、最も信頼できる分割結果を提供した。
(2)複雑なシーンでのドメイン適応――Potsdam RGB→Vaihingen IRRG。Potsdam RGB→Vaihingen IRRGのドメイン横断実験を通じて、地理環境と画像モードの違いが大きい場合の本文の方法の表現を評価した。ソースドメインとターゲットドメインのイメージングの違いにより、同種の地物マッピングが複雑になり、ドメインの位置合わせの難しさが増しています。如Table 2示されているように、ドメイン適応処理の注目点が異なる可能性があるため、ドメインギャップが大きくなるにつれて、他の先進的な方法とSource onlyの精度の違いが小さくなります。例えば、CTRL法は樹木類で最も精度が高いが、自動車類では最も精度が低い、一方、MIDAとCorDAは樹木類では精度が悪い。対照的に、本文の方法は意味と標高情報の相関性を明示的に構築し、細粒度の整列を制約することによって、性能に対するドメインギャップの負の影響を減少させた。その結果、本文の方法はすべての方法の中で最適な平均F 1 _ Scoreが61.67%であり、平均IoUが48.02%であり、5種類の地物の中で最も優れていることを示した。本文の方法の樹木類の精度は低いが、樹木と低い植生類の精度をバランスさせることにより、両者の分類の混同を減少させ、複雑なドメイン間分割タスクにおける有効性を示した。
Table 2 Quantitative results with Potsdam RGB as source domain and Vaihingen IRRG as target domain /%
| 方法 | 评估指标 | 杂波或背景 | 不透水面 | 汽车 | 树木 | 低矮植被 | 建筑 | 总体 |
|---|
| Source only | F1_Score | 1.29 | 62.24 | 38.52 | 56.55 | 16.35 | 62.54 | 39.58 |
| IoU | 0.65 | 45.18 | 23.86 | 39.42 | 8.91 | 45.48 | 27.25 |
| DADA | F1_Score | 2.44 | 65.28 | 27.33 | 66.32 | 32.71 | 62.78 | 42.81 |
| IoU | 1.23 | 48.46 | 15.83 | 49.61 | 19.55 | 45.75 | 30.07 |
| CTRL | F1_Score | 0.67 | 68.03 | 10.00 | 73.16 | 33.51 | 69.74 | 42.52 |
| IoU | 0.34 | 51.56 | 5.26 | 57.68 | 20.13 | 53.55 | 31.42 |
| MIDA | F1_Score | 10.73 | 68.67 | 39.66 | 14.06 | 51.33 | 83.10 | 44.59 |
| IoU | 5.67 | 52.29 | 24.73 | 7.57 | 34.52 | 71.09 | 32.64 |
| CorDA | F1_Score | 5.02 | 70.75 | 54.06 | 1.38 | 49.22 | 74.68 | 42.52 |
| IoU | 2.58 | 54.74 | 37.04 | 0.70 | 32.65 | 59.59 | 31.22 |
| 本文 | F1_Score | 24.94 | 80.81 | 65.22 | 49.99 | 58.10 | 90.97 | 61.67 |
| IoU | 14.25 | 67.81 | 48.39 | 33.32 | 40.94 | 83.44 | 48.02 |
可視化の結果Fig. 7示したように、Source only方法は建物と不透過水面を区別することは難しいが、樹木を識別することはできる。他のドメイン適応ベースライン法により、建物と不透過水面の分類が改善されますが、境界にはノイズが残っています。特に大きな建物と影の領域ではノイズが発生しています。対照的に、本文の方法は他の方法より著しく優れており、予測結果はより良いコンテキスト関係を持ち、誤り分類を減少させた。本文の方法は建築物の輪郭及び植生と非植生区の正確な識別を正確に識別し、特に小さい目標の位置付けと予測に優れている。全体的な結果により、本文の方法は樹木区を効果的に識別し、樹木と低い植生類の精度をバランスさせることができ、その他の方法はある種類だけでよく表現され、これは増大した領域格差による誤った知識移転の可能性がある。総じて言えば、本文の方法は大部分の地物上で最適な分割結果を得て、高距離情報を有効に利用してスペクトル情報の曖昧性を最適化して、各種のドメインに適応してシーンに適応する。
(3)簡単なシーンでのドメイン適応――Omaha→Jacksonville。地理環境は異なるが地物の外観が似ている場合の本方法の性能をOmaha→Jacksonvilleのドメイン横断実験により評価した。如Table 3示されているように、DADAとCTRLの全体的な精度とほとんどのカテゴリの精度はSource onlyメソッドよりも低い。これは、単純なシーンでのドメイン適応では、不適切な改善方向に負の移行やオーバーフィットが発生し、パフォーマンスが低下することを示しています。他の先進的な方法とSource onlyの精度の差はそれほど大きくなく、これは簡単なシーンでのドメイン適応方法による改善が限られていることを示している。すべての方法の中で、本文の方法は依然として最高の性能を得て、そして地面、植生と建築の種類の上ですべてその他の方法より優れています。オマハの水域と高架橋類のサンプル数が少なすぎるため、本文の方法は意味と高距離情報の相補的な学習に重点を置いており、サンプル量が少ない場合、意味と高距離情報のマッピング関係を十分に学習することが困難であるため、この2種類の方法の識別能力はやや不足している。
Table 3 Quantitative results with Omaha as source domain and Jacksonville as target domain
| 方法 | 评估指标 | 地面 | 植被 | 建筑 | 水域 | 高架桥 | 总体 |
|---|
| Source only | F1_Score | 84.50 | 74.03 | 75.22 | 85.62 | 33.68 | 70.61 |
| IoU | 73.15 | 58.77 | 60.28 | 74.86 | 20.25 | 57.46 |
| DADA | F1_Score | 82.48 | 68.64 | 69.45 | 87.59 | 12.68 | 64.17 |
| IoU | 70.18 | 52.26 | 53.20 | 77.92 | 6.77 | 52.06 |
| CTRL | F1_Score | 82.64 | 66.94 | 69.97 | 85.74 | 10.81 | 63.22 |
| IoU | 70.41 | 50.32 | 53.81 | 75.04 | 5.72 | 51.06 |
| MIDA | F1_Score | 85.64 | 73.90 | 75.44 | 83.01 | 39.51 | 71.50 |
| IoU | 74.88 | 58.61 | 60.57 | 70.96 | 24.62 | 57.93 |
| CorDA | F1_Score | 85.48 | 75.57 | 78.79 | 90.66 | 21.58 | 70.42 |
| IoU | 74.64 | 60.74 | 65.00 | 82.92 | 12.09 | 59.08 |
| 本文 | F1_Score | 85.89 | 76.69 | 79.51 | 89.25 | 28.26 | 71.92 |
| IoU | 75.27 | 62.19 | 65.99 | 80.58 | 16.46 | 60.10 |
可視化の結果Fig. 8図示されているように、ドメイン適応なしの場合、Source only方法はコンテキスト関係を良好に維持することができるが、形状が不規則な地物を予測する際には、周囲の地物と混同しやすく、特に地物と地面が分類される際には、小さな目標が検査漏れやすい。DADAとCTRL法では、地物の予測結果はSource only法より悪く、サンプル量の少ない高架橋は類似のスペクトルを持つ地上類と混同しやすく、建物と水域の検出正確率と完全度はSource only法に及ばない。MIDAとCorDAの方法は各種類の地物によく表れているが、細部から見ると、植生類と建築類は依然として検査漏れと予測不備が多い。これに対して、本文で提案した方法は各種類の地物に対して比較的に良い性能を示し、小さい目標物体に対する検査漏れと検査間違いを減少した。同時に、本文の方法はより滑らかでより整然とした地物形状、特に建物の境界を示した。全体的に見ると、本文の方法はドメイン適応難易度が低いシーンでも最適な性能を得ることができ、建築と植生の分割を著しく改善し、提案した方法の汎化能力が強く、各種ドメイン適応シーンに広く使用できることを証明した。
(4)簡単なシーンでのドメイン適応――Jacksonville→Omaha。地理環境は異なるが地物の外観が似ている場合の本文の方法の性能をJacksonville→Omahaのドメイン横断実験により評価した。如Table 4示したように、Omaha→Jacksonvilleの実験と同様に、DADAとCTRLの精度はSource onlyの方法より低く、本文の方法は67.83%の最適F 1 _ Scoreと52.98%の最適平均IoUを獲得し、多数の地物カテゴリで良い精度を得た。注目すべきは、本方法は高架橋の分割性能を大幅に向上させ、地上、植生、水域類において本方法の精度は最適精度よりやや低いが。これは、他の方法に比べて、本方法は小サンプルに対してより強い特徴表現能力とドメイン移行能力を持っていることを示している。
Tabel 4 Quantitative results with Jacksonville as source domain and Omaha as target domain /%
| 方法 | 评估指标 | 地面 | 植被 | 建筑 | 水域 | 高架桥 | 总体 |
|---|
| Source only | F1_Score | 88.01 | 55.94 | 72.41 | 45.08 | 33.04 | 58.90 |
| IoU | 78.58 | 38.83 | 56.75 | 29.10 | 19.79 | 44.61 |
| DADA | F1_Score | 88.65 | 55.76 | 68.98 | 52.54 | 28.30 | 58.85 |
| IoU | 79.61 | 38.66 | 52.65 | 35.63 | 16.48 | 44.61 |
| CTRL | F1_Score | 88.64 | 58.45 | 70.13 | 42.97 | 32.06 | 58.45 |
| IoU | 79.59 | 41.30 | 54.00 | 27.37 | 19.09 | 44.27 |
| MIDA | F1_Score | 89.90 | 60.45 | 75.36 | 47.18 | 44.62 | 63.50 |
| IoU | 81.66 | 43.32 | 60.47 | 30.87 | 28.72 | 49.01 |
| CorDA | F1_Score | 90.22 | 58.44 | 75.10 | 56.44 | 50.53 | 66.15 |
| IoU | 82.17 | 41.28 | 60.14 | 39.31 | 33.81 | 51.34 |
| 本文 | F1_Score | 90.10 | 58.02 | 75.84 | 55.16 | 60.05 | 67.83 |
| IoU | 81.98 | 40.87 | 61.08 | 38.09 | 42.91 | 52.98 |
可視化の結果Fig. 9を参照してください。ドメイン適応がない場合、Source onlyメソッドは全体的に良好であるが、地面と他の地物の間に分類の混同がある。ドメイン適応に加入すると、一部の混同が減少したにもかかわらず、大型建築の誤検出、小型建築の癒着、高架橋の認識不全が残っている。観察によると、分類混同は主に高度差が明らかな領域で発生し、その他の方法はこれらの領域でもエラーが発生しやすいことが分かった。対照的に、本文の方法は建物の位置と形状を正確に予測することができて、特に密集した小型建築区域では、建物の癒着が少ない。全体的に言えば、本文の方法の地物境界は更に平滑で、各種類の地物の上ですべて良好な分割性能を維持した。これらの結果は、本論文で提案した方法がより良い利点を持っていることを示している。
3.5アブレーション実験及び討論
3.5.1アブレーション試験
本文の方法における異なるモジュールの有効性を検証するために、ベースラインに異なるモジュールを組み合わせてアブレーション研究を行った。まず、MTLDAnetフレームワーク上のCFCL、PMCL、ECAモジュールを除去し、CorDAメソッドと一致するモデルをベースライン(Baseline)としてドメイン適応メソッドを設定します。異なる組み合わせのアブレーション実験の結果Table 5に示すように、ベースライン法は49.27%の平均IoUと61.42%の平均F 1 _ Scoreを取得できることが分かる。これは、マルチタスク学習フレームワークを導入することで、ハイレベル情報を効果的に利用して意味情報を強化することができることを示している。次に、タスク横断特徴関連学習モジュール(+CFCL)をベースラインにそれぞれ追加して、連合標高特徴とセマンティック特徴のモデルに対する有効性を検証し、偽ラベルの異なる融合ゲート構造の詳細構造指導を加えた混合一貫性学習モジュール(+PMCL)は最適化された偽ラベルと一致性学習の改善を検証し、エントロピー誘導を加えたクラスレベル整列モジュール(+ECA)はドメイン適応への貢献を検証した。
Table 5 Quantitative results of ablation experiments /%
| 方法 | CFCL | PMCL | ECA | 平均F1_Score | 平均IoU |
|---|
| Baseline | | | | 61.42 | 49.27 |
| +CFCL | √ | | | 64.67 | 51.81 |
| +PMCL | | √ | | 67.57 | 52.92 |
| +ECA | | | √ | 69.75 | 55.31 |
| +CFCL、PMCL | √ | √ | | 71.52 | 59.41 |
| +ECA、PMCL | | √ | √ | 70.44 | 56.01 |
| +ECA、CFCL | √ | | √ | 69.19 | 56.48 |
| Ours | √ | √ | √ | 75.71 | 62.05 |
如Table 5示されているように、ベースラインに上記3つのモジュールを単独で加えると、それぞれ51.81%、52.92%、55.31%の平均IoUが提供されます。高距離特徴と意味特徴の連係を強化することはモデルの意味に対する識別能力を強化するのに役立ち、高信頼性の目標ドメインサンプルとソースドメインサンプルの一致性学習を強化することはソースドメイン知識の良好な移転を促進することができ、エントロピー情報の指導の下でソースドメインとターゲットドメインのカテゴリレベルの整列を促進することはドメイン間分割性能を大幅に向上させることができる。一方、PMCLにCFCLモジュール(+CFCL、PMCL)またはECAモジュール(+ECA、PMCL)を加えると、平均IoUはそれぞれ「+PMCL」より6.49%、3.09%高かった。また、CFCLにECAモジュール(+ECA、+CFCL)を加えると、平均IoUは「+CFCL」より4.67%高い。この利得は、より高い精度を得るために、異なるモジュール間で協働することができることをさらに証明している。また、すべてのモジュールを追加する方法、つまりMTLDAnetは分割精度を大幅に向上させ、平均IoUと平均F 1 _ Scoreはベースラインよりそれぞれ12.78%と14.29%高い。これは、異なるタスク間の緊密な関連学習と、異なるドメイン間の細粒度配置を同時に重視することで、ドメイン間の意味分割のパフォーマンスをより効果的に向上させることができることを示しています。
3.5.2タスク横断的特徴関連学習における異なる融合ゲート制御構造の影響
タスク横断フィーチャー関連学習モジュールでは、タスク固有のフィーチャー、タスク横断フィーチャー、タスク横断フィーチャー間の関連性を効果的に学習する方法が重要であり、異なるタスクフィーチャーの表示能力を十分に強化し、最適化することができます。異なる組み合わせ方式に基づき、本節では3種類の融合ゲート制御構造を設置し、それぞれ合併後の融合ゲート制御構造、ネスト融合ゲート制御構造、並列融合ゲート制御構造である。ハイレベルフィーチャーをセマンティックフィーチャーに組み込む例として、具体的な構造は次のとおりです。Fig. 10を参照してください。これら3つの構造をタスク横断特徴関連学習モジュールにそれぞれ挿入して実験を行い、Table 6に表示されているコード「RED」は変更できます。たとえば、REDの代わりに
Table 6 Quantitative results using different fusion gating structure models /%
| 融合门控结构类型 | 平均F1_Score | 平均IoU |
|---|
| 合并后融合门控结构 | 70.57 | 56.73 |
| 本文嵌套融合门控结构 | 74.03 | 60.55 |
| 并列融合门控结构 | 63.12 | 51.57 |
由Table 6このように、最適な融合構造はネストされた融合ゲート制御構造であり、それぞれ60.55%の平均IoUと74.03%の平均F 1 _ Scoreを得た。次に、統合後にゲート構造を融合させ、並列融合ゲート構造の性能が最も悪い。これは、異なるゲート構造がタスクフィーチャー間の関連学習モジュールの有効性に大きく影響することを十分に示しています。異なる構造では、ネストされた融合ゲート制御構造は、異なるタスクの相補性を十分に掘り起こすことができ、それによってタスク横断の特徴情報をより細かく融合し、さらに予測精度を向上させることができる。
Fig. 11でいくつかのサンプルの各種出力特徴図と予測結果を可視化した。異なる融合構造を用いたモデルは、樹木、低い植生、自動車などの地物における分割精度が類似しており、主に雑波、建物、不透過水面の間にいくつかの分類混同が存在する。例えば、予測入力サンプルはFig. 11中真値がスプリアスの領域である場合、統合後の融合モジュール構造は不透過水面とスプリアス上の特徴図が比較的に顕著であるため、結果としてスプリアスが不透過水面に誤分類されていることが示された。また、並列融合ゲート制御構造は不透過水面類の特徴図でより顕著であるため、予測結果におけるスプリアスは完全に不透過水面に誤分類される。予測入力サンプルはFig. 11中真値が水面を透過しない領域の場合、影領域では、統合後の融合モジュール構造と並列融合ゲート構造のいずれも建物の特徴が顕著な場合があったため、建物に誤って分類される場合があった。全体的に見ると、ネストされた融合ゲート構造を用いたモデルの予測が最適で、スプリアスと不透過水面をよりよく識別することができ、そして類似のスペクトルを持つ建物と不透過水面を正確に識別し、影の干渉を減少させた。これは、タスク固有の特徴、タスク固有の特徴、およびタスク横断の顕著な特徴がセマンティック分割タスクに対して重要性が異なるため、ネスト融合ゲート構造によってタスク固有の特徴を階層的に細分化することで、階層的に異なる顕著な特徴とタスク固有の特徴の効果的な結合を促進することができるからである可能性がある。
3.5.3クロスタスクフィーチャー関連学習におけるクロスフィーチャー強化ユニット数の影響
タスク横断フィーチャー関連学習モジュールのパフォーマンスに影響を与えるもう1つの重要な要素は、クロスフィーチャー強化ユニットです。タスク横断特徴関連学習モジュールが最適な性能を得るために、交差特徴強化ユニットの数をそれぞれ1、2、3に設定して3組の実験を行い、量子化結果はTable 7を参照してください。クロスエンハンスメントユニットの数が徐々に増加するにつれて、平均F 1 _ Scoreと平均IoUはいずれも前後に増加する傾向を示し、数が2の場合に精度が最適であることがわかる。
Table 7 Quantitative results for models with different numbers of cross-feature enhancement units /%
| 交叉特征增强单元数量 | 平均F1_Score | 平均IoU |
|---|
| 1 | 62.09 | 50.45 |
| 2(本文) | 74.03 | 60.55 |
| 3 | 65.17 | 53.91 |
異なる交差特徴強化ユニットの数の影響をさらに分析するために、Fig. 12に表示されます。交差特徴増強ユニット数が1の場合、低層建築物は不透水面に分類されやすく、不透水面は雑波と低植生に誤分類されやすいことがわかる。これは、単一の交差特徴強化ユニットが高次元高距離特徴と高次元意味特徴をうまく融合できず、スペクトル情報が複雑で高距離情報が少ない場合の予測結果が困惑するためである可能性がある。交叉特徴増強ユニットの数が3の場合、樹木予測はより正確になるが、建物は低植生分類と混同され、面積がより大きい誤った分類が発生する。これらの分類混同は通常、高度値が明らかでない領域に現れるが、これは、複雑なシーンで顕著ではない高度情報が意味情報を誤って導くように、過剰な交差特徴強化ユニットが意味特徴に高度特徴を組み込みすぎている可能性がある。数量が2の場合、モデルは異なるタスクからの顕著な情報を十分に結合し、モデルの特徴表示能力を強化し、複雑なシーンでの予測性能が最も優れている。全体的に、セル数が少なすぎると、セマンティックタスクとハイレベルタスクからの高次元フィーチャー間の相補的な構築力は強くありませんが、セル数が多すぎると、モデルは異なるタスクの相補的な情報を過度にマイニングし、元のタスクへの関心を弱めます。どちらの場合も最終的な意味情報の予測結果に影響します。交差フィーチャーの拡張数が2の場合、最適なバランスをとることができます。
3.5.4混合一貫性学習におけるサンプル混合方式の影響
混合一貫性学習では、異なるサンプル混合方式がモデルのロバスト性と耐干渉性に影響を与える可能性がある。領域混合方式とは、画像を同じ大きさの領域に分割することであり、混合画像は、ソース領域とターゲット領域からの画像が領域マスクに基づいて分割され、例えばFig. 13を参照してください。領域混合には6種類の領域マスクが設置され、訓練中にランダムにいずれかのスプライス形式を選択した。カテゴリ混合方式では、ソースドメイン画像のすべてのクラスから半分のカテゴリをランダムに選択します。これらのカテゴリが存在する領域は、ターゲットドメイン画像の同じ領域のピクセルに置き換えられます。Fig. 13を参照してください。最適なサンプル混合方式を得るために、混合一貫性学習における混合方式をそれぞれ領域混合とカテゴリ混合に設定して2組の実験を行い、Table 8で量子化結果を示します。クラス混合を用いたモデルは最適な全体性能を得ており、領域混合を用いたモデルよりも各クラスの地物上の精度が優れていることがわかる。これは、カテゴリ混合方式がよりロバストであり、ソースドメイン知識のターゲットドメインへの移行をより容易にすることができることを示している。具体的には、種別混合を用いたモデルは、自動車、樹木、低植生のような部内差の小さい地物において、いずれも使用領域混合のモデルより10%程度精度が高く、その他の部内差の大きい地物において5%程度精度が高い。これはさらに、クラス混合を使用することで、異なる地物の識別能力を一般的に最適化することができ、クラス内の差異の少ない地物の正確な分割に有利であることを示している。
Table 8 Quantization results of different mixing methods /%
| 方法 | 评估指标 | 杂波或背景 | 不透水面 | 汽车 | 树木 | 低矮植被 | 建筑 | 总体 |
|---|
| 区域混合 | F1_Score | 71.17 | 83.84 | 38.33 | 64.09 | 59.94 | 88.67 | 67.67 |
| IoU | 55.24 | 72.17 | 23.71 | 47.16 | 42.79 | 79.64 | 53.45 |
| 类别混合(本文) | F1_Score | 75.35 | 86.75 | 49.91 | 72.10 | 68.27 | 91.77 | 74.03 |
| IoU | 60.45 | 76.59 | 33.26 | 56.37 | 51.82 | 84.79 | 60.55 |
3.5.5超パラメータ感受性解析
モデルのパフォーマンスに及ぼす異なる超パラメータ値の影響を調べるために、本節ではそれぞれ重み和の値を0.1、0.5、1.0に設定し、その量子化結果はTable 9和Table 10を選択します。は0.5、0.1から1まで変化すると、全体的な精度が徐々に上昇することが見られ、1の場合に最適な精度が得られた。このプロセスでは、ドメイン間分割能力と高距離予測能力が徐々に均衡している。詳細には、高距離推定タスクの重みが増加するにつれて、最も顕著なのはノイズ類の精度が急激に上昇し、自動車類の精度が急速に低下したことである。これは、高距離情報の強化は、差異が顕著で混同された地物を分離することに有利であり、高さ値が小さく外観の変化が少ない自動車類では、高距離情報の加入はかえって意味認識能力を弱めるからである可能性がある。
Table 9 Quantization results for different (=0.5) /%
| 评估指标 | 杂波或背景 | 不透水面 | 汽车 | 树木 | 低矮植被 | 建筑 | 总体 |
|---|
| 0.1 | F1_Score | 6.60 | 86.47 | 68.83 | 72.35 | 66.86 | 91.83 | 65.49 |
| IoU | 3.41 | 76.16 | 52.48 | 56.68 | 50.23 | 84.89 | 53.98 |
| 0.5 | F1_Score | 48.86 | 86.37 | 65.79 | 71.33 | 67.02 | 91.59 | 71.83 |
| IoU | 32.32 | 76.02 | 49.02 | 55.45 | 50.39 | 84.47 | 57.95 |
| 1.0 | F1_Score | 75.35 | 86.75 | 49.91 | 72.10 | 68.27 | 91.77 | 74.03 |
| IoU | 60.45 | 76.59 | 33.26 | 56.37 | 51.82 | 84.79 | 60.55 |
Table 10 Quantization results for different (=1) /%
| 评估指标 | 杂波或背景 | 不透水面 | 汽车 | 树木 | 低矮植被 | 建筑 | 总体 |
|---|
| 0.1 | F1_Score | 57.20 | 86.57 | 57.65 | 72.86 | 68.33 | 91.61 | 72.37 |
| IoU | 40.05 | 76.33 | 40.50 | 57.31 | 51.89 | 84.52 | 58.43 |
| 0.5 | F1_Score | 75.35 | 86.75 | 49.91 | 72.10 | 68.27 | 91.77 | 74.03 |
| IoU | 60.45 | 76.59 | 33.26 | 56.37 | 51.82 | 84.79 | 60.55 |
| 1.0 | F1_Score | 77.69 | 87.00 | 56.17 | 68.00 | 68.32 | 91.98 | 74.86 |
| IoU | 63.52 | 77.00 | 39.05 | 51.53 | 51.89 | 85.14 | 61.36 |
当固定は1、0.1から1まで変化すると、全体の精度が58.43%から61.36%に向上し、値が1の場合に最適な性能が得られることがわかります。細部から見ると、クラス内の差が比較的小さい自動車、樹木、低植生類の精度は徐々に低下し、クラス内の差が大きい他のクラスの精度は徐々に上昇している。これは、エントロピー値が高エントロピー領域、すなわち予測難易度の高いカテゴリにより敏感であるためである可能性がある。したがって、高くなると、モデルはドメイン適応が難しい地物の識別能力を高める傾向があります。
3.5.6疑似ラベル閾値解析
ハイブリッド一貫性学習におけるターゲットドメインサンプルの信頼性を高めるために、疑似ラベル閾値機構を導入した。訓練回数が増加するにつれて、偽ラベル閾値は徐々に最低閾値から最高閾値に増加した。異なる閾値範囲がモデルの性能に与える影響を検証するために、最低閾値は0.2、0.3、0.4に設定され、最高閾値は0.6から0.9まで0.1の間隔で上昇し、12組の実験を構成した。各グループの実験の平均F 1 _ Score及び平均IoUは、例えばFig. 14を参照してください。見られるように、最低閾値は0.4、最高閾値は0.6の場合、モデルは最適な性能を取得した。最低閾値が低すぎると信頼できないサンプルを導入しやすく、最高閾値が高すぎると学習できるサンプル量が少なすぎる可能性があり、閾値が中間範囲にある場合にのみ、この2つの状況のマイナス影響をよりよく抑制することができる、異なる閾値範囲の性能表現には明確な規則性はない。一般的に、モデルのパフォーマンスは、最低しきい値が0.3を超え、最高しきい値が0.7を超えず、最高しきい値と最低しきい値の差が0.3を超えない場合に優れています。
3.5.7モデル複雑度解析
モデルの効率を定量的に評価するために、本文はモデルパラメータ量と計算量FLOPs(floating-point operations per second)を指標として採用し、同じ入力画像サイズ(512×512画素)の下でモデル複雑度をテストした。結果は次のとおりです。Table 11を参照してください。MIDA法と比較して、本方法はFLOPS上で明らかな向上を示している。ベースライン方法の中で全体的な性能表現が最も良いCorda方法に比べて、本文方法のパラメータ量とFLOPsはそれぞれCorda方法より高いが、4つのドメイン横断実験の上で、本文方法はいずれもより良い分割性能を示した。総合的に、本文の方法は精度と効率の上で比較的に良いバランスを達成した。
Table 11 Number of parameters and FLOPs for the test models
| 方法 | 模型参数量/M | FLOPs/GB |
|---|
| DADA | 46.58 | 402.42 |
| CTRL | 47.13 | 203.10 |
| MIDA | 50.34 | 1691.78 |
| CorDA | 46.50 | 400.62 |
| Ours | 57.54 | 453.79 |