面向低信噪比信道下多任务卫星遥感的任务导向语义特征传输
发布时间:2026/9/29 4:29:32 作者:尧图编辑部 阅读量:1,286

大家读完觉得有帮助记得关注和点赞摘要传统卫星遥感传输遵循“先重建后推理”范式该范式优化像素级保真度与分类和检测等下游任务产生目标不匹配尤其是在低信噪比SNR条件下。本文研究一种任务导向框架绕过图像重建直接传输由多任务预训练骨干网络提取的语义特征。一个轻量级信道适配模块CAM压缩特征维度以降低带宽特征恢复器在信道损坏后恢复任务相关结构。在骨干网络冻结的情况下CAM 和任务特定下游头在随机 SNR 训练下通过任务级和特征级监督联合优化。在所采用的 AWGN 设置下场景分类和目标检测实验表明在不同 SNR 条件下该方法相比面向重建的 JSCC 基线取得一致增益在低 SNR 区域改进最大。索引词 任务导向语义通信语义特征传输遥感多任务预训练JSCC低 SNR 鲁棒性I 引言低地球轨道LEO卫星星座提供全球地球观测和时间敏感的遥感但其下行链路面临严格的频谱约束以及由仰角、大气衰减、干扰和轨道几何驱动的宽 SNR 变化。与此同时遥感正从图像交付转向即时决策——场景分类、水平边界框HBB检测和定向边界框OBB检测——要求通信层服务于下游任务效用而不仅仅是图像恢复。现有遥感语义通信系统 largely 遵循先重建后推理范式。深度联合信源–信道编码DeepJSCC[1] 方法如 SwinJSCC [2]、MambaJSCC [3] 和 NTSCC [4]将源图像直接映射到信道符号但优化像素级保真度MSE 或 SSIM。这产生了根本性的目标不匹配通信模块保留与下游分类或检测无关的像素级细节。在低 SNR 下重建图像遭受不成比例的任务指标下降因为噪声引起的伪影破坏了下游模型依赖的判别线索。图 1a传统基于重建的图像传输与b所提出的任务导向语义特征传输。所提出方法使用多任务预训练骨干网络提取特征通过 CAM 传输并直接从恢复特征执行下游任务无需图像重建。任务导向语义通信 [5, 6] 提供了另一种选择仅传输对下游任务直接有用的表示——目标级结构和类别判别模式——从而更有效地利用稀缺下行资源。一个关键使能因素是多媒体预训练遥感骨干网络。在多任务预训练MTP范式 [7] 下一个在语义分割、实例分割和旋转目标检测上联合训练的共享骨干网络产生可跨下游任务迁移的表示。我们采用这样的骨干网络作为语义特征提取器使用其高层特征作为传输载荷替代原始图像。然而噪声信道会降低特征判别质量。因此我们在预训练骨干网络和下游任务头之间引入信道适配模块CAM。特征压缩器降低信道维度以适应带宽受限传输特征恢复器在信道损坏后恢复任务相关结构。结合随机 SNR 训练CAM 在不重建图像的情况下保持下游任务效用。本文做出三项主要贡献。第一我们提出一种用于卫星遥感的任务导向语义特征传输框架其中多任务预训练骨干网络提取可迁移高层表示通信流水线传输语义特征而非重建图像。该框架在场景分类、水平目标检测和定向目标检测中实例化以检验特征域传输是否更好地将通信与下游任务效用对齐。第二我们开发一种轻量级信道适配模块CAM由特征压缩器和特征恢复器组成并在随机 SNR 条件下与每个下游任务头联合训练以提高对信道失真的鲁棒性同时保持传输效率。第三在 EuroSAT、DIOR 和 DIOR-R 上的实验表明在相同压缩比、骨干网络、任务头、AWGN 评估协议以及预训练与下游评估数据之间明确分离的条件下所提出框架始终优于面向重建的 JSCC 方法在低 SNR 区域观察到最显著增益。II 系统概述与任务导向特征提取所提出框架由三个阶段组成(1) 冻结的多任务预训练骨干网络从遥感图像提取任务导向语义特征(2) 信道适配模块CAM通过噪声信道压缩、传输和恢复这些特征以及 (3) 下游任务头直接在恢复特征上执行推理无需图像重建。本节描述特征提取阶段CAM 在第 III 节介绍。遵循 MTP 范式 [7]一个共享骨干网络在 SAMRS [8] 上通过语义分割、实例分割和旋转目标检测的联合监督训练。所得表示捕获可迁移的任务相关结构包括类别判别模式、空间关系和多尺度目标语义并泛化到下游分类和检测应用。这些多任务预训练特征作为传输的语义载荷。我们采用分阶段预训练方案将所得骨干网络记为 IMPMTP。IMP 指 InternImage-XL [9] 的 ImageNet-22K 预训练初始化MTP 表示随后在 SAMRS 上的监督多任务预训练阶段。因此骨干网络从强通用视觉检查点开始并进一步用遥感任务监督预训练缩小通用预训练与下游密集预测之间的差距。II-A 骨干网络与特征金字塔接口InternImage-XL [9] 作为骨干网络。它采用动态稀疏核和自适应空间聚合进行长程上下文建模具有适合密集视觉任务的局部性和效率并使用层归一化、前馈网络和 GELU 激活实现稳定优化。给定输入图像 x ∈ ℝ^{3×H×W}编码器产生多尺度特征图层次该层次作为共享特征金字塔空间分辨率分别为输入的 1/4、1/8、1/16、1/32鼓励可迁移而非任务特定的表示。II-B 多任务预训练三个密集预测头——UperNet [10]语义分割、Mask R-CNN [11]实例分割和 Oriented R-CNN [12]旋转检测——附加到共享骨干网络并在 SAMRS 上联合优化数据集细节见第 IV 节。令 ℒ_rod 表示旋转检测损失ℒ_ins^b 和 ℒ_ins^m 分别表示实例框损失和实例掩码损失ℒ_sem 表示语义分割损失。由于 SAMRS 由三个子集i ∈ {1,2,3}组成总目标为这些头不被保留它们的互补监督教授跨任务语义结构这是单任务训练无法捕获的。图 2 整体架构。冻结的多任务预训练骨干网络提取任务导向特征最后阶段特征图由特征压缩器×1 Conv GN压缩通过信道传输并由特征恢复器恢复得到 z̃。恢复特征直接馈入任务头用于分类的 GAP 线性分类器或用于 HBB/OBB 检测的 FPN 检测头——不重建图像。III 用于任务导向传输的信道适配模块本节详述 CAM它通过噪声、带宽受限信道传输载荷 z。它由特征压缩器降维和特征恢复器损坏后维度恢复组成。整个流水线在特征域操作无图像重建。III-A 载荷选择从冻结骨干网络产生的层次 {z_ℓ}_{ℓ1}^L 中我们选择最后阶段特征图作为载荷较浅层图 {z_ℓ}_{ℓ1}^{L−1} 不传输。分类仅使用 z̃检测用零张量替换未传输层并通过 FPN [13] 与 z̃ 结合。骨干网络 θ 冻结仅 CAM 和任务头更新。III-B 特征压缩器、信道和特征恢复器直接传输 z 面临两个挑战信道容量不足以承载完整 C 维特征以及噪声损坏判别结构。CAM 解决两者其中 E_ϕ 是特征压缩器C → C′C′ ≪ Cℋ_γ 表示 SNR 为 γ 的信道D_ψ 是特征恢复器C′ → C。各组件详述如下。III-B1 特征压缩器特征压缩器应用学习的 ×1 卷积与组归一化 [14]将维度从 C 降至 C′C′ ≪ C其中 W_e ∈ ℝ^{C′×C}b_e ∈ ℝ^{C′}。编码后 z̄ ∈ ℝ^{C′×H′×W′} 将每个空间位置的传输符号减少 C/C′结合骨干网络空间下采样总体压缩比 ρ C′H′W′/(3HW)。组归一化在传输前稳定特征分布。III-B2 信道模型动态卫星下行条件抽象为具有随机 SNR 采样的 AWGN 信道将传播特定效应衰落、多普勒推迟到未来工作。信道输出为 r z̄ nn ∼ (0, σ²I)其中 γ 从以下采样噪声方差由平均信号功率设定噪声在训练和推理期间均注入。随机 SNR 训练防止过拟合到单一工作点。III-B3 特征恢复器特征恢复器应用学习的 ×1 卷积与组归一化将噪声损坏特征扩展回 C 维其中 W_d ∈ ℝ^{C×C′}b_d ∈ ℝ^C。恢复的 z̃ ∈ ℝ^{C×H′×W′} 与 z 的原始维度匹配因此任务头无需架构修改。III-C 任务头每个任务头接收 z̃ 并产生任务特定预测。对于分类CLSGAP 后接线性分类器得到对于检测零填充浅层和 z̃ 馈入 FPN 颈部对于定向检测对于检测仅恢复的最后阶段特征携带任务信息而较浅金字塔输入是 FPN 接口所需的零填充占位符。FPN 和检测头参数与 CAM 联合优化。III-D 训练目标CAM 和活动任务头联合优化其中 λ 是固定加权系数默认 λ 0.2。任务损失为特征重建损失强制 z 与 z̃ 之间一致性这平衡任务有效性和特征级可恢复性。骨干网络 θ 冻结仅 ϕ {W_e, b_e}、ψ {W_d, b_d} 和任务头 ω 更新。图 3 不同 SNR 条件下的性能(a) EuroSAT 上分类Acc.ρ 1/96(b) DIOR 上 HBB 检测mAPρ 1/15(c) DIOR-R 上 OBB 检测mAPρ 1/15。虚线随机 SNR 性能。所提出方法优于所有比较方法且差距在低 SNR 下扩大。III-D1 任务特定实现细节IV 实验IV-A 实验细节本小节描述预训练数据集、下游评估数据集、通用评估协议以及整个实验中使用的任务特定实现细节。IV-A1 预训练数据集SAMRS [8] 为语义分割、实例分割和旋转目标检测提供联合监督。它包含三个子集SOTA、SIOR、FAST分别源自 DOTA-V2.0 [15]、DIOR [16] 和 FAIR1M-2.0 [17]通过 SAM [18] 转换旋转边界框标注总计 105,090 张图像和 1,668,241 个实例典型尺寸为 ×1024、×800 和 ×600。对于每个旋转框SAM 产生二值实例掩码最小外接水平矩形作为轴对齐框语义图通过将每个框的类别分配给其掩码像素形成。IV-A2 下游数据集EuroSAT [19] 包含 27,000 张 Sentinel-2 图像×64跨越 10 个土地利用类别。我们使用公共训练/验证划分。DIOR [16] 包含 23,463 张图像×800跨越 20 个类别具有 192,472 个 HBB 实例分为 5,862/5,863/11,738 用于训练/验证/测试。我们在测试集上报告结果。DIOR-R [16] 为相同 23,463 张 DIOR 图像提供 OBB 标注192,158 个实例由中心、宽度、高度、角度参数化。使用相同划分。IV-A3 评估协议所有方法使用相同的冻结 IMPMTP 骨干网络和相同的下游头架构。对于每种方法下游头在相同协议下在对应通信流水线上训练。所提出方法在发射端提取 z通过 CAM 传输并将 z̃ 直接馈入任务头。比较方法SwinJSCC [2]、MambaJSCC [3]、NTSCC [4]在相同划分、相同压缩比和随机 SNR 信道下使用其原始编码器–解码器架构训练测试时每种方法重建图像通过相同冻结骨干网络和任务头传递。任务头在冻结骨干网络上相同训练评估使用相同 SNR 条件。这隔离了单一因素通信层传输任务导向特征所提出还是重建图像比较方法。采用 AWGN 信道模型在从 Γ {20, 13, 10, 0, −10, −13, −20} dB 随机采样的 SNR 下训练。分类EuroSAT图像调整大小为 ×224。骨干网络产生四阶段特征通道数为 (192, 384, 768, 1536)空间尺寸为 (56, 28, 14, 7)。仅传输 z ∈ ℝ^{1536×7×7}压缩至 C′ 32ρ ≈ 1/96。分类头对恢复的 1536 维特征应用 GAP 线性分类器。训练使用 AdamWlr ×10^{−5}权重衰减 0.055 轮线性预热从 10^{−6} 开始随后余弦退火批量大小 64100 轮。增强随机调整大小裁剪、翻转、RandAugment、随机擦除。损失权重 λ 0.2。指标Top-1 分类准确率Acc.%。HBB 检测DIOR骨干网络产生四阶段空间分辨率 (200, 100, 50, 25)。载荷 z ∈ ℝ^{1536×25×25} 压缩至 C′ 205ρ ≈ 1/15。恢复的 z̃ 与零填充浅层结合并馈入 FPN [13]256 通道 Faster R-CNN [20]。训练使用 AdamWlr ×10^{−4}权重衰减 0.055 轮预热从 10^{−6} 开始余弦退火批量大小 836 轮。增强水平翻转、调整大小裁剪、多尺度训练短边 ∈ [640, 800]。λ 0.2。指标平均精度均值mAP%。OBB 检测DIOR-R所有设置与 HBB 配置匹配除了检测头为 Oriented R-CNN [12]增强中增加随机旋转。指标mAP(%)。图 4 CAM 在不同 SNR 条件下的消融(a) 分类(b) HBB 检测(c) OBB 检测。实心标记表示训练 SNR 点空心标记表示未见点虚线表示随机 SNR 性能。IV-B 与面向重建的 SOTA 方法比较我们在上述评估协议下在所有三个下游任务上将所提出方法与三种面向重建的 SOTA 方法 SwinJSCC [2]、MambaJSCC [3] 和 NTSCC [4] 比较。性能在 Γ 中每个 SNR 以及随机条件 γ ∼ Uniform(Γ) 下报告。该比较直接检验传输任务导向特征是否比传输随后必须重建用于推理的图像更有效。IV-B1 场景分类图 3(a) 总结所有训练 SNR 条件下的分类准确率。在随机条件下所提出方法达到 99.01%而 MambaJSCC 为 65.37%。在 −20 dB 时差距扩大到 97.57% 对 34.12%。即使在 20 dB特征传输也领先99.15% 对 NTSCC 的 93.56%表明任务导向特征即使在有利条件下也是更好的通信目标。所提出方法在整个 SNR 范围内保持 ≥97.57%而比较方法在 −20 dB 时降至 18–34%。这种稳定性可能因为分类主要依赖最后阶段特征中的高层语义而 GAP 降低对局部扰动的敏感性。值得注意的是这种行为表明对该任务而言保持语义可分性比保持像素保真度更重要。IV-B2 水平目标检测图 3(b) 总结所有训练 SNR 条件下的水平检测 mAP。在随机条件下所提出方法达到 59.25%而 MambaJSCC 为 51.01%。差距随 SNR 降低而增大20 dB 时 1.890 dB 时 11.41−10 dB 时 21.27−20 dB 时 20.58。检测比分类对空间结构更敏感重建伪影可能破坏定位线索而特征域传输避免显式图像重建阶段因此倾向于更直接地保留任务相关结构。IV-B3 旋转目标检测图 3(c) 总结所有训练 SNR 条件下的定向检测 mAP。在随机条件下所提出方法达到 54.61%而 MambaJSCC 为 47.05%。在 −20 dB 时差距扩大到 43.63% 对 21.97%在 −10 dB 时扩大到 55.48% 对 34.46%。比较方法比 HBB 检测退化更陡峭因为定向框对局部几何和边界精度敏感。此外角度预测依赖细粒度结构一致性特别容易受到重建噪声影响。在所有三个任务中所提出方法从 20 到 −20 dB 的下降为 Δ_CLS −1.58 Acc.Δ_HBB −15.74 mAPΔ_OBB −15.35 mAP。检测远比分类对 SNR 敏感因为它依赖易受噪声影响的空间精确定位线索。这些跨任务差异进一步支持将传输表示与实际上游目标对齐的必要性。IV-C 消融研究为了验证 CAM 中特征恢复器的有效性我们在图 4 中比较两个变体无 CAM仅压缩器和有 CAM完整 CAM 带恢复器。IV-C1 实验设置无 CAM 变体从 C 1536 压缩到 C′分类 C′ 32检测 C′ 205并注入 AWGN 噪声但移除恢复器。任务头适配为直接接受 C′ 维输入。有 CAM 变体保留完整 CAM压缩和噪声注入后恢复器将特征扩展回 C 维。两个变体共享相同冻结骨干网络和随机 SNR 训练协议。IV-C2 结果与分析有 CAM 变体始终优于无 CAM。在随机条件下恢复器将 HBB mAP 提高 0.5059.25 对 58.75OBB 提高 0.5054.61 对 54.11。分类提高 0.16 Acc.99.01 对 98.85如预期因为基于 GAP 的分类比基于 FPN 的检测对维度不太敏感。优势在各 SNR 下一致−10 dB 时 HBB 和 OBB 均为 1.0320 dB 时 1.79此时维度扩展帮助 FPN 产生更丰富特征−20 dB 时 0.10此时噪声底主导。压缩器执行关键压缩而恢复器为检测提供一致细化。IV-D 复杂度分析本小节仅比较传输相关模块的参数、FLOPs 和延迟共享骨干网络、FPN 和任务头被排除。具有自定义 CUDA 算子的方法的 FLOPs 可能部分估计墙钟延迟用 torch.cuda.Event 测量。表 I 检测设置下传输相关模块的复杂度DIOR-RC′ 205特征 1536×25×25。骨干网络、FPN 和任务头被排除。†FLOPs 因自定义 CUDA 算子部分估计。方法参数FLOPs延迟 (ms)我们的仅压缩器315.29K197.44M0.12 ± 0.00我们的完整 CAM633.24K399.04M0.47 ± 0.19SwinJSCC33.07M34.02G18.23 ± 1.05MambaJSCC14.55M6.51G†16.52 ± 0.94NTSCC28.63M1.76G4.47 ± 0.28• 注延迟在单 GPU 上以 200 次迭代测量。表 I 比较检测设置下的模块C′ 205特征 ××25。CAM 使用 633.24K 参数和 399.04M FLOPs——比比较方法低 1–2 个数量级14.55–33.07M 参数1.76–34.02G FLOPs。延迟为 0.47 ms而比较方法为 4.47–18.23 ms。在分类设置下C′ 32特征 ××7开销更小101.44K 参数5.20M FLOPs0.22 ms 延迟。这种效率源于仅在紧凑骨干特征上使用两个 ×1 卷积而非全分辨率图像。V 结论本文提出一种用于变 SNR 信道下多任务卫星遥感的任务导向语义特征传输框架。所提出框架不是在推理前重建图像而是直接传输由多任务预训练骨干网络提取的任务相关语义特征并在恢复特征上执行下游推理。轻量级信道适配模块在信道噪声下保持判别特征质量导致强分类和检测性能在训练 SNR 范围内平滑退化。在相同压缩比和 AWGN 设置下该框架始终优于面向重建的 JSCC 方法在低 SNR 区域增益最显著。未来工作将把信道模型扩展到 AWGN 之外的衰落、多普勒和时选信道代表 LEO 卫星链路纳入自适应速率控制与可变压缩比和显式载荷核算并探索渐进式多尺度语义特征传输用于小目标定位和定向检测。硬件感知部署与轻量级星载骨干网络、模型压缩和资源受限卫星平台上的能量感知推理也将被研究以用于实际实现。