基于多源遥感与地球化学数据的KAN模型智能成矿预测:以甘肃寨上-马坞整装勘查区为例
陈以纯, 贺金鑫*, 陈永良, 遇运良, 陈家骏
吉林大学地球科学学院,吉林长春130061
DOI: 10.13745/j.esf.sf.2026.2.1
地学前缘, 2026, 33(4): 295-309
关键词
Kolmogorov-Arnold网络; 多源数据融合; 深度学习; 成矿预测; 西秦岭
摘要
机器学习技术已广泛应用于
矿产资源预测,但主流监督学习方法常受限于正样本稀缺、负样本界定主观及模型决策“黑箱” 等瓶颈。为应对这些挑战,本研究首次将具有内生可解释性与高参数效率的Kolmogorov-Arnold网络(KAN) 引入矿产预测领域。以甘肃寨上-马坞金矿整装勘查区为试验区,系统融合区域地球化学与多源遥感数据,构建了涵盖构造地貌、热液蚀变、元素异常的30 m分辨率多维特征数据集,并设计了伪标签迭代扩充机制以缓解小样本过拟合风险。该区成矿背景复杂,隐伏矿体定位困难,为方法验证提供了理想场景。结果表明:KAN模型训练区AUC达0.82,在独立盲测区对3处已知矿床60 m缓冲带的识别率达100%,预测性能显著优于随机森林。可解释性分析进一步揭示,地球化学异常(44.2%)、遥感蚀变信息(38.6%)与地形特征(17.2%)的协同贡献,完整映射了成矿作用过程。本研究不仅提升了预测模型的精度与可解释性,也为弱信息区及类似复杂地质背景下的找矿勘查,提供了一条兼具高准确率与过程透明度的技术新路径。
研究背景
黄金作为支撑国家经济与国防安全的关键战略矿产,市场需求持续增长,矿产预测技术也历经专家经验驱动、统计数据驱动发展至智能机器学习阶段,但现有方法仍存在显著短板:传统知识驱动法主观性强,难以量化多源地学数据复杂关联,统计数据驱动法受严格线性、独立假设约束,无法刻画成矿系统非线性动力学特征;而当下主流深度学习、机器学习智能预测模型又面临两大核心瓶颈,一是模型内部权重参数繁杂形成决策“黑箱”,预测过程缺乏地质逻辑、可解释性缺失,难以追溯成矿判断依据,二是矿产勘查天然存在极端小样本、正负样本划分困难的问题,有经济价值的矿床正样本数量稀少,未发现矿点区域也不能简单判定为无矿负样本,样本失衡与标签噪声极易引发模型过拟合、泛化能力不足;与此同时,多源遥感、地球化学、地形地貌数据蕴含着成矿相关的物理化学关联,具备统一栅格融合建模的数据基础,2024 年提出的 KAN 网络凭借可学习激活函数的独特架构,兼具高精度、高参数效率与内生可解释性,为破解现有成矿预测技术痛点提供了全新思路,西秦岭甘肃寨上 - 马坞整装勘查区构造、岩浆活动复杂,浅成中低温热液型微细浸染金矿发育,隐伏矿体定位难度大,是验证新型智能成矿预测方法的理想试验区,基于此,研究依托 GEE 云平台整合多源地学数据,引入半监督伪标签扩充策略与 KAN 模型开展可解释智能成矿预测研究。
本研究以甘肃寨上-马坞整装勘查区为实例,集成地形、遥感与地球化学等多源数据,针对传统二分类框架中正负样本不均衡及标签噪声等问题,引入半监督学习与伪标签技术予以优化;并在模型架构上,将 Kolmogorov-Arnold 网络(KAN)应用于成矿预测领域,旨在构建一套兼具可解释性与高精度的智能预测方法,为弱信息提取与隐伏矿床勘查提供可靠的技术解决方案。
研究结论
本文以甘肃寨上-马坞整装勘查区为例,针对矿产预测中“正样本稀少、负样本不可靠”的“正-无标记”数据特性,构建了基于Kolmogorov-Arnold网络(KAN)的半监督学习金矿远景预测框架,取得以下主要结论和认识:
(1)基于“源-运-储-变”成矿系统理论,从构造地貌、热液蚀变与地球化学异常3个维度,融合多源遥感(Sentinel-2、ASTER、SRTM DEM)、地球化学(Ag、As、Au等10种元素)及地形数据,构建了27维特征预测体系。经S-A多重分形滤波与Z-score标准化处理,形成空间分辨率30 m的统一特征栈,为模型输入提供高质量数据基础。
(2)提出“伪标签迭代扩充”的半监督学习策略,通过设置高置信度阈值(正≥0.8,负≤0.1)筛选无标签样本加入训练集,有效缓解了小样本学习中的过拟合问题。KAN半监督模型在训练区验证集AUC达0.82;在独立测试区盲测中,对3处已知金矿床60 m缓冲区的识别率达100%,平均预测概率为90%,显著优于随机森林模型(识别率0%),表明该模型具有较强的泛化能力与实际预测价值。
(3)借助KAN模型内在的可解释性,定量揭示了多源特征的贡献度:地球化学异常贡献最高(44.2%),其中Pb、Hg、Au、Sn、As等元素作用显著;遥感蚀变特征次之(38.6%),S2_B11_max、ASTER_MI等指标有效识别硅化、泥化蚀变带;地形特征贡献17.2%,TRI、TPI、Slope等地形因子清晰刻画控矿构造。三类特征协同揭示了“物质来源-热液通道-赋存空间”的完整成矿系统结构。
(4)根据预测概率空间分布,将研究区划分为3级成矿远景区(一级:0.9~1.0;二级:0.7~<0.9;三级:0.6~<0.7),为勘查区弱信息提取与找矿工作部署提供了依据。
本次研究表明,KAN模型在成矿预测中兼顾了高精度与强可解释性,可为类似复杂地质背景下的矿产资源智能预测提供有效方法参考。然而,本次研究仍存在一定局限性:地形因子虽然可在一定程度上间接反映区域构造格局,但未直接引入岩性与构造矢量数据,限制了对控矿构造空间展布的精细刻画;同时,研究区周边地形复杂,部分地球化学指标低于仪器检测下限,导致多源数据在空间上存在覆盖不全、交错缺失的现象,限制了全要素协同建模在边缘区域的潜力挖掘。未来研究可通过栅格化处理将关键地质要素纳入预测体系,并结合基于机器学习的缺失数据插补方法,对不完整特征进行智能重建,在降低野外采样与数据获取成本的同时,为西秦岭及类似区域开展更系统、更精细的成矿预测提供更完整的数据支撑。
引用本文:
陈以纯, 贺金鑫, 陈永良, 遇运良, 陈家骏. 基于多源遥感与地球化学数据的KAN模型智能成矿预测:以甘肃寨上-马坞整装勘查区为例[J]. 地学前缘, 2026, 33(4): 295-309.
CHEN Yichun, HE Jinxin, CHEN Yongliang, YU Yunliang, CHEN Jiajun. Intelligent mineral prospectivity mapping via KAN model based on remote sensing and geochemical data: A case study of the Zhaishang-Mawu exploration area, Gansu Province, China[J]. Earth Science Frontiers, 2026, 33(4): 295-309.
代表性图件
图1 寨上-马坞整装勘查区地质简图
图2 哨兵二号蚀变指数图
图3 ASTER蚀变指数图
图4 地形因子提取图
图5 克里金插值示意图
图6 二层KAN网络结构模式图(据文献[50]修编)
图7 训练区与独立测试区空间位置图
图8 KAN(半监督学习)与 随机森林 ROC对比图
图9 测试区KAN与随机森林模型成矿概率对比
图10 KAN模型特征重要性图
图11 成矿远景区预测结果
免责声明:本文内容来源自“青春地矿三院”,如需转载请联系我们。如涉及作品内容、版权和其它问题,请来电或致函告之,我们将及时给予处理!