最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python深度學(xué)習(xí)時(shí)序預(yù)測:從數(shù)據(jù)預(yù)處理到DGCRN/Informer模型對(duì)比

 更新時(shí)間:2026年04月25日 10:49:41   作者:Wu Yu  
本文系統(tǒng)對(duì)比DGCRN動(dòng)態(tài)圖卷積循環(huán)網(wǎng)絡(luò)與Informer長序列學(xué)習(xí)器在PM2.5濃度預(yù)測中的性能,涵蓋184個(gè)站點(diǎn)三年數(shù)據(jù)預(yù)處理、缺失填補(bǔ)、周期特征分析及模型代碼實(shí)現(xiàn),為環(huán)境時(shí)空預(yù)測提供可復(fù)現(xiàn)實(shí)證框架,

隨著城市化和工業(yè)化的深度推進(jìn),細(xì)顆粒物(PM2.5)污染問題日益突出,精準(zhǔn)預(yù)測PM2.5濃度對(duì)公眾健康預(yù)警、應(yīng)急減排措施制定以及環(huán)境治理政策優(yōu)化至關(guān)重要。

數(shù)據(jù)預(yù)處理(插值、異常值、標(biāo)準(zhǔn)化)
    │
特征分析與因子挖掘(周/年周期、GAUST 相似性)
    │
模型構(gòu)建與訓(xùn)練(DGCRN、Informer、LSTM、GRU)
    │
多指標(biāo)對(duì)比評(píng)估(RMSE、MAPE、MAE、R²)
    │
模型改進(jìn)展望(多尺度時(shí)序單元、空間注入)

從數(shù)據(jù)驅(qū)動(dòng)的視角看,這本質(zhì)上是一個(gè)融合時(shí)空動(dòng)態(tài)和長程依賴的復(fù)雜時(shí)間序列預(yù)測課題。本文綜合運(yùn)用時(shí)序特征分析、因子關(guān)聯(lián)挖掘以及深度學(xué)習(xí)建模,對(duì)某區(qū)域184個(gè)站點(diǎn)連續(xù)三年的多變量記錄進(jìn)行系統(tǒng)分析,重點(diǎn)對(duì)比動(dòng)態(tài)圖卷積循環(huán)網(wǎng)絡(luò)(Dynamic Graph Convolutional Recurrent Network, DGCRN)與長序列學(xué)習(xí)器Informer,并使用長短期記憶網(wǎng)絡(luò)(Long Short-Term Memory, LSTM)和門控循環(huán)單元(Gated Recurrent Unit, GRU)作為基線模型。這項(xiàng)工作靈感來源于一次面向環(huán)保業(yè)務(wù)的咨詢?nèi)蝿?wù),經(jīng)數(shù)據(jù)脫敏和方法沉淀后,形成可復(fù)現(xiàn)的學(xué)術(shù)分析框架,可為同類研究提供模型選型參考和實(shí)踐經(jīng)驗(yàn)。

拓展說明:時(shí)空預(yù)測任務(wù)的核心難點(diǎn)在于:① 污染物濃度受氣象條件(風(fēng)速、濕度、氣壓等)和排放源雙重影響,具有強(qiáng)非線性;② 站點(diǎn)間污染物擴(kuò)散存在空間傳播延遲(例如上風(fēng)向站點(diǎn)濃度升高后數(shù)小時(shí)影響下風(fēng)向站點(diǎn));③ 時(shí)間維度上同時(shí)存在日、周、年等多尺度周期模式。DGCRN和Informer分別從“時(shí)空同步建模”和“超長序列壓縮”兩個(gè)角度切入,代表了兩種不同的技術(shù)路線。

一、數(shù)據(jù)預(yù)處理與特征工程

1. 數(shù)據(jù)探索與缺失填補(bǔ)

數(shù)據(jù)集包含184個(gè)監(jiān)測點(diǎn),時(shí)間跨度為2015年1月至2018年12月,采樣頻率為每3小時(shí)一次,每個(gè)時(shí)間點(diǎn)記錄14個(gè)特征變量(包括PM2.5濃度、2米溫度、邊界層高度、風(fēng)速、風(fēng)向角、降水量、相對(duì)濕度、地面氣壓等)。經(jīng)重新生成完整時(shí)間索引并逐條比對(duì),發(fā)現(xiàn)由觀測時(shí)間點(diǎn)和觀測點(diǎn)構(gòu)成的主鍵缺失11,776條記錄,缺失時(shí)段主要集中在跨年夜附近,且表現(xiàn)為連續(xù)、短時(shí)中斷模式——這可能是由于節(jié)假日期間監(jiān)測設(shè)備維護(hù)或通訊故障所致。


圖1 數(shù)據(jù)集的基本屬性探索(含各特征統(tǒng)計(jì)分布、缺失率矩陣、時(shí)間覆蓋范圍)

缺失填補(bǔ)策略根據(jù)變量物理特性分類實(shí)施:
- 周期性插值:對(duì)具有明顯日周期和年周期的2米溫度、邊界層高度,采用基于歷史同期數(shù)據(jù)的周期性插值(取前后各24個(gè)周期的加權(quán)平均),以保留季節(jié)變化規(guī)律。
- 風(fēng)向角處理:環(huán)形特征風(fēng)向角(0°-360°存在邊界不連續(xù)性)通過三角函數(shù)分解(sin和cos變換)展開為連續(xù)值后進(jìn)行插值,再反變換回角度。
- 累計(jì)量插值:降水等累計(jì)量采用累計(jì)量插值法(即對(duì)非零降水的連續(xù)時(shí)段整體處理,避免破壞累積關(guān)系)。
- 突變變量插值:PM2.5、風(fēng)速等易突變的變量采用分段線性插值,僅填補(bǔ)短時(shí)缺口(連續(xù)缺失不超過3個(gè)時(shí)間點(diǎn)),長時(shí)段缺失則不強(qiáng)行插補(bǔ),以盡量保留突發(fā)波動(dòng)特征。


圖2 缺失記錄可視化(熱力圖展示各站點(diǎn)、各月份的缺失分布)


圖2(續(xù)) 缺失前后的數(shù)據(jù)對(duì)比示例

最受歡迎的見解

以下為平臺(tái)讀者高頻關(guān)注的相關(guān)研究主題(供拓展參考):

  • Python員工人力流失預(yù)測:ADASYN采樣、CatBoost算法、LASSO特征選擇與動(dòng)態(tài)不平衡處理及多模型對(duì)比研究
  • R語言分布式滯后非線性模型(DLNM)分析某城市空氣污染與健康數(shù)據(jù):多維度可視化優(yōu)化滯后效應(yīng)解讀
  • Python古代文物成分分析與鑒別研究:灰色關(guān)聯(lián)度、嶺回歸、K-means聚類、決策樹分析
  • Python + TensorFlow + OpenCV的卷積神經(jīng)網(wǎng)絡(luò)(CNN)人臉識(shí)別系統(tǒng)構(gòu)建與應(yīng)用實(shí)踐
  • Python實(shí)現(xiàn)Transformer、SARIMAX、RNN、LSTM、Prophet時(shí)間序列預(yù)測對(duì)比分析(應(yīng)用于用電量、零售銷售、公共安全、交通事故數(shù)據(jù))
  • MATLAB貝葉斯超參數(shù)優(yōu)化LSTM預(yù)測設(shè)備壽命應(yīng)用——以航空發(fā)動(dòng)機(jī)退化數(shù)據(jù)為例
  • Python谷歌商店Google Play APP評(píng)分預(yù)測:LASSO、多元線性回歸、嶺回歸模型對(duì)比研究
  • Python+AI提示詞糖尿病預(yù)測模型融合構(gòu)建:伯努利樸素貝葉斯、邏輯回歸、決策樹、隨機(jī)森林、支持向量機(jī)SVM應(yīng)用

2. 異常值處理與標(biāo)準(zhǔn)化

結(jié)合物理閾值(如PM2.5濃度不超過500 μg/m³、風(fēng)速不超過30 m/s)和統(tǒng)計(jì)方法(Z-score > 3或< -3、箱線圖超出1.5倍四分位距)進(jìn)行異常值檢測。對(duì)于符合極端天氣特征(如沙塵暴導(dǎo)致濃度驟升、臺(tái)風(fēng)期間風(fēng)速極大)的“真實(shí)異常”予以保留,不作為異常剔除;對(duì)于傳感器漂移或記錄錯(cuò)誤導(dǎo)致的孤立離群點(diǎn),則采用中位數(shù)替代或鄰近點(diǎn)均值修正。

隨后通過Z-score標(biāo)準(zhǔn)化消除量綱影響:對(duì)每個(gè)特征獨(dú)立計(jì)算均值和標(biāo)準(zhǔn)差,將數(shù)據(jù)轉(zhuǎn)換為均值為0、標(biāo)準(zhǔn)差為1的分布,以保證不同量級(jí)變量(如溫度數(shù)值在-10~40之間,氣壓在980~1030 hPa之間)對(duì)模型訓(xùn)練的貢獻(xiàn)均衡。風(fēng)向角用正余弦映射(構(gòu)造sin(角度)和cos(角度)兩個(gè)新特征)解決角度突變問題,同時(shí)保留方向信息的完整性。


圖3 觀測屬性可視化特征(各特征箱線圖、分布直方圖)


圖4 插值后可視化結(jié)果(插值前后時(shí)序曲線對(duì)比)


圖4(續(xù)) 多站點(diǎn)插值效果驗(yàn)證圖

專家建議:在環(huán)境時(shí)間序列的預(yù)處理中,不建議對(duì)所有缺失采用同一插值方法。應(yīng)根據(jù)缺失模式(隨機(jī)缺失 vs. 連續(xù)缺失)和變量物理意義(連續(xù)變量 vs. 環(huán)形變量 vs. 累積變量)分別處理。跨年夜連續(xù)缺失若超過6小時(shí)(兩個(gè)采樣點(diǎn)),建議直接標(biāo)記為“無數(shù)據(jù)”而非強(qiáng)行插補(bǔ),以避免引入虛假的濃度變化模式。

閱讀原文進(jìn)群獲取完整內(nèi)容及更多AI見解、行業(yè)洞察,與900+行業(yè)人士交流成長。

二、時(shí)序特征與因子分析

1. 多尺度周期特征

  • 日周期:整體波動(dòng)平緩,無顯著的“早晚高峰、午后低谷”模式,表明該區(qū)域排放源結(jié)構(gòu)以工業(yè)連續(xù)排放為主,交通源貢獻(xiàn)相對(duì)較弱,氣象驅(qū)動(dòng)(如日間垂直擴(kuò)散增強(qiáng))對(duì)濃度的調(diào)節(jié)作用有限。
  • 周周期:呈現(xiàn)出“周中穩(wěn)態(tài)、周末抬升”的規(guī)律,周末波幅加大(標(biāo)準(zhǔn)差比工作日增加約12%)??赡艿慕忉屖侵苣┎糠止S停工導(dǎo)致背景濃度變化,或居民出行模式的改變影響了二次轉(zhuǎn)化條件。
  • 年周期:呈現(xiàn)明顯的“冬高夏低”季節(jié)鎖定效應(yīng)。冬季靜穩(wěn)天氣(逆溫層頻繁出現(xiàn)、混合層高度降低)利于污染物累積,而夏季對(duì)流活動(dòng)和降水沖刷顯著降低濃度。三個(gè)年份間PM2.5中位數(shù)持續(xù)下降(2015→2016下降約11%,2016→2017下降約9%),箱體收窄,極端峰值減少,表明該區(qū)域污染治理措施(如燃煤鍋爐改造、工業(yè)排放標(biāo)準(zhǔn)收緊)效果顯著。


圖5 日周期特性對(duì)比(各小時(shí)PM2.5均值及置信區(qū)間)


圖6 周周期特性對(duì)比(周一至周日逐日分布盒圖)


圖7 月周期特性對(duì)比(1-12月PM2.5變化曲線)


圖8 年周期特性對(duì)比(2015-2018逐年對(duì)比)


圖9 PM2.5年度分布對(duì)比(小提琴圖疊加箱線圖)

2. 氣象因子關(guān)聯(lián)分析(GAUST)

在滑動(dòng)時(shí)間窗口(窗口大小為30天,步長為5天)內(nèi)計(jì)算各氣象因子與PM2.5濃度的Pearson相關(guān)系數(shù),形成時(shí)變相關(guān)曲線。結(jié)果顯示:風(fēng)速與PM2.5的時(shí)序趨勢相似度最高(平均相關(guān)系數(shù)約-0.58,風(fēng)速越大濃度越低),印證了水平擴(kuò)散為主導(dǎo)的清除機(jī)制;地面氣壓次之(相關(guān)系數(shù)約-0.42,低壓系統(tǒng)伴隨輻合上升利于擴(kuò)散);相對(duì)濕度與PM2.5呈弱正相關(guān)(相關(guān)系數(shù)約0.23,高濕條件下氣溶膠吸濕增長促進(jìn)二次生成);風(fēng)向的影響表現(xiàn)為區(qū)域差異——當(dāng)風(fēng)向來自工業(yè)區(qū)方向時(shí)相關(guān)性轉(zhuǎn)正。這些結(jié)果直接指導(dǎo)了后續(xù)建模中特征權(quán)重的差異化設(shè)計(jì)(如為風(fēng)速特征分配更高的注意力分?jǐn)?shù))。

術(shù)語解釋:GAUST(Granger-Augmented Spatio-Temporal)是一種結(jié)合格蘭杰因果檢驗(yàn)的時(shí)空關(guān)聯(lián)分析方法。與傳統(tǒng)相關(guān)系數(shù)不同,GAUST不僅考察兩個(gè)變量的同期相關(guān)性,還評(píng)估一個(gè)變量的滯后值是否對(duì)另一個(gè)變量的預(yù)測有顯著貢獻(xiàn),從而識(shí)別出“因果性”而非僅僅是“相關(guān)性”。


圖10 氣象因子與PM2.5 GAUST分析結(jié)果(包含各因子不同滯后階數(shù)的貢獻(xiàn)熱圖)

三、模型構(gòu)建與代碼實(shí)現(xiàn)

1. DGCRN:動(dòng)態(tài)圖卷積循環(huán)網(wǎng)絡(luò)

DGCRN的核心在于自適應(yīng)圖生成擴(kuò)散圖卷積的協(xié)同設(shè)計(jì)。具體而言:
- 自適應(yīng)圖生成:每個(gè)站點(diǎn)學(xué)習(xí)一個(gè)可訓(xùn)練的嵌入向量(embedding vector),嵌入向量之間的內(nèi)積經(jīng)過Softmax歸一化后產(chǎn)生動(dòng)態(tài)鄰接矩陣。與傳統(tǒng)預(yù)定義空間圖(如基于地理距離或道路連接)不同,該矩陣在訓(xùn)練過程中自動(dòng)更新,能夠?qū)W習(xí)到數(shù)據(jù)驅(qū)動(dòng)的潛在空間依賴(例如兩個(gè)地理上相隔較遠(yuǎn)的站點(diǎn),只因處于同一氣流通道而產(chǎn)生高度相關(guān)的污染波動(dòng))。
- 擴(kuò)散圖卷積:模擬污染物在站點(diǎn)間的雙向傳播——既沿風(fēng)向方向擴(kuò)散,也反向回傳(對(duì)應(yīng)于污染物回流或區(qū)域背景均勻化)。每個(gè)時(shí)間步的圖卷積操作聚合鄰居節(jié)點(diǎn)的信息,更新當(dāng)前節(jié)點(diǎn)的表征。
- 時(shí)序單元:使用改寫的門控循環(huán)單元(GRU),將線性門(更新門、重置門)替換為擴(kuò)散圖卷積操作,形成DGCRM(動(dòng)態(tài)圖卷積循環(huán)模塊)。這使得網(wǎng)絡(luò)在每個(gè)時(shí)間步都能同時(shí)捕捉:
- 空間依賴(當(dāng)前時(shí)刻各站點(diǎn)之間的相互影響)
- 時(shí)間依賴(各站點(diǎn)自身的歷史序列模式)


圖11 DGCRN模型總覽圖(含嵌入層、圖卷積層、GRU循環(huán)層、輸出層的完整數(shù)據(jù)流)

下面給出簡化后的核心架構(gòu)代碼:

# 自適應(yīng)圖卷積與循環(huán)單元(變量名已重構(gòu))
class GraphDiffusionConv(nn.Module):
    def __init__(self, in_dim, out_dim, K_steps=2):
        super().__init__(); self.K_steps = K_steps
        # 拼接多步擴(kuò)散結(jié)果的全連接層
        self.linear_combine = nn.Linear(in_dim * K_steps, out_dim)
    def forward(self, x, adj_matrix):
        B, N, _ = x.shape
        adj_mod = adj_matrix + torch.eye(N, device=x.device)   # 自環(huán)連接
        deg_inv = (adj_mod.sum(1) + 1e-6).pow(-1)             # 度矩陣的逆
        norm_adjacency = torch.diag(deg_inv) @ adj_mod
        spatial_supports, x_diffused = [x], x
        for _ in range(1, self.K_steps):   # 多步擴(kuò)散模擬
            x_diffused = torch.einsum('ij,bjk->bik', norm_adjacency, x_diffused)
            spatial_supports.append(x_diffused)
        combined = torch.cat(spatial_supports, dim=-1)
        return self.linear_combine(combined)
class GraphConvGRUCell(nn.Module):
    def __init__(self, in_dim, hid_dim, K_steps=2):
        super().__init__(); self.hid_dim = hid_dim
        self.update_conv = GraphDiffusionConv(in_dim + hid_dim, hid_dim, K_steps)
        self.reset_conv  = GraphDiffusionConv(in_dim + hid_dim, hid_dim, K_steps)
        self.candidate_conv = GraphDiffusionConv(in_dim + hid_dim, hid_dim, K_steps)
    def forward(self, x, h_state, adj_matrix):
        concat_input = torch.cat([x, h_state], dim=-1)
        # ......(省略門控計(jì)算與狀態(tài)更新,完整代碼請(qǐng)進(jìn)群獲?。?/pre>


圖12 DGCRN訓(xùn)練過程損失下降圖(訓(xùn)練集與驗(yàn)證集損失曲線,約30個(gè)epoch后趨于收斂)

2. Informer:概率稀疏自注意力

Informer專門針對(duì)長序列時(shí)間預(yù)測(Long Sequence Time-series Forecasting, LSTF)設(shè)計(jì),核心創(chuàng)新點(diǎn)包括:
- ProbSparse自注意力:僅對(duì)少數(shù)“活躍”的Query(概率分布偏離均勻分布較大的Query)計(jì)算完整的注意力分?jǐn)?shù),其余使用均勻分布近似,從而將計(jì)算復(fù)雜度從O(L²)降低到O(L·log L),其中L為序列長度。
- 自注意力蒸餾:通過卷積和池化操作逐層壓縮編碼器的序列維度,突出主導(dǎo)注意力模式,過濾冗余信息。
- 生成式解碼器:一次性輸出所有預(yù)測步長的結(jié)果,無需逐步步進(jìn)式推理。

在本任務(wù)中,輸入序列長度為72(對(duì)應(yīng)9天數(shù)據(jù)),預(yù)測步長為24(對(duì)應(yīng)3天數(shù)據(jù))。實(shí)測發(fā)現(xiàn):由于PM2.5濃度自身的日周期和周周期特征較弱(見第二節(jié)分析),Informer的序列蒸餾機(jī)制傾向于保留長程趨勢而濾除大量點(diǎn)維度的異動(dòng),導(dǎo)致預(yù)測結(jié)果過于平滑,對(duì)突發(fā)污染峰值的捕捉能力明顯不足。


圖13 Informer訓(xùn)練過程損失下降圖

3. 基線模型 LSTM 與 GRU

作為循環(huán)神經(jīng)網(wǎng)絡(luò)(RNN)的基礎(chǔ)基準(zhǔn),LSTM和GRU直接對(duì)多變量時(shí)間序列建模(將14個(gè)特征拼接成輸入向量,未顯式利用站點(diǎn)間的空間關(guān)系)。LSTM通過輸入門、遺忘門、輸出門控制長期記憶的流動(dòng);GRU結(jié)構(gòu)更精簡,將遺忘門和輸入門合并為更新門。兩者憑借門控機(jī)制仍能捕捉一定程度的時(shí)序動(dòng)態(tài),但無法建模站點(diǎn)間污染物傳播,因此在空間異質(zhì)性強(qiáng)的區(qū)域預(yù)測表現(xiàn)受限。

對(duì)比表格:三種模型的復(fù)雜度與適用場景

模型空間建模能力時(shí)間復(fù)雜度(每層)參數(shù)量適用場景
LSTM/GRU? 無O(L·d²)單站點(diǎn)或多變量獨(dú)立時(shí)序
DGCRN? 動(dòng)態(tài)圖卷積O(N·L·d² + N²·d)多站點(diǎn)時(shí)空依賴建模
Informer? 無(純時(shí)序)O(L·log L·d)超長序列、周期性強(qiáng)

注:N=站點(diǎn)數(shù),L=序列長度,d=隱藏維度

四、結(jié)果對(duì)比與解讀

下表匯總了各模型在測試集上的表現(xiàn)(訓(xùn)練30個(gè)epoch,RMSE/MAE指標(biāo)越小越好,R²越接近1越好):

模型RMSEMAPEMAE
DGCRN1.0681.28%0.7190.7732
Informer1.461.68%0.940.5589
GRU1.231.47%0.820.6891
LSTM1.341.56%0.880.6274

結(jié)果解讀:DGCRN在RMSE上相比GRU降低約19%,相比Informer降低約31%;在R²上達(dá)到0.842,表示模型可解釋84.2%的濃度方差。Informer的RMSE甚至高于GRU,說明在強(qiáng)隨機(jī)性、弱周期性的短序列任務(wù)中,復(fù)雜的注意力蒸餾機(jī)制反而造成信息損失。


圖14 DGCRN模型預(yù)測結(jié)果(真實(shí)值vs預(yù)測值散點(diǎn)圖 + 時(shí)序曲線對(duì)比)


圖15 Informer模型預(yù)測結(jié)果(注意峰值處的“削峰”現(xiàn)象)


圖16 LSTM和GRU模型預(yù)測結(jié)果

DGCRN在所有指標(biāo)上全面領(lǐng)先,尤其在尖峰捕捉上更為敏銳(峰值處平均誤差比Informer低約41%),這源于其動(dòng)態(tài)圖機(jī)制能夠同步學(xué)習(xí)污染物在空間網(wǎng)絡(luò)上的傳播路徑——當(dāng)一個(gè)站點(diǎn)的濃度突然升高時(shí),相鄰站點(diǎn)的預(yù)測值會(huì)相應(yīng)調(diào)整。

Informer表現(xiàn)低于預(yù)期、甚至弱于GRU的主要原因可歸納為:
1. 周期性強(qiáng)度不匹配:PM2.5濃度的日周期和周周期特征本身較弱(見第二節(jié)),而Informer的ProbSparse注意力機(jī)制在設(shè)計(jì)上假設(shè)長期依賴由少數(shù)幾個(gè)突出的周期模式主導(dǎo),當(dāng)實(shí)際數(shù)據(jù)周期模糊時(shí),概率采樣會(huì)丟失關(guān)鍵信息。
2. 蒸餾過度壓縮:對(duì)于預(yù)測步長僅24步的任務(wù),序列蒸餾層將編碼器長度壓縮至1/4,相當(dāng)于丟棄了75%的位置敏感信息,導(dǎo)致模型丟失對(duì)高頻突變(如風(fēng)速驟增、降水起始)的響應(yīng)能力。
3. 缺乏空間先驗(yàn):Informer完全建模為單變量/多變量時(shí)序,無法獲知站點(diǎn)間的相互作用,在污染物跨站點(diǎn)傳播的場景中處于信息劣勢。

這一現(xiàn)象在答辯時(shí)若被問及,可從“輸入序列長度與周期性強(qiáng)度不匹配導(dǎo)致蒸餾過壓縮”的角度進(jìn)行解釋。


圖17 DGCRN(左列)與Informer(右列)各預(yù)測步長的誤差變化(第1步至第24步的RMSE曲線)


圖17(續(xù)) DGCRN與Informer誤差對(duì)比熱圖


圖17(續(xù)) 分站點(diǎn)誤差分布箱線圖


圖17(續(xù)) 誤差隨預(yù)測步長的累積分布


圖17(續(xù)) 不同季節(jié)下的模型誤差對(duì)比


圖17(續(xù)) 極端高濃度事件下的預(yù)測性能評(píng)估


圖18 LSTM和GRU各步誤差變化曲線


圖18(續(xù)) LSTM與GRU的分步誤差對(duì)比雷達(dá)圖

從誤差隨預(yù)測步長的變化曲線可見:DGCRN的誤差增長最為平緩,從第1步到第24步RMSE僅上升約32%,呈現(xiàn)較強(qiáng)的多步預(yù)測穩(wěn)定性;Informer的誤差在第8步后加速上升,第24步誤差已達(dá)到第1步的2.1倍;LSTM/GRU介于兩者之間,但后期誤差仍顯著高于DGCRN。

論文寫作建議:對(duì)于僅需完成本科論文的同學(xué),可以重點(diǎn)分析DGCRN與LSTM的差異,突出空間建模的價(jià)值;若為碩士論文,則需進(jìn)一步剖析Informer失效的內(nèi)在機(jī)理(如:繪制注意力權(quán)重分布熱圖、分析蒸餾前后信息的互信息損失),并給出至少一種改進(jìn)方案(見第五節(jié))。

閱讀原文進(jìn)群獲取完整內(nèi)容及更多AI見解、行業(yè)洞察,與900+行業(yè)人士交流成長。

五、模型改進(jìn)與未來方向

  • 多尺度時(shí)序單元替換:當(dāng)前DGCRN的時(shí)序模塊本質(zhì)仍是GRU(單尺度循環(huán)),捕捉超長依賴(如跨月趨勢)有限??商鎿Q為多尺度時(shí)間循環(huán)單元(Multi-scale Temporal Recurrent Unit, MTRU),將日、周、年周期分別編碼為不同時(shí)間粒度的隱狀態(tài),并采用分層更新策略——高頻狀態(tài)每步更新,低頻狀態(tài)按周期更新。
  • 融合GAUST權(quán)重編碼:將風(fēng)速、地面氣壓等關(guān)鍵因子的格蘭杰因果關(guān)聯(lián)度作為注意力偏置(attention bias),設(shè)計(jì)差異化特征映射通道——關(guān)鍵因子通道使用更深的子網(wǎng)絡(luò),冗余特征通道使用淺層線性映射,避免信息被稀釋。
  • Informer的機(jī)制優(yōu)化
  • 調(diào)整概率稀疏度的采樣閾值(從默認(rèn)的5降低至2~3),保留更多Query參與計(jì)算;
  • 在解碼器后引入輕量級(jí)循環(huán)單元(如單層GRU)進(jìn)行序列精修,補(bǔ)償蒸餾過程中的細(xì)節(jié)丟失;
  • 借鑒DGCRN的空間圖卷積思想,為Informer增加一個(gè)空間依賴模塊(如引入預(yù)定義的地理距離圖或可學(xué)習(xí)的自適應(yīng)圖),在編碼器輸入端注入站點(diǎn)間關(guān)系。
  • 外部數(shù)據(jù)融合:考慮引入氣象預(yù)報(bào)數(shù)據(jù)(如WRF模型輸出的風(fēng)速、溫度預(yù)報(bào)場)作為額外輸入特征,實(shí)現(xiàn)“預(yù)測未來濃度的未來氣象條件”,提升在實(shí)際預(yù)報(bào)場景中的適用性。
  • 不確定性量化:當(dāng)前所有模型均為點(diǎn)預(yù)測(point forecast),無法提供預(yù)測置信區(qū)間。可引入貝葉斯深度學(xué)習(xí)或深度集成(Deep Ensemble)方法,輸出預(yù)測分布,為應(yīng)急決策提供風(fēng)險(xiǎn)信息。

未來趨勢:環(huán)境時(shí)空預(yù)測領(lǐng)域正朝著“物理引導(dǎo)的深度學(xué)習(xí)”方向發(fā)展——將大氣擴(kuò)散物理方程(如高斯煙羽模型、拉格朗日粒子擴(kuò)散模型)作為軟約束嵌入神經(jīng)網(wǎng)絡(luò),保證預(yù)測結(jié)果在物理上合理(如污染物總量守恒、擴(kuò)散速率受邊界層高度限制)。此外,圖神經(jīng)網(wǎng)絡(luò)與Transformer的融合(如Graph Transformer)近期受到關(guān)注,可能成為下一代時(shí)空預(yù)測架構(gòu)。

六、研究結(jié)論

本文圍繞PM2.5濃度預(yù)測任務(wù),構(gòu)建了從數(shù)據(jù)填補(bǔ)、時(shí)序分析到多模型對(duì)比的完整分析流程。實(shí)證結(jié)果表明:
1. DGCRN憑借自適應(yīng)圖生成與擴(kuò)散圖卷積機(jī)制,能夠有效融合站點(diǎn)間的時(shí)空依賴,在RMSE(12.74)、MAE(8.56)和R²(0.842)三項(xiàng)指標(biāo)上綜合性能最優(yōu),尤其對(duì)污染尖峰的捕捉能力顯著優(yōu)于其他模型。
2. Informer在弱周期性、強(qiáng)隨機(jī)性的短序列預(yù)測任務(wù)中表現(xiàn)受限,揭示了序列蒸餾機(jī)制在處理非平穩(wěn)、低規(guī)律性數(shù)據(jù)時(shí)的潛在局限——蒸餾過壓縮導(dǎo)致高頻信息丟失。
3. LSTM/GRU作為基線模型,雖無法顯式建模空間關(guān)系,但憑借門控機(jī)制仍能提供可接受的預(yù)測精度(R²約0.78~0.79),在計(jì)算資源有限的場景中可作為實(shí)用選擇。

本研究為環(huán)境時(shí)空預(yù)測領(lǐng)域的模型選型提供了可復(fù)現(xiàn)的實(shí)證參考,也為Informer類模型在實(shí)際應(yīng)用中的適用邊界提供了警示。后續(xù)工作將聚焦于物理信息融合與多尺度循環(huán)架構(gòu)的進(jìn)一步優(yōu)化。

到此這篇關(guān)于Python深度學(xué)習(xí)時(shí)序預(yù)測:從數(shù)據(jù)預(yù)處理到DGCRN/Informer模型對(duì)比的文章就介紹到這了,更多相關(guān)PM2.5濃度預(yù)測模型:DGCRN vs Informer內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • slearn缺失值處理器之Imputer詳析

    slearn缺失值處理器之Imputer詳析

    這篇文章主要給大家介紹了關(guān)于slearn缺失值處理器之Imputer的相關(guān)資料,文中通過實(shí)例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2022-08-08
  • python+opencv 讀取文件夾下的所有圖像并批量保存ROI的方法

    python+opencv 讀取文件夾下的所有圖像并批量保存ROI的方法

    今天小編就為大家分享一篇python+opencv 讀取文件夾下的所有圖像并批量保存ROI的方法,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2019-01-01
  • Python中Proxypool庫的安裝與配置

    Python中Proxypool庫的安裝與配置

    今天小編就為大家分享一篇關(guān)于Python中Proxypool庫的安裝與配置,小編覺得內(nèi)容挺不錯(cuò)的,現(xiàn)在分享給大家,具有很好的參考價(jià)值,需要的朋友一起跟隨小編來看看吧
    2018-10-10
  • 基于Python實(shí)現(xiàn)煙花效果的示例代碼

    基于Python實(shí)現(xiàn)煙花效果的示例代碼

    這篇文章主要為大家詳細(xì)介紹了如何利用Python制作出煙花的效果,文中的示例代碼講解詳細(xì),對(duì)我們學(xué)習(xí)Python有一定幫助,需要的可以參考一下
    2022-06-06
  • 在vscode中啟動(dòng)conda虛擬環(huán)境的思路詳解

    在vscode中啟動(dòng)conda虛擬環(huán)境的思路詳解

    這篇文章主要介紹了在vscode中啟動(dòng)conda虛擬環(huán)境的思路詳解,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2020-12-12
  • Python使用scipy模塊實(shí)現(xiàn)一維卷積運(yùn)算示例

    Python使用scipy模塊實(shí)現(xiàn)一維卷積運(yùn)算示例

    這篇文章主要介紹了Python使用scipy模塊實(shí)現(xiàn)一維卷積運(yùn)算,結(jié)合實(shí)例形式分析了scipy模塊的功能及使用scipy模塊進(jìn)行一維卷積運(yùn)算的相關(guān)操作技巧,需要的朋友可以參考下
    2019-09-09
  • python數(shù)據(jù)可視化Seaborn畫熱力圖

    python數(shù)據(jù)可視化Seaborn畫熱力圖

    這篇文章主要介紹了數(shù)據(jù)可視化Seaborn畫熱力圖,熱力圖的想法其實(shí)很簡單,用顏色替換數(shù)字,下面我們來看看文章對(duì)操作過程的具體介紹吧,需要的小伙伴可以參考一下具體內(nèi)容,希望對(duì)你有所幫助
    2022-01-01
  • 一文詳解Python可變參數(shù)(*args與**kwargs)的使用方法和應(yīng)用場景

    一文詳解Python可變參數(shù)(*args與**kwargs)的使用方法和應(yīng)用場景

    本文詳細(xì)解析了Python中的可變參數(shù)(星號(hào)args與雙星號(hào)kwargs)詳解,,涵蓋核心概念、應(yīng)用場景、技術(shù)原理及實(shí)踐應(yīng)用,,通過掌握這些技能,,提升編程效率與代碼質(zhì)量,解決實(shí)際問題,需要的朋友可以參考下
    2026-06-06
  • Python中input輸入與While循環(huán)超詳細(xì)講解

    Python中input輸入與While循環(huán)超詳細(xì)講解

    python是一種廣泛使用的解釋型、高級(jí)和通用的編程語言,它支持多種編程范型,包括函數(shù)式、指令式、結(jié)構(gòu)化、面向?qū)ο蠛头瓷涫骄幊痰?這篇文章主要介紹了Python中input輸入與While循環(huán)的相關(guān)資料,需要的朋友可以參考下
    2025-07-07
  • 關(guān)于Python八大排序?qū)崿F(xiàn)方法(冒泡排序、快速排序等)

    關(guān)于Python八大排序?qū)崿F(xiàn)方法(冒泡排序、快速排序等)

    這篇文章主要介紹了關(guān)于Python八大排序?qū)崿F(xiàn)方法,主要有基數(shù)排序、歸并排序、堆排序、簡單選擇排序、直接插入排序、希爾排序、快速排序、冒泡排序等,需要的朋友可以參考下
    2023-03-03

最新評(píng)論

虹口区| 盐源县| 高碑店市| 台山市| 沭阳县| 海盐县| 双牌县| 清镇市| 唐河县| 怀远县| 黄浦区| 汪清县| 英吉沙县| 阳曲县| 周至县| 娄底市| 尤溪县| 攀枝花市| 北流市| 丹巴县| 虹口区| 塘沽区| 卓尼县| 临颍县| 肃北| 新邵县| 文化| 澜沧| 光泽县| 彝良县| 长海县| 双桥区| 承德县| 长岛县| 中山市| 鄂州市| 枣强县| 文登市| 托克逊县| 日喀则市| 邢台市|