2026 年工業物聯網(IIoT)設備預測性維護:振動與音訊感測 AI 演算法

concept%20visualization%20for%202026%20%E5%B9%B4%E...
發表時間:2026 年 09 月 16 日 | 更新日期:2026 年 09 月 16 日 | 編輯:雅寶社區編輯團隊
2026 年工業物聯網(IIoT)設備預測性維護:振動與音訊感測 AI 演算法 - 雅寶社區 · 頂客論壇

換句話說,2026 年的預測性維護不再是「抽樣監測幾台重點設備」,而是全面覆蓋、即時運算、分散式智慧的新架構。而這個架構的兩個主要訊號來源,正是振動與音訊。

二、振動感測:預測性維護的骨幹訊號

在所有可用於機械診斷的物理訊號中,振動是資訊密度最高、研究最透徹、也最容易標準化的一種。旋轉機械的絕大多數故障——軸承磨損、齒輪嚙合異常、不平衡、不對中、鬆動、軸彎曲——都會在振動訊號中留下可辨識的痕跡。

2-1 振動訊號的物理基礎與故障特徵頻率

要理解 AI 模型在振動診斷中學到了什麼,必須先回到物理層面。軸承是振動分析中最經典的應用場景,其四個主要故障特徵頻率分別對應不同元件:

故障類型

特徵頻率代號

物理意義

常見頻譜表現

外圈剝離

BPFO

滾動體通過外圈缺陷的衝擊頻率

BPFO 及其倍頻處出現峰值,伴隨邊帶

內圈剝離

BPFI

滾動體通過內圈缺陷的衝擊頻率

BPFI 峰值,受轉軸調變產生邊帶

滾動體損傷

BSF

滾動體自轉與公轉的複合頻率

BSF 及其二倍頻,常與保持架頻率調變

保持架磨損

FTF

保持架公轉頻率

低頻區微弱峰值,易被雜訊淹沒

這些頻率可透過軸承幾何參數(滾動體直徑、節圓直徑、接觸角、滾動體數量)與轉速精確計算。傳統振動分析師會用包絡解調(Envelope Demodulation)、希爾伯特轉換(Hilbert Transform)等技術把高頻衝擊訊號解調到低頻,再從包絡譜中尋找 BPFO、BPFI 等特徵。

問題在於:這些方法高度依賴專家經驗與準確的轉速資訊。當設備工況多變(變轉速、變負載)、軸承型號未知、或同時存在多種故障時,傳統方法的準確率會快速下降。這正是深度學習切入的空間。

2-2 從時域、頻域到時頻域:特徵工程的演進路徑

振動訊號的 AI 分析,歷經三個階段的特徵工程演進:

第一階段:時域統計特徵。最直觀的做法是計算訊號的統計量,包括均方根值(RMS)、峰值(Peak)、峰度(Kurtosis)、偏度(Skewness)、波峰因數(Crest Factor)等。其中 RMS 反映振動能量,峰度對衝擊性故障特別敏感。這類特徵計算成本極低,適合部署在資源受限的感測器上,但缺點是難以區分故障類型,只能判斷「有異常」。

第二階段:頻域特徵。透過快速傅立葉轉換(FFT)將時域訊號轉為頻譜,觀察特定頻率成分的幅值變化。進一步可用包絡譜、倒頻譜(Cepstrum)等技術強化週期性衝擊的辨識度。頻域方法能定位故障元件,但對非平穩訊號(如變轉速工況)表現不佳。

第三階段:時頻域特徵。短時傅立葉轉換(STFT)、小波轉換(Wavelet Transform)、Wigner-Ville 分布等方法,可同時保留時間與頻率解析度,適合處理非平穩訊號。在深度學習時代,最常見的做法是把振動訊號轉成時頻圖(Spectrogram 或 Scalogram),再當成影像丟進 CNN 處理。

值得注意的是,2026 年的主流趨勢逐漸走向端到端學習(End-to-End Learning):不再手工設計特徵,而是直接把原始振動波形或 STFT 頻譜餵給模型,讓網路自行學習判別性特徵。這個轉變大幅降低了對領域知識的依賴,但也帶來可解釋性下降與資料需求增加的新問題。

2-3 深度學習模型在振動診斷的主流架構

目前實務上最常見的四類架構如下:

(1)一維卷積神經網路(1D-CNN):直接對原始振動時序做卷積,優點是計算效率高、參數少,非常適合邊緣部署。經典結構如 WDCNN(Wide Deep CNN)在凱斯西儲大學(CWRU)軸承資料集上可達 99% 以上的分類準確率。

(2)CNN + LSTM / GRU 混合架構:用 CNN 抽取局部特徵,再以 RNN 捕捉時間依賴性。適合處理「故障演化過程」這類需要考慮歷史狀態的任務。缺點是訓練不穩定、推論延遲較高。

(3)二維 CNN 處理時頻圖:把 STFT 或小波時頻圖當成影像,套用 ResNet、VGG、EfficientNet 等成熟骨幹。這條路線的優勢是可大量借用電腦視覺領域的預訓練權重與技巧,缺點是時頻圖解析度與記憶體佔用的取捨。

(4)Transformer 與注意力機制:2023 年後快速崛起的路線。ViT(Vision Transformer)與時序 Transformer(如 Informer、PatchTST)在振動診斷上的表現逐漸超越 CNN,特別是在長序列建模與多感測器融合場景。其自注意力機制能自動捕捉不同時間尺度與不同感測通道之間的關聯,但推論成本仍是邊緣部署的主要考量。

實務經驗顯示,沒有一種架構能在所有場景勝出。高轉速、工況穩定的設備,1D-CNN 就足夠;變轉速、多故障並存的複雜場景,則需要 Transformer 或混合架構。選擇的關鍵在於資料量、標註品質與邊緣算力預算。

2-4 邊緣部署與推論延遲的工程取捨

把模型放到產線邊緣,遠比在實驗室跑出高準確率困難。實務上必須同時滿足四個約束:

  • 延遲:從感測器取樣到異常告警,通常要求在 100 毫秒至 1 秒內完成,否則高速旋轉設備可能已經進入不可逆的損壞階段。
  • 功耗:電池供電或能量採集(Energy Harvesting)的無線感測節點,平均功耗需壓在毫瓦等級。
  • 記憶體:工業級 MCU 的 SRAM 常見規格為 256 KB 至 2 MB,模型與中間張量必須塞得進去。
  • 可靠性:模型在極端溫度、電磁干擾、震動環境下必須穩定運行,不能因為一次數值溢位就當機。
  • 為了滿足這些約束,2026 年的標準流程包括:INT8 量化(可將模型體積壓縮至 FP32 的四分之一)、結構化剪枝、知識蒸餾(用大模型教小模型)、以及運算圖融合。部分團隊更進一步採用「輕量模型常駐 + 雲端模型覆核」的兩階段架構:邊緣端只做粗篩,疑似異常才上傳原始片段給雲端大模型細判,兼顧延遲與準確率。

    三、音訊與聲學感測:被長期低估的第二訊號源

    如果振動是預測性維護的骨幹,音訊就是那條長期被忽略、卻在某些場景無可替代的神經。人類老師傅判斷設備是否異常,往往不是摸振動,而是用聽的——軸承乾摩擦的尖銳聲、齒輪缺齒的週期性敲擊、氣閥洩漏的嘶嘶聲,都是聲音訊號的典型案例。

    3-1 聲學診斷的物理原理與相對優勢

    聲音本質上是空氣中的壓力波,與振動同源——機械振動會同時透過結構傳遞(振動)與空氣傳播(聲音)。音訊感測的優勢在於:

  • 非接觸式量測:麥克風不需貼附設備,適合旋轉件、高溫件、或難以安裝加速計的位置。
  • 空間選擇性:透過麥克風陣列與波束成形(Beamforming),可定位聲源方向,在整條產線上分辨是哪一台設備在異常。
  • 涵蓋高頻資訊:超音波頻段(20 kHz 以上)對早期潤滑失效、微小裂紋、氣體洩漏極度敏感,往往比振動更早發現問題。
  • 成本更低:MEMS 麥克風單價遠低於工業級加速計,且佈建不需停機。

    當然,音訊也有明顯弱點:環境噪音干擾嚴重、難以直接對應到具體元件、以及在密閉或高背景噪音環境下訊噪比極差。這使得音訊 AI 演算法的設計重點,往往不在於模型多深,而在於抗干擾能力。

    3-2 可聽聲、超音波與聲發射:三個頻段的應用分工

    聲學診斷依頻段可粗分為三類,各自對應不同故障類型與硬體需求:

    頻段

    頻率範圍

    典型應用

    感測硬體

    可聽聲

    20 Hz – 20 kHz

    齒輪異常、軸承中期磨損、泵浦氣蝕

    MEMS 麥克風、電容式麥克風

    超音波

    20 kHz – 100 kHz

    氣體洩漏、電氣放電、早期潤滑失效

    超音波麥克風、壓電換能器

    聲發射

    100 kHz – 1 MHz

    材料裂紋擴展、結構損傷、複合材料分層

    壓電式聲發射感測器(AE Sensor)

    實務上,可聽聲 + 超音波是 IIoT 預測性維護的主力,因為兩者的硬體成本已大幅下降,且取樣率需求在一般 MCU 可處理範圍內(可聽聲 48 kHz 取樣、超音波 192 kHz 取樣)。聲發射雖然靈敏度最高,但硬體昂貴、資料量龐大,目前多用於關鍵結構的專項監測。

    3-3 音訊 AI 演算法:從梅爾頻譜到自監督學習

    音訊 AI 的發展比振動晚了幾年,主要原因是「資料取得與標註」的門檻更高。不過自 2020 年後,隨著 AudioSet、ESC-50 等大型音訊資料集的出現,以及語音辨識領域的技術外溢,工業音訊診斷的演算法已快速成熟。

    目前主流流程如下:

    步驟一:前處理。將原始波形切分成短幀(Frame),做預加重(Pre-emphasis)、加窗(Windowing),再轉換為梅爾頻譜圖(Mel-Spectrogram)或 MFCC。梅爾刻度模擬人耳對頻率的非線性感知,能有效壓縮維度並保留判別性資訊。

    步驟二:特徵抽取。早期使用 MFCC + GMM / SVM,2015 年後轉向 CNN 直接處理梅爾頻譜圖。近年則流行音訊預訓練模型(如 PANNs、AST、BEATs),這些模型在大量通用音訊上預訓練,再以少量工業資料微調,可大幅降低對標註資料的需求。

    步驟三:自監督學習。2024 年後,對比學習(Contrastive Learning)與遮罩重建(Masked Modeling,如 Audio-MAE)成為主流。做法是把正常運轉的聲音片段做增強(時間位移、頻率遮罩、加噪音),訓練模型學會「什麼是正常」,異常偵測時再用重建誤差或嵌入向量距離判斷。這條路線的最大優勢是完全不需要故障樣本,對工業場景極具吸引力。

    3-4 高噪音環境下的抗干擾策略

    工廠現場的背景噪音可能高達 85 至 100 dB(A),涵蓋空壓機、風扇、金屬撞擊等寬頻干擾。要在這種環境中辨識軸承的微弱異常聲,必須多管齊下:

  • 指向性麥克風與陣列:利用波束成形技術把收音範圍聚焦在目標設備,抑制旁側噪音。
  • 頻譜減法與自適應濾波:以參考麥克風錄製背景噪音,從主訊號中扣除。深度學習版本的語音增強模型(如 DCCRN)也可用於工業場景。
  • 高頻段優勢:環境噪音能量多集中在低頻,超音波頻段(20 kHz 以上)的訊噪比通常好得多。
  • 同步觸發與工況標記:結合設備的 PLC 訊號,只在特定工況(如空載、定轉速)下取樣,避開噪音變異。
  • 資料增強:訓練時加入多樣化的噪音類型,提升模型的噪音魯棒性。

    值得一提的是,音訊與振動在同一台設備上往往互補:振動對低頻、結構性故障敏感,音訊對高頻、摩擦性故障敏感。這也為下一節的跨模態融合鋪路。

    四、振動 × 音訊跨模態融合架構

    單一感測模態有先天盲區,這在工業診斷中是常識。振動加速計對軸承外圈故障極敏感,但對氣閥洩漏幾乎無感;麥克風能聽到氣體洩漏,卻難以判斷軸承損傷程度。2026 年最前沿的做法,是把兩種模態在 AI 模型中融合,讓模型學會「何時該相信誰」。

    4-1 特徵層、決策層與注意力融合

    跨模態融合依融合發生的位置,可分為三類:

    (1)特徵層融合(Early Fusion)。把振動特徵與音訊特徵在輸入端串接成單一向量,再餵給同一個模型。優點是模型能學到跨模態的交互作用,缺點是兩種訊號的取樣率、時間尺度差異大,對齊困難。

    (2)決策層融合(Late Fusion)。各自訓練一個振動模型與一個音訊模型,最後把兩者的輸出(分類機率或異常分數)加權平均或投票。實作簡單、模組化程度高,但無法捕捉模態之間的細緻關聯。

    (3)注意力融合(Attention-based Fusion)。2026 年的主流路線。做法是把兩個模態各自編碼成嵌入向量序列,再用交叉注意力(Cross-Attention)讓模型動態決定每個時間點該關注哪個模態。例如當設備處在高噪音工況時,模型自動降低音訊權重;當振動訊號被工頻干擾時,則提高音訊權重。這種動態權衡的能力,正是注意力機制最大的價值。

    實務上也有「階層式融合」的變體:在邊緣端做決策層融合(省算力),在雲端做注意力融合(求精度),形成兩級決策架構。

    4-2 模態缺失與時間對齊的實務處理

    跨模態系統最容易被低估的兩個問題:

    模態缺失(Missing Modality)。麥克風可能因環境噪音過大而失效,加速計可能因安裝鬆脫而讀值異常。好的融合模型必須在任一模態失效時仍能給出合理輸出。常見做法包括模態 dropout 訓練(訓練時隨機遮蔽某一模態,逼迫模型學會單模態推論),以及生成式補全(用擴散模型或 VAE 重建缺失模態的特徵)。

    時間對齊(Temporal Alignment)。振動與音訊的取樣率不同,且訊號在設備內部的傳遞路徑長度不同,抵達感測器的時間有微小差異。在處理瞬態事件(如軸承衝擊)時,幾毫秒的錯位就可能讓融合效果大打折扣。實務上需透過硬體觸發同步、互相關函數(Cross-Correlation)估計延遲,或在模型層用動態時間規整(DTW)與可學習的對齊模組來處理。

    五、2026 年主流 AI 演算法實戰盤點

    前面談的是感測與架構,這一節回到演算法本身。以下盤點 2026 年實務上最常被採用的三類模型。

    5-1 無監督異常檢測:Autoencoder、VAE 與 GANomaly

    工業場景最現實的問題是:故障樣本太少,正常樣本太多。設備大多數時間正常運轉,真正故障的資料可能一年只有幾筆,且故障類型無法窮舉。因此無監督異常檢測成為主流。

    Autoencoder(AE)是最經典的架構:訓練模型重建正常訊號,測試時若重建誤差超過閾值,即判定為異常。優點是簡單、易部署;缺點是對「與正常相似但不完全相同」的細微異常不夠敏感。

    變分自編碼器(VAE)引入機率分布假設,能估計樣本的重建機率,對噪聲更魯棒,但訓練較不穩定。

    GANomaly結合生成對抗網路,同時最小化重建誤差與潛在空間距離,在多個工業資料集上表現優於純 AE。2024 年後,擴散模型(Diffusion Model)也被引入異常檢測,以逐步去噪的方式重建樣本,精度更高但推論延遲較大,目前多用於雲端覆核階段。

    5-2 剩餘使用壽命(RUL)預測模型

    異常檢測回答的是「現在有沒有問題」,RUL 預測回答的是「還能用多久」。這是預測性維護中最具商業價值、也最困難的任務。

    主流方法包括:

  • LSTM / GRU:以歷史感測序列預測未來健康指標的衰減曲線,實作成熟。
  • Temporal Convolutional Network(TCN):以膨脹卷積擴大感受野,訓練比 RNN 穩定,在 NASA C-MAPSS 資料集上表現優異。
  • Transformer 系列:如 Informer、PatchTST,適合長序列與多變量輸入,2025 年後快速普及。
  • 物理信息神經網路(PINN):把磨損方程、疲勞理論等物理先驗納入損失函數,讓模型在資料稀少時仍能外推。這是 2026 年最受學術界關注的方向之一。
  • RUL 預測最大的挑戰不是模型,而是標註:真實產線不可能等到設備壞掉才收集一筆「壽命終點」的標籤。常見替代方案是使用「健康指標」(Health Index)做間接監督,或以模擬加速壽命試驗(ALT)資料預訓練。

    5-3 工業基礎模型與遷移學習的新範式

    2025 年至 2026 年間,工業 AI 出現一個明顯趨勢:通用工業基礎模型(Industrial Foundation Model)。這些模型在數十萬小時的跨設備、跨工況振動與音訊資料上預訓練,再針對特定設備微調。其價值在於:

    大幅降低新設備導入所需的標註資料量(可能從數千筆降到數十筆)。

    提升跨工況泛化能力,減少模型漂移。

    讓中小企業也能用得起高精度診斷,不需自行累積多年資料。

    目前已有多家工業軟體與雲端廠商推出此類服務,商業模式從「賣模型」轉向「訂閱診斷能力」。這對整個產業的導入門檻是重大利好,但也引發資料主權與模型可解釋性的新爭議。

    六、從感測器到 MLOps:完整落地鏈路

    演算法只是冰山一角。真正決定預測性維護專案成敗的,是資料工程與維運治理。

    6-1 資料採集與標註策略

    工業資料的品質問題遠比想像中嚴重:感測器安裝位置不佳、取樣率設定錯誤、時鐘不同步、資料遺漏、工況標籤缺失。建議在佈建階段就建立「資料契約」,明確定義每個通道的取樣率、單位、時間戳來源與品質檢查規則。

    標註方面,純人工標註成本極高。實務上常用三種策略:(1)維修工單回饋,把實際維修記錄與對應時段的訊號關聯;(2)加速壽命試驗,在實驗室製造故障並記錄全生命週期;(3)弱監督與半監督學習,用少量標註資料加上大量未標註資料訓練。

    6-2 邊雲協同運算架構

    標準架構分為三層:

  • 感測層:內建輕量模型做初步異常篩選,只上傳摘要特徵或疑似異常片段,大幅降低頻寬需求。
  • 邊緣閘道層:匯聚多個感測節點資料,執行中等規模模型(如 1D-CNN 或小型 Transformer),負責即時告警與本地決策。
  • 雲端平台層:執行大型模型、跨設備關聯分析、模型訓練與版本管理、以及與 CMMS(維護管理系統)整合。
  • 這個架構的關鍵設計原則是「該在哪裡算,就在哪裡算」:延遲敏感的運算下沉到邊緣,需要全局視野的運算留在雲端。

    6-3 模型漂移、持續學習與治理

    設備會老化、工況會改變、製程會調整,這意味著模型上線那天就開始過時。模型漂移(Model Drift)是預測性維護最常見的長期失效原因。

    治理機制包括:持續監控輸入分布(Data Drift)與預測分布(Concept Drift)、設定自動重訓觸發條件、保留模型版本與訓練資料血緣、以及建立人工覆核流程(Human-in-the-Loop)。2026 年的先進做法,是採用持續學習(Continual Learning)架構,讓模型在運行中吸收新資料,同時用彈性權重固化(Elastic Weight Consolidation)等技術避免災難性遺忘。

    七、效益量化與實務案例

    理論談完,來看實際數字。以下整理 2025 至 2026 年公開報導與產業報告中,幾個具代表性的應用場景:

  • 風力發電機齒輪箱:以振動 + 音訊融合模型監測,提前 3 至 6 週預警軸承損傷,單台機組避免的停機損失約 15 至 40 萬美元。
  • 半導體廠真空泵浦:導入超音波感測 + 自監督學習,非計畫停機降低 45%,且因提前更換軸承,避免了二次損壞導致的轉子報廢。
  • 石化廠往復式壓縮機:以音訊診斷氣閥洩漏,配合 RUL 預測排程維修,年度維護成本下降約 28%。
  • 軌道運輸牽引馬達:在列車行進間以麥克風陣列監測軸承,取代部分人工巡檢,檢測覆蓋率從每月一次提升到每日連續。
  • 值得注意的是,這些案例的成功關鍵很少是「模型多厲害」,而是感測佈建扎實、標註流程嚴謹、以及與維修團隊的協作機制順暢。技術只是必要條件,組織流程才是充分條件。

    八、挑戰與 2026 年後的技術展望

    儘管前景看好,IIoT 預測性維護仍面臨幾個結構性挑戰:

    首先是資料孤島。設備製造商、終端用戶、雲端平台各自持有部分資料,缺乏共享誘因,導致基礎模型的訓練資料難以規模化。產業聯盟與聯邦學習(Federated Learning)是可能的解方,但標準與治理機制仍在早期。

    其次是可解釋性。當模型判斷某台設備將在兩週內故障,維護工程師需要知道「為什麼」。純黑箱模型難以取得現場信任。SHAP、Grad-CAM、注意力可視化等技術正在補足這一塊,但距離「讓老師傅信服」仍有距離。

    第三是資安。大量感測器與邊緣裝置進入 OT 網路,擴大了攻擊面。2026 年已出現針對工業感測網路的攻擊案例,資安設計必須從第一天就納入,而非事後補救。

    展望 2027 年之後,幾個值得關注的方向包括:多模態基礎模型的標準化、生成式 AI 用於合成故障資料、數位孿生與預測性維護的深度整合,以及以 LLM 作為維護決策助理,把診斷結果轉譯成維修工單與操作建議。

    九、結語

    2026 年的工業物聯網預測性維護,已經從「要不要做」進入「怎麼做才對」的階段。振動與音訊這兩個模態,分別代表了結構性與聲學性的診斷視角,而 AI 演算法的價值,在於把過去需要資深老師傅多年經驗才能完成的判斷,轉化為可複製、可規模化、可持續學習的系統能力。

    對台灣與華語地區的製造業而言,這既是挑戰也是機會。台灣在精密機械、半導體設備、自行車與工具機產業累積了深厚的設備知識,這些領域知識正是訓練高品質診斷模型的關鍵資產。若能結合邊緣 AI 硬體供應鏈的優勢,在預測性維護這個賽道上,極有機會從「技術採用者」轉為「解決方案輸出者」。

    最後提醒一句:預測性維護不是買一套軟體就好,而是一場關於資料、流程與組織的長期工程。演算法會迭代,感測器會更新,但對設備行為的深入理解,永遠是這一切的核心。

    —— 本文同步刊載於「雅寶社區 · 頂客論壇」📈 最新趨勢分類,歡迎在下方留言區分享你的導入經驗與踩過的坑。

    ```

    🏠 返回首頁