2026 年邊緣 AI 攝影機(Smart Cameras):結合內建 NPU 的即時人流與物件辨識
離線可用性。 網路斷線時,攝影機仍能獨立運作、本地儲存事件、恢復連線後補傳。對工廠、礦場、偏鄉基礎設施這類網路不穩的場域,這是剛性需求。
1.3 2026 年的市場態勢
根據多家市調機構在 2025 年底到 2026 年初發布的報告,具備 1 TOPS 以上 NPU 算力的網路攝影機,出貨占比已經突破整體市場的三成,在中高階商用機種中更超過六成。價格方面,入門級邊緣 AI 攝影機(約 0.5 至 1 TOPS)的單機價格已下探到與傳統高階 IPC 相差不到兩成的區間,這正是它從「專案指定」變成「標配」的關鍵。
值得注意的是,2026 年的競爭已經不在「有沒有 NPU」,而在「NPU 拿來做什麼、生態系夠不夠開放」。下一節我們就從硬體架構談起。
二、NPU 硬體架構與 2026 年主流規格
要理解邊緣 AI 攝影機的能力邊界,得先弄清楚它內部到底裝了什麼。2026 年的主流智慧攝影機,本質上是一台高度特化的嵌入式系統,而不是「加了 AI 的網路攝影機」。
2.1 一顆 SoC 裡的四個關鍵模組
典型的 2026 年邊緣 AI 攝影機 SoC,會包含以下四個協同運作的單元:
ISP(Image Signal Processor,影像訊號處理器)。 負責處理感測器輸出的 RAW 資料,執行去馬賽克、白平衡、自動曝光、3D 降噪、寬動態範圍(WDR)合成。很多時候,AI 推論的準確度不是輸在模型,而是輸在 ISP 調校——例如夜間過度降噪導致人臉細節糊掉,或 WDR 把背光處的人壓成剪影。2026 年高階機種開始支援 ISP 與 NPU 的「感知式曝光」,也就是 NPU 回饋畫面中的人物區域,讓 ISP 針對該區域優先曝光。
NPU。 專門執行神經網路推論的加速器。它與 CPU、GPU 的差別在於:NPU 是為矩陣乘法與卷積運算設計的固定功能電路,能同時達成高效能與低功耗。2026 年主流 NPU 支援 INT8、INT4 甚至混合精度量化,並普遍原生支援 Transformer 架構——這點很重要,因為過去幾年的邊緣模型幾乎都是 CNN,而 2025 年後半開始,輕量化 ViT(Vision Transformer)與 DETR 系列模型開始在邊緣端普及。
CPU。 通常是一顆 ARM Cortex-A 系列的多核處理器,負責作業系統、網路協定、事件管理、模型排程。它不直接做推論,但負責「什麼時候該跑哪個模型」的調度工作。
VPU/編解碼引擎。 負責 H.264/H.265/AV1 的硬體編解碼。2026 年的新機種開始導入 AV1,在相同畫質下比 H.265 再省約兩成頻寬,對多路數的部署相當有感。
2.2 算力區間與適用場景對照
2026 年的邊緣 AI 攝影機,可以依 NPU 算力大致分成四個級距。要注意的是,TOPS 數字只是一個粗估的比較基準,實際效能還取決於記憶體頻寬、模型效率與散熱設計。
2.3 功耗、散熱與供電的現實限制
規格表上的 TOPS 很漂亮,但裝到現場後真正決定成敗的往往是熱與電。
傳統 PoE(802.3af)供電上限約 15.4W,扣除 PD 損耗後可用約 12.95W。2026 年的主流邊緣 AI 攝影機,滿載推論時整機功耗落在 8 至 12W,剛好卡在 PoE 的邊緣。當算力推到 4 TOPS 以上,就必須改用 PoE+(802.3at,30W)甚至 PoE++(802.3bt,60W)。這代表佈建時的 PoE 交換器規格、線材規格(Cat5e 以上)都要重新盤點,否則會出現「白天正常、中午高溫時段降頻甚至重開機」的詭異現象。
散熱方面,無風扇被動散熱是主流,靠的是金屬機殼導熱。2026 年的設計趨勢是把 NPU 與 ISP 分區散熱,避免 ISP 的熱影響 NPU 的推論時脈。實務上,戶外機種的機內溫度上限通常標示 60°C 至 70°C,在台灣夏季正午的日照下,機殼表面溫度動輒超過 70°C,因此遮陽罩與安裝方位(避免西曬)是不可忽略的細節。
三、即時人流辨識:從計數到洞察
人流辨識是邊緣 AI 攝影機最成熟、也最普遍落地的應用。它之所以適合邊緣端,是因為人流資料本質上高度即時、高度在地——你不需要把影像送到雲端才能算出「現在店裡有幾個人」,而且這個數字的價值會隨時間快速衰減。
3.1 人流計數的技術路線比較
2026 年主流的人流計數方法有三種,各有適用場景:
越線計數(Line Crossing)。 在畫面中畫一條虛擬線,偵測物件中心點跨越的方向。優點是演算法極輕、幾乎不耗算力、準確率高(在人員不並肩通過的前提下可達 95% 以上)。缺點是無法處理滯留人數,且當多人同時穿越時容易漏計。適合出入口、單向通道。
區域計數(Region Counting)。 定義一個或多個感興趣區域(ROI),統計區域內的即時人數與進出變化。這是零售「店內即時人數」與「熱區分析」的基礎。2026 年的新機種支援動態 ROI,可隨陳列調整而重新框選,不必重新校準攝影機。
軌跡追蹤(Multi-Object Tracking)。 對畫面中每個人物建立唯一 ID,持續追蹤其移動軌跡。這是滯留時間、動線分析、排隊長度估算的基礎。技術難點在於跨遮蔽(occlusion)後的 ID 重識別,2026 年主流方案已改用輕量化的 ReID 特徵嵌入,在單機 NPU 上就能即時運行。
3.2 從「有多少人」到「發生了什麼事」
純粹的人數統計,價值其實有限。真正讓零售與場館營運有感的,是下列幾種衍生指標:
3.3 準確度的現實:別相信規格書上的數字
廠商型錄上常寫「人流計數準確率 98%」,但這個數字通常是在實驗室、單人依序通過、光線充足的條件下量測的。真實場域的變數多到難以想像:
逆光與側光。 出入口面對馬路或玻璃帷幕時,人物容易變成剪影,或出現強烈眩光。解決方式包括安裝位置調整、WDR 調校、以及採用對比度更穩健的模型。
擁擠與遮蔽。 當人群密度超過每平方公尺 2 人,人物互相遮蔽,任何基於「偵測完整人形」的方法都會失效。這時需要改用密度估計(Density Estimation)或頭肩偵測(Head-Shoulder Detection)模型。2026 年高階機種已開始內建這兩種備援模型。
攜帶物品與推車。 嬰兒車、購物車、行李箱會讓模型誤判為「多人」或完全漏檢。這需要透過場域微調(fine-tuning)來改善,而不是靠通用模型硬撐。
反光地板與鏡面。 光滑地板會產生倒影,導致重複計數。這是商場與機場最常見的誤判來源。實務上可以透過遮罩 ROI 的方式排除,或在模型訓練時加入反光增強資料。
建議的實務做法是:部署後進行至少兩週的實地校驗,用人工計數對比系統輸出,計算每日誤差率並找出系統性偏差。多數專案在調校後能把誤差控制在 ±5% 以內,但前提是願意花時間調校,而不是裝完就跑。
四、物件辨識與多場景整合應用
人流之外,物件辨識是邊緣 AI 攝影機的另一條主軸。2026 年的技術已經從「辨識這是人還是車」進展到「辨識這是什麼狀態、正在做什麼、可能有什麼風險」。
4.1 物件偵測的模型演進
2020 年前後,邊緣端主流是 YOLOv4-tiny、MobileNet-SSD 這類輕量 CNN。到了 2026 年,主流模型已經換過好幾輪:
4.2 典型物件辨識場景盤點
工業安全與作業規範。偵測人員是否配戴安全帽、反光背心、護目鏡、安全帶;偵測是否有人進入危險機台區域;偵測堆高機與行人的距離是否過近。這類應用對延遲極度敏感,必須在邊緣端完成,並直接連動機台停止或警示燈。
車牌與車輛辨識。車牌辨識(ANPR/LPR)在 2026 年已經非常成熟,邊緣端可在 30 至 50 毫秒內完成偵測、校正、字元辨識。常見於停車場管理、社區門禁、違規取締。要注意的是車牌屬於個資,各國法規對保留期限與用途有明確限制。
物件遺留與遺失。偵測公共場所的無人行李、遺留物品。技術上是「先建立場景背景,再偵測長時間靜止且無人接近的物件」。這是機場與車站的高價值功能,但誤報率向來偏高(例如清潔人員的水桶),需要仔細調校。
商品與貨架管理。偵測貨架缺貨、商品陳列錯誤、價格標籤位置。2026 年開始有零售業者把這類模型直接放進店內攝影機,即時通知補貨,而不再依賴每日巡檢。
農業與畜牧。偵測果實成熟度、病蟲害、牲畜行為異常。這類場景通常網路不穩、供電困難,邊緣 AI 加上太陽能與 4G/5G 回傳是很典型的組合。
4.3 跨鏡頭關聯:從單機智慧到場域智慧
單一攝影機能做的事有極限,真正的價值往往出現在多鏡頭協作。2026 年的架構通常有兩種:
邊緣主機集中推論。多路攝影機把影像送到一台地端 AI 主機(例如 16 TOPS 以上的邊緣伺服器),由主機統一推論與關聯。優點是算力集中、模型可較大、跨鏡頭追蹤容易;缺點是佈線與單點故障風險。
分散式推論加中繼資料融合。每台攝影機各自推論,輸出結構化 metadata 到中央平台,由平台做跨鏡頭的軌跡拼接。優點是擴充性極佳、單機故障不影響全局;缺點是跨鏡頭的 ReID 需要足夠的特徵資訊,且時間同步必須非常精準。
2026 年的實務趨勢是後者逐漸勝出,原因很簡單:攝影機的 NPU 算力已經足夠,而集中式架構的頻寬與單點風險在大型場域中越來越難以接受。不過這也帶來新的挑戰——時間同步。跨鏡頭追蹤要求各裝置的時鐘誤差在 10 毫秒以內,這需要靠 NTP 或 PTP(IEEE 1588)來達成,而不是隨便開個 NTP 對時就好。
五、隱私、法規與資安:不能事後補的功課
邊緣 AI 攝影機雖然在架構上對隱私更友善,但不代表自動合法。2026 年的法規環境比三年前嚴格許多,這部分必須在專案規劃階段就納入。
5.1 主要法規框架與實務要求
歐盟 GDPR。影像屬於個資,處理需要有合法性基礎。實務上多數場域採用「正當利益」加上「明確告知」的方式,並在入口處設置明顯告示。人臉辨識、情緒辨識等高風險處理則受到更嚴格限制。2024 年通過的 EU AI Act 把即時遠端生物辨識列為高風險或禁止用途,2026 年正是各國開始執行的階段。
台灣個人資料保護法。2025 年後的修法方向強化了個資事故的通報義務與罰則。蒐集影像應有特定目的、告知當事人,並注意比例原則。人臉資料屬於特種個資的討論持續進行中,實務上建議避免長期儲存可辨識的人臉特徵。
中國《個人信息保護法》與《數據安全法》。公共場所安裝影像採集設備需為維護公共安全所必需,並設置顯著提示標識。人臉資訊屬於敏感個人信息,處理需取得單獨同意。
共同的核心原則是資料最小化與目的限制。邊緣 AI 攝影機在這兩點上有先天優勢:影像不留存、只上傳統計數據,這讓「資料最小化」從口號變成技術預設值。
5.2 去識別化與隱私增強技術
2026 年常見的隱私增強做法包括:
5.3 邊緣裝置的資安風險
把 AI 搬到邊緣,等於把更多智慧放到一個實體上更容易被接觸的裝置裡。資安風險因此改變了樣貌:
實體接觸攻擊。攻擊者拔走記憶卡、接上 UART 或 USB、嘗試讀取韌體。防護手段包括安全開機(Secure Boot)、韌體簽章、除錯介面停用、機殼防拆偵測。
模型竊取。NPU 模型檔案若未加密,被取出後可被複製或反向工程。對投入大量資料訓練模型的廠商來說,這是實質的智慧財產損失。
對抗性攻擊(Adversarial Attack)。特製的貼紙或圖案可能讓物件偵測模型失效。這在自駕與安控領域是嚴肅議題。2026 年的緩解方式包括模型集成、輸入預處理、以及對抗訓練。
韌體供應鏈。2026 年已有數起邊緣裝置被植入後門的案例。採購時應確認廠商提供 SBOM(軟體物料清單)、定期韌體更新、以及 CVE 回應機制。
實務建議:把邊緣 AI 攝影機當作「放在公共場所的伺服器」來管理,而不是「一台攝影機」。網路分段、最小權限、定期更新、日誌集中,這些基本功一個都不能省。
六、部署選型與成本評估實務
談完技術與法規,回到最實際的問題:如果你現在要規劃一個專案,該怎麼選、怎麼算?
6.1 硬體選型檢查清單
以下是一份 2026 年適用的實務檢查清單,建議在採購前逐項確認:
供電與散熱:確認滿載功耗、PoE 等級、工作溫度範圍、散熱設計。
本地儲存:支援的記憶卡容量、是否支援邊緣 NAS、寫入壽命規格。
生命週期承諾:韌體更新年限、EOL 政策、備品供應。
6.2 網路頻寬與儲存規劃
邊緣 AI 攝影機雖然大幅降低頻寬需求,但規劃時仍要分開計算兩條流量:
影像串流。若仍需中央錄影(NVR/VMS),1080p/30fps 的 H.265 串流約 2 至 4Mbps,4K 約 8 至 16Mbps。200 路 1080p 約需 600Mbps 至 1Gbps 的骨幹頻寬,加上突發餘裕,建議規劃 2 至 3 倍的頻寬。
中繼資料。每台攝影機的事件 metadata 通常低於 100kbps,200 路合計約 20Mbps,相對可忽略。但若要做跨鏡頭 ReID 並上傳特徵向量,流量會上升,需實測評估。
儲存方面,若採中央錄影,200 路 1080p 保存 30 天約需 60 至 100TB(視編碼與場景複雜度而定)。若採邊緣儲存搭配事件上傳,中央儲存需求可降低 70% 以上,但要注意記憶卡的寫入壽命與故障率。
6.3 總持有成本(TCO)的三個層次
採購成本。邊緣 AI 攝影機的單價比傳統 IPC 高約 20% 至 150%,視算力級距而定。但若把雲端推論費用、頻寬費用、後端伺服器成本一併計入,三年 TCO 往往是邊緣方案更低,路數越多差距越大。
部署成本。邊緣方案的佈線與供電需求較高(PoE+ 交換器、較高規格線材),但省下了雲端整合與網路升級的費用。整體而言差異不大,取決於既有基礎設施。
維運成本。這是常被低估的一塊。邊緣裝置數量多,韌體更新、模型更新、故障更換都需要流程化管理。建議在專案初期就建立裝置管理平台與更新策略,而不是等到第 200 台上線才想這件事。
七、2026 年之後:趨勢與展望
最後,讓我們把視角拉遠一點,談談這個領域接下來兩三年的走向。
7.1 從辨識到預測,再到自主行動
2026 年的邊緣 AI 攝影機主要還是「辨識」——告訴你發生了什麼。下一階段是「預測」與「建議」——根據歷史模式預測即將發生的事,並提出行動建議。例如:預測結帳區在五分鐘後會排隊超過八人,建議現在加開櫃檯。
再下一步是「自主行動」——攝影機結合 AI Agent 架構,直接與 POS 系統、排班系統、照明系統、空調系統連動,在授權範圍內自動執行決策。這在 2026 年已經有早期案例,但多數企業仍傾向保留人工確認環節。
7.2 視覺語言模型下放邊緣
2026 年最令人興奮的技術發展,是輕量化視覺語言模型(VLM)開始在邊緣端實用化。這意味著使用者可以用自然語言下指令:「如果有人沒戴安全帽進入這個區域,通知我」,而不需要事先標註資料、訓練模型。
目前的限制在於運算需求與推論速度,1B 參數以下的模型在 8 TOPS 級別的裝置上大約能跑 2 至 5 fps,對於需要即時反應的場景仍不足。但依照這幾年的演進速度,2027 至 2028 年在 16 TOPS 級別裝置上達到 15fps 以上是可以期待的。
7.3 開源模型與邊緣生態系
邊緣 AI 的門檻正在快速下降,很大一部分要歸功於開源。2026 年,主流邊緣推論框架都已相當成熟,模型動物園(Model Zoo)提供了大量預訓練模型,從人物偵測、姿態估計、到車牌辨識一應俱全。這讓系統整合商的價值從「能不能做出模型」轉移到「能不能選對模型、調好模型、整合進客戶流程」。
同時,硬體廠商之間的競爭也從封閉生態轉向半開放。過去某些廠商只支援自家模型格式,2026 年的趨勢是支援 ONNX 等通用格式,並提供轉換工具鏈。這對使用者是好事,但也意味著「買了裝置就能跑所有模型」仍是過度樂觀——轉換過程中的精度損失、算子支援度、效能調校,仍是實務上的痛點。
7.4 值得關注的三個不確定性
法規收緊的速度。EU AI Act 的執行細則、各國對人臉辨識的態度、跨境資料傳輸的規範,都會直接影響可部署的功能範圍。建議任何涉及生物特徵的應用都先做法律評估。
記憶體與供應鏈。NPU 算力提升的同時,記憶體頻寬成為新瓶頸。高頻寬記憶體的成本與供應狀況,可能限制高階邊緣裝置的普及速度。
資安事件的衝擊。只要發生一起大規模的邊緣攝影機殭屍網路事件,就可能引發監管與採購政策的連鎖反應。資安投資在 2026 年已經不是選配,而是入場門檻。
八、結語:智慧往邊緣移動,價值往整合集中
回顧這幾年的演進,邊緣 AI 攝影機的發展軌跡其實很清晰:算力不斷下放,價格不斷下降,功能不斷從「看得見」進展到「看得懂」,再進展到「能判斷、能連動」。2026 年是一個分水嶺——內建 NPU 不再是高階機種的賣點,而是中階機種的標配;競爭的重心從硬體規格轉移到生態系、工具鏈與整合能力。
對使用者而言,這意味著選擇變多了,但決策也變複雜了。同樣標示 4 TOPS 的兩台攝影機,在模型支援度、ISP 調校、資安設計、生命週期承諾上可能有天壤之別。建議的做法是:先釐清自己要解決的問題(是計數、是安全、還是流程優化),再回頭選擇對應的算力級距與生態系,而不是先買了最貴的機器再想辦法用它。
對系統整合商與開發者而言,機會在於「最後一哩路」——把通用模型調校成特定場域可用的模型,把技術指標轉譯成客戶聽得懂的營運指標,把裝置管理與資安維運做成可持續的服務。這些都不是晶片廠商能代勞的,也是這個領域最不容易被商品化的價值所在。
最後提醒一句:技術再先進,專案成功的關鍵仍然是「有沒有解決真實的問題」。人流計數的準確率從 92% 提升到 96%,對某些場景是關鍵突破,對另一些場景則毫無意義。搞清楚你的場景需要什麼,比追逐規格表上的數字重要得多。
如果你正在規劃相關專案,或是有實際部署的經驗與踩雷心得,歡迎在雅寶社區 · 頂客論壇的「最新趨勢」版區分享討論。這個領域變化極快,社群裡的實戰經驗往往比任何白皮書都來得實用。
```