裝置端物件偵測的運作原理
這個工具的功能
AI 物件偵測會掃描一張相片,為它辨識到的每個對象(人、車、狗、筆記型電腦、椅子等)畫出附標籤的方框。背後是在 TensorFlow.js 上運行的 COCO-SSD 模型,這是一個以 COCO 資料集訓練、能辨識 80 種日常物件類別的神經網路。每一項偵測都會提供三種資訊:類別名稱、標示物件所在位置的邊界框,以及 0 到 100% 的信賴度分數,用來表示模型的把握程度。
偵測會在圖片載入的當下開始,整個分析都在裝置端完成。模型檔案(約 10MB)只在首次下載,之後便保留在快取中,供日後使用。
什麼時候適合用
它適合為相片資料夾自動加上標籤、在訓練自己的模型前先確認資料集實際包含哪些內容,或計算一個畫面中出現多少人物或車輛。用於無障礙工作也很方便,可為圖片產生簡短的文字描述,對於想在不架設 Python 環境的情況下試作電腦視覺構想的人同樣有幫助。
由於它能匯出含座標的結構化 JSON,也能嵌入更大的流程中:先執行偵測,取得方框,再交給裁切、模糊或標註的指令碼處理。
具體範例
放入一張街景相片。模型可能會回傳人 92%、車 88%、紅綠燈 71%,各自框在不同顏色的方框裡。把最低信賴度提高到 80%,紅綠燈便會從結果中消失,只留下兩項把握較高的偵測。降到 40%,較淡或部分遮擋的物件開始出現,偶爾也會夾雜錯誤的判斷。下載標註後的圖片可保留這些疊加標示,或匯出 JSON 以取得原始的類別名稱、分數與方框座標。
注意事項與限制
COCO-SSD 只認得 80 種類別,因此清單以外的東西(特定犬種、品牌標誌、文字等)都不會被標記。互相重疊或非常小的物件是最棘手的情況,往往落在門檻以下。信賴度滑桿是主要的控制項:數值調高會犧牲召回率換取精確率,調低則相反。若相片什麼都沒回傳,調低門檻通常能讓模型看得見卻不夠有把握的物件顯現出來。