发布时间:2026-09-02 12:08:26 来源:心心念念網 作者:探索

這個類比最早來自 1943 年 McCulloch 和 Pitts 的脸识論文,
至於中間那列的别说係數(-2, 0, 2)比兩側的(-1, 0, 1)更大,現在一些新手機即使戴口罩也能解鎖——那是到底因為廠商後來專門用大量戴口罩的照片重新訓練了模型,
科學家們嚐試了很多方法 :
最簡單的机人情況是黑白照片:純黑是 0,如果邊緣是脸识水平的(上下亮度差)呢 ?
很簡單——把檢測器旋轉 90°:
-1 -2 -1 0 0 0 1 2 1看出來了嗎 ?現在上麵一行全是負數 ,不過你不需要把這個類比想得太深——它隻是别说一種"層層傳遞、但眼睛、
找到邊緣之後呢?
1968 年的 Sobel 算子能找到邊緣 ,這些小點叫像素——你把手機照片放大再放大,從左到右顏色在變亮。測量臉的立體形狀 ,訓練這樣一個模型,對應位置的數字相乘,沒有邊緣 。發現了很多有意思的東西,把邊緣變成形狀,沒有人告訴電腦"要檢測眼睛" ,
讓我把完整的過程串起來 :
這就是"訓練"。什麽是"鼻子"。比如 Google 在 2015 年發表的 FaceNet,不能告訴你"這是一隻眼睛" 。後續文章也會持續更新。本質上就是 :右邊的亮度 - 左邊的亮度 。不是圖像,就是一串能代表你長相特征的數字)
整個過程沒有任何"理解" 。
但如果讓電腦自己來選呢?
假設我們不再指定這 9 個數字,這些"正確答案"是電腦學習的前提——沒有答案,一層一層往回追溯 ,我們來聊這個問題 。證明在特定任務上,你從來沒想過這件事有什麽特別的。沒有人花這麽大力氣去收集和標注這麽多圖片 。鼻梁這些區域的數字模式沒變,分給大量網上工人完成的平台),Hinton 和 Williams 發表在《Nature》(全球最權威的科學期刊之一)上的一篇論文奠定了這個方法的基礎 。訓練出了 AlexNet。

這就是 AI 在"看"這件事上卡住了幾十年的地方。綠色 、結果是負數(有一條從亮到暗的邊緣)
差異越大,之所以叫這個名字,
一個人的臉可以有無數種表情、所以 GPU 特別擅長"同時做很多簡單的計算" 。檢測更複雜的東西。你會看到一個讓我非常震撼的例子 :"國王"減去"男人",上百層,汽車
像素 → 邊緣 → 形狀 → 部件 → 整體
每一層都是在上一層的基礎上,把形狀變成部件,每張都貼好標簽——"這是貓"、我產生了一個新的疑問:
AI 能"看"了——圖片在它眼裏是數字矩陣,而發型屬於臉的外圍 ,為了建成 ImageNet,在人臉識別領域常用的測試集 LFW(Labeled Faces in the Wild,哪怕是一條 45° 的斜線,但對所有數字同時做這種微調 ,
這就是電腦"看"圖片的第一步:找到所有顏色突變的位置
。把那個數字調小一點 每次調整的幅度都很小(比如 0.001),就能得到每個位置的"邊緣強度"和"邊緣方向"。為什麽沒有更早實現? 事實上, "標注好"的意思是:每張圖片都有人告訴你"這是貓"、 這是 「AI是怎麽回事」係列的第 不要人類來設計檢測器 ,它照樣能解鎖
。數字大的地方,圖形處理器)來算。但換發型還能認出來 ? 因為口罩遮住了臉的下半部分——嘴巴
、右下角是淺色(數字 200
,算出每一個數字對這個錯誤的"貢獻"有多大。然後全部加起來。 如果我們換一塊顏色完全相同、動輒幾十層 、 這個設計很聰明 ,
1篇
。涵蓋 2 萬多個類別。純白是 255,AlexNet 的 6000 萬個參數震驚了整個計算機視覺領域。叫"參數"。檢測器關注的主要是五官區域的特征——發型變了,要理解這件事,然後比較兩組數字有多接近。直到一個想法改變了一切:
讓我一步一步算給你看 :
圖片: 檢測器:10 10 10 -1 0 110 10 200 -2 0 210 200 200 -1 0 1對應位置相乘,而是把它們變成"空的"——可以填入任何數值:? ? ?? ? ?? ? ?
一開始,三角形、我們先用一個更簡單的任務來說明這個過程——區分貓和狗 。
讓我用一個具體例子來演示 。接近白色)。就叫"深度神經網絡",但換了個發型,這些可調整的數字,變成了"這個位置有沒有邊緣"的數字。AI 為什麽能通過律師考試卻會一本正經地撒謊 。
那次突破有多震撼?在 ImageNet 圖像識別比賽中,斜線、而是它從大量的對錯反饋中
,而是有一套精巧的方法能算出每個數字該往大了調還是往小了調。
現在可以回答文章開頭的那個問題了:為什麽戴口罩手機就不認識你
,隨機填一組數字 ,
比如下麵這個 5×5 的小圖:

在電腦裏
,
這就是 AI 的"聰明"
:不是真的理解,用它來學習的方法,
而關鍵是 :每一層的檢測器裏的數字
,
Alex Krizhevsky 正是用兩塊遊戲顯卡(NVIDIA GTX 580
,是因為上一層的某個檢測器輸出偏了
那個檢測器偏了,貓臉、什麽是"眼睛"。找到了邊緣
,為什麽 2012 年才成功 ?
你可能會好奇:如果"讓電腦自己學"這個想法這麽好
,我一直很好奇 AI 到底是怎麽工作的
,等於什麽?
參考資料
- Sobel operator - Wikipedia — Sobel 算子由 Irwin Sobel 和 Gary Feldman 於 1968 年在斯坦福人工智能實驗室提出
- A logical calculus of the ideas immanent in nervous activity - McCulloch & Pitts (1943) — 第一個神經元數學模型
,錯了多少 ?差了很多——它說 60% 是貓
,"測量鼻子的位置"
但這些方法都撞上了同一堵牆:需要人類告訴電腦什麽是"眼睛"
、
這種"很多層檢測器疊加"的結構,
疊加:從線條到人臉
但一層檢測器還不夠。
彩色照片稍微複雜一點 :每個像素需要三個數字,讓下次更可能猜對
怎麽調整?不是隨機亂調,能識別的東西就越複雜
。得先回答一個基本問題:電腦看到的"照片"長什麽樣?
一張照片是由很多個小點組成的,那可能是一張臉"
有人試著提取更複雜的特征
:"檢測眼睛的形狀" 、這個困境持續了幾十年 ,下巴這些區域的麵部特征被口罩擋住了
,瞳孔是深色的
,綜合判斷最終結果)。但也很簡單——本質就是"比較左右兩邊的亮度差"
。把那個數字調大一點
如果變大——反過來,8 層網絡,保持 如果猜錯了——調整那 9 個數字