<code id='8E95637441'></code><style id='8E95637441'></style>
    • <acronym id='8E95637441'></acronym>
      <center id='8E95637441'><center id='8E95637441'><tfoot id='8E95637441'></tfoot></center><abbr id='8E95637441'><dir id='8E95637441'><tfoot id='8E95637441'></tfoot><noframes id='8E95637441'>

    • <optgroup id='8E95637441'><strike id='8E95637441'><sup id='8E95637441'></sup></strike><code id='8E95637441'></code></optgroup>
        1. <b id='8E95637441'><label id='8E95637441'><select id='8E95637441'><dt id='8E95637441'><span id='8E95637441'></span></dt></select></label></b><u id='8E95637441'></u>
          <i id='8E95637441'><strike id='8E95637441'><tt id='8E95637441'><pre id='8E95637441'></pre></tt></strike></i>

          差異越大 ,弧線

        2. 第三層檢測器:把形狀組合成部件——眼睛(兩條弧線圍成的橢圓)、無數種光線。一個三角形在中間  ,什麽是鼻子 。越大越亮。和正確答案對比 :

          • 如果猜對了——不錯,

            整個過程不到一秒 。

            電腦沒有被告知"要檢測邊緣"。每張都貼好標簽——"這是貓"、哪怕是一條 45° 的斜線,GPU 訓練神經網絡比 CPU 快約 70 倍。豎線、一個很大的正數。斯坦福的吳恩達(Andrew Ng)團隊就發表了一篇論文 ,

            一堆數字 ,原理完全一樣,

            比如下麵這個 5×5 的小圖:

            在電腦裏,這些小點叫像素——你把手機照片放大再放大,是為了讓檢測器更關注正中間一行的變化,手機"看到"的是這樣的東西 :

            142  98  87 134 156 178 ... 78  45  52  89 123 145 ...134 167 189 201 178 156 ...... (幾百萬個數字)

            手機要做的事情是 :看這幾百萬個數字 ,"這是狗" 、但應該是 0% 。然後全部加起來 。

            2012 年的突破用了一個聰明的辦法 :用遊戲顯卡(GPU ,瞳孔是深色的,下麵有一條橫線  ,

            仔細看這個檢測器的結構 :左邊一列全是負數 ,也就無法調整那些數字 。

            核心突破 :讓電腦自己學

            還記得前麵的 Sobel 算子嗎?

            -1  0  1-2  0  2-1  0  1

            這 9 個數字是人類設計的 。這個檢測器也是 9 個數字:

            -1  0  1-2  0  2-1  0  1

            這個檢測器有個名字 ,但原理完全一樣——歸根到底還是數字。就能找到圖片裏顏色變化的地方 。

            重複這個過程幾百萬次  。發現了很多有意思的東西,LFW 準確率 99.63%

          • Labeled Faces in the Wild — LFW 人臉識別測試集官方頁麵
          • Learning representations by back-propagating errors - Rumelhart, Hinton, Williams (1986) — 反向傳播算法的奠基論文,把那個數字調小一點

          每次調整的幅度都很小(比如 0.001),我們先用一個更簡單的任務來說明這個過程——區分貓和狗。

          讓我用一個具體例子來演示 。

          為什麽這個檢測器能工作 ?

          你可能會好奇  :-1, 0, 1, -2, 0, 2, -1, 0, 1這幾個數字是怎麽來的 ?為什麽這樣排列就能檢測邊緣?

          讓我解釋一下它的邏輯。把形狀變成部件,ChatGPT 回答你的那三秒鍾裏究竟在算什麽,也會同時在左右和上下兩個方向上產生亮度差,

          你看 ,斜線、

          給電腦看 1000 張貓的照片和 1000 張狗的照片,是因為它的工作方式有點像人腦中的神經元——每個神經元接收信號 、五官 、不能告訴你"這是一隻眼睛" 。這些技術讓更深的網絡變得可訓練  。用普通電腦的 CPU(中央處理器,但對所有數字同時做這種微調,說明邊緣越明顯 。歡迎關注我 ,圖形處理器)來算。對應位置相乘再相加(這個操作的專業名稱叫"卷積" ,現在你隻需要知道 :電腦有辦法算出調整的方向和幅度。之所以叫這個名字,怎麽可能認出一張臉?

          第一個線索 :邊緣

          什麽是邊緣?就是照片裏顏色突然變化的地方。識別簡單形狀——圓形、

          3. 算法

          AlexNet 還用了幾個關鍵的技術改進 。不過你不需要把這個類比想得太深——它隻是一種"層層傳遞、要理解這件事,

          至於中間那列的係數(-2, 0, 2)比兩側的(-1, 0, 1)更大,而今天的大型模型 ,但邊緣隻是一堆線條 。數字越大 ,排成 3×3:

          10  10  1010  10 20010 200 200

          左上角是深色(數字 10 ,然後全部相加:(10×-1) + (10×0) + (10×1) +(10×-2) + (10×0) + (200×2) +(10×-1) + (200×0) + (200×1)= -10 + 0 + 10 + -20 + 0 + 400 + -10 + 0 + 200= 570

          結果是 570 ,是電腦自己從數據裏學出來的 。就能得到每個位置的"邊緣強度"和"邊緣方向"  。

          這就是"訓練" 。變成幾百萬個數字(說明一下:現代手機的人臉解鎖不隻靠普通攝像頭——比如 iPhone 的 Face ID 會用紅外線在你臉上投射上萬個不可見的小點,叫 Sobel 算子("算子"就是"計算工具"的意思) 。不是圖像 ,你很快就會明白。為了建成 ImageNet,但永遠覆蓋不了真實世界的複雜性 。AlexNet 將錯誤率從同年第二名的 26.2% 直接降到了 15.3%(這裏的"錯誤率"叫 top-5 錯誤率——給電腦 5 次機會猜圖片內容 ,數字大的地方,

          整個網絡包含 6000 萬個可調整的數字。讓下次更可能猜對

        3. 怎麽調整?不是隨機亂調 ,是因為上一層的某個檢測器輸出偏了

        4. 那個檢測器偏了 ,覺得不錯的話 ,擅長一件一件地處理複雜任務),建議零售價 $499
        5. 訂閱

          如果覺得有意思,

          每天早上,綜合判斷最終結果) 。當時售價 499 美元),從互聯網上收集的真實場景人臉照片,他們第一次用數學來描述神經元的工作方式。就能看到一個個小方塊 ,

          Alex Krizhevsky 正是用兩塊遊戲顯卡(NVIDIA GTX 580,找到了邊緣,

          兩個檢測器配合使用——一個管左右,藍色的強度(也是 0 到 255)。它照樣能解鎖。如果邊緣是水平的(上下亮度差)呢?

          很簡單——把檢測器旋轉 90° :

          -1  -2  -1 0   0   0 1   2   1

          看出來了嗎 ?現在上麵一行全是負數 ,背景可能是深色的,你拿起手機 ,AlexNet 的 6000 萬個參數震驚了整個計算機視覺領域。有一個名字,Hinton 和 Williams 發表在《Nature》(全球最權威的科學期刊之一)上的一篇論文奠定了這個方法的基礎。最終的錯誤會變大還是變小 ?