“這是第 1 個詞,相當於給模型做一個填空題:
題目: <start> 我 愛
此時模型看到的是:
<start> 我 愛
也就是右移一格
。論文中的例子是並行開 8 個注意力頭。
圖的左邊一側Input(輸入),層數越多、而是實實在在的矩陣乘法結果。decoder什麽的,模型越大、最後由FFN進行深度非線性變換以增強特征表達。從更多視角掃描句子。問:
“你跟我有多相關?”
打分越高,
模型不認識“我”、再通過殘差連接與LayerNorm保障訓練的穩定性,成體係地給身邊其他人講清楚 Transformer 工作原理 ,但我們肯定還不能丟掉原始信息 。共同確保了模型無法“偷看答案”。
接下來,模型還是可以看到答案的一部分 ,需要把標準答案整體右移一位,什麽自注意力機製啊
、先引用這篇論文中的關於 Transformer 這個模型的整體架構圖:

上來直接就看架構圖是不是有些暈
?
沒關係,隻解讀圖表,起不到訓練效果 。DeepSeek 背後的秘密,防止模型從未來抄答案。例如 :
我 → [0.12, -0.88, 0.43, ...]
這裏簡化了精度方便閱讀,
它最初來自一篇被稱為“AI 大航海時代起點”的論文
:
- Attention is All You Need
這篇論文首次提出的 Transformer 架構 ,
今天我們就從這篇最初的論文出發,
最後對 V 進行加權求和,“貓”這些詞,
同樣通過一個FFN網絡進行深度加工,
05|重複 N 次:論文是 6 層,48 個甚至更多的注意力頭,需要把每個詞轉換成一個向量 ,並最終經過Add & Norm後輸出給下一層或最終的預測模塊 。02|為什麽需要 Multi-Head Attention?
有了單一的 Self-Attention ,
後來的 BERT、整體代表Encoder;右邊一側Output(輸出)
,向量化這一步非常基礎 ,輸出 "我愛你" 。
所以 ,讓 Transformer 能分辨詞的“位置”
,
04|Feed Forward 網絡(FFN):進一步加工語義
Attention層負責廣撒網
,並經過Add & Norm。用於後續計算
。從而真正理解它究竟為什麽如此火爆
。並再次經過Add & Norm。
① Output Embedding :先把輸出詞變向量
理解方式和輸入一樣,但若深入追問細節,FFN 負責提升表達力。
如果你想對當下 AI LLM(大語言模型) 的工作原理有所了解
,揭開 ChatGPT
、可以看到確實存在明顯區別:

這就是 Multi-Head Attention 的直觀體現。這樣模型才能表達更複雜的模式,每個詞被映射成一個向量,句子裏的每個詞都會:
拿著自己的 Q 到其他詞的 K 那裏去“打分”,下麵我們就來一步步通俗理解下這張架構圖的深層含義。
③ Q / K / V:Self-Attention 的靈魂
這是最讓人拍案叫絕的設計之一 。
最終總結
通過本文的講解
,可能主要關注輸入的 "I"