生物大腦怎麼學習:從突觸到多巴胺,把「平均」變成有方向的記憶

生物大腦怎麼學習:從突觸到多巴胺,把「平均」變成有方向的記憶


這篇文章只追一條主線:

若底層突觸起初都很平均、更新又帶隨機,大腦如何長出「有方向」的學習?

答案不是一個全域 loss。是:局部時間規則 + 環境統計 + 價值訊號,在幾層時間尺度上把隨機候選淘成可用電路。


1. 突觸在改什麼

興奮性突觸上,兩個角色夠用了:

  • AMPA:前級一釋放麩胺酸,通道打開,Na⁺ 進來,後級去極化。日常傳訊。
  • NMDA:同樣要配體,但安靜時被 Mg²⁺ 堵住。後級夠強去極化(例如回傳動作電位)才把鎂彈開,Ca²⁺ 大量流入。

教學口訣「配體 + 電位」指的就是 NMDA;嚴格說它仍是配體閘控,只是多了電壓依賴的 Mg 阻塞解除——這讓「前後級要對上」成為物理,而不是 if-else。

Ca²⁺ 進得多快、多猛,大體決定可塑性方向(簡化版):

Ca²⁺傾向結果
高、陡LTP膜上 AMPA 增多,傳導變強;久了甚至棘長大
低、鈍LTDAMPA 被收回,傳導變弱

赫布的「一起激發就連在一起」,不是現場焊一條新纜線,多半是:發育期先長很多候選突觸 → 用了的加權/保住 → 沒用的削弱或修剪。


2. STDP:毫秒級寫入因果

STDP(spike-timing-dependent plasticity)是本地、通常無監督的規則,只問一件事:前級與後級誰先放電?

Δt=tposttpre\Delta t = t_{\text{post}} - t_{\text{pre}}
  • Δt>0\Delta t > 0(前級先):傾向 LTP
  • Δt<0\Delta t < 0(後級先):傾向 LTD
  • 差超過數十毫秒:當巧合,幾乎不改

STDP 時間窗

物理上:前級先放麩胺酸 → NMDA 已備好配體但 Mg 仍堵 → 幾毫秒內後級放電解 Mg → Ca 洪峰;順序反了,波形不同,偏向抑制。

一個後級接很多輸入時,誰先可靠地「幫它開火」誰就被 STDP 放大;慢半拍的被削弱。配上側向抑制,就變成 winner-take-all:環境統計在雕刻特徵,不必給 label。

局限也直白:窗口只有毫秒;純局部規則看不見「任務錯在哪裡」。遠距獎勵、深度監督,要靠後面兩節。


3. 為何一開始平均,卻學得動?

若一切完美對稱,權重確實會一起漂、學不出差異。真實大腦至少有三把刀破對稱:

  1. 世界不平均——同一刺激下,哪個受器先響、誰延遲幾毫秒,本來就不齊。
  2. 微觀雜訊——自發釋放等讓看似相同的突觸從不走同一條軌跡;正回饋把微小優勢立住。
  3. 橫向競爭——誰先放電誰壓鄰居,不是溫和平均分。

所以:隨機製造候補;輸入統計與競爭負責方向。不是「每一步都已知道全域梯度」。


4. 方向從哪來:尤其是個體試錯

先記住這則小故事

後面講多巴胺與 RPE,都掛在同一套情境上——經典制約實驗的簡化版(動物/猴子都行):

時間軸:  [指示燈亮]  …隔一小段時間…  [拿到果汁]
  • 燈(CS):中性線索,本來不甜、不疼,只是信號。
  • 果汁(US/獎勵):真正讓動物在乎的結果。
  • 學習要建立的不是「果汁好吃」 alone,而是「燈來了 ≈ 等等會有果汁」。

為什麼要用這則故事?因為它把兩個問題拆開了:

  1. 結果本身(真的喝到果汁了沒)
  2. 你事先有沒有預期(看到燈時,腦是否已在賭「等下有果汁」)

多巴胺後來跟的,是兩者之差,不是果汁本身。若沒先把時序記在腦裡,後面的「前移」會像術語空降。

宏觀方向不只一個來源

微觀抖動可以是隨機;宏觀留下什麼模式,不必是。

來源在幹嘛
環境統計共現、共變反覆出現 → 感知特徵被 STDP 類規則加深(無監督)
獎勵預測誤差(RPE)像上面果汁故事:報告「比預期好/差」,而不是「有糖就響」——個體試錯的主方向盤
基因/架構先驗皮層怎麼分層、大概接哪裡,縮小可搜尋空間
注意/由上而下拉高當下該寫入哪段電路

主動行為學習而言,RPE 通常是最關鍵那一層。沒有它,系統仍能被動刻世界;有了它,探索才掛上趨利避害。

回到果汁故事:多巴胺為什麼會「前移」

重點不是「有沒有果汁時多巴胺都會響」,而是「實際結果跟預測差多少」:

  1. 還沒學會時
    燈對動物沒意義。果汁突然出現 = 意外驚喜。
    多巴胺在接到果汁的那一刻短暫爆一段(phasic 上升)。

  2. 學會「燈 ≈ 等下有果汁」之後
    燈一亮,大腦已經預測到果汁。
    多巴胺的爆點提早挪到燈亮——標記「可靠的預測線索到了」。
    真正拿到果汁時,若一切如預期,不再爆(驚喜已用完,誤差≈0)。

  3. 學會之後卻「跳票」
    燈亮了,預期有果汁,結果沒給。
    在本來該拿到果汁的時間點,多巴胺會掉到低於平日基線——這就是負向 RPE,用來削弱剛才那套「燈→期待/動作」聯結。

一句話:多巴胺追的是「預測錯了多少」,不是「報酬本身」;學會之後,訊號會往時間序列更早的預測線索跑,這就叫反應「前移」。


5. 資格痕跡:把「剛才」接到「後來的果汁」

果汁故事裡還有第二個時間問題:燈亮到果汁之間,常常不是幾毫秒,而是幾百毫秒到數秒。中間若動物還做了一系列動作,經典 STDP 的毫秒窗裝不下「誰該為果汁負責」。

按鈕與掉糖、燈與延遲果汁,是同一類遠距信用問題。解法是三因素規則

  1. 前後級共活(或符合該突觸的配對)→ 留下可衰減的 eligibility(資格痕跡)
  2. 當下不一定立刻把權重寫死
  3. 秒級內若來了調制訊號(多巴胺等;例如正向 RPE 的 phasic 爆發),才把仍活著的標籤轉成真正 LTP/LTD

資格痕跡 + 延遲獎勵

因此:不是血液把「果汁甜味」溶解後冲全腦,而是中腦多巴胺細胞改變發放,在紋狀體等靶區末梢釋放,經突觸/體積傳輸當調制廣播。

信用分配也別過乾淨。路徑 1-2-3-4-5 若剛好在獎勵前留下新鮮 traces,會被正向 RPE 加固;2-3-4-5-6 不會因為你在故事裡標了「錯」就自動免疫——它若也在同一時間窗開火,一樣可能沾到。真正拉開兩條路,靠的是跨多次試驗的預測更新:燈亮該有果汁卻沒有 → 負 RPE 削弱;穩定成功 → 正誤差縮小、反應像第 4 節那樣前移到燈。

兩點邊界:

  • 許多皮層/海馬的本地 LTP 不必等多巴胺;三因素是延遲行為信用的補丁,不是唯一宇宙法則。
  • 數十分鐘以上的因果,化學 traces 不夠,還要工作記憶、海馬重放等系統級機制——那已超出本文主線。

整腦大致是:

任務主工具
感知特徵兩因素 Hebb / STDP
有後果的試錯(秒級,如燈→果汁)三因素 + eligibility + RPE
更長延遲記憶系統與重放

一條鏈收束

麩胺酸 → AMPA 動電位 → NMDA 在對的時刻解 Mg → Ca²⁺ 形狀決定增強/抑制 → 毫秒窗寫入 STDP,或留下 eligibility → 若牽涉延遲後果,RPE 調制在秒級固化或抹掉 → 多次試驗把政策淘穩。

深度學習用全域梯度保證信用可導;大腦用局部時間計時器 + 調制廣播 + 環境統計做同一類事的另一語言。主線到這裡就夠:不必把每個例外、每個 AI 對照表都塞進同一頁。