大腦真的在做 Backpropagation 嗎?從 NGRAD 看生物學候選機制

大腦真的在做 Backpropagation 嗎?從 NGRAD 看生物學候選機制


如果你把一個神經網路的權重改動想成「修理一座工廠」,backpropagation 解決的是一個很實際的問題:到底是哪一顆螺絲,對最後產品的不良率負責?

在兩層 MLP 裡,這件事看起來只是微積分。網路先做 prediction,算出 loss,再用 chain rule 把責任往回分配。可是把同一件事放回大腦,問題就變成:一個突觸只看得到自己附近的電活動,怎麼知道它對幾個皮質區之外的行為錯誤做了多少貢獻?

這個問題叫做 credit assignment(責任分配):當最後的行為出錯時,每個局部突觸要如何知道自己應該改多少?

這就是 2020 年 Lillicrap、Santoro、Marris、Akerman 和 Hinton 發表在《Nature Reviews Neuroscience》的〈Backpropagation and the brain〉真正關心的問題。

它的答案不是「大腦已經被證明在跑 PyTorch 的 backward pass」。比較精確的說法是:大腦可能利用 feedback 改變局部神經活動,再用活動差異近似梯度所提供的 credit-assignment 訊號。 作者把這一組想法稱為 NGRAD,全寫是 Neural GRADient representation by Activity Differences,可譯為「以神經活動差異表徵梯度」。其中 GRAD 特別凸顯它要表徵的是 gradient;但它不是把 gradient vector 原封不動地沿著皮質逐層倒傳,而是讓局部活動的差異在特定模型條件下扮演類似梯度的角色。

這個版本沒有那麼戲劇化,卻更有用。因為它把問題從「大腦有沒有一個神秘的反向傳播器」改寫成了幾個可以測量的問題:feedback 到底改變了什麼?哪些 neuron 或 dendritic compartment 在表示 mismatch?突觸能不能只靠附近的訊號,得到足夠好的學習方向?

Backprop 真正在傳的是什麼?

先把機器學習裡的版本寫清楚。

對第 ll 層,前向權重是 WlW_l,前一層輸出是 hl1h_{l-1}。標準 backprop 會用當層的 error signal δl\delta_l 和 presynaptic activity hl1h_{l-1} 更新權重:

ΔWl=ηδlhl1\Delta W_l = -\eta\, \delta_l h_{l-1}^{\top}

困難在 δl\delta_l 怎麼得到。它會從更高一層遞迴回來,大致是:

δl=(Wl+1δl+1)f(al)\delta_l = (W_{l+1}^{\top}\delta_{l+1}) \odot f'(a_l)

這裡的 ala_l 是第 ll 層的 pre-activation,f(al)f'(a_l) 是 activation function 的導數,\odot 則表示逐元素相乘。δl\delta_l 也不是「預測值和標籤直接相減」,而是 loss 對這一層 neuron 輸入的敏感度。

對單一突觸而言,更新量可以簡寫成 Δwij=ηδihj\Delta w_{ij}=-\eta\delta_i h_j:它需要 presynaptic activity,以及目前 neuron 所收到的 error derivative。這就是 backprop 能有效做 credit assignment 的原因:它把「最後答錯了」轉成每一層、每一個 neuron 的權重更新方向與幅度。

但這套公式放到大腦會立刻撞上幾個硬問題。

第一個問題:weight transport

如果前向連線使用 WW,標準 backprop 在反向傳播時會用 WW^{\top}。這不是說大腦需要把一張矩陣複製一份放在另一邊,而是說:負責把 error 往回傳的連線,必須知道前向突觸的精確對應關係。

這個要求被稱為 weight transport problem。原論文指出,皮質確實有大量 feedback connections,但沒有看到 textbook backprop 所需的 point-to-point reciprocal connectivity。更麻煩的是,讓每一對前後向連線長期維持精準對稱,本身就需要另一套學習規則。

第二個問題:forward 與 backward 傳的不是同一種東西

前向 pass 傳的是 activation,反向 pass 傳的是帶正負號的 error derivative。它們不是同一種物理量,只是在人造網路的數學中被安排成兩個方向。

大腦的 feedback 卻常常直接影響 neural activity。它可以參與注意力與 gain control,也可能在低階視覺區驅動活動。這和「forward pass 算完之後,error 只在旁邊偷偷改權重、不改變 neuron 狀態」的乾淨工程假設不一樣。

第三個問題:大腦不像一台兩階段的 trainer

很多 biologically plausible learning 演算法需要先跑一個 negative phase,再跑一個 positive phase,最後比較兩次活動。可是皮質裡的 feedforward 和 feedback 路徑似乎會同時互動,不是整個網路先向前、再整個網路向後。

所以真正的問題不是「神經元能不能做乘法」。而是:大腦如何在連續運作的電化學系統裡,把前向狀態、top-down influence、局部 plasticity 和行為結果接起來?

這篇論文的關鍵轉向:不要傳遞梯度,傳遞會改變活動的 feedback

〈Backpropagation and the brain〉最重要的概念不是 feedback alignment,也不是某一個新的 neuron model,而是 NGRAD 的抽象。

NGRAD 的基本想法是:error 不一定要以一個明確的梯度向量,在區域之間逐層傳遞。高階區域、另一種感覺模態、或某個 target,可以透過 feedback 把低階活動「推」到另一個狀態。原本的 feedforward activity 和被 top-down 影響後的 activity 之間的差,就變成局部學習訊號。

用工程語言說,標準 backprop 是把 blame assignment 直接算出來;在某些 NGRAD 實作中,系統則會被 feedback 推向一個「如果結果更好,這一層應該長什麼樣子」的狀態,再用兩個狀態的差距反推權重該怎麼改。這個近似不是只要有兩個活動狀態就會自動成立,通常還依賴特定的 feedback、inverse mapping、equilibrium 或小幅 nudging 等條件。

這個差距可以出現在三個地方:

  • 不同時間的兩次 network state,例如負相與正相。
  • 同一層不同 neuron population 的活動差。
  • 同一個 neuron 不同 dendritic compartment 的活動差。

因此 NGRAD 不是單一演算法,而是 Lillicrap 等人在這篇 perspective 中提出的統攝性命名,不是所有研究者都採用的標準分類。它把 GeneRec、contrastive Hebbian learning、equilibrium propagation、predictive coding、target propagation,以及以樹突 compartment 為基礎的模型放到同一張問題地圖上;但這些方法仍處在不同抽象層次,不能當成同義詞。

本文的 error 也至少有三種意思:backprop 的梯度訊號、predictive coding 的預測誤差,以及 error-neuron 模型中的神經活動族群。它們在特定模型裡可能相關,但不是同一個物理量。本文聚焦的是 supervised、error-driven 的 cortical learning 假說,不是所有可能的生物 credit-assignment 路線。

Feedback alignment:反向權重不必完美對稱?

2016 年 Lillicrap 等人在 Nature Communications 的 feedback alignment 論文 提出一個很反直覺的結果:feedback matrix 不必是 forward weight 的精確轉置,也可以用固定的隨機權重。

對單一線性 hidden layer,可把標準 backprop 寫成 δBP=We\delta_{BP}=W^{\top}e。Feedback alignment 改成 δFA=Be\delta_{FA}=Be,其中 BB 是固定、隨機的 feedback matrix。乍看之下,這像是把正確答案的方向換成亂指;在深層非線性網路中,feedback error 會經由各層的 BlB_l 逐層傳遞,並搭配 activation derivative。

但是在訓練過程中,forward weights 會逐漸調整,讓由 BB 產生的 teaching signal 和真正的 error derivative 變得足夠一致。這不是精準重建 WW^{\top};Nature Communications 的結果顯示,兩者之間的角度可以縮小,但不必降到零,模型仍然可以學習。

這個結果的意義很有限,也很重要。

有限,是因為一個 ANN 實驗不能證明皮質用了隨機 feedback。重要,是因為它拆掉了「只要沒有完美 weight symmetry,就不可能做深度 credit assignment」這個過強的前提。生物系統也許不需要一份完美的梯度,只需要一個在訓練中逐漸變得有用的方向。

2020 年的 review 指出,單純 random feedback 在某些更深或更複雜的網路中可能不足;後續工作因此探索如何讓 backward pathway 被塑形。這提醒我們:feedback alignment 是在特定模型與訓練條件下放寬限制的 proof of possibility,不是完整的腦學習理論。

Target propagation:把 error 換成「這一層應該到哪裡」

另一條路線是 target propagation。它不直接把 gradient 從輸出層往回乘,而是先學一個 forward mapping 的近似 inverse。

假設前向網路把 hlh_l 送到 hl+1h_{l+1},feedback network 就學一個近似逆函數,把 output target 往回轉成 hidden target。這個 hidden target 和原本 feedforward activity 的差異,便可以在本層局部使用。

這和 backprop 的差異很像「傳責任」和「傳目標」的差異:前者說你對錯誤貢獻了多少,後者說如果結果正確,你這一層應該呈現什麼狀態。

〈Backpropagation and the brain〉整理的結果是,target propagation 在某些影像分類任務上可以有效學習,而且完成訓練所需時間比 node perturbation 這類方法短;但直接的 DTP 實作在 ImageNet 和大型 convolutional network 上仍不如 backprop,也沒有解決 online learning 或 forward / backward pathway 如何在生物迴路中溝通的問題。

2017 年的 segregated-dendrite 模型也不是完全連續、純局部的機制:它仍然使用 forward phase 與 target phase,並比較不同 phase 的 apical plateau。這使它成為有生物動機的模型,但還不是已驗證的在線皮質學習機制。

這裡有一個很容易被忽略的界線:「可以近似 backprop」不等於「已經解決了生物實作」。 中間還隔著訊號如何儲存、如何同步、如何傳到正確的突觸,以及如何在沒有人工 phase boundary 的狀態下完成比較。

Predictive coding:prediction error 和 gradient 是同一件事嗎?

Predictive coding 提供了一條很直覺、但不是唯一的神經科學路線。

高階區域向低階區域送 prediction,低階區域比較 prediction 與感覺輸入,產生 mismatch 或 prediction error,再把這些差異往上送。從這個角度看,feedback 不再是「把 error derivative 搬回去的專用線路」,而是持續改變各層對世界的預測;局部 neuron 直接處理自己看得到的 prediction error。

Whittington 和 Bogacz 在 2017 年的 Neural Computation 論文 展示,在特定 predictive-coding network 和 local Hebbian synaptic plasticity 的設定下,更新可以近似 error backpropagation。這是數學上的橋,不是生物學上的驗收章。

原因是 predictive coding 並不自動等於 backprop。兩者的關係取決於網路如何定義 prediction、error unit、precision、固定哪些變數,以及是否假設網路已經接近某個 equilibrium。不同版本可能近似梯度,也可能只是在優化另一個目標。

這也讓 2020 論文的立場變得很清楚:作者不是要替 predictive coding 宣布「它就是大腦的 backprop」,而是把 prediction、feedback 和局部 activity difference 視為一組可能支撐 credit assignment 的零件。

樹突:把前向與回饋訊號分開的硬體線索

如果只用一個 scalar activation 代表一顆 neuron,feedforward 和 feedback 訊號很難在同一個地方分開。真實的 cortical pyramidal neuron 沒有這麼簡單:它有 soma、basal dendrite、apical dendrite 等不同區域,不同輸入可以在不同 compartment 整合。可以先把它想成:basal dendrite 主要接收前向/感覺輸入,apical dendrite 主要接收高階回饋,soma 再整合兩者並產生輸出;這是簡化的直觀圖像,不是每個皮質區都固定如此。

這就是 Guerguiev、Lillicrap 和 Richards 的 segregated-dendrite 模型 的核心。模型把 sensory / feedforward input 和 higher-order feedback 分到不同 dendritic compartment,再用兩者的局部互動形成 error-like signal。即使 feedback synapses 使用隨機權重,該 MNIST 模型的多層網路也能得到比單層網路更好的類別分離與分類表現。

這類工作對 AI 工程師最有啟發的地方,是它把「神經元」從一個加權和加 activation 的節點,改成一個有內部空間結構的運算單元。你不必先假設每個 neuron 能讀取全域 loss;你可以問:basal compartment 看得到什麼?apical compartment 看得到什麼?soma 如何把兩者的狀態差傳給 plasticity rule?

2020 論文列出的候選機制還包括 backpropagating action potentials、plateau potentials、interneuron modulation 和 multifactor synaptic plasticity。這些比較像一組待拼接的元件,而不是已經跑通的完整電路。原作者明確指出,feedforward 與 feedback 如何在生物組織中協調,仍是 open question。

2026 年的新進展:error-neuron microcircuit 走得更遠,但還不是證明

2026 年 Max、Jaras、Granier、Wilmes 和 Petrovici 在 PLOS Computational Biology 發表的模型,可以視為這條研究路線的一次整合。

它在每個 cortical area 裡建模兩類 pyramidal-cell population:representation units 和 error units。跨區域的 representation 訊號使用 forward weights,error 則透過另一組 feedback weights 傳遞;模型把每顆 pyramidal neuron 抽象成 soma、representation 和 error 三個 integration zones,但兩類 unit 使用這些 compartments 的輸入與功能不同。作者把跨區連線參考到 primate visual cortex 的 connectivity,並讓 inference 與 learning 在沒有明確 phase 的情況下進行。

這裡也有一個不能略過的模型化妥協:論文提出 PAL(Phaseless Alignment Learning)來學習 error-projecting weights,但為了計算可行性,主要模擬把 error-projecting weights 設成 representation weights 的 noisy transpose。這是對 weight transport 的近似處理,不是已驗證的獨立 feedback pathway。

模型可以處理需要短期記憶的 delayed match-to-sample task,也在 Yin-Yang 分類與 teacher-student 的多區域任務上和同規模 ANN 做比較。作者報告,顯式 error representation 的模型在增加 cortical areas 時仍接近 ANN;相對地,幾個 dendritic error construction 模型在 error 跨越兩個以上區域時擴展不佳。論文也提出了可以在實驗上區分不同理論的 measurable predictions,而不只展示一個能在電腦上收斂的網路。

但這項工作應該被讀成「更完整、更可測試的模型」,不是「大腦已被證明在做 backprop」。論文自己的結論仍說,backpropagation-and-the-brain hypothesis 是 controversial。模型能把多個生物限制放在一起,是因為研究者選擇了一組合理的 circuit assumptions;它還沒有直接測量活體皮質如何用這套機制學習。

這個區別很重要。模型的 benchmark accuracy 是 algorithmic evidence;與已知解剖或生理相容的 connectivity assumptions 只能算 plausibility argument;只有在神經活動、突觸可塑性和行為學習之間建立可重複的因果對應,才接近 biological evidence。

所以,大腦到底有沒有 backprop?

截至目前,最負責任的答案不是 yes 或 no,而是把問題拆成三層:

第一層是計算原理。如果大腦要透過多層突觸調整來改善長距離行為,就需要某種 credit assignment,或功能上等價的跨層協調機制。Backprop 是一個非常成功的計算解。

第二層是演算法近似。Feedback alignment、target propagation、predictive coding、equilibrium-style learning 和 NGRAD 類模型都說明:不必精確執行 textbook backward pass,也可能得到類似的多層學習效果。

第三層是生物實作。目前仍沒有證據把完整的 feedback、error representation、dendritic computation、synaptic update 和行為改善串成一個已被驗證的 cortical learning algorithm。

把「證實」拆成三個層級會比較準:模型能不能學,是 algorithmic evidence;零件是否符合已知神經生理,是 plausibility argument;活體大腦是否真的靠它完成學習,才是 biological evidence。這四條路線目前大多停在前兩層。

方法已經有的證據還沒有證實的事
NGRAD2020 論文提出的統攝性框架;特定模型中,活動差異可以近似梯度。皮質真的用 NGRAD 作為學習規則。
Feedback alignment人工網路實驗顯示固定隨機 feedback 也能在多層網路傳遞有用 teaching signal。大腦使用固定隨機 feedback,或這是皮質的主要機制。
Predictive coding特定 predictive-coding 模型可在假設成立時近似 backprop;大腦中也觀察到 prediction mismatch。所有 predictive coding 都等於 BP,或它已被證明是大腦的通用學習演算法。
Dendritic learning樹突模型能以 compartment 分離在人工任務中學習;部分樹突與 plasticity 零件有生理依據。完整的樹突局部規則能在活體皮質中長距離分配 credit。

資格痕跡:同一個 credit-assignment 問題的時間面

前面四種方法主要在問:「哪一層、哪個 neuron 或哪個 compartment 應該改變?」這比較接近空間上的 credit assignment。資格痕跡(eligibility trace)問的是另一個面向:「幾百毫秒、幾秒,甚至更久以前參與過的哪個突觸,應不應該等到延遲的回饋到達後才改變?」這是時間上的 credit assignment

可以把 eligibility trace 想成突觸上的暫存標籤:局部的 pre/post-synaptic activity 發生時,突觸留下會逐漸衰減的 trace;稍後 dopamine、reward prediction error 或其他 teaching signal 到達時,這個訊號再對帶有 trace 的突觸進行調節。用簡化記號表示,就是先累積局部資格,再由延遲訊號 gate 更新:

eij(t)=γλeij(t1)+local activityij(t),Δwij(t)=ηm(t)eij(t)e_{ij}(t) = \gamma\lambda e_{ij}(t-1) + \text{local activity}_{ij}(t), \qquad \Delta w_{ij}(t) = \eta\,m(t)e_{ij}(t)

這不是另一個和前述方法競爭的「第六種 BP 替代品」,而是一個可以嵌入它們的時間機制:

  • NGRAD 可以提供局部或 compartment-level 的梯度近似;eligibility trace 則把這些局部活動保留到較晚的學習訊號抵達。NGRAD 本身不等於資格痕跡。
  • Feedback alignment 解決的是如何用不對稱或固定的 feedback 傳遞有用的 teaching signal;eligibility trace 解決的是這個 signal 延遲到達時,哪些先前突觸仍然「有資格」被改。兩者可以組合。
  • Predictive coding 若持續產生局部 prediction error,可能降低對長時間資格痕跡的需求;但對有延遲結果的 recurrent 或行動任務,仍可搭配 eligibility trace。prediction error 不是 eligibility trace。
  • Dendritic learning 的 dendritic voltage、calcium 或 plateau state 可以扮演 eligibility-like 的暫存角色,但「用樹突做局部學習」和「資格痕跡」不是同義詞。

一個很清楚的橋接例子是 e-prop:它讓每個突觸在線上累積描述局部活動與權重關係的 eligibility trace,再與較廣泛傳來的 learning signal 相乘,作為 recurrent spiking network 的更新規則。Bellec 等人的研究顯示,這種架構可以在不執行完整 BPTT 的情況下,近似需要的時間 credit assignment。另一條經典路線是 dopamine-modulated STDP:局部突觸先留下活動痕跡,延遲的 dopamine/reward signal 再選擇性地改變它們,Izhikevich 的模型正是這種想法的代表。

因此,最精確的說法是:**資格痕跡和 NGRAD、feedback alignment、predictive coding、dendritic learning 有關,但屬於互補的維度,不是同一件事。**前四者主要在處理 error 或 teaching signal 如何在網路中表示、近似與傳遞;eligibility trace 主要在處理局部突觸如何跨時間保留「我剛才參與了這個結果」的證據。把兩者合起來,才更接近一個能在局部、持續、延遲回饋下學習的腦式機制。

神經系統的主要學習方案:多套機制並行

如果把問題改成「神經系統平常主要靠什麼學習」,最準確的答案不是某一個總演算法,而是幾套依照功能分工、彼此疊加的機制:

  1. 局部關聯式學習(Hebbian learning、LTP/LTD、STDP):突觸根據附近的 presynaptic activity、postsynaptic activity,以及 spike 的相對時間改變強度。這是最接近「單一突觸能直接執行的基本規則」;但它本身只知道哪些活動一起發生,不知道最後的行為是否成功。Bi 與 Poo 的實驗顯示,前後神經元的放電時序可以決定突觸增強或減弱。
  2. 獎勵/神經調節式學習(reinforcement learning、three-factor learning):在局部活動之外,再加入 dopamine、acetylcholine、noradrenaline 等較廣泛的 neuromodulatory signal。這個「第三因子」可以把普通的相關活動標記成值得保留或值得削弱的改變;若結果延遲,就搭配 eligibility trace。中腦 dopamine neuron 的活動與 reward prediction error 的關係,是這條路線最有影響力的神經生理證據之一。Schultz、Dayan 與 Montague的經典研究建立了這個連結。
  3. 誤差驅動的校準學習(error-driven/supervised-like learning):小腦是最典型的例子。climbing fiber 可以提供與動作表現或感覺結果相關的 instructive signal,改變 Purkinje-cell circuit 的突觸可塑性,讓下一次動作更準確。小腦研究支持它具有類似 supervised learning 的功能;但這是特定迴路的誤差校準,不等於整個皮質在跑 BP。
  4. 穩態學習(homeostatic plasticity):synaptic scaling、inhibitory plasticity 和 intrinsic-excitability 調節,會把過高或過低的整體活動拉回可運作範圍。Turrigiano 等人的研究展示了 synaptic scaling:神經元可以依照長期活動,整體調高或調低多個突觸。它不主要回答「哪個刺激值得記住」,而是避免 Hebbian 學習把網路推到飽和或完全沉默。
  5. 結構與系統層級的學習:dendritic spine 的形成與消除、突觸重組、發育期的 pruning,以及 hippocampus–cortex 間的記憶鞏固,處理的是更長時間尺度的表徵重組。這些不是單一 synapse 的更新公式,而是讓網路本身改變容量、路徑與記憶分布的機制。

用一句話總結:Hebbian/STDP 負責「一起活動的連線怎麼改」;dopamine 與 eligibility trace 負責「哪些活動值得因結果而被保留」;小腦誤差訊號負責「動作要往哪個方向校正」;homeostatic plasticity 負責「整個網路不要失控」;結構與系統可塑性負責「長期記憶如何重組」。

這裡的「方向」要特別拆開來看。eligibility trace 只是在突觸上留下「這個連線曾經參與」的資格標記;它本身不決定突觸要變強還是變弱。真正提供方向的,是 instructive/neuromodulatory signal 與局部細胞狀態的組合:在某些條件下促進 LTP,在另一些條件下促進 LTD。換句話說,方向性學習最少需要三樣東西:局部活動留下的資格、能區分好壞或誤差的訊號、以及把訊號對準正確突觸的機制三因子學習的研究也強調,neuromodulator 不只是決定「要不要學」,還可能影響突觸改變的方向。

這也說明 NGRAD、feedback alignment、predictive coding 和 dendritic learning 在這張地圖中的位置:它們比較像是對「跨區域 credit assignment 如何可能」的網路級或演算法級假說,不是已被證明取代上述基本可塑性機制的四套生物學規則。真實神經迴路很可能是「局部 Hebbian-like plasticity + 神經調節 + 時間痕跡 + 穩態控制」的組合,而不是一個單一、全腦共用的 BP 替代品。

所以本文的結論不是「大腦不用 BP」,而是「大腦未被證明使用 textbook BP 的精確實作」。Backpropagation 提供的是一個解決 credit assignment 的計算原理;NGRAD、feedback alignment、predictive coding 和 dendritic learning,則是嘗試在不同生物限制下,實現功能上相近的學習效果。它們可能近似 BP,也可能只在部分任務與條件下近似;哪一種最接近真實大腦,仍是待驗證的科學問題。

因此,這篇 2020 論文的價值不在於替神經科學宣布一個答案,而在於改變問題的形狀。它告訴我們不要只尋找一條「把梯度倒著送」的線路;要尋找的是一套能讓局部活動差異承擔 credit assignment 的迴路。

這對 AI 也有一個很實際的含義。

如果目標只是把離線資料集上的 loss 降到最低,對主流可微分、離線監督式模型而言,標準 backprop 仍然是工程上最成熟的工具之一。沒有必要因為大腦不一定這樣學習,就把現有訓練堆疊全部推倒。

但如果目標是讓 agent 在低功耗硬體上持續學習、在沒有完整 label 的世界裡適應、在感覺與行動的閉迴路裡更新,那麼「error 要怎麼到達每個局部突觸」會重新變成第一級問題。NGRAD、樹突 compartment 和 predictive coding 的價值,正是在這裡:它們把 global gradient 拆成一組更接近物理系統的局部訊號。

大腦未必在跑 backprop。目前只能說,大腦若要解決與 backprop 類似的 credit-assignment 問題,可能採用不同於 textbook backprop 的硬體妥協;哪一種機制更接近真實大腦,仍未確定。對 AI 工程師而言,評估一個 biologically plausible learning model 時,可以先問三件事:error 或 target 在哪裡表示?單一突觸實際讀得到哪些局部訊號?forward 與 feedback 的同步、對稱性和 phase 假設是什麼?能回答這三題,才知道它是在描述神經科學,還是在真正解決 credit assignment。

References