「高表達不等於作用大,且高表達基因確實往往是『功能的末端執行者』;而低表達基因則多半扮演『上游的指揮開關』。」
那傳統生物統計如何解釋?(由 Gemini 回答)
這是轉錄組學與生物統計學中極為經典的「**統計顯著性(Statistical Significance)與生物重要性(Biological Relevance)的悖論**」。
傳統生物統計(如 DESeq2、edgeR、limma)的數學模型,本質上是建立在「訊號強度(Signal-to-Noise Ratio, SNR)」**與**「線型效應(Linear Effect Size)」的假設之上。面對「低表達是上游開關、高表達是末端執行者」的生物學事實,傳統生物統計從數學機制與模型設計上有以下幾層解釋與局限:
---
### 1. 抽樣噪訊與統計檢定力的天然限制(Statistical Power & Noise)
RNA-seq 的定序計數(Counts)通常採用負二項分佈(Negative Binomial Distribution)進行建模:
$$\text{Var}(Y) = \mu + \alpha \mu^2$$
* $\mu$:基因的平均表達量
* $\alpha$:離散參數(Dispersion)
**統計上的困境:**
* **低表達基因(上游開關):** 當平均表達量 $\mu \to 0$ 時,泊松抽樣噪訊(Poisson Shot Noise)佔據主導地位,相對變異度(Coefficient of Variation)極高。這會導致 Wald Test 或 Likelihood Ratio Test 中的標準差偏大,**直接壓低 $Z$ 分數或 $t$ 分數,使得 $p$-value 不顯著**。
* **傳統統計的處置:** 為了防止多重檢定(Multiple Testing)的 False Discovery Rate (FDR) 被無意義的低表達噪訊稀釋,傳統統計工具會採用**獨立過濾(Independent Filtering)**,在檢定前直接將低表達基因剔除。這意味著**許多低表達的轉錄因子(TF)或受體,在傳統統計第一關就被當作「噪訊」扔掉了**。
---
### 2. 廣義線性模型(GLM)與非線性級聯放大的錯位
傳統微分表達分析(DEG)的核心是廣義線性模型:
$$\log(\mu_{ij}) = \beta_0 + \beta_1 \cdot \text{Condition}_j$$
該模型隱含了一個假設:**對數表達量的變化量($\beta_1$,即 Log Fold Change, LFC)直接對應於生物學效應的大小**。
**生物學與統計的錯位:**
* **級聯放大(Signal Cascade):** 生物系統是非線性催化系統。上游轉錄因子或激酶只需要微量的 mRNA 波動($\Delta \text{RNA}$ 極小),透過蛋白質翻譯與酶催化放大,就能啟動下游數百個結構蛋白或代謝酶的大量轉錄($\Delta \text{RNA}$ 極大)。
* **傳統統計的盲點:** 傳統 GLM 只能量化「轉錄本濃度的改變量」,無法量化「該分子在調控網路中的**控制權重(Control Coefficient)**」。因此,統計上最顯著(LFC 大、$p$-value 小)的基因,往往都是幾何級數增加的末端執行者(如熱休克蛋白、結構蛋白、代謝酶)。
---
### 3. 傳統生物統計為了修正此問題所作的努力
為了減輕「低表達基因因估計不準而產生高偽陽性或高偽陰性」的問題,傳統統計學家引入了幾項核心技術:
| 統計修正技術 | 數學/邏輯機制 | 對「上游開關/低表達基因」的影響 |
| --- | --- | --- |
| 經驗貝葉斯方差壓縮<br>
<br>(Empirical Bayes Shrinkage) | 利用全基因組平均表達量與方差的趨勢(Mean-Variance Relationship),將個別基因的離散度向整體壓縮(`limma-voom`, `DESeq2`)。 | **提高檢定力**:防止低表達基因因單次採樣誤差導致方差被高估,讓穩定微幅變化的上游基因有機會達到顯著。 |
| 對數倍數變化縮減<br>
<br>(LFC Shrinkage, e.g., `apeglm`) | 利用 Prior Distribution 懲罰低表達基因因抽樣波動產生的虛假高 Fold Change(如從 1 變 10 的 10 倍)。 | **抑制偽陽性**:讓真正具備高表達量且穩定的基因排在 DEG 前列,但同時也進一步壓低了低表達基因的 LFC 排序。 |
---
### 4. 統計思維的演進:從「單基因檢定」到「系統/網路推算」
正因為傳統生物統計在單基因層面(Single-gene level)難以克服「高表達 vs 低表達」的權重錯位,現代生物資訊統計學逐漸將重點轉向**系統級別的推算**:
1. **靶基因集整合推算(Regulon-based Target Inference):**
* *代表工具:* VIPER, Decoupler (ULM/MLM), DoRothEA / CollecTRI。
* *統計邏輯:* 不直接去檢定低表達 TF 本身的 mRNA 變化(因為噪訊太高),而是**觀察該 TF 下遊數十個 Known Targets(多為中高表達基因)的集體表達趨勢**。透過統計上游標的基因集的對齊程度,反向推算低表達 TF 的活性(Activity Score)。
2. **網路拓撲中心性(Network Centrality):**
* *代表工具:* WGCNA, Single-cell GRN (SCENIC)。
* *統計邏輯:* 放棄以「表達量」或「微分表達顯著性」為唯一指標,改用**共表達網路中的連通度(Degree / Hubness)**。上游驅動基因(Hub Genes)即使絕對表達量低,但因其與大量下游模組基因保持高度相關性,在統計拓撲上會被識別為核心節點。
No comments:
Post a Comment