출처: https://www.nature.com/articles/s41467-024-49457-w

PROBLEM STATEMENT
"colocalization" 즉, 두 gene의 RNA들이 세포 안에서 서로 가까이 위치하는 경향이 있는가?
1. PP test
Proximal Pair test를 통해 한 cell 안에서 gene A와 B의 transcript pair가 거리 d 이내에 있는 경우가 우연히 기대되는 것보다 많은지 확인한다. 단, 단순히 거리 d 이내에 있는 경우의 수를 세는 것이 아니라, 그 cell 자체의 spatial density를 null background에 반영해 비교한다. 이는 cell마다 크기도 다르고, RNA density도 다르고, transcript 수 자체도 다르기 때문이다.
예. d = 4 라고 해보자. Gene A transcript가 3개, Gene B transcript가 2개라면 가능한 A-B pair는 3*2 = 6개이다. 그 6개 중 실제 거리가 4보다 작은 pair가 예를 들어 5개라면, 5/6이나 가까이 있는 게 그냥 그 cell에서 RNA들이 전반적으로 빽빽해서 생긴 현상은 아닐까? 하고 물어야 한다. 그래서 InSTAnT는 그 cell 안의 모든 transcript pair들의 거리 distribution을 background로 사용한다. 그리고 특정 gene pair가 보이는 proximity가 이 background보다 과도한지를 Binomial test로 검정한다.
2. d는 spatial scale
기준 거리 d는 biological interpretation에도 영향을 준다. 작은 d를 선택할 것인지 큰 d를 선택할 것인지에 따라 보고자 하는 관계의 해상도가 달라진다. 따라서 InSTAnT의 질문은 엄밀히 말하자면, "A와 B가 colocalized인가?" 라기 보다는 "거리 scale d에서 A와 B가 colocalized인가?" 라고 보는 게 더 정확하다.
3. CPB test
PP test는 cell 하나하나에 대해 수행한다. 결과는 아래와 같을 것이다.
A-B pair
Cell 1 significant
Cell 2 significant
Cell 3 not significant
Cell 4 significant
Cell 5 not significant
...
그렇다면 다음 질문은 "A와 B가 충분히 많은 cell에서 반복적으로 proximal한가?"일 것이다. 이에 대한 답을 찾을 수 있는 게 Conditional Poisson Binomial test이다.
그냥 '몇 % cell에서 유의했는지' 확인하는 게 부정확한 이유는, cell마다 PP test에서 significant pair가 나올 기본 확률이 다르기 때문이다. cell 1은 transcript가 엄청 많고, cell 2는 transcript가 엄청 적고, cell 3는 특정 gene이 highly expressed 되어 있다면 각 cell에서 우연히 proximal pair이 생길 확률이 동일하지 않을 것이다.
그래서 각 cell을 Xc = A-B가 그 cell에서 PP significant하다면 1, 그렇지 않다면 0으로 놓고,
각 Xc가 서로 다른 probability를 가진 Bernoulli variable이라고 본다.
그 합 X = sum Xc는 Poisson Binomial distribution을 따르게 되고, CPB test는 이를 사용해서 "이 pair가 여러 cell에서 반복적으로 proximal한 것이 우연 이상인가?"를 검정한다.
4. 어디서 colocalize?
A-B가 colocalized한다고 끝내는 게 아니라, 그 가까운 transcript들이 주로 Nucleus, Perinuclear, Cytosol, Cell periphery 중 어디에서 발견되는지도 annotation한다.
5. Differential colocalization
PP-positive cell들이 특정 cell type, tissue region, phenotype, experimental condition에 과도하게 몰리는지 검정한다.
- cell-type-specific colocalization
- A나 B 자체가 그 cell type에서 많이 발현돼서 proximity가 많아진 경우
- A와 B의 개별 expression만으로는 설명할 수 없는데, 그 relationship 자체가 cell-type-specific한 경우
6. Spatial Modulation
cell-level spatial relationship 뿐만 아니라, tissue-level sptial location도 같이 본다.
각 cell에서 gene pair가 PP-significant한지 여부를 표시한 다음, proximal-pair cell들이 tissue에서 spatially clustered되는지를 probabilistic model로 평가한다.
7. Gene Module
A-B, A-C, B-C가 모두 colocalize하다면 하나의 functional module일 수 있지 않을까?
RESULT
U20S MERFISH에서 수백 개의 d-colocalized pair를 찾았다. 또한 d-colocalized pair 중에는 RNA-RNA interaction 가능성이 있는 pair, 같은 functional pathway의 gene, nuclear speckle처럼 같은 subcellular domain에 localization되는 pair, ECM/local translation 관련 module 등이 있었다.
즉 이 논문의 큰 biological claim은: RNA-RNA spatial proximity 자체가 gene functional relationship에 대한 새로운 정보를 제공할 수 있다는 것!