간행물

생화학분자생물학회입니다.


우수논문소개

GDBr: DNA 이중나선 손상 수선 메커니즘 분석을 위한 유전체 특징 해독 프로그램

  • 작성자

    김준 (충남대학교)
  • 작성일자

    2026-07-23
  • 조회수

    447

GDBr: DNA 이중나선 손상 수선 메커니즘 분석을 위한 유전체 특징 해독 프로그램

GDBr: genomic signature interpretation tool for DNA double-strand break repair mechanisms

Nucleic Acids Research, 2025, 53, gkae1295

 

김준 : 충남대학교 (junkim@cnu.ac.kr) 

 

연구 배경

 

DNA는 여러 요인으로 인해 지속적으로 손상 받고 수선되며 다양한 변이를 남긴다. 시퀀싱(sequencing) 기법은 이러한 DNA의 염기서열을 해독함으로써 한 사람 안에서 나타나는 개체 내 체세포 변이(somatic variant), 사람과 사람 사이에서 나타나는 집단 내 변이, 종과 종 사이에서 나타나는 종 간 변이에 대한 이해를 높인 바 있다. 다만 기존에 널리 쓰이던 시퀀싱 기법은 일반적으로 150염기쌍 내외의 짧은 DNA 분자에 담긴 정보만을 해독할 수 있어, 크기가 큰 변이인 구조 변이(structural variant)를 검출하기에는 적합하지 않다는 것이 밝혀져있었다(2).

롱리드 시퀀싱(long-read sequencing) 기법은 이처럼 분석이 어려운 지역, 유전체 내 암흑 지대(genomic dark matter)를 밝히기 위한 가장 고도화된 시퀀싱 기법의 일종이다(3). 이는 기존 시퀀싱 대비 100배 이상 긴 DNA 서열 정보를 한 번에 해독할 수 있다는 장점을 지니고 있으며, 이를 기반으로 한 개인맞춤형 유전체 지도 작성 연구(personalized genome project)가 활발하게 진행되고 있다. 이를 통해 생산된 롱리드 시퀀싱 데이터 기반 고품질 유전체 지도 정보는 집단에 존재하는 유전체 서열 정보, 나아가 변이 정보를 온전하게 검출하고 해독할 수 있는 기반을 마련해주고 있다.

본 연구는 이러한 롱리드 시퀀싱 기반 유전체 지도를 활용하여 변이를 해독하기 위한 프로그램 개발 내용을 담고 있다. 구체적으로는 당시 가장 규모가 큰 롱리드 시퀀싱 데이터였던 인간 범유전체 참조 컨소시엄(Human Pangenome Reference Consortium)의 47명 유래 94개 유전체 지도를 활용하여(4), 다양한 변이를 검출하고 검출된 변이에 대해 그 형성 메커니즘을 추정하는 전산학적 방법론(computational methodology) 내용에 대한 기술을 담고 있다. 이는 유전체 내 변이를 검출하는 것을 넘어, 그 변이가 형성된 과정을 추론할 수 있다는 점에서 중요성과 의의를 인정 받은 것으로 추정된다. 동시에, 현재까지도 비용 문제 등으로 인해 데이터 생산과 분석이 제한되고 있는 롱리드 시퀀싱 데이터를 적극적으로 활용할 수 있는 방법론이라는 점 또한 중요하게 고려됐을 것으로 보인다.

 

연구 결과

 

본 연구의 핵심 가설은 변이 인근에 존재하는 서열의 특징을 활용하여, 해당 변이가 형성되는 데 관여했을 수선 기전(repair mechanism)을 추론할 수 있다는 것이다. 이는 몇몇 DNA 손상 수선 기전이 그 작동 과정에서 유전체에 명확한 특징을 남긴다는 사실을 전제로 한다. DNA 이중 나선이 모두 손상되고 난 뒤 작동하는 상동성 기반의 수선 기전(homology-directed repair mechanism)은 여러 종류가 있는데, 이중 TMEJ (polymerase theta-mediated end joining)와 SSA (single-strand annealing)라는 두 가지 기전은 각각 미세상동서열(microhomology)과 충분히 긴 상동서열을 활용해 결손(deletion) 변이 등을 형성할 수 있다는 것이 잘 알려져있기 때문이다(5).

 

 


 

그림 1. 상동성 기반 변이 형성 과정 및 GDBr 기반 변이 형성 추론 과정 요약. 

출처: https://academic.oup.com/nar/article/53/2/gkae1295/7951712

 

거꾸로 말하면, 서로 다른 유전체를 비교하여 결손 변이를 명확하게 정의할 수 있다면, 그리고 해당 결손 변이 인근에 미세상동서열 또는 상동서열이 존재한다는 것을 확인할 수 있다면, 그 변이가 형성되는 데에 TMEJ 또는 SSA 중 어떤 것이 관여했는지를 확인할 수 있는 셈이다. 다만 이는 몇 가지 제한된 조건에 해당하는 변이에만 적용할 수 있다는 점을 주의해야 한다. 반복서열 지역에 발생한 변이의 경우 이것이 단순 반복서열인지 아니면 미세상동서열 또는 상동서열인지 구별하는 것이 불가능하기에 위와 같은 분류 체계를 활용할 수 없다는 것이 한계점 중 하나이다. 또한 TMEJ 또는 SSA의 기전 특성상 DNA 서열이 일부 잘려나간 결손의 경우에만 제대로 된 분류가 가능하며, NHEJ (non-homologous end joining)이 작동해 발생했을 가능성이 있는 5염기쌍 내외의 변이의 경우 발생 가능한 기전이 다수 존재해 분류가 불가능하다는 한계를 지닌다.

본 연구는 이러한 TMEJ와 SSA의 특성을 활용하여 인구 집단에 존재하는 변이를 분류할 수 있는 방법론을 개발한 결과를 담고 있다. 구체적으로는 롱리드 시퀀싱 기반 유전체 지도 94개를 참조 유전체 지도(reference genome)와 비교하여 변이를 검출한다. 이후 각 변이에 대해 명확한 위치를 보정하고 반복서열 및 크기를 기반으로 분류 가능한 변이만을 남긴다. 전처리 전 확보했던 전체 변이는 총 1천만 개에 달했으나, 전처리를 통해 남긴 10염기쌍 이상의 비-반복서열 변이는 총 47만 개 수준이었다. 이중 약 82%는 결손과 삽입 서열로 이루어져있었고, 이중 78%는 실제로 미세상동서열 또는 상동서열을 지니고 있다는 것이 확인되었다. 결손과 삽입 변이 중 대부분이 실제로 상동성 기반의 수선 기전을 통해 형성됐을 가능성을 암시하는 셈이다.

이렇게 확보한 변이는 특징적인 분포를 지니고 있었으며, 우리는 이를 TMEJ와 SSA의 분포로 분리해서 분석하고자 하였다. TMEJ는 기존에 2~18염기쌍 내외의 미세상동서열을 활용한다는 것으로 알려져있었고, SSA는 20~60염기쌍 내외의 상대적으로 긴 상동서열을 활용한다는 것이 알려져있었다. 우리가 확인한 분포에서는 이 둘을 명확하게 분리하는 것이 어렵긴했으나, 약 29염기쌍 인근에서 2개의 분포를 분리하는 것이 가능하다는 것을 확인할 순 있었다. 참고로 속도 또한 개선하여, 일반적인 현대 고성능 서버를 활용할 때 하나의 유전체 지도를 처리하는 데 약 10분, 94개를 전부 처리하는 데에는 약 16시간 정도면 처리가 가능하도록 설계되었다.

 

연구의 의의와 한계

 

본 연구는 집단 내 변이를 대상으로 그 형성 과정을 추론할 수 있다는 측면에서 의의가 높다. 예컨대 환자에서 새롭게 형성된 체세포 변이가 어떤 기전을 통해서 형성됐는지를 확인하여 변이 형성 및 축적 과정에 대한 이해를 높일 수 있으며, 집단 수준에서도 인구 집단이 진화하는 데 기여하는 변이에 대한 해석을 고도화할 수 있다는 점이 장점이다.

다만 한계도 명확하다. 변이 형성에 관여할 수 있는 다양한 기전 중 TMEJ와 SSA만을 대상으로 삼았으며, 다른 기전에 대해서는 분류 체계를 마련하지 못했다는 점이 대표적이다. 현재는 이러한 한계를 극복하기 위해 대규모 집단 데이터를 활용한 변이 분석을 시도하고 있으며, 이를 통해 GDBr을 개선한 신규 방법론을 마련하고자 노력하고 있다.

 

참고문헌

 

1. Ryu, Hyunwoo, et al. "GDBr: genomic signature interpretation tool for DNA double-strand break repair mechanisms." Nucleic Acids Research 53.2 (2025): gkae1295.

2. Joe, Soobok, et al. "Comparison of structural variant callers for massive whole-genome sequence data." BMC genomics 25.1 (2024): 318.

3. Sedlazeck, Fritz J., et al. "Piercing the dark matter: bioinformatics of long-range sequencing and mapping." Nature Reviews Genetics 19.6 (2018): 329-346.

4. Liao, Wen-Wei, et al. "A draft human pangenome reference." Nature 617.7960 (2023): 312-324.

5. Al-Zain, Amr M., and Lorraine S. Symington. "The dark side of homology-directed repair." DNA repair 106 (2021): 103181.