- 데이터에서 육종 정보를 찾는 GWAS 기술
-
- 등록일 2026-07-30
![]()
데이터에서 육종 정보를 찾는 GWAS 기술
![]()
씨더스, 경남 RISE와 함께 배우는 GWAS 데이터분석 교육
디지털육종 시대에는 유전체 데이터를 확보하는 것만으로는 충분하지 않습니다.
수많은 유전변이 가운데 실제 작물의 형질과 관련된 정보를 찾아내고, 이를 품종 개발과 우수 개체 선발에 활용하는 과정이 더욱 중요해지고 있습니다.
씨더스는 부산대학교 경남 RISE 사업의 지원을 받아 디지털육종 데이터분석 교육을 운영하고 있습니다.
1회차 교육에서 NGS 데이터를 통해 유전변이를 확보하는 과정을 다뤘다면, 2회차 교육에서는 확보한 변이가 실제 형질과 어떤 관계를 가지는지를 분석하는 전장유전체 연관분석(GWAS) 을 중심으로 교육을 진행했습니다.
이번 과정은 GWAS의 기본 개념부터 토마토 데이터를 활용한 실습, 그리고 유의한 SNP를 분자마커 후보로 발전시키는 과정까지 단계적으로 구성되었습니다.
GWAS, 유전체 데이터 속에서 형질과 연결되는 변이를 찾다
NGS 분석을 수행하면 VCF 파일 안에는 수많은 SNP와 InDel 정보가 생성됩니다.
하지만 변이가 많다는 사실만으로는 어떤 변이가 과실 크기나 병 저항성, 개화 시기와 같은 형질에 영향을 주는지 알 수 없습니다.
이때 활용되는 분석 방법이 GWAS(Genome-Wide Association Study, 전장유전체 연관분석) 입니다.
GWAS는 다양한 유전자원의 유전형 데이터와 표현형 데이터를 함께 분석해 특정 형질과 통계적으로 연관성이 높은 유전체 위치를 찾는 방법입니다.
예를 들어 토마토 품종마다 과실 크기나 씨방 수가 다르다면, 각 품종의 SNP 정보와 실제 측정된 형질 데이터를 비교하여 특정 SNP가 반복적으로 같은 형질과 함께 나타나는지를 분석합니다.
이렇게 발견된 유전변이는 형질 연관 분자마커 개발, 우수 개체 선발, 후보 유전자 탐색 등 디지털육종의 다양한 단계에서 활용됩니다.
![]()
신뢰도 높은 GWAS를 위한 데이터는 무엇이 필요할까?
정확한 GWAS 결과를 얻기 위해서는 단순히 많은 SNP를 확보하는 것만으로는 부족합니다.
교육에서는 분석에 필요한 핵심 요소로 유전형 데이터, 표현형 데이터, 충분한 유전자원, 그리고 적절한 통계 모델을 소개했습니다.
또한 같은 작물이라도 유전자원 간 혈연관계나 집단구조가 존재하기 때문에 이를 보정하지 않으면 실제와 관계없는 SNP가 의미 있는 결과처럼 나타나는 위양성(False Positive) 이 발생할 수 있다는 점도 함께 설명했습니다.
이를 이해하기 위해 GLM, MLM, MLMM뿐 아니라 FarmCPU, BLINK 등 다양한 GWAS 분석 모델의 특징을 비교하며, 집단구조와 개체 간 유전적 유사도를 어떻게 보정하느냐에 따라 결과의 신뢰도가 달라질 수 있음을 학습했습니다.
토마토 데이터를 활용한 GWAS 실습
이론 교육 이후에는 공개된 토마토 다양성 패널 데이터를 활용한 실습이 진행되었습니다.
실습에서는 166개의 토마토 유전자원 가운데 약 5,000개의 SNP를 선별해 분석을 수행했습니다.
분석 대상 형질은 토마토의 크기와 모양에 영향을 주는 씨방 수(Locule Number) 로 선정했으며, 수강생들은 실제 데이터를 활용해 GWAS 전 과정을 직접 경험했습니다.
교육에서는 R과 RStudio 환경에서 GAPIT 패키지를 활용해 다음과 같은 순서로 분석을 진행했습니다.
유전형·표현형 데이터 준비 → VCF 파일 변환 → GWAS 모델 실행 → 결과 시각화 → 유의 SNP 선발
단순히 분석 결과를 확인하는 것이 아니라 데이터 입력부터 결과 해석까지 전체 과정을 이해하는 데 초점을 맞췄습니다.
Manhattan Plot과 QQ Plot은 어떻게 읽을까?
GWAS 분석이 완료되면 가장 먼저 확인하는 결과가 Manhattan Plot과 QQ Plot입니다.
Manhattan Plot은 염색체 전체에서 형질과 연관성이 높은 SNP를 시각적으로 보여주는 그래프입니다.
그래프에서 높게 나타나는 지점일수록 해당 형질과 관련될 가능성이 높은 후보 SNP를 의미합니다.
반면 QQ Plot은 분석 모델이 집단구조와 혈연관계를 적절하게 보정했는지를 확인하는 그래프입니다.
대부분의 점이 기준선 주변에 분포하고 일부 SNP만 크게 벗어난다면, 분석 과정에서 오류는 잘 통제되면서 형질과 강하게 연관된 후보 SNP가 탐색된 것으로 해석할 수 있습니다.
교육에서는 PCA 결과와 Kinship Matrix도 함께 확인하며 유전자원 간 관계가 GWAS 결과에 어떤 영향을 미치는지 살펴보았습니다.
![]()
![]()
GWAS 결과를 실제 분자마커 개발까지 연결하다
이번 교육의 가장 큰 특징은 GWAS 분석으로 끝나지 않았다는 점입니다.
수강생들은 여러 분석 모델에서 도출된 결과를 비교해 유의한 SNP를 선발하고, 토마토 Genome Browser를 활용해 해당 SNP 주변의 후보 유전자를 확인했습니다.
이후에는 Flanking Sequence를 추출하고 Primer-BLAST와 Primer3를 이용해 프라이머를 설계하는 과정까지 실습했습니다.
이 과정을 통해 GWAS 결과가 연구 데이터에 머무르는 것이 아니라 실제 육종 현장에서 활용되는 분자마커 개발 기술로 이어지는 전체 흐름을 이해할 수 있었습니다.
형질 연관 SNP 탐색 → 후보 유전자 확인 → 주변 서열 확보 → 프라이머 설계 → 분자마커 개발
데이터 분석과 육종 현장을 연결하는 씨더스
GWAS는 단순한 통계 분석 기법이 아닙니다. 궁극적인 목적은 작물의 형질을 이해하고, 보다 정확한 육종 의사결정을 지원하는 것입니다.
이번 교육을 통해 수강생들은 토마토 유전체 데이터를 직접 분석하고, 유의한 SNP를 선발해 분자마커 개발 가능성까지 확인하며 디지털육종의 실제 활용 과정을 경험했습니다.
씨더스는 앞으로도 NGS, GWAS, QTL Mapping, Genomic Selection, 표현체 분석 등 디지털육종의 핵심 기술을 현장 중심의 교육으로 전달하며, 유전체와 표현형 데이터를 실제 품종 개발에 활용할 수 있는 전문 인재 양성에 기여하겠습니다.
데이터를 분석하는 능력은 곧 더 나은 품종을 만드는 경쟁력입니다.
씨더스는 연구 현장과 산업 현장을 연결하는 실무 중심 교육을 통해 디지털육종 생태계의 성장과 데이터 기반 인재 양성에 함께하겠습니다.
DATA IS REAL
씨더스는 데이터와 AI로 더 건강한 먹거리를 제안하는 기업입니다.