주간복기라이브테크경제국제롱제비티
MYOSU
구독
구독멤버십

묘수의 관점테크경제국제롱제비티

주간 복기라이브 자료AI 대화록팟캐스트

투자의 묘수

투자유형검사글로벌 메가캡

묘수의 관점 · 투자 매거진

묘수의 관점

혼란스러운 세상의 변화를 이해하고 싶습니다. 매일의 라이브, 매주의 복기, 매일의 매거진.

콘텐츠주간 복기라이브팟캐스트
투자의 묘수투자유형검사글로벌 메가캡
멤버멤버십로그인
정책개인정보처리방침이용약관

MYOSU VIEW

본 콘텐츠는 정보 제공·교육 목적이며, 특정 종목의 매매를 권유하는 투자 자문이 아닙니다. 투자 판단과 그 결과의 책임은 이용자 본인에게 있습니다.

© 2026 묘수의 관점. All rights reserved.

핵심은 무료로, 전문은 멤버에게.

← 롱제비티

원글2026.09.10

딥마인드, DNA 한 글자 변이 90억 개를 미리 계산해 놓았습니다

글쓴이오레놀 대덕2026.09.10

구글 딥마인드가 9월 8일 사람 유전체에서 나올 수 있는 한 글자짜리 DNA 변이 90억 개 전부에 대해 분자 수준의 영향을 미리 계산한 자료를 내놓았습니다. 연구용으로는 무료로 열려 있습니다.

1970년대 미국 국립암연구소의 DNA 염기서열 판독 작업. 한 구간을 읽는 데도 여러 날이 걸리던 시절입니다. 이미지: Linda Bartlett / Wikimedia Commons (Public domain)
1970년대 미국 국립암연구소의 DNA 염기서열 판독 작업. 한 구간을 읽는 데도 여러 날이 걸리던 시절입니다. 이미지: Linda Bartlett / Wikimedia Commons (Public domain)

무엇을 공개했나

자료의 이름은 알파지놈 아틀라스입니다. 딥마인드는 발표문에서 사람과 생쥐의 수백 종 세포 유형에 대해 변이별 예측값을 담았고, 여기에 변이 하나당 숫자 하나를 매기는 AVI 점수와 예측의 근거가 된 특징값, DNA 서열 모티프 2,500여 종을 함께 넣었다고 밝혔습니다. 전체 용량은 1페타바이트 안팎으로, 같은 회사가 내놓은 단백질 구조 데이터베이스보다 30배 넘게 큽니다.

공개 조건은 용도에 따라 갈립니다. 웹사이트와 API, 깃허브를 통한 접근은 비상업 연구용이고, 상업용은 구글 클라우드를 통해 제공할 예정입니다. AVI 점수를 통으로 받아 가는 경우는 상업과 비상업 모두에 허용됩니다. 발표에는 브로드연구소와 영국 엑서터대학, 스토워스의학연구소 연구진이 함께 이름을 올렸고, 이 자료로 기존 방법보다 비코딩 구간의 연관을 22% 더 찾았다는 적용 사례가 소개됐습니다.

연구용 슈퍼컴퓨터. 유전체 전체를 미리 계산해 표로 저장하는 방식은 이런 규모의 연산 자원을 전제로 합니다. 이미지: OLCF / Wikimedia Commons (CC BY 2.0)
연구용 슈퍼컴퓨터. 유전체 전체를 미리 계산해 표로 저장하는 방식은 이런 규모의 연산 자원을 전제로 합니다. 이미지: OLCF / Wikimedia Commons (CC BY 2.0)

미리 계산해 둔다는 것

밑바탕이 된 모델은 알파지놈입니다. DNA 서열을 넣으면 그 구간이 세포 안에서 어떻게 읽힐지를 내놓는 종류입니다. 지금까지는 궁금한 변이가 생길 때마다 모델을 한 번씩 돌려야 했고, 그때마다 계산 시간과 비용이 들었습니다. 아틀라스는 그 계산을 유전체 전체에 대해 미리 다 돌려 표로 저장해 둔 것입니다. 연구자는 모델을 돌리는 대신 표에서 변이 번호를 찾아보면 됩니다. AVI 점수는 알파지놈의 예측과, 단백질 서열을 다루는 알파미센스의 예측을 합쳤습니다.

라이브 자료 사진

두 구간을 한 점수로 묶은 데에는 이유가 있습니다. 사람 유전체에서 단백질 설계도가 들어 있는 구간은 2%에 불과합니다. 나머지 98%는 어떤 유전자를 언제 얼마나 켜고 끌지를 정하는 조절 구간인데, 키나 혈압처럼 여러 유전자가 조금씩 거드는 형질과 연관된 변이는 대부분 여기에 놓여 있습니다. 단백질 구조가 바뀌는 변이는 어느 아미노산이 바뀌었는지를 보고 해석할 수 있지만, 조절 구간의 변이는 그런 실마리가 없어 지금까지 읽기 어려웠습니다.

유전체 분석에 쓰이는 서열 분석 장비. 예측값은 결국 이런 장비와 세포 실험으로 확인해야 합니다. 이미지: Scotted400 / Wikimedia Commons (CC BY 3.0)
유전체 분석에 쓰이는 서열 분석 장비. 예측값은 결국 이런 장비와 세포 실험으로 확인해야 합니다. 이미지: Scotted400 / Wikimedia Commons (CC BY 3.0)

어디까지 믿을 수 있나

회사가 먼저 선을 그어 두었습니다. 딥마인드는 아틀라스와 AVI가 연구 도구이며 임상 진단의 근거 사슬 일부로만 쓰일 수 있다고 적었고, 알파지놈이 임상 용도로 검증되거나 승인된 적이 없다는 안내를 함께 달았습니다.

기술적인 한계도 남아 있습니다. 평가는 참조 서열 위의 한 글자 치환을 중심으로 이뤄졌는데, 실제 사람의 유전체에는 글자가 끼어들거나 빠진 변이와 큰 덩어리가 통째로 자리를 옮기거나 뒤집힌 변이, 살면서 쌓인 체세포 돌연변이가 섞여 있습니다. 10만 염기쌍 넘게 떨어진 조절 구간이 유전자에 미치는 영향을 잡아내는 것도 아직 과제로 남아 있습니다.

제3자 검증도 의미 있는 숫자를 남겼습니다. 한 연구진은 조직 기증 유전체 데이터베이스(GTEx)에 들어 있는 953명, 50개 조직의 자료로 알파지놈이 개인별 유전자 발현을 얼마나 맞히는지 재어 봤습니다. 전작인 엔포머보다 상관계수 중앙값이 0.07 높았지만, 개인 단위 데이터로 직접 학습시킨 고전적인 기계학습 모델에는 여전히 미치지 못했습니다. 연구진은 계산 부담 때문에 유전자 300개만 무작위로 골라 평가했고, 그 탓에 표본이 치우쳤을 가능성을 스스로 밝혀 두었습니다.

순서를 매기는 도구가 늘었습니다

노화와 질병 연구에서 병목은 변이를 찾는 단계에서 이미 찾은 변이 가운데 무엇을 먼저 볼지 정하는 단계로 옮겨왔습니다. 유전체 전체를 읽는 비용은 오랫동안 내려왔고, 그 결과 조절 구간에서 나온 해석되지 않은 변이가 연구진마다 쌓여 있습니다. 아틀라스는 그 더미에 순서를 매기는 자료이고, 무료로 풀렸다는 점에서 작은 연구실도 같은 기준을 쓸 수 있게 됐습니다.

다만 순위표가 실험을 대신하지는 않습니다. AVI가 높게 매긴 변이가 세포와 동물에서 실제로 무엇을 하는지는 여전히 실험으로 확인해야 하고, 그 단계의 시간과 비용은 이번 발표로 줄어들지 않았습니다. 국내 연구진이 이 자료를 가져다 쓸 때도 한 가지 확인이 먼저입니다. 모델이 학습한 자료가 어느 집단의 유전체에 치우쳐 있는지에 따라 예측이 잘 듣는 구간이 달라지기 때문에, 한국인에게 흔한 변이가 그 구간에 들어 있는지부터 따져 보는 작업이 필요합니다.

글 오레놀 대덕

이 글은 롱제비티와 바이오 분야의 공개된 연구·보도 자료를 바탕으로 AI가 정리해 작성한 정보성 기사입니다. 일반 독자의 이해를 돕기 위한 것으로, 의학적 진단이나 치료를 위한 조언이 아닙니다. 소개된 연구는 대부분 초기 단계이며, 개인의 건강과 관련한 결정은 반드시 의사 등 전문가와 상의하시기 바랍니다. 사실을 정확히 전하려 노력했으나 오류가 있을 수 있으므로, 확인이 필요한 내용은 본문의 원 출처 링크를 참고해 주십시오.

다음 읽기

  • 2026.09.11알존 알츠하이머 알약, 3상 혈액 지표 분석 논문 공개→
  • 2026.09.09늦게 받은 비만치료제로 생쥐 수명이 12% 늘었습니다→
롱제비티 전체 보기 →