원글2026.09.19
노화 연구용 소형 AI, Cell에 공개
인실리코 메디신이 9월 17일 Cell에 노화 생물학 문제로 AI를 평가하는 공개 벤치마크와, 이 분야에 맞춰 훈련한 소형 언어모델 5종을 발표했습니다. 회사는 매개변수 90억 개짜리 모델이 시험한 범용 대형 모델들보다 높은 종합 점수를 받았다고 밝혔습니다.
공개된 세 가지
논문 제목은 ‘노화 생물학 AI를 위한 공개 벤치마크와 언어모델’이고, 알렉스 자보론코프 인실리코 최고경영자가 이끌었습니다. 액체신경망 모델을 만드는 리퀴드 AI, 벅 노화연구소, 하버드 의대, 브리검 여성병원이 함께 참여했습니다. 보도자료에 따르면 공개된 것은 세 가지입니다.
첫째는 평가용 문제집인 롱제비티벤치입니다. 임상 자료, 유전체, 후성유전체(유전자에 붙는 화학적 표식), 전사체, 단백체 다섯 영역에 걸쳐 과제 17개를 담았고, 알파시그널에 따르면 질문은 모두 2만 5,457개입니다. 미국 국민건강영양조사(NHANES) 검사치로 나이를 비교하는 과제, 조직별 유전자 발현 자료(GTEx)로 연령대를 가르는 과제, 혈액 단백질 자료로 나이를 비교하는 과제 등이 들어 있습니다.
둘째는 매개변수 6억~90억 개 크기의 소형 모델 5종입니다. 리퀴드 AI의 LFM2와 알리바바의 큐웬(Qwen) 계열을 바탕으로, 노화 관련 임상·다중오믹스 자료를 추가로 학습시켰습니다. 유레카알럿에 실린 자료에 따르면 오픈AI·구글·앤트로픽·xAI·딥시크·문샷AI의 대형 모델 18개를 포함해 모두 26개 AI 시스템을 비교했고, 이 가운데 L-Qwen3.5-9B가 종합 1위를 차지했습니다.
셋째는 롱제비티 클로라는 연구 에이전트입니다. 공개 저장소에 따르면 노화 시계 233개로 생물학적 나이를 계산하고, 약 1,000개 화합물의 수명 관련 근거를 점수로 매기며, MIT 라이선스로 누구나 쓸 수 있습니다. 논문에서 이 에이전트는 노화의 14가지 특징을 기준으로 표적을 평가해 후보 유전자 328개를 추천했고, 기준 표적 목록과 비교한 통계적 농축도는 5.6배로 보고됐습니다. 후보 가운데 KDM1A는 앞선 다른 연구에서 예쁜꼬마선충의 수명을 늘린 것으로 보고된 유전자입니다.
작은 모델이 앞선 이유
노화 연구의 문제는 대부분 숫자표를 읽는 일입니다. 수천 개 유전자의 발현량이나 수백 가지 혈액 단백질 수치를 보고 나이나 상태를 추정해야 하는데, 범용 대형 모델은 주로 인터넷 문장으로 훈련돼 이런 형식의 자료를 상대적으로 적게 접합니다. 반면 소형 모델은 크기는 작아도 바로 그 형식의 자료를 집중적으로 학습했습니다. 특정 분야 자료로 모델을 다시 훈련하는 이런 방식을 미세조정이라고 부릅니다.
크기가 작다는 점은 연구 현장에서 실용적인 의미도 있습니다. 알파시그널에 따르면 26억 개 매개변수 모델은 약 5.2GB의 메모리로 돌아갑니다. 연구실 컴퓨터 한 대에서 돌릴 수 있는 크기라, 환자 자료를 외부 서버로 보내지 않고 기관 안에서 분석할 수 있습니다.
문제를 낸 쪽과 푼 쪽이 같습니다
이번 결과는 벤치마크를 설계한 팀이 1위 모델도 만들었다는 점을 감안하고 읽어야 합니다. 문제의 형식과 학습 자료가 같은 곳에서 나왔다면 소형 모델이 유리해질 수 있고, 범용 모델이 분야 밖 문제에서 보이는 추론 능력과는 따로 봐야 합니다. 인실리코는 홍콩 증시에 상장된 영리 기업이고, 공개된 보도자료에는 한계나 이해관계에 대한 언급이 따로 없습니다.
후보 유전자 328개는 계산으로 나온 목록이며, 5.6배라는 농축도도 기준 표적 목록과 비교한 통계 값입니다. 실험으로 확인된 사례로 제시된 것은 선충에서 이미 보고된 KDM1A 하나이고, 포유류나 사람에서의 검증 결과는 이번 발표에 들어 있지 않습니다.
이 발표에서 눈여겨볼 대목은 평가 기준을 누가 정하느냐는 문제입니다. 지난 8일 소개한 폐섬유증 신약 후보 렌토서팁도 이 회사의 AI가 표적을 골랐는데, 이번에는 AI를 채점하는 문제집까지 같은 회사가 내놓았습니다. 문제집이 공개돼 있어 다른 연구진이 자기 모델로 점수를 다시 낼 수 있고, 제3의 연구진이 같은 순위를 재현하는지가 다음 확인할 지점입니다. 범용 모델의 성능 경쟁과 별개로, 바이오 분야에서는 검사·오믹스 자료를 학습에 쓸 수 있는 조직이 얼마나 좋은 소형 모델을 만드느냐가 결과를 가를 가능성이 큽니다.