자연계 단백질 접힘(Protein Folds)의 비합리적인 중복성
·2026.06.03 12:47
생성형 생체 분자 모델의 확장을 위해 시퀀스 데이터를 늘려도 단백질 접힘의 중복성으로 인해 구조적 다양성이 충분히 확보되지 않는 문제를 다룬다.
AlphaFold3와 같은 생성형 모델의 발전으로 약물 및 항체 설계 등 생체 분자 모델링 분야가 급격히 성장하고 있습니다. 이러한 모델을 개선하는 핵심 방법론은 모델, 컴퓨팅, 그리고 **데이터의 규모를 확장(Scaling)**하는 것입니다.
특히 방대한 단백질 시퀀스 데이터를 구조 예측 모델을 통해 3D 구조 데이터로 변환하여 차세대 모델의 학습 데이터로 활용하는 방식이 주목받고 있습니다. 이는 시퀀스 규모를 구조 규모로 전환하여 데이터의 가치를 높이는 전략입니다.
그러나 연구 결과, 자연계의 단백질 시퀀스는 매우 방대함에도 불구하고 그들이 형성하는 단백질 접힘(Fold)은 시퀀스 수에 비해 매우 중복적이라는 한계가 발견되었습니다. 단순히 더 많은 시퀀스를 접힘(folding)시키는 것만으로는 모델 학습에 필요한 구조적 다양성을 충분히 확보하기 어렵습니다.
결과적으로 시퀀스 다양성과 구조 다양성 사이의 이러한 **불일치(Mismatch)**는 효소 설계와 같은 고도화된 생성형 모델을 구축할 때 해결해야 할 핵심적인 데이터 엔지니어링 과제입니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.