Vibe Coding Specificity Foundation Models
Reddy, S. T.
트랜스포머 아키텍처의 수학적 특성을 활용해 6개 분자 인식 도메인에 공통 적용 가능한 기반 모델을 개발했다.
분자 인식(특이성) 예측은 도메인별 실험적 스크리닝이나 전용 계산 도구에 의존하며, 결합 양식 전반에 걸쳐 일반화하기 어렵다.
트랜스포머의 소프트맥스 어텐션이 분자 결합의 볼츠만 분포와 수학적으로 동일하다는 점에 착안해, 이중 시퀀스 인코더, 대칭 대조 학습, 학습된 물리적 온도를 갖는 단일 아키텍처를 설계했다. 이 아키텍처를 전사인자-DNA, 효소-기질, 펩타이드-MHC, CRISPR gRNA-오프타겟 DNA, 마이크로RNA-mRNA, 소분자-단백질 등 6개 도메인에 각각 적용했다.
6개 도메인 모두 동일한 아키텍처로 학습해, 512개 후보군에서의 교차 모달 검색(R@1)이 27.7%에서 98.0%로 높은 성능을 보였다. 특히 mir-SFM은 기존 씨드 매칭 도구가 찾지 못하는 약 80%의 유효한 상호작용을 포함해 98.0%의 R@1을 달성했으며, crisprSFM은 CRISPR 오프타겟 예측 정밀도를 기존 33.2%에서 94.0%로 향상시켰다. 이는 도메인별 구조 정보 없이 시퀀스만으로 높은 예측 정확도를 달성할 수 있음을 보여주는 중요한 기여이다.