LLM 기반 생체 모델 검증 프레임워크 BELL 공개
생체 모델 구축 시 수동 검증의 비효율성을 극복하기 위해 LLM 기반 자동화 프레임워크 BELL이 개발되었습니다. BELL은 증거 검색, 점수화, 설명 생성을 자동화하여 49.5% 상위 신뢰도, 72.4% 긍정적 추천 결과를 보였습니다.
arXiv 원문 →Section Archive
A focused archive of the stories selected for this section in the current edition, ordered by editorial composition.
생체 모델 구축 시 수동 검증의 비효율성을 극복하기 위해 LLM 기반 자동화 프레임워크 BELL이 개발되었습니다. BELL은 증거 검색, 점수화, 설명 생성을 자동화하여 49.5% 상위 신뢰도, 72.4% 긍정적 추천 결과를 보였습니다.
arXiv 원문 →약물 재창출은 ER+ 유방암을 위한 치료법 발견을 가속화할 수 있으나, 조합 선택에는 여전히 어려움이 따른다. 본 연구에서는 595,122개의 PubMed 초록에서 약물-타겟 관계를 추출하고, 교차 모델 합의 네트워크를 구축하며, 이를 KEGG 에스트로겐 신호 전달 경로에 중첩하여 상호 보완적인 약물 쌍을 열거하는 LLM 기반 네트워크 의학 프레임워크를 개발했다. 후보 조합은 경로 커버리지, LLM 합의, RAG 검증, 교차 방법론 일치성, ClinicalTrials.gov 선례를 통합하는 ComboRank에 의해 순위가 매겨진다. 이 프레임워크는 FDR <= 0.05에서 임상시험 선례가 있는 31개를 포함하여 166개의 유의미한 쌍을 식별했으며, 추출 전략 전반에 걸쳐 393개의 공유 약물-타겟 쌍과 경로 중첩에 의해 추가로 뒷받침되는 11개의 정확한 쌍을 찾아냈다.
arXiv 원문 →희귀 질환은 개별적으로는 드물지만 집단적으로는 널리 퍼져 있다. 이들의 주요 임상적 과제는 치료가 아닌 진단에 있다. 임상 관리 초기 단계에서는 관찰된 표현형이 희귀 질환과 관련이 있는지 여부가 불분명한 경우가 많다. 조기 진단을 위해 머신러닝 방법을 활용하여 이러한 표현형과 희귀 질환 사이의 잠재적 연관성을 발굴하는 것은 진단적 딜레마를 완화할 수 있는 실행 가능한 전략을 제공한다. 본 연구에서 우리는 머신러닝이 관찰된 표현형과 제외된 표현형을 특징(feature)으로 사용하여 희귀 질환 사례를 대조군으로부터 효과적으로 판별할 수 있음을 입증하였다. 그중 Random Forest 모델이 일정 수준의 일반화 성능과 함께 가장 우수한 분류 성능을 달성하였다. 특징 선택 결과에 대한 추가 분석을 바탕으로, 우리는 특이성(specificity)과 발생 횟수(occurrence count)라는 두 요소가 희귀 질환 판별을 위한 표현형 선택에 중요하며, 특징 구축 과정에서 관찰된 표현형과 제외된 표현형 모두에 대등한 중요성을 부여해야 한다는 결론을 내렸다.
arXiv 원문 →세포 간의 기계적 상호작용은 발달 및 재생 과정 중 조직 형태 형성의 핵심 요소이다. 세포 모양의 현미경 이미지로부터 세포 간 응력을 추론하는 계산 방법은 실험적 섭동 기술을 대체할 수 있는 비침습적 대안을 제공하지만, 기존의 모든 접근 방식은 명시적인 물리 모델에 의존한다. 본 연구에서는 기저 물리 모델을 가정하지 않고 조직의 기하학적 구조로부터 세포 간 기계적 응력을 직접 추론하는 Graph Neural Network (GNN)인 StressNET을 제시한다. StressNET을 학습시키고 벤치마킹하기 위해 합성 데이터셋을 생성하였으며, zebrafish neuromasts 및 Xenopus embryos의 실험적 응력 대리 지표와 비교했을 때 StressNET의 예측이 최첨단(state-of-the-art) 상관관계를 달성함을 입증하였다. 네트워크의 잠재 공간(latent space) 분석 결과, StressNET은 국소적인 세포 간 상호작용을 넘어 기계적 응력 분포의 전역적 조직 원리를 학습함을 보여준다. StressNET은 오픈 소스로 제공되며, in vivo 데이터에 맞춰 미세 조정(fine-tuning)할 수 있는 사전 학습된 모델을 제공하여 다양한 생물학적 시스템의 조직 역학 연구에 폭넓게 적용 가능한 도구이다.
arXiv 원문 →MicroRNAs (miRNAs)는 구조화된 전구체로부터 가공된 후 Argonaute 단백질에 결합하여 표적 mRNAs를 억제한다. 그러나 전구체 맥락에서 성숙한 miRNAs를 해독할 수 있는 일반화된 계산 프레임워크는 여전히 제한적이며, 이는 종 간 주석 달기(cross-species annotation)와 합리적인 인공 miRNA 설계를 모두 제약하고 있다. 본 연구에서는 miRNA/miRNA* 이중 가닥을 정의하는 네 가지 경계를 해독하는 생성 인식 RNA 언어 프레임워크인 miRstring을 제시한다. 414개 종에 걸친 77,708개의 miRNA 전구체로 학습된 miRstring은 family- 및 species-held-out 평가에서 기존 방법보다 뛰어난 성능을 보였으며, 성숙한 miRNAs의 첫 번째 뉴클레오타이드를 정확하게 식별한다. 중요한 점은, 이 모델의 attention mechanism이 endonuclease에 의해 절단되는 miRNA/miRNA* 경계 부위를 강조한다는 것이며, 이는 모델이 생물학적으로 의미 있는 특징을 포착하고 있음을 나타낸다. 나아가, miRstring을 사용하여 인공 miRNAs를 위한 최적의 pre-miRNA 스캐폴드를 설계하였으며, 표적 mRNAs를 억제하는 데 있어 그 효능을 검증하였다. 종합적으로 miRstring은 종 간 성숙-miRNA 주석 달기부터 예측 설계에 이르는 확장 가능한 경로를 구축하여, 인공지능 기반의 miRNA 엔지니어링을 가능하게 하고 계산 능력을 확장한다.
arXiv 원문 →최근 유전체 편집 기술의 발전으로 박테리아의 유전적 조작이 용이해졌으며, 이를 통해 병원성 강화나 항생제 내성 확대와 같이 위험할 수 있는 새로운 형질을 부여할 수 있게 되었다. 인위적으로 변형된 박테리아를 탐지하는 능력은 잠재적인 생물학적 위협을 식별하는 데 매우 중요하다. 그러나 박테리아 간의 수평적 유전자 전달을 통한 자연적인 유전자 교환으로 인해 악의적인 유전체 편집을 추적하는 것은 어려울 수 있다. 본 연구에서는 천연 유전체와 시뮬레이션된 편집 유전체를 포함한 광범위한 데이터셋을 큐레이션한 후, 자연어 처리 방식을 활용하여 편집된 유전체를 탐지하였다. 우리는 문장의 단어를 분석하는 대신 유전체의 유전자군을 모델링하는 transformer-encoder 기반의 머신러닝 분류기를 개발하였다. 데이터셋을 통해 모델을 학습시킨 결과, 부자연스러운 맥락으로 인해 박테리아 유전체에 인위적으로 추가된 유전자를 정확하게 탐지할 수 있었다. 우리의 접근 방식은 특정 마커 유전자에 의존하지 않고 설계된 서열을 식별할 수 있는 확장 가능한 방법을 제공하며, 생물 보안, 농업, GMO 규제 등 다양한 분야에 적용될 잠재력이 있다.
arXiv 원문 →