화학 생성·기반 모델을 위한 고차 분자 문법
고차 문법 표현 HGR은 분자 그래프를 고리와 모티프의 계층을 담은 조합 복합체로 올린 뒤, 복원 가능한 생성 규칙열로 직렬화한다. 따라서 일반 시퀀스 모델이 명시적 고차 위상을 다룰 수 있다. 저자들은 약 118만 분자의 RingDiv와 고리 다양성 지수를 제안하고, 다섯 생성 벤치마크의 FCD 1위와 일곱 MoleculeNet 분류 과제의 평균 AUC 향상을 보고했다. 다만 유효성은 화학적으로 일관된 규칙, 접속면 일치, 완전한 도출에 달려 있으며 합성 가능성까지 뜻하지 않는다.
기술 배경과 문제 정의
분자는 원자와 결합의 그래프이지만 고리계, 융합 골격, 반복 모티프는 여러 원자가 함께 만드는 관계다. SMILES 계열 문자열은 시퀀스 모델에 편리하나 고리 닫힘과 가지를 간접적으로 표현한다. 일반 그래프 모델은 쌍별 결합을 직접 다루며, 고차 구조를 명시적으로 추가하면 계산과 복호화가 어려워질 수 있다. HGR의 목표는 고차 위상을 보존하면서 일반 시퀀스 모델이 학습할 수 있는 가역적 표현을 만드는 것이다.
평가 데이터의 편향도 중요하다. 단순 고리가 많은 데이터에서 좋은 평균 점수를 받아도 스피로 고리, 가교 고리, 중간 크기 고리의 생성 능력은 알 수 없다. 저자들은 약 118만 분자의 RingDiv, 위상 균형을 고려한 RingDiv300k, 고리 다양성 지수 RDI를 제시한다. 다만 데이터 선별은 고리 수 1~10개, 분자량 100~900 Da에 제한하고 거대 고리를 제외한다. 따라서 결과를 거대 고리나 전체 화학 공간으로 그대로 확대할 수 없다.
핵심 구조와 기술 원리
먼저 분자 그래프를 조합 복합체로 끌어올린다. 원자 셀을 잎으로 두고, 자주 등장하는 인접 부분 그래프를 병합해 모티프 계층을 만든다. 셀의 차수는 수축 나무의 높이로 정한다. 논문은 MIG와 RSG라는 두 가지 구성법을 설명한다. 복합체는 고차 포함 관계를 기록하고 원래 그래프는 실제 결합 정보를 계속 제공한다. 셀들은 서로 포함되거나 겹치지 않아 자식을 부모보다 먼저 방문할 수 있다. 파서는 각 셀을 생성 규칙으로 바꾼다. 규칙 오른쪽에는 국소 그래프와 순서가 있는 자식 위치가 있고, 외부 결합은 순서가 있는 앵커 접속면으로 기록된다. 구조와 접속면이 맞는 규칙은 분자 사이에 재사용되며 분자는 규칙 번호의 열이 된다. 결합 정보를 버리는 압축이 아니라 공유 규칙에 정보를 옮기는 방식이다. 허용 가능한 형제 셀 순서가 달라도 해당 규칙열의 역도출은 원래 복합체와 분자 그래프를 복원한다.
복호화는 시작 기호와 미해결 위치 스택에서 출발한다. 현재 접속면에 맞는 규칙만 선택하고 모든 규칙을 사용한 뒤 스택이 비어야 완료한다. 정확한 복원 명제는 이미 파싱된 복합체와 대응 그래프에 적용된다. 임의의 토큰열에 대한 보증은 아니다. 논문의 구성적 유효성은 규칙이 원자가 일치하는 분자에서 왔고, 접속면이 맞으며, 도출이 끝났다는 조건에 의존한다. 이것은 안정성, 합성 가능성, 독성, 실제 약효를 보증하지 않는다. HGR-VAE는 규칙열 생성에, HGR-LDF는 잠재 공간 표본 추출에, HGR-FM은 사전학습 표현의 전이에 쓰인다. 신경망 내부의 명시적 고차 계산을 줄일 수 있지만 모티프 채굴, 규칙 사전, 허용 마스크, 복호화의 시간과 메모리는 전체 비용에 포함해야 한다. 새로운 화학 영역에서는 규칙 어휘가 부족할 수도 있다.
실전 평가와 적용
생성 비교는 QM9, ZINC250k, MOSES, GuacaMol, RingDiv300k에서 이루어진다. 저자들은 다섯 데이터 모두에서 가장 좋은 FCD와 문법 제약 생성의 100% 유효성을 보고한다. FCD는 특징 공간에서 생성 분포와 시험 분포의 거리를 재며 개별 분자의 약효가 아니다. 유일성, 신규성, 물성, 골격, 위상 지표도 함께 봐야 한다. 유효성 이외의 여러 지표는 유효한 생성물에 대해서만 계산되므로 탈락률을 함께 제시해야 한다.
전이 평가는 BBBP, Tox21, ToxCast, SIDER, ClinTox, HIV, BACE의 일곱 MoleculeNet 분류 과제를 골격 기준 8:1:1 분할로 수행한다. 프로빙은 인코더를 고정하고 예측 머리만 학습하며, 전체 미세조정은 둘 다 갱신한다. 저자들이 보고한 최강 비교법 대비 평균 AUC 상승은 각각 8.3점과 3.3점이다. 이는 지정된 과제와 절차의 평균으로, 모든 과제의 동일한 개선이나 실제 신약 개발 성공률 향상을 뜻하지 않는다.
산업 영향과 향후 과제
모델이 규칙을 선택하고 문법이 접속을 검사하는 분업은 생성 과정을 감사하기 쉽게 한다. RingDiv는 드문 고리 구조의 포괄 범위를 독립된 평가 항목으로 만든다. 그러나 원본 데이터의 편향, 거대 고리 제외, 입체화학과 삼차원 구조, 합성 경로 및 실험 활성은 여전히 열린 문제다. 동일한 예산의 비교, 미지 골격의 실패율, 전 과정 계산 비용, 실험 검증이 있어야 벤치마크 우위가 실용적인 분자 설계 능력으로 이어지는지 판단할 수 있다. 이 글은 논문의 보고 결과를 분석하며 독립 재현 실험을 제시하지 않는다.
Sources
FAQ
HGR은 어떤 정보로 분자를 복원하는가?
규칙의 국소 그래프, 순서가 있는 자식 위치와 앵커 접속면을 저장하고 역도출로 복합체와 대응 분자 그래프를 복원한다.
100% 유효성의 조건은 무엇인가?
원자가 일치하는 분자에서 얻은 규칙, 맞는 접속면, 완료된 도출을 조건으로 하며 합성 가능성은 보증하지 않는다.