15. MLIP와 기하 모델¶
이 장의 질문과 목표¶
Machine-Learned Interatomic Potential, MLIP는 atomic structure에서 energy, force, 때로는 stress를 예측해 비싼 reference calculation을 근사한다. 학습된 potential은 structure relaxation이나 molecular dynamics, MD에서 반복 호출될 수 있다.
이 장의 목표는 electronic structure theory나 개별 모형 구조를 숙달하는 것이 아니다. 다음 인과관계를 이해하는 것이다.
Atomic geometry -> symmetry-aware 표현 -> energy 모형 -> force -> simulation -> downstream 검증
MLIP는 14장의 PDE solver와 다른 문제다. 둘 다 AI4Science에 속하지만 입력, 출력, 사전 지식, reference data, 실패 방식이 다르다.
읽기 수준과 선수지식 확인
미리 알아볼 말¶
- Atom과 chemical species: 원소 종류와 위치가 structure를 구성한다.
- Coordinate, distance, angle: 3D geometry를 표현한다.
- Energy: structure의 상대적 안정성과 dynamics를 결정하는 scalar quantity다.
- Force: atom의 coordinate 변화에 따른 energy 변화와 연결되는 벡터 quantity다.
- Periodic boundary condition: crystal이나 bulk system을 반복 cell로 표현한다.
- 그래프와 메시지 전달: 8장에서 배운 노드, 에지, neighborhood의 개념을 사용한다.
- Invariant와 equivariant: 변환해도 같아야 하는 값과 입력 변환에 맞춰 변해야 하는 값을 구분한다.
Density Functional Theory, DFT의 세부 이론은 필요하지 않다. 이 장에서는 널리 쓰이는 reference electronic-structure calculation의 한 family라는 위치만 알아둔다.
1. 퍼텐셜 에너지 곡면을 근사한다¶
\(N\)개 atom의 species를 \(Z=(Z_1,\dots,Z_N)\), coordinate를 \(R=(r_1,\dots,r_N)\)이라고 하자. Potential energy surface, PES는 structure에 energy를 대응시킨다.
Force는 energy의 coordinate 기울기와 연결된다.
MLIP는 reference calculation으로 얻은 structure-energy-force pair를 사용해 \(E_\theta(Z,R)\)를 학습한다. Force를 energy 기울기로 계산하면 scalar energy와 벡터 force 사이의 일관성을 구조적으로 만들 수 있다.
이 관계는 자동미분이 과학 모델에 사용되는 또 다른 예다. PINN은 coordinate derivative로 PDE residual을 만들었고, MLIP는 predicted energy의 coordinate derivative로 force를 얻는다.
2. 왜 원자간 퍼텐셜을 학습하는가¶
높은 정확도의 electronic-structure calculation은 system size와 필요한 샘플링 양에 따라 많은 계산비용이 들 수 있다. 반면 MD는 아주 많은 time step에서 force를 반복 평가해야 한다. MLIP는 reference method의 PES를 근사해 더 큰 system이나 더 긴 trajectory를 탐색하려 한다.
여기서 빠르다는 주장은 조건을 포함해야 한다.
- 어떤 reference method와 비교하는가
- 같은 hardware와 precision 조건인가
- Neighbor construction과 communication 비용을 포함했는가
- 훈련 데이터 생성과 모형 훈련 비용을 포함했는가
- 원하는 downstream accuracy와 stability를 유지하는가
MLIP는 reference method보다 빠를 수 있지만 모형을 학습한 분포 안에서 reference method를 근사하는 것이다. 자연의 exact potential을 직접 얻는 것은 아니다.
3. 입력 구조가 만족해야 하는 대칭성¶
고립된 system의 total energy는 coordinate system을 평행 이동하거나 회전해도 변하지 않아야 한다. 같은 species의 atom index를 바꾸어도 물리적 structure는 같다.
- Translation invariance: 모든 atom을 같은 벡터만큼 옮겨도 energy가 같다.
- Rotation invariance: structure 전체를 회전해도 energy가 같다.
- Permutation invariance: 동일 species atom의 순서를 바꾸어도 total energy가 같다.
Force는 벡터이므로 rotation에 대해 invariant가 아니라 equivariant해야 한다. Structure를 rotation \(Q\)로 돌리면 force도 같은 방식으로 회전해야 한다.
이 성질은 데이터 증강만으로 근사할 수도 있지만 descriptor나 모형 구조에 직접 넣으면 data efficiency와 consistency에 도움이 될 수 있다. 그래도 equivariance가 prediction accuracy나 OOD generalization을 자동으로 보장하지는 않는다.
4. 국소 에너지 분해와 컷오프 반지름¶
많은 MLIP는 total energy를 atomic contribution의 합으로 표현한다.
\(\mathcal{N}_i\)는 cutoff radius 안의 local 환경이다. 이 표현은 total energy의 extensive 성질과 variable-size system을 다루기 쉽게 한다. 또한 neighbor list를 사용하면 계산량을 제어할 수 있다.
하지만 실제 interaction이 모두 짧은 거리는 아니다. Electrostatics, dispersion, charge transfer 같은 long-range effect를 local cutoff만으로 충분히 표현하지 못할 수 있다. Message-passing 층을 여러 번 쌓아 수용 영역을 늘릴 수 있지만 계산량과 oversmoothing 문제가 생길 수 있다. Explicit long-range term, charge 모형, global interaction을 결합하는 이유다.
Locality는 편리한 engineering choice이자 physical assumption이다. 대상 system과 property에 맞는지 검증해야 한다.
더 깊이 살펴보기: 표현, 데이터 구성, 시뮬레이션 검증
5. 서술자 기반 모형에서 학습된 표현으로¶
초기 neural potential의 대표 사례인 Behler-Parrinello 모형은 각 atom 주변의 geometry를 symmetry function으로 표현하고 atomic 신경망으로 energy contribution을 예측한다. Descriptor가 translation, rotation, permutation 성질을 반영하도록 설계된다.
SchNet은 interatomic distance에 대한 continuous-filter convolution을 사용해 atomic 표현을 학습한다. 이는 사람이 정한 고정 descriptor에서 end-to-end learned 표현으로 이동한 중요한 예다.
입문 단계의 핵심 구분은 다음과 같다.
- Handcrafted descriptor는 어떤 geometric quantity를 모형에 줄지 사람이 설계한다.
- Invariant 메시지 전달은 distance 같은 invariant 특성을 사용해 표현을 학습한다.
- Equivariant 모형은 scalar뿐 아니라 벡터나 higher-order geometric 특성이 rotation에 맞춰 변하도록 층을 구성한다.
이 셋은 단순한 성능 순위가 아니다. Data 양, chemical diversity, 목표 accuracy, 추론 cost, software ecosystem에 따라 선택이 달라진다.
6. 등변 메시지 전달¶
3D equivariant GNN은 relative position의 방향 정보를 보존하면서 message를 전달한다. 특성은 rotation에 변하지 않는 scalar만 있을 수도 있고, rotation에 맞춰 변하는 벡터나 텐서 표현을 포함할 수도 있다.
NequIP은 E(3)-equivariant convolution과 메시지 전달을 이용하는 대표적인 모형 구조다. MACE는 higher-order message와 equivariant 표현을 효율적으로 구성하는 계열이다. 모델별 수학과 구현 차이는 후속 심화 주제로 남긴다.
이름보다 다음 질문이 중요하다.
- Energy 출력이 rotation과 permutation에 invariant한가
- Force는 energy 기울기로 얻는가, 별도 head로 예측하는가
- 어떤 interaction order와 angular information을 표현하는가
- Cutoff와 message-passing depth가 effective 수용 영역을 어떻게 정하는가
- Computational precision과 neighbor count가 비용에 어떤 영향을 주는가
7. 에너지, 힘, 응력을 함께 학습하기¶
훈련 손실은 energy와 force 오차의 weighted sum으로 구성할 수 있다.
한 structure에는 energy 레이블 하나와 atom 수에 비례한 force component가 있다. 단순히 모든 component를 합하면 force term이 손실을 지배할 수 있다. Per-atom normalization, unit, 가중치, dataset composition을 함께 봐야 한다.
Force 레이블은 PES의 local slope 정보를 제공하므로 data efficiency에 도움이 될 수 있다. 하지만 reference force도 convergence error를 가지며, energy와 force를 함께 맞추는 optimization이 자동으로 쉽지는 않다. Energy, force, stress 평가 지표를 별도로 보고 downstream 결과까지 확인한다.
8. 기준 데이터가 모형의 적용 범위를 정한다¶
훈련 데이터에는 모형이 simulation 중 만날 relevant configuration이 포함되어야 한다. Equilibrium structure만 학습하면 높은 temperature, defect, transition 상태, collision처럼 equilibrium에서 먼 configuration에서 실패할 수 있다.
Data 설계 시 다음 축을 기록한다.
- Chemical species와 composition
- Crystal phase, molecular conformation, defect
- Volume, strain, temperature, pressure
- Energy와 force의 범위
- Reference method, basis, pseudopotential, convergence criterion
- 샘플링 method와 중복 제거 방식
Random structure split은 거의 같은 trajectory의 이웃 frame을 훈련과 테스트에 나눌 수 있다. 이 경우 테스트 error가 낮아도 새로운 trajectory나 phase에 일반화한다고 볼 수 없다. Trajectory, composition, prototype, thermodynamic condition에 따른 split을 사용 목적에 맞게 설계한다.
9. 능동 학습과 불확실성의 위치¶
처음부터 모든 가능한 configuration을 reference calculation으로 만들 수는 없다. Active learning은 현재 모형이 불확실하거나 committee 예측이 크게 엇갈리는 configuration을 선택해 reference 레이블을 추가하는 반복 workflow다.
- 초기 dataset으로 모형 또는 ensemble을 학습한다.
- 모형으로 structure 탐색이나 MD를 수행한다.
- 불확실하거나 새로운 configuration을 선택한다.
- Reference calculation을 수행해 dataset에 추가한다.
- 모형을 다시 학습하고 검증한다.
Uncertainty score가 실제 error와 항상 일치하는 것은 아니다. Selection 편향과 blind spot이 남을 수 있으므로 independent 테스트 데이터, physical sanity check, failure recovery가 필요하다. Active learning은 자동으로 안전한 coverage를 보장하는 버튼이 아니라 dataset construction strategy다.
10. 후속 시뮬레이션으로 검증하기¶
Energy MAE나 force RMSE는 필요하지만 충분하지 않다. 작은 개별 prediction error도 MD에서 반복되며 trajectory와 thermodynamic property에 영향을 줄 수 있다.
평가를 다음 층으로 확장한다.
- Point prediction: energy, force, stress error와 error 분포
- Structure optimization: relaxed geometry, lattice 매개변수, relative stability
- Response와 dynamics: equation of state, phonon, barrier, vibrational quantity
- MD behavior: energy drift, temperature 분포, trajectory stability
- Thermodynamic 또는 kinetic 목표량: 연구 질문에 맞는 observable
- OOD stress 테스트: 새로운 phase, composition, defect, temperature, pressure
- Efficiency: atom-step당 시간, memory, scaling, reference data cost
모든 downstream property를 한 연구에서 다 측정할 필요는 없다. 실제 사용 목적에 직접 연결된 테스트를 미리 정하는 것이 중요하다.
11. MLIP와 다른 모델을 구분하기¶
- Molecular property predictor는 한 structure의 레이블을 예측할 수 있지만 MD에 필요한 conservative force field를 제공하지 않을 수 있다.
- Generative 모형은 새로운 structure 후보를 만들 수 있지만 그 energy와 dynamics를 정확히 평가하는 potential은 아닐 수 있다.
- Neural Operator는 function-to-function mapping을 학습하며 atomic PES를 학습하는 MLIP와 input-output 구조가 다르다.
- Classical force field는 parameterized physical functional form을 사용하고, MLIP는 더 유연한 learned 표현을 사용한다. 둘 모두 적용 범위와 검증이 필요하다.
현대 workflow는 생성모델로 후보를 만들고 MLIP로 탐색한 뒤 높은 정확도의 calculation과 experiment로 검증할 수 있다. 각 component의 역할과 오차를 분리해야 한다.
핵심으로 가져갈 내용¶
- MLIP는 atomic structure에서 reference energy와 force를 근사하는 learned potential이다.
- Scalar energy는 rigid transformation과 동일 atom permutation에 invariant해야 하고, 벡터 force는 rotation에 equivariant해야 한다.
- Force를 energy 기울기로 계산하면 energy-force consistency를 구조적으로 만들 수 있다.
- Local cutoff, 훈련 분포, reference method가 적용 범위를 제한한다.
- Pointwise error뿐 아니라 실제 relaxation, dynamics, 물성, OOD condition으로 검증해야 한다.
이름과 위치만 알아둘 내용¶
- Behler-Parrinello symmetry function
- SchNet과 continuous-filter convolution
- NequIP과 E(3)-equivariant 메시지 전달
- MACE와 higher-order equivariant 표현
- Long-range electrostatics와 charge-aware potential
- Delta learning과 multi-fidelity data
- Active learning과 committee uncertainty
자주 하는 혼동과 한계
자주 생기는 혼동과 한계¶
DFT data로 학습하면 DFT와 항상 같은가¶
아니다. Finite dataset과 모형 capacity 때문에 approximation error가 있고, 훈련 분포 밖에서는 오차가 커질 수 있다. Reference DFT 자체도 선택한 approximation과 numerical setting에 의존한다.
Force error가 작으면 MD가 안정적인가¶
보장되지 않는다. 드문 configuration의 큰 error, non-conservative force, integration setting이 trajectory를 망칠 수 있다. Long rollout과 목표 observable을 검증해야 한다.
Equivariance가 OOD generalization을 해결하는가¶
아니다. 좌표계 변환에 대한 올바른 behavior를 보장하거나 유도하지만, 보지 못한 chemistry, phase, thermodynamic condition의 정확성을 보장하지 않는다.
큰 범용 모형이면 모든 simulation에 바로 쓸 수 있는가¶
아니다. 대상 system, composition, charge 상태, pressure와 temperature 범위에 대한 검증이 필요하다. Fine-tuning을 하더라도 catastrophic failure region을 별도로 탐색해야 한다.
낮은 테스트 MAE면 scientific conclusion이 신뢰할 만한가¶
아니다. Relative phase ordering, barrier, phonon, MD stability처럼 실제 conclusion을 결정하는 downstream quantity를 확인해야 한다.
AI4Science 종합 연결¶
자동미분 + 복합 손실 -> PINNConvolution + function 표현 -> Neural OperatorGNN + 3D geometry + equivariance -> MLIPGenerative 모형 -> 새로운 과학 후보의 분포RL -> sequential control과 experiment selection기준 모델 + split + OOD + 전체 비용 -> 모든 접근의 과학적 평가
PINN, Neural Operator, MLIP는 하나의 발전 계보가 아니다. 서로 다른 입력, 출력, 사전 지식, 학습 신호를 1장의 공통 분석축으로 비교한다.
스스로 확인하기¶
- Atomic structure를 회전할 때 energy와 force는 각각 invariant와 equivariant 중 어떤 성질을 가져야 하는가?
- 작은 energy 또는 force 테스트 error와 안정적인 MD trajectory가 같은 평가가 아닌 이유는 무엇인가?
- Local cutoff가 계산에는 유리하지만 long-range interaction에는 한계가 될 수 있는 이유는 무엇인가?
- MLIP와 molecule property predictor, structure generative 모형의 input-output 역할은 어떻게 다른가?
원전과 공식 읽을거리¶
- Behler and Parrinello, Generalized Neural-Network Representation of High-Dimensional Potential-Energy Surfaces, Physical Review Letters 2007: https://doi.org/10.1103/PhysRevLett.98.146401
- Schütt et al., SchNet: A continuous-filter convolutional neural network for modeling quantum interactions, NeurIPS 2017: https://papers.nips.cc/paper/6700-schnet-a-continuous-filter-convolutional-neural-network-for-modeling-quantum-interactions
- Batzner et al., E(3)-equivariant graph neural networks for data-efficient and accurate interatomic potentials, Nature Communications 2022: https://doi.org/10.1038/s41467-022-29939-5
- Batatia et al., MACE: Higher Order Equivariant Message Passing Neural Networks for Fast and Accurate Force Fields, NeurIPS 2022: https://openreview.net/forum?id=YPpSngE-ZU
- Deringer, Caro, and Csányi, Machine Learning Interatomic Potentials as Emerging Tools for Materials Science, Advanced Materials 2019: https://doi.org/10.1002/adma.201902765
원전을 읽을 때 benchmark 순위보다 reference data의 chemistry와 configuration 범위, energy-force loss, split, downstream validation, 계산비용을 먼저 확인한다.