콘텐츠로 이동

13. 과학 학습 문제의 구성

이 장의 질문과 목표

AI4Science는 특정 모형 구조의 이름이 아니다. 과학 질문, 관측과 simulation data, 알려진 법칙, 수치해석, 불확실성, 계산비용을 함께 고려해 학습 문제를 구성하는 영역이다.

이 장의 목표는 과학 분야를 모두 다루는 것이 아니다. 앞에서 배운 입력, 출력, 표현, 손실, 기준 모델, generalization의 언어로 과학 문제를 다시 기술하는 것이다. 학습자는 새 방법을 만났을 때 먼저 다음을 물어야 한다.

어떤 과학적 양을 어떤 조건에서 예측하며, 알려진 구조는 어디에 들어가고, 무엇과 비교해 유효성을 판단하는가?

읽기 수준과 선수지식 확인

미리 알아볼 말

계산법보다 각 항목이 문제 정의에서 어떤 역할을 하는지 알아보는 것이 우선이다.

  • Unit과 dimension: 물리량의 의미와 식의 일관성을 확인한다.
  • Coordinate와 reference frame: 표현이 이동이나 회전에 따라 어떻게 변하는지 정한다.
  • Initial condition과 boundary condition: differential equation의 해를 특정하는 조건이다.
  • Conservation law와 symmetry: 가능한 solution과 모형 behavior를 제약한다.
  • Numerical solver: 방정식을 근사적으로 계산하는 기존 방법이며 중요한 기준 모델이다.

1. 먼저 과학 질문을 고정한다

분자에 AI를 적용한다PDE를 딥러닝으로 푼다는 아직 충분한 문제 정의가 아니다. 최소한 다음 항목을 명시해야 한다.

  • 분석 단위는 원자 구조, molecule, material, spatial field, time series 중 무엇인가
  • 입력은 측정값, structure, equation coefficient, initial condition 중 무엇인가
  • 출력은 scalar property, class, field, trajectory, structure 중 무엇인가
  • 학습 신호는 실험, simulation, governing equation, self-supervised objective 중 어디에서 오는가
  • 실제 사용 조건은 interpolation, 새로운 조성, 새로운 geometry, 더 긴 시간 중 무엇인가
  • 틀렸을 때 발생하는 과학적 또는 운영상 비용은 무엇인가

같은 모형 구조도 이 정의에 따라 전혀 다른 연구 문제가 된다. 예를 들어 pressure를 고정한 구조들의 energy를 예측하는 문제와 새로운 pressure 영역에서 stable phase를 찾는 문제는 평가 split과 필요한 evidence가 다르다.

2. 정문제와 역문제

Forward problem은 원인이나 조건에서 결과를 계산한다. PDE coefficient와 boundary condition에서 solution field를 구하거나 atomic structure에서 energy를 예측하는 경우가 이에 해당한다.

Inverse problem은 관측된 결과에서 원인, 매개변수, structure를 추정한다. 측정 signal에서 material 매개변수를 추정하거나 목표 물성을 만족하는 structure를 찾는 경우다.

Inverse problem은 여러 원인이 비슷한 관측을 만들 수 있어 해가 하나가 아니거나 작은 노이즈에 민감할 수 있다. 이때 단일 point prediction만 제시하면 가능한 해의 다양성과 uncertainty를 숨길 수 있다. Generative 모형, Bayesian 추론, regularization 등이 연결되는 이유다.

Forward와 inverse는 모형 구조로 구분되는 것이 아니다. 같은 신경망도 입력과 출력, objective를 바꾸면 다른 문제에 사용될 수 있다.

3. 대리 모델은 무엇을 대신하는가

과학 계산은 높은 정확도의 simulation이나 반복 실험 때문에 비쌀 수 있다. Surrogate 모형은 기존 계산이나 실험의 input-output 관계를 근사해 반복 query를 빠르게 처리하려 한다.

Surrogate를 평가할 때는 테스트 error만으로 충분하지 않다.

  • Reference solver나 실험의 비용까지 포함해 훈련 데이터 생성비용을 계산했는가
  • 모형 훈련 비용을 포함했는가
  • 한 번만 예측하는가, 수천 번 반복 추론하는가
  • 원하는 정확도에서 end-to-end wall-clock time이 실제로 줄었는가
  • 근사 오차가 이후 optimization이나 simulation에서 누적되는가

Neural surrogate가 한 번의 추론에서 빠르더라도 data 생성과 훈련 비용을 회수할 만큼 반복 사용하지 않으면 전체 비용상 이점이 없을 수 있다.

더 깊이 살펴보기: 데이터, 과학 지식, 평가 설계

4. 데이터는 어디에서 오는가

과학 학습 data는 크게 observation, experiment, simulation에서 온다.

  • Observation data에는 sensor 노이즈, missing value, selection 편향, 기기별 차이가 있을 수 있다.
  • Experimental data는 protocol, batch, operator, calibration에 따라 달라질 수 있다.
  • Simulation data는 solver, discretization, convergence criterion, force field, exchange-correlation functional 같은 계산 선택을 반영한다.

Simulation 레이블도 자연의 완전한 ground truth가 아니다. 모형은 reference method의 근사를 학습한다. Reference calculation의 설정과 오차 범위를 기록하지 않으면 모형 error와 레이블 error를 구분하기 어렵다.

Data provenance에는 출처뿐 아니라 생성 조건, software version, preprocessing, 제외 기준, split rule이 포함되어야 한다. FAIR 원칙은 data가 찾기 쉽고, 접근 가능하며, 상호운용되고, 재사용 가능하도록 관리하는 공통 출발점이다.

5. 알려진 과학 지식을 어디에 넣는가

과학적 사전 지식은 여러 위치에 들어갈 수 있다.

  • 입력과 표현: dimensionless variable, distance, 그래프, basis function을 사용한다.
  • 모형 구조: locality, symmetry, equivariance, conservation-compatible structure를 반영한다.
  • 손실: equation residual, conservation error, boundary-condition violation을 벌점으로 둔다.
  • 출력 parameterization: positive quantity나 energy 기울기처럼 필요한 관계를 구조적으로 만든다.
  • Data 생성과 augmentation: symmetry-equivalent 샘플이나 알려진 feasible region을 활용한다.
  • Post-processing: 예측을 constraint set에 projection한다.

Physics-informed라는 레이블만으로 어떤 지식이 어떻게 사용되었는지 알 수 없다. 논문에서는 사전 지식의 위치와 강도, 틀릴 수 있는 가정, ablation을 확인해야 한다.

다음 세 표현은 문헌에서 일관되게 쓰이지 않을 수 있지만 문제를 읽는 질문으로는 유용하다.

  • Data-driven: 주된 학습 신호가 input-output data에서 온다.
  • Physics-informed: 방정식이나 물리 관계를 손실 또는 훈련 procedure에 추가한다.
  • Physics-constrained 또는 structure-preserving: 모형 구조나 출력 형식이 특정 성질을 만족하도록 설계된다.

6. 앞에서 배운 모형 구조를 과학 문제에 연결하기

과학 data도 구조를 가진다. 중요한 것은 분야 이름과 모형 구조를 일대일로 외우지 않는 것이다.

  • CNN은 regular grid의 locality와 translation 구조를 활용해 field data나 microscopy 이미지를 처리할 수 있다.
  • Transformer는 long-range interaction, 시퀀스, set, multi-modal data를 표현하는 backbone이 될 수 있다.
  • GNN은 원자, bond, mesh처럼 relation이 중요한 data에 적합한 귀납 편향을 제공한다.
  • VAE, diffusion, Flow Matching은 가능한 structure나 field의 분포를 모델링하고 inverse design 후보를 생성하는 데 연결될 수 있다.
  • RL은 sequential experiment design이나 control에 연결될 수 있지만 모든 scientific ML 문제의 필수 단계는 아니다.

모형 구조는 학습 문제의 한 요소일 뿐이다. 같은 GNN이라도 scalar property regression, force prediction, structure 생성, 정책 모형은 입력, 출력, objective가 다르다.

7. 보간과 분포 외 조건을 구분한다

Random split은 전체 dataset에서 샘플을 무작위로 나누므로 훈련과 테스트의 분포가 매우 비슷할 수 있다. 실제 사용이 새로운 chemical composition, crystal prototype, temperature, geometry, instrument, time regime에 대한 예측이라면 random split 성능은 그 질문에 답하지 못한다.

Split은 deployment question과 맞아야 한다.

  • 새로운 구조를 다룰 것인가
  • 새로운 조성 또는 species를 다룰 것인가
  • 학습 범위를 벗어난 온도, 압력, 시간을 다룰 것인가
  • 새로운 geometry나 boundary condition을 다룰 것인가
  • 다른 lab, instrument, simulator로 옮길 것인가

OOD는 하나의 단일 평가 지표가 아니다. 어떤 축으로 분포가 바뀌는지 명시해야 한다. Extrapolation이 중요하면 해당 축을 의도적으로 분리한 테스트 데이터와 실패 범위를 보고해야 한다.

8. 기준 모델은 무엇이어야 하는가

과학 문제의 기준 모델에는 machine-learning 모형만 두면 부족할 수 있다.

  • 단순 평균, 선형 모형, nearest neighbor
  • 해당 data 구조에 맞는 기존 ML method
  • Reduced-order 모형이나 empirical potential
  • Established numerical solver
  • 단순한 physics-based approximation
  • 추가 계산 없이 사용할 수 있는 기존 database 또는 heuristic

새 모형의 평균 error가 더 작더라도 훈련 cost, memory, robustness, 해석 가능성, 구현 복잡도를 고려하면 기존 방법이 더 적합할 수 있다. 비교 조건에는 hardware, precision, tolerance, preprocessing, data budget을 포함해야 한다.

9. 과학적 타당성은 하나의 테스트 오차가 아니다

과학적 평가는 여러 층으로 나누는 편이 안전하다.

  1. Predictive 평가 지표: MAE, RMSE, classification score 등 직접적인 예측 오차
  2. Constraint check: unit, symmetry, conservation, boundary condition, feasible range
  3. Downstream 검증: relaxation, trajectory, phase behavior, control처럼 실제 사용 과제
  4. Robustness: 노이즈, resolution, seed, OOD condition, adversarial하지 않은 작은 perturbation
  5. Efficiency: data 생성, 훈련, 추론, memory, energy cost
  6. Reproducibility: data provenance, code, hyperparameter, random seed, 환경

평균 error는 드문 치명적 실패를 숨길 수 있다. Error 분포, worst-case region, domain별 subgroup, uncertainty와 error의 관계를 함께 살펴야 한다.

10. 불확실성과 보정

Uncertainty estimate는 모델이 언제 자신 없어 하는지를 나타내려는 시도다. Calibration은 비슷한 confidence를 가진 예측들의 실제 성공률이나 error가 confidence와 맞는지를 묻는다.

Uncertainty는 자동으로 정확하거나 OOD를 탐지하지 않는다. Ensemble, Bayesian approximation, conformal prediction 등 방법마다 가정과 산출물이 다르다. 실제 의사결정에서는 다음을 확인한다.

  • Uncertainty가 어떤 종류의 변동을 표현하는가
  • OOD condition에서 error와 함께 커지는가
  • 새로운 데이터를 선택하는 active learning 기준으로 유용한가
  • 잘못된 확신을 줄이는 calibration 검증이 있는가

이 과정에서는 방법을 구현하지 않고 평가 질문으로만 위치를 알아둔다.

핵심으로 가져갈 내용

  • AI4Science에서는 모형 구조 선택 전에 과학 질문, data source, 사전 지식, deployment condition을 고정한다.
  • Simulation 레이블도 reference method의 가정과 오차를 가진다.
  • 알려진 과학 지식은 표현, 모형 구조, 손실, 출력, data 생성에 서로 다른 방식으로 들어갈 수 있다.
  • Split과 평가 지표는 실제 사용에서 만날 분포 변화와 downstream 목적을 반영해야 한다.
  • ML 기준 모델뿐 아니라 numerical method와 전체 계산비용을 비교해야 한다.

이름과 위치만 알아둘 내용

  • Multi-fidelity learning
  • Active learning과 Bayesian optimization
  • Differentiable simulation
  • Reduced-order modeling
  • Uncertainty quantification과 calibration
  • Causal 추론과 intervention
  • Digital twin
자주 하는 혼동과 한계

자주 생기는 혼동과 한계

물리 법칙을 넣으면 항상 좋아지는가

아니다. 법칙의 적용 범위가 틀리거나 손실 scale이 부적절하면 학습을 방해할 수 있다. 어떤 사전 지식을 어디에 넣었는지와 data-only ablation을 함께 봐야 한다.

Equation residual이 작으면 solution error도 작은가

항상 그렇지 않다. 샘플링 point, optimization, PDE 특성, norm에 따라 작은 residual과 관심 quantity의 작은 error가 일치하지 않을 수 있다. 14장에서 PINN의 핵심 한계로 다시 본다.

Random 테스트 성능이 좋으면 새로운 과학 조건에도 일반화하는가

아니다. Random split은 비슷한 샘플 사이의 interpolation 능력을 주로 측정할 수 있다. 실제 변화 축을 분리한 평가가 필요하다.

빠른 추론이면 전체 workflow도 빨라지는가

아니다. Data 생성, 훈련, 실패 시 재계산, uncertainty 확인까지 포함한 end-to-end 비용을 비교해야 한다.

생성물이 그럴듯하면 발견으로 볼 수 있는가

아니다. Novelty 확인, 물리적 feasibility, 높은 정확도의 재계산, 실험 검증이 필요하다. 생성은 후보 제안 단계일 뿐이다.

앞뒤 챕터와 연결하기

  • 1장: 입력, 목표값, 손실, 평가 지표, 기준 모델의 공통 틀을 과학 문제에 적용한다.
  • 3장: optimization stability와 generalization은 physics 손실이 있어도 사라지지 않는다.
  • 5장부터 8장: data geometry와 귀납 편향이 scientific 표현을 결정한다.
  • 9장부터 11장: 생성모델은 inverse design의 후보 분포를 만들 수 있다.
  • 12장: RL은 sequential control과 experiment selection이라는 별도 branch로 연결된다.
  • 14장: PDE 문제에서 equation과 paired data를 사용하는 두 구성을 비교한다.
  • 15장: atomistic structure의 symmetry와 energy-force 관계를 모형에 넣는다.

스스로 확인하기

  • 과학 문제의 random split 성능과 실제 OOD generalization이 서로 다른 질문인 이유는 무엇인가?
  • 물리 사전 지식은 표현, 모델 구조, 손실에 들어갈 때 각각 어떤 의미를 갖는가?
  • 빠른 모형 추론만으로 전체 scientific workflow의 가속을 주장하기 어려운 이유는 무엇인가?
  • 생성된 과학 후보를 실제 발견으로 받아들이기 전에 어떤 검증 층이 필요한가?

원전과 공식 읽을거리

이 자료들은 AI4Science의 범위와 data stewardship을 보는 출발점이다. 개별 과학 주장에는 해당 분야의 reference method, 실험 protocol, benchmark 원문을 추가로 확인해야 한다.