콘텐츠로 이동

14. PINN과 신경 연산자

이 장의 질문과 목표

Partial Differential Equation, PDE로 정의된 문제에 신경망을 사용하는 방식은 하나가 아니다. 이 장은 자주 함께 언급되지만 학습 대상이 다른 물리 정보 신경망, PINN과 Neural Operator를 구분한다.

  • 표준적인 PINN은 주어진 PDE instance의 solution function을 신경망으로 표현하고 equation residual을 줄인다.
  • Neural Operator는 입력 function에서 출력 function으로 가는 mapping을 여러 instance의 paired data로 학습한다.

목표는 두 방법을 구현하거나 PDE 이론을 숙달하는 것이 아니다. 입력, 출력, 학습 신호, 비용 구조, 검증 질문을 비교할 수 있으면 충분하다.

읽기 수준과 선수지식 확인

미리 알아볼 말

  • PDE: 여러 독립변수에 대한 derivative 관계로 현상을 표현한다.
  • Initial condition, IC: 시간 evolution 문제의 시작 상태를 정한다.
  • Boundary condition, BC: domain 경계에서 solution이 만족해야 하는 조건을 정한다.
  • 자동미분: 신경망 출력의 입력 derivative를 계산한다.
  • Function과 operator: Function은 값에서 값으로, operator는 function에서 function으로 mapping한다고 생각한다.
  • Fourier transform: spatial signal을 frequency component로 표현한다. FNO subsection을 이해하는 데 도움이 되는 선택 배경이다.

5장의 convolution과 Fourier 관련 맥락은 FNO subsection에서 도움이 되지만, 이 장의 핵심인 PINN과 Neural Operator의 학습 대상 차이를 이해하는 데는 필요하지 않다. PDE 자체의 well-posedness, numerical stability, weak solution은 후속 수치해석 학습이 필요한 영역이다.

1. 공통 예제로 문제를 고정하기

Domain \(\Omega\)에서 solution \(u(x)\)가 다음 관계를 만족한다고 하자.

\[ \mathcal{N}[u](x)=f(x), \qquad x\in\Omega \]

\(\mathcal{N}\)은 differential operator이고, \(f\)는 source나 forcing term일 수 있다. Boundary에서는 \(\mathcal{B}[u](x)=g(x)\) 같은 조건을 만족한다.

여기서 서로 다른 두 질문을 만들 수 있다.

  1. \(f\), coefficient, boundary condition이 고정된 이 한 문제의 solution \(u\)를 구하고 싶은가
  2. 서로 다른 \(f\), coefficient, initial condition이 주어질 때마다 solution을 내는 operator \(G:f\mapsto u\)를 학습하고 싶은가

첫 질문은 전형적인 PINN 문제 설정과, 두 번째 질문은 neural operator 문제 설정과 가깝다. 실제 연구에는 여러 변형과 혼합형이 있으므로 이것은 입문용 기준선이다.

2. PINN은 해를 신경망으로 표현한다

PINN은 coordinate \(x\) 또는 \((x,t)\)를 입력으로 받아 solution value를 출력하는 신경망 \(u_\theta(x,t)\)를 둔다. 자동미분으로 필요한 derivative를 계산한 뒤 PDE residual을 만든다.

\[ r_\theta(x,t)=\mathcal{N}[u_\theta](x,t)-f(x,t) \]

대표적인 손실은 여러 항의 합이다.

\[ \mathcal{L}(\theta)= \lambda_r\mathcal{L}_{residual}+ \lambda_b\mathcal{L}_{boundary}+ \lambda_i\mathcal{L}_{initial}+ \lambda_d\mathcal{L}_{data} \]
  • Residual 손실은 domain 내부의 collocation point에서 PDE 위반을 측정한다.
  • Boundary 손실은 boundary condition 위반을 측정한다.
  • Initial 손실은 시작 상태와의 차이를 측정한다.
  • Data 손실은 관측 또는 simulation value가 있을 때 예측과 data의 차이를 측정한다.

모든 문제에 네 항이 전부 필요한 것은 아니다. 어떤 항을 쓰고 어떻게 가중치를 정했는지가 문제 정의의 일부다.

신경망 출력과 자동미분으로 나비에-스토크스 방정식의 잔차를 계산하는 PINN 구성
신경망의 출력과 도함수로 지배 방정식의 잔차를 구성하는 PINN 예시. 출처: Riccardo Munafò, Wikimedia Commons, CC BY-SA 4.0, 변경 없음.

3. 콜로케이션 점과 자동미분

Collocation point는 PDE residual을 평가하는 coordinate다. Regular grid일 필요는 없으며 domain 내부와 중요한 region에서 샘플링할 수 있다. 하지만 유한한 point에서 residual이 작다는 사실만으로 전체 domain의 solution error가 작다고 보장되지는 않는다.

자동미분은 finite difference 없이 신경망 계산 그래프를 따라 derivative를 계산할 수 있게 한다. 이것은 symbolic differentiation이나 전통적 discretization과 같은 개념이 아니다.

  • 신경망이 입력 coordinate에 대해 미분 가능해야 한다.
  • 고차 derivative는 계산과 optimization을 어렵게 만들 수 있다.
  • 자동미분은 derivative를 계산할 뿐, PDE solution의 정확성을 보장하지 않는다.
더 깊이 살펴보기: 역문제와 신경 연산자

4. PINN 학습이 어려운 이유

PINN도 신경망 optimization 문제이므로 손실 landscape와 기울기 문제가 있다. 특히 서로 다른 손실 항이 competing 기울기나 매우 다른 scale을 가질 수 있다.

  • PDE residual은 작아지지만 boundary condition이 잘 맞지 않을 수 있다.
  • 급격한 변화나 multi-scale solution을 신경망이 표현하고 최적화하기 어려울 수 있다.
  • Advection-dominated, chaotic, stiff problem에서 학습 난도가 커질 수 있다.
  • Collocation 샘플링이 중요한 region을 놓칠 수 있다.
  • 같은 residual 크기라도 관심 quantity의 solution error는 다를 수 있다.

Adaptive 샘플링, 손실 weighting, domain decomposition, curriculum 훈련, weak-form formulation 등이 제안되는 이유다. 이 방법들은 만능 처방이 아니라 각각 추가 가정과 hyperparameter를 가진다.

5. PINN은 역문제에도 쓰인다

미지의 PDE coefficient를 매개변수 \(\phi\)로 두고 \(u_\theta\)와 함께 학습하면 관측 data와 equation을 이용한 inverse problem을 구성할 수 있다. 이때 매개변수 identifiability를 확인해야 한다. 서로 다른 coefficient가 비슷한 관측을 만들면 손실을 줄였다는 사실만으로 참 매개변수를 복원했다고 말할 수 없다.

노이즈, sensor 위치, boundary condition의 정확성, 매개변수 사전 분포가 결과에 영향을 준다. Synthetic data에서의 복원과 실제 measurement에서의 복원은 별도로 검증해야 한다.

6. 신경 연산자는 문제군을 학습한다

Neural Operator는 function \(a\)를 받아 solution function \(u\)를 내는 operator \(G\)를 근사한다.

\[ G_\theta:a(\cdot)\mapsto u(\cdot) \]

\(a\)는 coefficient field, initial condition, forcing function 등이 될 수 있다. 훈련 데이터는 보통 여러 PDE instance에서 얻은 pair \((a_i,u_i)\)로 구성된다. Paired solution을 만들기 위해 기존 numerical solver를 반복 실행해야 할 수 있다.

훈련 cost를 지불한 뒤 새로운 입력 function에 대해 빠르게 solution을 예측하는 amortized solver 관점이 중요하다. 한 번만 풀 문제라면 data 생성과 훈련 비용이 이점을 만들지 못할 수 있다. 비슷한 family의 문제를 많이 query할 때 비용 구조가 달라진다.

7. DeepONet의 브랜치와 트렁크 관점

DeepONet은 operator를 두 component로 표현한다.

  • Branch 신경망은 sensor point에서 관측한 입력 function 값을 encode한다.
  • Trunk 신경망은 solution을 평가할 출력 coordinate를 encode한다.

두 표현을 결합해 해당 coordinate에서의 solution 값을 예측한다. 이 구성은 어떤 입력 function인가어느 위치의 출력을 묻는가를 분리해 생각하게 한다.

Sensor 위치, 수, 훈련 분포가 바뀌면 성능이 달라질 수 있다. Operator를 학습한다는 이름만으로 임의의 function이나 geometry에 일반화하는 것은 아니다.

8. 푸리에 신경 연산자의 주파수 관점

Fourier Neural Operator, FNO는 field를 latent 표현으로 올린 뒤 Fourier domain에서 선택된 mode에 learned transformation을 적용하고 다시 spatial domain으로 돌아오는 층을 사용한다. Spatial domain의 pointwise transformation과 함께 쌓아 operator를 근사한다.

핵심 직관은 convolution을 frequency domain에서 효율적으로 표현하고 넓은 spatial interaction을 다룬다는 것이다. FNO가 전통적 spectral solver와 동일하다는 뜻은 아니다. Learned 매개변수와 nonlinear 층을 가진 data-driven operator 모형이다.

원 논문은 한 resolution에서 학습하고 다른 discretization에서 평가하는 가능성을 보여주었지만, resolution generalization이 자동으로 보장되는 것은 아니다. Aliasing, cutoff mode, geometry, normalization, 훈련 resolution 범위를 확인해야 한다. Standard FFT 기반 FNO는 regular grid와 periodic 표현에서 특히 자연스럽고 irregular geometry에는 추가 설계가 필요하다.

9. PINN과 신경 연산자를 같은 축으로 비교하기

무엇을 학습하는가

  • PINN: 주로 특정 PDE instance의 coordinate-to-solution function
  • Neural Operator: PDE instance family에 대한 input-function-to-solution-function mapping

어떤 학습 신호가 필요한가

  • PINN: governing equation, IC와 BC, 선택적으로 sparse observation
  • Neural Operator: 여러 instance의 paired input-output field가 중심이며 physics 손실을 추가할 수 있음

훈련 뒤 무엇을 얻는가

  • PINN: 그 instance에 맞게 최적화된 solution approximation
  • Neural Operator: 훈련 분포와 관련된 새로운 입력 function에 반복 query할 모형

주요 비용은 어디에 있는가

  • PINN: 새 instance마다 다시 optimization해야 하는 경우가 많음
  • Neural Operator: paired solution dataset 생성과 사전 훈련 비용이 큼

무엇과 비교해야 하는가

  • 동일 tolerance와 hardware 조건의 numerical solver
  • Reduced-order 모형
  • 문제에 맞는 classical surrogate
  • Data-only 신경망과 physics-informed variant의 ablation

이 비교는 고정된 법칙이 아니다. Parameterized PINN, physics-informed neural operator처럼 경계를 섞는 방법이 있다. 논문에서는 이름이 아니라 실제 입력, 출력, objective, retraining 조건을 확인한다.

10. 평가 설계

PDE 모형은 pointwise average error만으로 판단하지 않는다.

  • Relative \(L^2\) error와 관심 physical quantity의 error
  • Initial condition과 boundary condition 만족
  • Conservation error와 long-time stability
  • 새로운 coefficient, forcing, geometry, resolution에 대한 OOD 성능
  • 훈련과 추론을 포함한 wall-clock cost
  • Numerical solver의 tolerance와 mesh convergence
  • 여러 random seed와 실패 비율

Residual 손실은 훈련 objective이고 solution error는 evaluation quantity다. 둘을 같은 것으로 취급하지 않는다. Reference solution도 discretization error를 가지므로 충분히 수렴한 solver 설정과 provenance가 필요하다.

핵심으로 가져갈 내용

  • 표준 PINN은 coordinate에서 solution value로 가는 신경망을 특정 PDE instance에 맞게 최적화한다.
  • Neural Operator는 여러 instance를 통해 function-to-function mapping을 학습한다.
  • PINN은 equation residual을 쓴다는 사실만으로, Neural Operator는 operator를 학습한다는 사실만으로 정확성과 일반화가 보장되지 않는다.
  • 두 방법 모두 기존 numerical solver, 전체 비용, 실제 OOD condition과 비교해야 한다.

이름과 위치만 알아둘 내용

  • Weak-form 또는 variational PINN
  • Domain decomposition과 XPINN
  • Adaptive collocation 샘플링
  • Physics-informed Neural Operator
  • 그래프 또는 geometry-aware neural operator
  • Spectral method와 aliasing
  • Operator learning의 approximation theory
자주 하는 혼동과 한계

자주 생기는 혼동과 한계

PINN은 data가 필요 없는가

Equation, IC, BC가 학습 신호가 될 수 있어 paired solution data가 없어도 구성할 수 있다. 하지만 collocation point와 정확한 equation 정보가 필요하고, inverse problem이나 noisy observation에서는 data가 들어갈 수 있다.

Neural Operator는 PDE를 몰라도 되는가

Paired data만으로 학습할 수 있는 설정도 있지만 data는 보통 PDE solver에서 생성된다. 문제 범위, boundary condition, discretization을 모르면 data와 일반화 범위를 해석하기 어렵다.

PINN이 numerical solver를 일반적으로 대체하는가

아니다. 문제 class, 정확도, dimension, 반복 query 여부에 따라 기존 solver가 더 빠르고 신뢰성 높을 수 있다. 반드시 controlled 기준 모델을 둔다.

다른 resolution에서 실행되면 mesh-independent한가

아니다. 모형 구조가 다른 discretization의 입력을 받을 수 있다는 것과 정확도가 유지된다는 것은 다르다. 훈련 범위 밖 resolution과 geometry에서 직접 검증해야 한다.

Physics-informed라는 이름이면 conservation을 보장하는가

Residual penalty는 constraint violation을 줄이려는 soft constraint일 수 있다. Exact conservation이나 boundary satisfaction이 필요하면 모형 구조와 numerical construction을 확인해야 한다.

앞뒤 챕터와 연결하기

  • 2장: PINN은 자동미분으로 coordinate derivative를 계산한다.
  • 3장: 여러 손실 항의 scale과 기울기 conflict가 optimization을 어렵게 만든다.
  • 5장: FNO의 spectral convolution을 CNN의 locality와 비교할 수 있다.
  • 8장: Irregular mesh를 그래프로 표현하는 operator 모형이 가능하다.
  • 13장: deployment question, numerical 기준 모델, OOD split, 전체 계산비용을 가져온다.
  • 15장: MLIP는 PDE solution이 아니라 atomistic energy와 force를 학습하는 별도 문제다.

스스로 확인하기

  • 표준적인 PINN과 Neural Operator는 각각 하나의 PDE instance와 problem family 중 무엇을 주로 학습하는가?
  • Equation residual이 작다는 사실과 reference solution error가 작다는 사실을 구분해야 하는 이유는 무엇인가?
  • Neural Operator의 사전 훈련 비용은 어떤 사용 조건에서 이점으로 회수될 수 있는가?
  • 다른 resolution을 입력할 수 있다는 사실과 resolution generalization이 검증되었다는 주장은 어떻게 다른가?

원전과 공식 읽을거리

원전을 읽을 때 architecture 그림만 보지 말고 각각 몇 개의 PDE instance를 학습하는지, reference solution은 어떻게 만들었는지, 새 instance마다 optimization하는지를 확인한다.