Deep Learning Atlas
딥러닝 개념을 연결해서 읽는다¶
딥러닝 기술의 목적과 관계를 먼저 익히고, 관심 분야의 후속 학습으로 이동하는 초심자용 개념 지도다.
누구를 위한 자료인가¶
이런 학습자¶
- Perceptron이나 backpropagation 전후에서 딥러닝 공부가 멈춘 사람
- 기술 이름을 외우기보다 기술이 해결하려는 문제와 상호관계를 알고 싶은 사람
- 논문에서 처음 보는 모델을 스스로 분류하고 후속 자료를 찾고 싶은 사람
이 사이트에서 얻는 것¶
- 모델을
입력, 표현, 출력, 학습 신호, 평가로 해석하는 공통 틀 - Backpropagation, optimizer, architecture, loss의 역할 구분
- CNN, Transformer, GNN이 데이터 구조를 다루는 방식의 차이
- VAE, diffusion, flow matching이라는 생성 관점의 차이
- PINN, neural operator, MLIP가 다루는 과학 문제의 차이
이 사이트가 하지 않는 것¶
- 모든 수식의 완전한 유도
- 처음부터 구현하는 프레임워크 강좌
- 프로젝트 수행이나 성적 평가
- 최신 모델의 완전한 목록
- 특정 기법이 항상 우수하다는 주장
구조: 하나의 줄기와 세 갈래¶
딥러닝 기술은 하나의 연대기나 난도 순서로 정렬되지 않는다. 이 사이트는 모든 학습자가 공유하는 공통 backbone을 먼저 두고, 그 위에서 데이터 구조, 생성, 의사결정이라는 세 branch로 갈라진 뒤, 마지막에 과학 문제에서 이 개념들을 재조합한다. 분류 기준과 챕터 사이의 연결선은 전체 개념 지도에서 자세히 설명한다.
공통 Backbone
Branch A · 데이터 표현과 구조
4. 차원축소와 표현 5. CNN과 공간적 구조 6. NLP와 언어 데이터 7. Attention과 Transformer 8. GNN과 기하학적 구조
Branch B · 생성
Branch C · 의사결정
재조합 · AI4Science
13. 과학 학습 문제의 구성 14. PINN과 Neural Operator 15. MLIP과 기하학적 모델
네 단계 교육과정¶
1단계는 순서대로 읽는다. 2단계와 3단계는 전체 순서를 따라도 되고 관심 branch를 골라 읽어도 된다. 4단계는 앞의 개념을 과학 문제에서 다시 조합한다.
I순서대로 읽기
공통 학습 원리¶
학습 문제를 구성하는 요소, 신경망이 gradient를 전달하는 방식, 학습이 흔들리는 이유와 처방.
IIBranch 선택 가능
데이터 표현과 구조¶
Vector, grid, sequence, graph라는 데이터 구조가 표현과 architecture에 어떻게 들어가는가.
IIIBranch 선택 가능
생성과 의사결정¶
분포를 학습해 새 sample을 만드는 관점과, 상호작용 속에서 행동을 고르는 관점.
IV앞 단계 재조합
AI4Science¶
과학 질문, 알려진 법칙, 계산비용을 함께 고려해 학습 문제를 다시 구성한다.
학습 깊이 표시¶
자료를 읽을 때는 항목을 세 가지 깊이로 구분한다. 같은 챕터 안에서도 모든 개념을 같은 수준으로 익힐 필요는 없다. 장마다 구획 제목은 달라도 이 구분을 읽기 기준으로 적용한다.
- 핵심 줄기
- 다른 개념과의 관계를 자기 말로 설명할 수 있어야 한다. 각 장의 핵심 요약과 인과적 설명에 해당한다.
- 개념 노출
- 이름, 목적, 전체 지도상의 위치를 아는 것을 목표로 한다. 세부 유도와 구현은 후속 학습으로 미룬다.
- 대표 사례
- 실제 문제를 언급하는 부분에 적용하는 읽기 기준이다. 성능 주장이 아니라 입력, 출력, 학습 신호와 평가를 찾는 데 사용한다.
권장 읽기 경로¶
숫자는 챕터 번호다. 어느 경로든 1, 2, 3장은 공통 기반이므로 먼저 읽는다.
모든 챕터가 반복하는 질문¶
챕터마다 모델이 달라도 같은 질문을 던진다. 이 질문이 서로 다른 모델을 비교하고 새 논문을 읽는 공통 언어가 된다. 전체 목록은 모델을 읽는 공통 질문에 있다.
- 문제와 데이터. 입력 한 개는 무엇이고, 출력은 예측값, 생성 sample, 행동 중 무엇이며, 학습 신호는 어디에서 오는가?
- 표현과 구조. 모델은 locality, order, connectivity, symmetry 중 어떤 구조를 가정하고, 그 가정은 어디에 들어가는가?
- 학습. 목적함수는 무엇을 작게 만들고, gradient는 어떻게 계산되며, 어떤 optimizer가 parameter를 갱신하는가?
- 평가. 가장 단순한 baseline은 무엇이고, 어떤 metric과 data split이 실제 목표를 나타내는가?
- 적용 범위. 이 방법이 잘 맞는 조건은 무엇이고, 무엇을 보장하지 않으며, 대표적인 실패 양상은 무엇인가?