1 note
Transformer는 RNN의 기울기 소실과 고정 크기 컨텍스트 벡터 문제를 Attention 메커니즘으로 해결한 아키텍처다. Q-K-V Attention으로 입력 시퀀스 전체에서 중요 정보를 동적으로 가중하며, Positional Encoding으로 위치 정보를 보완한다. 학습 시 Teacher Forcing을 사용해 수렴 속도를 높인다.