[Vision Transformer Image Classification] 3. VisionTransformer 모듈 완성
1. Transformer Encoder 재사용기존에 내가 만들어줬던 Encoder를 재사용할 예정이다. ViT에서는 Decoder/casual-mask/cross-attention 이 필요없기 때문에 Encoder 부분만 있는 그대로 들고와 줬다.import mathimport torchimport torch.nn.functional as Fimport torch.nn as nndef scaled_dot_product_attention(Q,K,V, mask = None): #Q,K,V: (batch, heads, seq_len, d_k) 크기의 행렬 scores = torch.matmul(Q,K.transpose(-2,-1)) / math.sqrt(Q.size(-1)) if mask ..
2026. 9. 25.