3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf
job d87d482d5ae7 · done
· openai_compat / gpt-5.6-luna
· 다운로드
진행
1
2
3
4
5
6
7
8
9
10
11
문서 요약
이 문서는 순환 신경망이나 합성곱 신경망 없이 어텐션 메커니즘만으로 구성된 Transformer를 제안한다. Transformer는 인코더와 디코더에 다중 헤드 자기 어텐션과 위치별 피드포워드 네트워크를 사용하며, 순차 연산을 줄여 높은 병렬화와 짧은 학습 시간을 달성한다. WMT 2014 영어-독일어 및 영어-프랑스어 번역 실험에서 기존 최고 성능 모델과 앙상블을 능가하는 BLEU 점수를 기록했다. 문서는 어텐션 기반 모델이 번역뿐 아니라 이미지, 음성, 비디오 등 다른 입력·출력 양식에도 확장될 수 있다고 결론짓는다.
용어집 (34)
| attention mechanism | 어텐션 메커니즘 |
| autoregressive property | 자기회귀 특성 |
| beam search | 빔 탐색 |
| byte-pair encoding | 바이트 쌍 인코딩 |
| compatibility function | 호환성 함수 |
| convolutional neural network | 합성곱 신경망 |
| decoder | 디코더 |
| dropout | 드롭아웃 |
| embedding | 임베딩 |
| encoder | 인코더 |
| feed-forward network | 피드포워드 네트워크 |
| hidden state | 은닉 상태 |
| key-value pair | 키-값 쌍 |
| label smoothing | 레이블 평활화 |
| layer normalization | 레이어 정규화 |
| learning rate | 학습률 |
| linear projection | 선형 사상 |
| machine translation | 기계 번역 |
| masking | 마스킹 |
| multi-head attention | 다중 헤드 어텐션 |
| parallelization | 병렬화 |
| perplexity | 퍼플렉서티 |
| positional encoding | 위치 인코딩 |
| query | 쿼리 |
| recurrent neural network | 순환 신경망 |
| representation | 표현 |
| residual connection | 잔차 연결 |
| scaled dot-product attention | 스케일 조정 내적 어텐션 |
| self-attention | 자기 어텐션 |
| sequence transduction | 시퀀스 변환 |
| softmax function | 소프트맥스 함수 |
| state of the art | 최고 수준 성능 |
| training cost | 학습 비용 |
| word-piece vocabulary | 워드피스 어휘 |
지표
| deferred_ratio | 0.0317 |
| fallback_pages | 0.0 |
| pixel_max_diff | 2.0 |
| size_ratio | 1.3154 |
| missing_glyphs | 0.0 |
| keep_violations | 0.0 |
| translated_ratio | 1.0 |
| failed_segments | 0.0 |
| llm_null_ratio | 0.009 |
| placeholder_ratio | 1.0 |
| number_ratio | 1.0 |
| glossary_consistency | 1.0 |
경고 (0)
- 없음