<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ko">
	<id>https://wiki.conaondaapps.com/index.php?action=history&amp;feed=atom&amp;title=%ED%8A%B8%EB%9E%9C%EC%8A%A4%ED%8F%AC%EB%A8%B8</id>
	<title>트랜스포머 - 편집 역사</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.conaondaapps.com/index.php?action=history&amp;feed=atom&amp;title=%ED%8A%B8%EB%9E%9C%EC%8A%A4%ED%8F%AC%EB%A8%B8"/>
	<link rel="alternate" type="text/html" href="https://wiki.conaondaapps.com/index.php?title=%ED%8A%B8%EB%9E%9C%EC%8A%A4%ED%8F%AC%EB%A8%B8&amp;action=history"/>
	<updated>2026-08-20T20:00:53Z</updated>
	<subtitle>이 문서의 편집 역사</subtitle>
	<generator>MediaWiki 1.46.0</generator>
	<entry>
		<id>https://wiki.conaondaapps.com/index.php?title=%ED%8A%B8%EB%9E%9C%EC%8A%A4%ED%8F%AC%EB%A8%B8&amp;diff=78&amp;oldid=prev</id>
		<title>Admina7ec671ac513: migrate: import legacy Wiki content to Vultr</title>
		<link rel="alternate" type="text/html" href="https://wiki.conaondaapps.com/index.php?title=%ED%8A%B8%EB%9E%9C%EC%8A%A4%ED%8F%AC%EB%A8%B8&amp;diff=78&amp;oldid=prev"/>
		<updated>2026-08-20T04:19:30Z</updated>

		<summary type="html">&lt;p&gt;migrate: import legacy Wiki content to Vultr&lt;/p&gt;
&lt;p&gt;&lt;b&gt;새 문서&lt;/b&gt;&lt;/p&gt;&lt;div&gt;&amp;#039;&amp;#039;&amp;#039;트랜스포머&amp;#039;&amp;#039;&amp;#039;(transformer)는 어텐션(attention) 메커니즘을 중심으로 하는 인공신경망 구조이다. 2017년 논문 &amp;quot;Attention Is All You Need&amp;quot;에서 제안되었으며, 이후 대규모 언어 모델(LLM)을 비롯한 많은 최신 모델의 표준 기반이 되었다.&lt;br /&gt;
&lt;br /&gt;
== 개요 ==&lt;br /&gt;
[[순환 신경망]]은 시퀀스를 순서대로 처리해야 해서 병렬화가 어렵고, 먼 거리의 정보를 전달하는 데 한계가 있었다. 트랜스포머는 순환 구조 없이 어텐션만으로 시퀀스 내 모든 위치 간의 관계를 직접 계산한다. 위치 간 의존성 계산이 병렬로 이루어지므로 대규모 데이터로 효율적으로 학습할 수 있다.&lt;br /&gt;
&lt;br /&gt;
원래 기계 번역을 위한 인코더-디코더 구조로 제안되었지만, 이후 인코더 전용 구조(BERT 계열)와 디코더 전용 구조(GPT 계열)로 나뉘어 발전했다. 디코더 전용 트랜스포머는 대규모 언어 모델의 표준 구조가 되었으며, [[Llama.cpp]]나 [[GGUF]] 같은 로컬 추론 생태계도 이 구조를 기반으로 한다.&lt;br /&gt;
&lt;br /&gt;
== 핵심 개념 ==&lt;br /&gt;
&lt;br /&gt;
=== 어텐션 ===&lt;br /&gt;
어텐션은 입력 시퀀스의 각 위치가 다른 위치의 정보를 얼마나 참고할지 가중치로 표현하는 메커니즘이다. 각 위치는 쿼리(query), 키(key), 값(value) 벡터를 만들고, 쿼리와 키의 유사도에 따라 값의 가중합을 계산한다.&lt;br /&gt;
&lt;br /&gt;
=== 셀프 어텐션 ===&lt;br /&gt;
셀프 어텐션은 시퀀스 내부의 위치들 사이에서 수행되는 어텐션이다. 각 토큰이 문장 안의 다른 토큰들과의 관계를 직접 학습할 수 있으며, 멀리 떨어진 토큰 사이의 의존성도 한 단계에 포착할 수 있다.&lt;br /&gt;
&lt;br /&gt;
=== 멀티헤드 어텐션 ===&lt;br /&gt;
여러 개의 어텐션을 병렬로 수행하여 서로 다른 관점의 관계를 학습한다. 각 헤드는 서로 다른 표현 공간에서 의존성을 포착하며, 그 결과를 합쳐 다음 계층으로 전달한다.&lt;br /&gt;
&lt;br /&gt;
=== 위치 인코딩 ===&lt;br /&gt;
어텐션 자체에는 순서 정보가 없으므로, 각 위치에 순서를 나타내는 위치 인코딩을 더해 시퀀스의 순서를 모델에 알려준다.&lt;br /&gt;
&lt;br /&gt;
=== 계층 구성 ===&lt;br /&gt;
트랜스포머 계층은 어텐션과 피드포워드 계층으로 구성되며, 각 부분에 잔차 연결과 층 정규화를 사용한다. 디코더는 미래 토큰을 보지 못하게 하는 인과적 마스크를 적용해 자기회귀(autoregressive) 생성에 맞춘다.&lt;br /&gt;
&lt;br /&gt;
== 변형과 활용 ==&lt;br /&gt;
* GPT 계열: 디코더 전용 구조로, 다음 토큰을 예측하는 방식으로 학습된 생성 모델. 대규모 언어 모델의 기반.&lt;br /&gt;
* BERT 계열: 인코더 전용 구조로, 문장 표현을 학습하는 데 사용된다.&lt;br /&gt;
* 비전 트랜스포머(ViT): 이미지를 패치로 나누어 트랜스포머에 입력하는 구조로, [[컨볼루션 신경망]] 기반 비전 모델을 대체하는 추세.&lt;br /&gt;
* 멀티모달: 이미지, 음성, 텍스트를 함께 다루는 모델에도 널리 사용된다.&lt;br /&gt;
&lt;br /&gt;
== 함께 보기 ==&lt;br /&gt;
* [[다층 퍼셉트론]]&lt;br /&gt;
* [[순환 신경망]]&lt;br /&gt;
* [[컨볼루션 신경망]]&lt;br /&gt;
* [[Llama.cpp]]&lt;br /&gt;
* [[LLMOps]]&lt;br /&gt;
&lt;br /&gt;
== 출처 ==&lt;br /&gt;
* [https://arxiv.org/abs/1706.03762 Attention Is All You Need (Vaswani et al., 2017)]&lt;br /&gt;
* [https://en.wikipedia.org/wiki/Transformer_(deep_learning_architecture) 위키백과: Transformer]&lt;br /&gt;
* [https://arxiv.org/abs/1810.04805 BERT: Pre-training of Deep Bidirectional Transformers (Devlin et al., 2018)]&lt;br /&gt;
* [https://arxiv.org/abs/2005.14165 An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (Dosovitskiy et al., 2020)]&lt;br /&gt;
&lt;br /&gt;
[[분류:인공신경망]]&lt;br /&gt;
[[분류:머신 러닝]]&lt;/div&gt;</summary>
		<author><name>Admina7ec671ac513</name></author>
	</entry>
</feed>