대형 언어 모델은 attention과 MLP의 비선형 연산으로 구성되지만, 입력 표현 두 개를 섞으면 각각의 의미가 완전히 사라질까?Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs는 서로 다른 텍스트 스트림의 토큰 임베딩을 위치별로 평균해 표준 causal Transformer에 넣는 실험으로 이 질문을 다룬다.
저자들은 섞인 입력의 다음 토큰 분포가 두 입력을 따로 처리했을 때의 분포 평균에 가까워질 수 있다는 가설을 “Superposition Linearity Hypothesis”라 부른다.
중요한 점은 이를 실제로 두 문장을 동시에 생성하는 범용 기능으로 과장하지 않는 것이다.
논문은 표현 혼합, 분포 근사, 분리 디코딩을 별개의 단계로 실험한다.

무엇을 해결하려는가
일반적인 모델 추론은 하나의 문맥에서 다음 토큰을 생성한다.
독립된 두 작업을 처리하려면 보통 별도 forward pass를 실행하거나 순차적으로 처리한다.
임베딩 수준에서 두 스트림을 섞어도 각 문맥의 예측 정보가 일정 부분 남는다면, Transformer 내부 표현의 선형성이 예상보다 넓은 의미를 가질 수 있다.
실험에서는 두 텍스트를 토큰화하고 길이를 맞춘 뒤 임베딩을 위치별로 평균해, 변경하지 않은 decoder-only Transformer에 입력한다.
각 스트림을 따로 실행했을 때의 정답 다음 토큰이 섞인 출력에서 얼마나 높은 순위에 남는지, 그리고 섞인 분포가 독립 분포 평균과 얼마나 가까운지 분석한다.
핵심 아이디어와 실험 흐름
저자들은 Pythia, Qwen, Llama, OLMo, Gemma 계열과 TinyStories·FineWeb 텍스트를 사용해 혼합 입력에서 양쪽 정답 토큰의 순위를 추적한다.
논문은 사전학습 모델에서 정답 토큰이 약 3040%의 사례에서 top-10, 5060%에서 top-50에 들어가며 top-100에서는 60~65%에 이른다고 보고한다.
다만 집계치는 입력의 성격 차이를 감춘다.
Qwen2.5-3B에서는 혼합 전 예측하기 쉬운 위치의 중앙 순위가 6인 반면, 내용어 위치에서는 284였다.
파인튜닝 후 내용어 위치의 중앙 순위는 5로 개선됐지만 exact top-1 일치는 22.8%였다.
입력 평균이 무의미하지 않다는 신호이지, 각 스트림의 모든 내용을 보존한다는 뜻은 아니다.
저자들은 학습 진행에 따라 hidden-state 가산성 오차가 커지는 경향을 관찰하며, 층별 선형성은 단조 감소가 아니라 late layer가 비교적 선형성을 유지하는 U자형 패턴이라고 분석한다.
소량 데이터 파인튜닝으로 분포 근사도를 회복할 수 있지만 비용과 단일 스트림 성능 저하가 따른다.
예를 들어 Pythia-2.8B의 KL은 1.86에서 0.27, 정규화 근사비는 0.42에서 0.06으로 낮아지고 true-token top-5 비율은 약 30%에서 60% 이상으로 오른 반면, LAMBADA 정확도는 0.544에서 0.357로 내려갔다.
Pythia-2.8B 파인튜닝은 2×A100 80GB에서 114시간 걸렸다고 보고돼, “가벼움”은 사전학습 데이터·step 대비 상대적 표현이다.
공개된 근거에서 확인되는 점
논문은 KL·Jensen–Shannon 발산과 임베딩 거리 기반 Wasserstein 측정으로 혼합 출력과 개별 출력 평균의 차이를 분석한다.
이 값은 무관한 문맥 쌍과 비교한 근사 비율이며 1보다 작다는 것은 무관한 경우보다 가깝다는 뜻이지, 이상적 분포와 거의 일치한다는 뜻은 아니다.
예를 들어 문맥 길이 32의 KL 비율은 0.350.42, JS는 0.400.57, Wasserstein은 0.63~0.71 범위다.
KL·JS는 temperature 1.5로 smoothing했고 Wasserstein은 cosine 임베딩 거리를 ground metric으로 top-256 토큰만 계산했다.
저자들은 hidden-state 가산성과 토큰 순위 보존의 상관도 보고하지만, 이는 연관성이지 인과 기제의 증명은 아니다.
분리 디코딩은 proof-of-concept이며 정확도·품질이 단일 스트림 기준선에 미치지 못하는 비교도 있다.
예컨대 Llama-3.2-3B와 1B guide의 Joint Contrastive 설정은 mixed LAMBADA 정확도 0.430으로, 소형 모델 단일 스트림 기준선 0.540보다 낮다.
논문은 별도 디코딩 처리량이 시험 설정에서 순차 vanilla 디코딩의 약 2배, batch-2와는 3% 이내였다고 보고하지만, 일반적인 batched inference보다 2배 빠르다는 뜻은 아니다.
세 스트림 분석에서도 근사 비율은 1 아래였으나, Pythia-2.8B의 512 토큰 KL 비율은 두 스트림 0.37에서 세 스트림 0.47로 악화됐다.
이 증거는 모델 전반의 정확한 선형성이나 일반적인 계산량 절감을 입증하지 않는다.
대부분의 분석은 짧은 문맥(최대 128 토큰)에 집중하고 분포 비교 일부만 512 토큰까지 확장하며, 주로 단일 언어 텍스트를 다룬다.
텍스트 스트림의 위치별 임베딩 평균은 일반적인 토큰 입력과 다르고, 이후 디코딩은 스트림 경계와 토큰 선택을 추가 처리해야 한다.
다국어·멀티모달 환경에서의 전이나 보편적 비용 이점은 아직 검증되지 않았다.
실무 관점에서의 해석
연구의 가장 흥미로운 가치는 “Transformer는 본질적으로 비선형”이라는 직관을 입력-출력 관점에서 재검토하게 한다는 데 있다.
표현 공간의 중첩 성질을 활용하는 방식은 병렬 추론이나 여러 작업을 하나의 계산에 실으려는 연구의 출발점이 될 수 있다.
그러나 제목의 “두 생각을 동시에”라는 이미지를 당장 제품 기능으로 읽어서는 안 된다.
개별 다음 토큰의 순위가 보존되는 것, 분포 전체가 평균에 가까운 것, 긴 생성에서 두 개의 일관된 결과물을 복원하는 것은 서로 다른 난도다.
현재 결과는 이 방향의 실험적 근거이지, 일반 LLM 호출을 두 배로 대체할 수 있다는 증명은 아니다.