Foundation ModelsFoundation ModelsTransformer는 두 입력의 다음 토큰 분포를 겹쳐 표현할 수 있을까서로 다른 텍스트의 토큰 임베딩을 섞었을 때 Transformer 출력에 각 문맥의 예측 신호가 남는다는 가설과, 이를 복원하는 학습·디코딩 실험을 검토한다.Sangmin Lee2026.09.30