
연구진이 공개한 사전인쇄 논문에 따르면, 코딩과 무관한 문장에 대해 교사 모델이 고른 한 단어만 학습한 학생 모델이 HumanEval+ 코딩 평가에서 통제군보다 5.34%포인트 높은 성능을 보였다. 연구진은 이를 사후 학습이 관련 없는 결정에도 남기는 ‘행동의 그림자’로 설명했다.
연구진이 제안한 ‘능동적 무과제 증류(ATD)’는 공개된 Qwen2.5-1.5B-Instruct를 교사와 학생의 공통 출발점으로 삼는다. 먼저 공개 모델이 두 평범한 단어 사이에서 거의 동률을 보이는 문장을 골랐다. 코딩 능력을 높이도록 별도 학습한 교사 모델에는 이 문장들에 한 단어로 답하도록 했고, 학생 모델은 코딩 문제나 교사의 내부 확률값 없이 문장·단어 쌍 5,664개만 학습했다.
논문과 공개된 실험 코드에 따르면 학생 모델의 HumanEval+ pass@1은 51.22%, 같은 조건에서 문장과 단어의 대응을 바꾼 통제군은 45.88%였다. 164개 문제와 네 번의 학습 실행을 바탕으로 계산한 차이는 5.34%포인트이며, 연구진이 제시한 95% 신뢰구간은 1.22~9.60%포인트다. 단어의 전체 빈도만으로는 이 차이를 설명하기 어렵고, 어떤 문장에 어떤 답이 붙었는지가 핵심이라는 해석이다.
이번 결과는 모델의 후속 학습 정보가 본래 과제와 무관해 보이는 응답에도 일부 남을 수 있음을 시사한다. 다만 연구진은 공개된 공통 출발 모델을 알고 정교하게 질문을 선별해야 하며, 모든 과제와 모델에서 안정적인 전이가 나타난 것은 아니라고 밝혔다. 이 논문은 사전인쇄본으로, 결과를 임의의 상용 모델이나 실제 서비스 환경으로 일반화할 단계는 아니다.
출처: 연구진 사전인쇄 논문 https://arxiv.org/abs/2609.29233 ; 연구진 실험 코드와 결과 https://github.com/myboker/ATD









