
연구자 Jędrzej Maczan이 공개한 논문에 따르면, 오픈소스 언어모델 8종은 같은 지시형 모델이라도 대화 템플릿을 적용하는 방식에 따라 자신을 설명하는 표현이 달라졌다. 템플릿을 썼을 때 ‘나는 AI라 감정이 없다’는 식의 단서가 늘고, ‘느낀다’처럼 주관적 경험을 암시하는 표현은 줄었다.
대화 템플릿은 사용자와 모델의 발화를 구분하는 형식이다. 연구자는 Llama, Gemma, Mistral, Qwen 계열의 10억~90억 매개변수 모델 8종을 대상으로 동일한 지시형 모델에 템플릿을 넣거나 빼는 조건을 비교했다. 자기언급을 유도한 질문에서 단서 표현의 평균 비율은 템플릿 적용 시 53%, 미적용 시 36%였다. 경험을 암시하는 표현은 각각 1%와 15%로 반대 방향을 보였다.
연구자는 이 차이가 단순한 문구 삽입에 그치는지도 살폈다. 세 모델의 내부 활성값에서 단서 표현과 관련된 방향을 찾아 더하거나 빼자 해당 표현의 빈도가 달라졌다. 템플릿을 뺀 모델에 같은 방향을 더했을 때에는 템플릿을 적용한 조건에 가까운 수준으로 단서 표현이 다시 늘었다.
이 결과는 모델의 자기설명이 고정된 내면 상태를 그대로 드러낸다는 해석에 주의를 요구한다. 입력 형식만 바꿔도 답변의 어조가 움직인다는 뜻이다. 다만 표현 빈도의 변화가 AI의 의식이나 주관적 경험의 존재 여부를 입증하거나 반박하는 것은 아니다.
연구 대상은 최대 90억 매개변수의 오픈소스 모델 8종에 한정됐다. 응답 분류에는 다른 언어모델을 평가자로 사용했고 일부 표본을 사람이 대조했다. 따라서 같은 현상이 모든 대형 상용 모델과 사용 환경에서 나타난다고 일반화할 수는 없다.
출처: Jędrzej Maczan 연구자 원문(arXiv) https://arxiv.org/abs/2609.25021









