본문 바로가기
딥러닝

[논문리뷰] LLM은 마음을 '이해'하면서도 왜 그렇게 '행동'하지 못할까? — CoSToM: Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models (ACL 2026 Best Theme Paper)

by 카이스토 2026. 9. 23.

들어가며: 안다고 다 되는 건 아니다

대화 상대가 지금 무엇을 알고 무엇을 모르는지, 어떤 의도를 갖고 있는지를 추론하는 능력을 심리학에서는 마음이론(Theory of Mind, ToM)이라고 부릅니다. 최근 LLM들은 "이 사람은 지금 이 사실을 모를 것이다"류의 ToM 문제를 텍스트로 물어보면 꽤 잘 맞힙니다. 문제는 그렇게 '알고 있다'는 것과, 실제 협상이나 설득 같은 살아있는 대화 속에서 그 지식을 반영해 '행동'하는 것은 전혀 다른 이야기라는 점입니다. ACL 2026 Best Theme Paper로 선정된 CoSToM은 바로 이 지식-행동 간극(knowledge-behavior gap)을 정면으로 겨냥합니다.

저자는 Mengfan Li, Xuanhua Shi(화중과기대, Huazhong University of Science and Technology)와 Yang Deng(싱가포르경영대, Singapore Management University)입니다. arXiv에는 2026년 4월(2604.10031)에 공개됐고 ACL 2026 메인 트랙에 채택됐습니다.

왜 겉핥기 정렬로는 안 되는가

기존에 LLM의 사회적 능력을 끌어올리는 방법은 대체로 프롬프트에 "상대방의 감정을 고려해서 답하라"는 식의 지시를 얹거나, 대화 예시로 추가 파인튜닝을 하는 것이었습니다. 그런데 이런 방식은 모델이 겉으로는 그럴듯한 문장을 내놓게 만들 뿐, 내부적으로 실제 사회적 추론 회로가 응답 생성과 얼마나 연결되어 있는지는 건드리지 못합니다. CoSToM 저자들은 여기서 한 걸음 더 들어가, "모델 내부의 어느 레이어에서 ToM 관련 정보가 처리되고, 그 정보가 실제로 출력에 얼마나 인과적으로 영향을 미치는가"를 직접 추적하는 쪽을 택했습니다.

핵심 방법: 인과 추적 + 활성화 스티어링

CoSToM의 파이프라인은 크게 두 단계입니다. 첫 번째는 인과 추적(causal tracing)으로, 모델이 ToM 관련 판단을 내릴 때 각 레이어의 활성화를 체계적으로 개입(intervention)해보며 "이 레이어를 건드리면 ToM 판단이 얼마나 바뀌는가"를 측정합니다. 이를 통해 저자들은 마음이론과 관련된 표상이 모델의 초반(early) 레이어에 상당히 집중되어 있다는 것을 확인했습니다. 이는 다소 직관에 반하는 결과인데, 흔히 '고차원적 추론'은 더 깊은 레이어에서 이루어진다고 여겨지기 때문입니다.

두 번째 단계는 이렇게 찾아낸 초반 레이어에만 목표를 좁혀 개입하는 경량 활성화 스티어링(targeted activation steering)입니다. 전체 모델을 재학습시키는 대신, 정확히 ToM 정보가 몰려 있는 지점의 활성화 벡터를 특정 방향으로 밀어줌으로써, 모델이 내부적으로 파악한 상대방의 마음 상태를 실제 발화 선택에 더 잘 반영하도록 정렬시키는 것입니다. 파라미터 전체를 건드리지 않는 가벼운 개입이라는 점이 이 방법의 실용적 매력입니다.

실험: 협상과 설득이라는 현실적인 무대

CoSToM의 효과는 협상(negotiation)과 설득(persuasion) 과제에서 검증되었습니다. 이 두 과제는 상대가 무엇을 원하는지, 무엇을 숨기고 있는지를 헤아리는 능력이 대화의 성패를 직접 좌우하는 대표적인 시나리오입니다. 저자들은 실험 결과, 인과 추적으로 찾은 레이어에 스티어링을 적용한 모델이 대화 품질과 사람이 느끼는 사회적 자연스러움(human-like social reasoning) 측면에서 눈에 띄게 개선되었다고 보고합니다. 즉 "안다"를 "행동한다"로 이어주는 작은 개입만으로도 실질적인 대화 능력 향상을 끌어낼 수 있었다는 것입니다.

왜 중요한가

CoSToM이 흥미로운 지점은 사회적 능력이라는 다소 추상적인 개념을, 프롬프트 엔지니어링이 아니라 모델 내부 해석가능성(interpretability) 도구로 파고들어 개선했다는 데 있습니다. "정렬(alignment)"이라고 하면 흔히 대규모 인간 피드백 학습(RLHF)을 떠올리지만, 이 논문은 특정 레이어를 정확히 짚어내는 인과 추적만으로도 가벼운 개입이 가능함을 보여줍니다. 협상 에이전트, 고객 응대 챗봇, 교육용 튜터처럼 상대의 마음 상태를 헤아리는 것이 중요한 응용 분야에 직접적인 시사점을 주는 연구입니다.

댓글