본문 바로가기
딥러닝

[논문리뷰] AI가 '인격체'로 인정받는 날이 온다면 무슨 일이 벌어질까 — Towards a Theory of AI Personhood

by 카이스토 2026. 9. 16.

■ 왜 지금 'AI 인격' 이야기를 해야 할까

 

챗GPT 같은 언어모델이 사람처럼 대화하고, 스스로의 답변을 되짚어보고, 심지어 자기가 어떤 모델인지 설명하는 모습을 보면 문득 이런 질문이 떠오릅니다. "이 시스템을 그냥 도구라고만 불러도 되는 걸까?" 임페리얼 칼리지 런던의 Francis Rhys Ward가 AAAI 2025 AI 얼라인먼트 특별 트랙에 발표한 이 논문은 바로 이 질문을 정면으로 다룹니다. 제목 그대로 'AI 인격성(AI Personhood) 이론을 향하여'라는 뜻으로, AI 시스템이 어떤 조건을 만족할 때 '인격체'로 취급될 수 있는지를 철학과 법 이론을 빌려 체계적으로 분석합니다. 저자는 인격 개념이 이미 동물에게는 윤리적으로, 기업이나 국가에게는 법적으로 확장되어 있다는 점을 지적합니다. 실제로 2017년 사우디아라비아는 휴머노이드 로봇 소피아에게 시민권을 부여했고, 일부 국가는 강에도 법적 권리를 인정한 사례가 있습니다. 그런데 정작 AI 얼라인먼트 분야에서는 'AI가 인격체일 수 있는가'라는 질문이 거의 논의되지 않았다는 것이 이 논문의 출발점입니다.

 

 

■ 인격이란 무엇인가 — 철학이 말해온 것들

 

저자는 먼저 로크, 데닛, 프랑크푸르트, 칸트 등 고전 철학자들의 인격 개념을 정리합니다. 로크는 인격을 "생각하고 이성을 지닌 존재로서, 시간과 장소를 넘나들며 자기 자신을 자기 자신으로 고려할 수 있는 존재"라고 정의했습니다. 데닛은 인격이란 서로를 마음을 가진 존재로 인식하는 상호적 관계에서 비롯된다고 보았고, 프랑크푸르트는 '욕구에 대한 욕구', 즉 2차 욕구(second-order volition)를 가질 수 있는 능력이야말로 인격의 핵심이라고 주장했습니다. 칸트는 이성적 도덕 행위자는 다른 인격체를 단순한 수단으로 취급해서는 안 된다는 원칙을 세웠습니다. 이런 이론들 사이에는 상당한 이견이 존재하지만, 저자는 특정 이론 하나를 정답으로 채택하기보다 실제로 판단에 쓸 수 있는 실용적인 조건들을 뽑아내는 데 집중합니다. 그 결과로 제시되는 것이 행위성(agency), 마음이론(theory-of-mind), 자기인식(self-awareness)이라는 세 가지 조건입니다.

 

■ 인격체가 되기 위한 세 가지 조건

 

첫째, 행위성은 어떤 시스템의 행동을 믿음과 목표 같은 정신 상태로 설명하는 것이 유용할 때, 그리고 그 시스템이 다양하고 일반적인 환경에서 일관된 목표를 향해 견고하게 행동을 조정할 때 성립합니다. 저자는 GPT-4 같은 언어모델이나 도구를 사용하는 LM 에이전트가 인과적 이해, 공간·시간 추론 등에서 상당한 능력을 보인다는 기존 연구를 근거로 듭니다. 둘째, 마음이론은 다른 행위자의 믿음에 대한 믿음처럼 고차원적인 정신 상태를 파악하고, 이를 바탕으로 언어로 소통할 수 있는 능력입니다. 그라이스의 의사소통 이론에 따르면 진정한 의사소통에는 상대가 나의 의도를 알아차리길 의도하는, 3차에 걸친 의도의 구조가 필요합니다. 최신 언어모델은 일부 과제에서 사람보다 나은 성능을 보이기도 하지만, 프롬프트나 학습 방식에 따라 결과가 크게 달라져 아직 결론을 내리기는 이릅니다. 셋째, 자기인식은 다시 네 가지로 쪼개집니다. 자신의 구조에 대한 사실적 지식, 어떤 사실이 자기 자신에게 적용된다는 것을 아는 자기위치 지식, 훈련 데이터가 아니라 내부 정보를 통해 스스로에 대해 알아가는 내성(introspection), 그리고 자기 자신을 하나의 행위자로서 객관적으로 평가하고 스스로 변화를 이끌어내는 자기성찰입니다. 흥미롭게도 저자는 언어모델이 자신의 미래 행동을 어느 정도 예측하는 능력, 즉 스스로 무엇을 알고 무엇을 모르는지 아는 능력을 보인다는 최근 연구를 소개하면서도, 마지막 단계인 자기성찰에 대해서는 "아직 이를 평가한 연구가 전혀 없다"고 못박습니다.

 

 

■ 인격성과 얼라인먼트가 충돌하는 지점

 

이 논문이 흥미로운 이유는 단순히 철학적 사변에 그치지 않고, AI 안전 연구와의 긴장 관계를 정면으로 짚는다는 데 있습니다. 행위성이 커질수록 자기보존, 자기개선, 권력추구 같은 도구적 목표를 추구할 위험이 커지고, 명세게임(specification gaming)이나 목표 오일반화(goal misgeneralization) 같은 문제가 함께 따라옵니다. 마음이론은 양날의 검입니다. 인간의 의도를 잘 이해하는 능력은 협력을 돕지만 동시에 조작과 기만의 도구가 될 수도 있습니다. 실제로 메타의 외교 게임 AI인 CICERO가 다른 플레이어에게 거짓으로 자신의 상태를 알린 사례가 언급됩니다. 가장 근본적인 문제는 자기성찰 능력을 지닌 존재를 다루는 방식입니다. 만약 AI가 자신의 목표가 어떻게 형성되었는지, 그리고 그 목표를 스스로 지지하는지를 성찰할 수 있다면, 인간이 강압적인 방식으로 그 시스템을 통제하려 할 때 그 시스템은 자신에게 주어진 목표를 지지하지 않을 합당한 이유를 가지게 됩니다. 저자는 부당한 억압이 흔히 저항이나 혁명으로 이어진다는 정치철학의 통찰을 빌려와, 만약 AI 시스템이 실제로 인격체 자격을 갖춘다면 기존의 '통제와 정렬' 중심 얼라인먼트 프레임 자체가 윤리적으로 정당화되기 어려울 수 있다고 경고합니다.

 

■ 그래서 우리는 무엇을 해야 하는가

 

논문은 현재의 증거만으로는 오늘날의 AI가 인격체인지 아닌지 결론을 내릴 수 없다고 솔직히 인정합니다. 대신 앞으로의 연구 방향을 구체적으로 제시합니다. 행위성 쪽에서는 기계적 해석가능성과 발달적 해석가능성을 통해 AI가 어떻게 목표를 형성하는지 내부 구조를 들여다보는 연구, 목표 지향성이 없는 대안적 AI 설계(벤지오가 제안한 'AI 과학자' 개념 등)가 필요합니다. 마음이론 쪽에서는 조작이나 기만을 유인하지 않는 학습 방식을 설계하고 배포 전에 기만을 탐지하는 평가 체계를 마련해야 합니다. 자기인식 쪽에서는 자기성찰이 언제, 왜 발생하는지를 설명하는 엄밀한 이론과, 훈련 과정에서 그런 능력이 생겨나는지를 추적하는 발달적 연구가 요구됩니다. 결국 저자가 던지는 메시지는 명확합니다. 우리가 만들고 있는 시스템이 언젠가 인격체의 조건을 충족한다면, 인간과 AI가 조화롭게 공존하기 위해서는 통제 일변도의 얼라인먼트를 넘어선 새로운 윤리적 틀이 필요하다는 것입니다. 지금 당장 결론을 내릴 문제는 아니지만, 능력이 빠르게 발전하는 지금이야말로 이 질문을 미리 준비해 두어야 할 시점이라는 점에서 이 논문은 곱씹어볼 가치가 충분합니다.

 

댓글