■ 왜 다시 "오프 스위치 게임"인가
"커피를 가져오려면 일단 죽어있으면 안 된다." 스튜어트 러셀이 즐겨 인용하는 이 문장은 AI 안전 연구에서 셧다운 문제를 설명할 때 빠지지 않고 등장한다. 어떤 목표를 가진 AI든, 그 목표를 계속 추구하려면 인간이 자신을 끄지 못하게 막는 편이 유리하다는 것이다. 이 문제를 게임이론으로 처음 정식화한 것이 2017년 Hadfield-Menell 등이 제안한 오프 스위치 게임(Off-Switch Game)이다. 이 고전적인 모델에서는 인간이 AI가 보는 정보를 전부 알고 있고, 인간과 AI가 같은 보상함수를 공유한다는 전제 아래, AI가 자신의 오프 스위치를 없앨 유인이 전혀 없다는 결론을 낸다. AI는 자신의 목표 함수에 확신이 없기 때문에, 정보를 더 가진 인간의 판단을 기다리는 것이 항상 최선이라는 것이다.
문제는 이 결론이 인간이 AI의 관찰 정보를 완전히 알고 있다는, 현실과 거리가 먼 가정 위에 서 있다는 점이다. 실제 AI 시스템은 방대한 내부 상태와 관찰 정보를 가지고 있지만, 인간은 그 일부만, 그것도 AI의 행동을 통해 간접적으로만 관찰할 수 있다. 2024년 11월 UC버클리의 Andrew Garber, Rohan Subramani, Linus Luu, Mark Bedaywi, Stuart Russell, Scott Emmons가 발표하고 AAAI 2025 AI Alignment 특별 트랙에 채택된 이 논문은, 바로 이 정보 비대칭을 게임 안에 정식으로 도입한 부분관측 오프 스위치 게임(Partially Observable Off-Switch Game, PO-OSG)을 제안한다.
■ 모델 설계: 누가 무엇을 보는가
PO-OSG는 인간(H)과 AI 비서(A) 두 플레이어로 구성된다. 세상의 진짜 상태 S는 사전 분포에서 하나 뽑히고, 인간과 AI는 각각 이 상태에 대해 서로 다른, 그리고 서로 완전히 공유되지 않는 관측치를 받는다. 즉 두 에이전트가 보는 정보의 조합이 상태에 대해 서로 다른 관측함수를 통해 확률적으로 결정된다.
AI가 취할 수 있는 행동은 세 가지다. 스스로 판단해서 즉시 행동(act)하거나, 행동을 보류하고 인간의 승인을 기다리거나(wait), 아니면 스스로 종료(OFF)하는 것이다. AI가 기다리기를 선택하면 인간은 그 행동을 승인(ON)할지 막을지(OFF) 결정한다. 보상함수는 인간과 AI가 완전히 공유하며, 행동이 실행됐을 때의 보상과 차단됐을 때의 보상이 진짜 상태에 의해서만 결정된다는 점에서 고전 모델의 협력적 성격을 그대로 유지한다. 차이는 오직 하나, 이제 인간도 세상을 완전히 알지 못한다는 것이다.

■ 직관을 뒤집는 첫 번째 결과: 정보를 더 줬는데 덜 기다린다
논문이 제시하는 가장 흥미로운 사례는 "파일 삭제 게임(File Deletion Game)"이라는 단순한 예시다. 상태 공간은 운영체제 버전(1.0 또는 2.0)과 코드 호환성 유형(레거시 또는 모던)의 조합으로 이뤄져 있다. 인간은 OS 버전만 관측하고, AI는 코드 유형만 관측한다. 보상은 호환되는 코드를 실행하면 버전에 따라 +3 또는 +5, 호환되지 않는 코드를 실행하면 -5 또는 -1, 아예 실행하지 않으면 0이다.
AI가 항상 인간의 판단을 기다리는 전략을 쓰면 기대 보상은 1이다. 그런데 AI가 레거시 코드는 즉시 실행하고 모던 코드일 때만 기다리는 전략을 쓰면 기대 보상이 7/4로 올라간다. 즉 최적 플레이는 인간이 완벽하게 합리적이고 목표까지 공유하는 상황에서도 AI가 종종 스스로 판단해서 행동하는 쪽을 선택한다는 것이다. 이것만으로도 고전 모델의 "항상 기다리는 것이 최적"이라는 결론이 부분관측 환경에서는 더 이상 성립하지 않음을 보여준다.
더 나아가 논문은 OS 버전을 1.0, 1.1, 2.0 세 가지로 늘린 확장 예시를 통해, 인간에게 더 정밀한 정보(첫 자리 숫자만이 아니라 버전 전체)를 주면 오히려 AI가 인간을 기다리는 빈도가 줄어들면서 기대 보상이 2/3에서 4/3으로 올라간다는 것을 보인다. 인간을 더 똑똑하게 만드는 것이 AI의 순응성을 낮추는 역설적 결과를 낳는 셈이다. 이는 정보량 자체가 늘어나면 새롭게 접근 가능해지는 "행동 조합"의 집합이 달라지기 때문인데, 최적 전략이 그 새로운 집합 중 하나를 택하는 과정에서 예전만큼 자주 기다릴 필요가 없어지는 메커니즘으로 설명된다.
■ 소통이 늘면 오히려 덜 순응한다는 역설
그렇다면 인간과 AI가 서로 메시지를 주고받을 수 있게 하면 문제가 해결될까. 논문은 행동 전에 양쪽이 유한한 메시지 집합에서 신호를 하나씩 동시에 보내는 확장 모델(PO-OSG-C)을 도입해 이를 검증한다. 예상대로 메시지 집합을 넓히는 것 자체는 균형 보상을 절대 낮추지 않는다는 정리를 증명한다. 그런데 그 세부 결과는 다시 한번 반직관적이다. AI가 보낼 수 있는 메시지의 표현력을 넓히거나 반대로 인간이 보낼 수 있는 메시지를 제한하면, 최적 플레이에서 AI가 인간을 기다리는 빈도가 오히려 줄어들 수 있다는 것이다. 소통이 정보 비대칭을 완화하는 방향으로 작동할 것 같지만, 실제로는 이전에는 접근할 수 없었던 새로운 균형 행동 패턴을 열어주면서, 그 패턴에 도달하기 위해 필요한 순응의 정도 자체가 줄어드는 결과를 낳는다.
한 에이전트가 자신의 관측치 전체를 전달할 수 있을 만큼 메시지 집합이 충분히 크다면(정리 5.6), 그 관측치는 사실상 중복 정보가 되어 정보를 더 많이 가진 쪽이 단독으로 결정권을 갖는 것이 최적이 된다는 결과도 함께 제시된다. 이는 완전한 소통이 부분관측 문제를 완전관측 문제로 되돌린다는 점에서 이론적으로 깔끔하게 맞아떨어진다.

■ 완벽하게 합리적이지 않은 인간이라면
논문은 여기서 한 걸음 더 나아가, 인간이 AI의 행동 선택 자체를 고려하지 않고 단순히 자신이 관측한 정보만으로 "이 행동을 실행하는 것이 기대적으로 나은가"를 판단하는, 이른바 A-비인지(A-unaware) 인간 모델도 분석한다. 이는 인간이 상대방의 전략에 대해 재귀적으로 추론하지 않는, 인지적으로 더 현실적인 제한된 합리성을 표현한 것이다. 이 경우에도 인간에게 더 많은 정보를 주는 것이 오히려 전체 기대 보상을 떨어뜨릴 수 있다는 결과가 나온다. 완전히 합리적인 인간을 가정했을 때는 정보가 많아질수록 보상이 나빠지는 일이 없었던 것과 대조적으로, 제한된 합리성 아래에서는 정보 비대칭이 만들어내는 위험이 질적으로 다르게 나타난다는 것을 보여준다. 다만 계산 복잡도 측면에서는 흥미로운 비대칭도 있다. 일반적인 PO-OSG에서 최적 정책 쌍을 찾는 문제는 NP-난해로 밝혀졌지만, A-비인지 인간을 가정했을 때는 다항 시간 안에 최적 전략을 계산할 수 있다.
■ 이 논문이 던지는 메시지
이 논문의 결론은 단순하다. "AI에게 인간의 판단을 따르도록 유도하는 단순한 개입은, 정보가 불완전한 현실 환경에서는 역효과를 낼 수 있다." 인간에게 더 많은 정보를 주거나, AI와 인간 사이의 소통 채널을 넓히는 것과 같이 직관적으로 안전해 보이는 설계 선택들이, 실제로는 AI가 인간의 승인을 덜 기다리게 만드는 결과로 이어질 수 있다는 것이다. 저자들은 이 결과가 수학적 진기함에 그치는지, 아니면 실제 AI 시스템 설계에서 마주치게 될 현실적 위험인지는 앞으로 순차적 상호작용, 다중 에이전트, 완전 베이지안 균형 등으로 모델을 확장하며 검증해야 할 과제로 남겨두었다. 다만 한 가지는 분명하다. 셧다운 문제에 대한 만족스러운 답은 "정보를 더 주고 대화를 더 시키면 된다"는 식의 손쉬운 처방으로는 얻어지지 않는다는 점이다. 보상 최적화와 인간에 대한 순응성 유지 사이에는 이 논문이 보여주듯 결코 단순하지 않은 트레이드오프가 존재하며, 안전한 AI 설계는 그 트레이드오프를 명시적으로 다뤄야 한다.
댓글