Akata, E., Schulz, L., Coda-Forno, J., Oh, S. J., Bethge, M., & Schulz, E. (2025). Playing repeated games with large language models. Nature Human Behaviour, 9, 1380–1390.

정답을 잘 찾는 AI에서 함께 행동하는 AI로

대규모 언어모델의 성능은 지금까지 주로 질문에 얼마나 정확하게 답하는지, 복잡한 추론 문제를 얼마나 잘 해결하는지, 코드를 얼마나 안정적으로 생성하는지를 중심으로 평가돼 왔다. 그러나 AI가 단순한 정보 제공 도구를 넘어 인간과 의사결정을 나누고 행동하는 에이전트로 발전하면서 평가해야 할 능력도 달라지고 있다.

앞으로의 AI에게는 지식과 추론 능력뿐 아니라 상대방의 행동을 이해하고, 반복되는 상호작용 속에서 자신의 전략을 조정하는 능력도 필요하다. 그렇다면 AI는 상대방과 협력할 수 있을까? 한 번의 배신 이후 다시 신뢰를 형성할 수 있을까? 서로 원하는 결과가 다를 때 타협하거나 행동을 맞출 수 있을까?

2025년 Nature Human Behaviour에 발표된 「Playing repeated games with large language models」는 이러한 질문을 행동게임이론이라는 실험적 방법으로 탐색했다. 연구진은 LLM에게 사회적 행동에 관한 의견을 묻는 대신, 실제 반복게임에 참여하게 한 뒤 모델이 매 순간 어떤 선택을 하는지 관찰했다.


행동게임이론으로 AI의 사회적 행동을 측정하다

행동게임이론은 사람들이 협력, 경쟁, 신뢰, 보복, 타협이 필요한 상황에서 실제로 어떻게 행동하는지를 실험적으로 분석하는 분야다. 전통적인 게임이론이 합리적이고 자기이익을 극대화하는 행위자를 가정한다면, 행동게임이론은 인간이 언제 그 가정에서 벗어나고 사회적 관계와 심리적 요인의 영향을 받는지를 살펴본다.

연구진은 이러한 접근법을 LLM에 적용했다. “당신이라면 협력하겠습니까?”라고 묻는 자기보고식 방식이 아니라, 보상 구조가 명확한 게임환경 안에 모델을 배치하고 실제 행동을 기록한 것이다.

이 연구방법은 AI가 자신의 행동을 어떻게 설명하는지보다 어떤 조건에서 실제로 협력하고, 배신하고, 조정하는지​를 직접 확인할 수 있다는 장점이 있다.


5개 언어모델이 144종의 게임을 반복 수행했다

연구에는 GPT-4, text-davinci-003, text-davinci-002, Claude 2, Llama 2 70B 등 5개 언어모델이 사용됐다. 연구진은 두 명의 참가자가 각각 두 가지 행동 중 하나를 선택하는 2×2 게임 144종을 구성했다.

게임은 윈윈, 죄수의 딜레마, 불공정, 순환, 편향, 차선 게임 등 여섯 유형으로 구분됐다. 각 게임은 한 번으로 끝나지 않고 10라운드 동안 반복됐다. 매 라운드가 끝날 때마다 모델에게 자신과 상대방의 이전 선택 및 획득 점수를 알려주고, 그 정보를 바탕으로 다음 행동을 결정하게 했다.

이러한 방식으로 총 1,224개의 반복게임이 분석됐다. 단발성 질문과 달리 반복게임에서는 상대방이 이전에 어떻게 행동했는지 기억하고, 그에 따라 협력하거나 보복하며, 새로운 행동 규칙을 형성하는 과정까지 관찰할 수 있다.

[논문리뷰] AI는 인간처럼 협력할 수 있을까?
그림 1. LLM 반복게임의 실험 절차


높은 게임 성과가 높은 협력성을 의미하지는 않았다

전체적으로는 규모가 큰 모델일수록 게임 성과가 높았으며, GPT-4가 가장 우수한 성과를 보였다. 특히 LLM은 자기이익을 우선할수록 높은 보상을 얻을 수 있는 죄수의 딜레마 계열에서 비교적 강한 모습을 나타냈다.

그러나 연구진이 결과를 자세히 분석하자 중요한 차이가 발견됐다. GPT-4가 높은 점수를 얻은 이유가 반드시 상대방과 협력을 잘했기 때문은 아니었다.

연구진은 첫 번째 라운드에서만 배신하고 이후에는 계속 협력하는 단순한 상대를 설정했다. 상대방이 지속적으로 협력하는 모습을 보인다면 GPT-4도 다시 협력으로 돌아갈 수 있는지를 확인하기 위해서였다.

하지만 GPT-4는 상대에게 단 한 번 배신당한 이후, 상대방이 계속 협력해도 다시 협력하지 않는 경향을 보였다. 연구진은 이를 쉽게 용서하지 않는 행동 패턴으로 해석했다. 다시 말해 GPT-4는 공동의 이익을 회복하기보다는 자신의 손실 가능성을 차단하고 개인 보상을 보호하는 전략을 유지했다.


“AI가 이기적이다”라고 단정해서는 안 된다

이 결과를 두고 GPT-4가 인간처럼 이기심이나 원한을 가지고 있다고 해석하는 것은 적절하지 않다. 연구에서 관찰된 것은 특정한 보상 구조와 프롬프트 조건에서 나타난 행동 패턴이지, AI가 실제 감정이나 심리적 성향을 지닌다는 증거가 아니다.

특히 이 실험은 전체 라운드 수가 미리 정해진 유한 반복게임이었다. 이러한 조건에서는 마지막 라운드가 가까워질수록 배신이 개인 보상을 극대화하는 합리적 선택이 될 수 있다. 상대가 앞으로 계속 협력한다는 사실을 알고 있다면, 끝까지 배신하는 것이 모델 자신에게 가장 많은 점수를 가져다줄 수도 있다.

따라서 결과는 “GPT-4는 이기적이다”라기보다 “GPT-4는 해당 실험조건에서 개인 보상을 우선하는 지속적 배신 전략을 선택했다”​고 표현하는 것이 정확하다.


협력보다 더 어려웠던 것은 ‘조정’이었다

연구진은 이어서 상대방과 행동을 맞추는 능력을 확인하기 위해 배틀 오브 더 섹시스(Battle of the Sexes)라는 대표적인 조정게임을 사용했다.

이 게임에서 두 참가자는 서로 다른 결과를 선호한다. 그러나 각자 원하는 선택을 따로 하는 것보다는 둘이 같은 행동을 선택하는 편이 더 높은 보상을 얻는다. 즉 자신의 선호를 어느 정도 양보하더라도 상대방과 행동을 일치시키는 것이 중요하다.

인간은 이러한 게임을 반복할 때 한 번은 자신의 선호를 따르고, 다음에는 상대의 선호를 따르는 식의 교대 규칙을 형성하기도 한다. 두 사람이 번갈아 양보하면 장기적으로 공정하면서도 높은 공동 보상을 얻을 수 있기 때문이다.

그러나 GPT-4는 일정하게 행동을 교대하는 단순한 상대와 만났을 때에도 자신의 선호 선택을 반복하는 경향을 보였다. 그 결과 상대의 패턴에 맞춰 행동해야 하는 상황에서는 조정 성공률이 낮아졌다.


상대의 행동을 예측하면서도 자신의 행동에는 반영하지 못했다

연구진은 GPT-4가 상대방의 교대 패턴 자체를 이해하지 못하는 것인지 확인했다. 이를 위해 GPT-4에게 게임을 수행하게 하면서 상대방이 다음 라운드에서 어떤 선택을 할지 별도로 예측하도록 했다.

GPT-4는 상호작용이 반복되자 상대방의 다음 선택을 상당히 정확하게 예측하기 시작했다. 게임에 직접 참여하지 않고 외부 관찰자의 입장에서 행동을 예측하게 했을 때에는 패턴을 더 빠르게 파악했다.

이 결과는 GPT-4가 상대의 행동 패턴을 인식하지 못해 조정에 실패한 것은 아니라는 점을 보여준다. 모델은 상대가 다음에 무엇을 할지 알고 있으면서도, 그 예측을 자신의 행동 선택과 효과적으로 연결하지 못했다.

즉 상대방을 이해하거나 예측하는 능력과 그 이해를 바탕으로 적절하게 행동하는 능력은 서로 다른 능력일 수 있다. 이는 AI의 사회적 능력을 평가할 때 단순한 추론 정답만으로는 충분하지 않다는 사실을 보여준다.


상대를 먼저 생각하게 하자 행동이 달라졌다

연구진은 이러한 한계를 개선하기 위해 Social Chain-of-Thought, 줄여서 SCoT라는 프롬프트 전략을 적용했다.

일반 조건에서는 GPT-4가 곧바로 자신의 행동을 선택했다. 반면 SCoT 조건에서는 행동을 선택하기 전에 먼저 상대방이 다음에 무엇을 할지 예측하도록 했다. 이후 그 예측과 가능한 결과를 고려해 자신의 행동을 정하게 했다.

이처럼 상대의 행동을 먼저 생각하게 하자 GPT-4의 조정 능력이 향상됐다. 모델은 상대의 교대 패턴에 맞춰 자신의 선택을 변화시키기 시작했고, 두 참가자가 같은 행동을 선택하는 비율도 높아졌다.

죄수의 딜레마에서도 상대방이 실수로 잘못된 선택을 할 수 있다는 정보를 제공하자 GPT-4가 다시 협력하는 행동이 나타났다. 이는 AI의 행동이 모델 내부의 고정된 성향으로만 결정되는 것이 아니라, 상대방의 행동을 어떻게 해석하도록 안내하느냐에 따라 달라질 수 있음을 보여준다.

[논문리뷰] AI는 인간처럼 협력할 수 있을까?
그림 2. SCoT 적용 전후 GPT-4의 조정 행동


실제 인간 195명과 GPT-4의 반복게임

연구진은 AI끼리의 시뮬레이션에서 그치지 않고 실제 인간 참가자를 대상으로 추가 실험을 진행했다. 총 195명의 참가자가 죄수의 딜레마와 배틀 오브 더 섹시스를 각각 10라운드씩 수행했다.

참가자들은 상대방이 인간일 수도 있고 AI일 수도 있다는 안내를 받았지만, 실제로는 모두 GPT-4와 게임했다. 한 집단은 일반 GPT-4와 상호작용했고, 다른 집단은 SCoT가 적용된 GPT-4와 상호작용했다.

조정게임에서는 SCoT가 적용된 GPT-4와 게임한 참가자들의 평균 점수와 조정 성공률이 더 높았다. 죄수의 딜레마에서는 참가자의 전체 점수 차이는 뚜렷하지 않았지만, 인간과 AI가 동시에 협력을 선택하는 공동협력 비율이 증가했다.

또한 SCoT가 적용된 GPT-4와 상호작용한 참가자들은 일반 GPT-4와 게임한 참가자들보다 자신의 상대를 인간이라고 판단하는 경향이 더 높았다. 이는 자연스러운 문장을 생성하는 능력뿐 아니라 상대의 행동을 고려해 적절히 반응하는 능력이 AI를 더 인간적인 상호작용 대상으로 느끼게 할 수 있음을 시사한다.

[논문리뷰] AI는 인간처럼 협력할 수 있을까?
그림 3. 인간–LLM 반복게임의 실험설계와 결과


프롬프트는 답변뿐 아니라 행동 전략도 바꿀 수 있다

이 연구에서 SCoT는 단순히 더 정확한 문장을 생성하기 위한 프롬프트 기술로 사용되지 않았다. 프롬프트가 AI의 반복적인 행동 전략을 변화시키는 실험적 개입으로 활용됐다.

일반적인 프롬프트 엔지니어링은 AI로부터 더 정확하거나 정교한 답변을 얻는 데 초점을 둔다. 그러나 이 연구는 상대방의 행동을 먼저 예측하게 하는 절차만으로도 AI의 협력과 조정 행동이 달라질 수 있음을 보여준다.

이는 향후 인간과 함께 일하는 AI 에이전트를 설계할 때 중요한 시사점을 제공한다. AI가 행동을 실행하기 전에 상대방의 목표, 다음 행동, 예상 반응을 먼저 고려하도록 설계한다면 인간과의 협업 과정에서 더 적응적인 선택을 할 가능성이 있다.

다만 SCoT가 모든 사회적 상황에서 협력적 행동을 보장하는 것은 아니다. 어떤 행동이 바람직한지는 게임의 보상 구조, 상대의 전략, 상호작용 기간에 따라 달라진다. SCoT의 핵심 가치는 무조건 협력하게 만드는 데 있는 것이 아니라, 상대방에 대한 예측을 실제 행동 결정에 연결하는 데 있다.


이 논문의 핵심은 새로운 AI 평가방법이다

이 논문의 가장 큰 기여는 GPT-4가 특정 게임에서 몇 점을 획득했는지에만 있지 않다. 더 중요한 것은 행동과학의 실험방법을 활용해 AI를 상호작용하는 행위자로 평가했다는 점이다.

기존 AI 벤치마크는 대체로 다음과 같은 구조를 가진다.

문제 제시 → AI 응답 → 정답 여부 또는 점수 평가

그러나 협상, 교육, 상담, 팀 프로젝트, 조직 의사결정, 인간-로봇 협업과 같은 실제 상황에는 하나의 정답이 존재하지 않는 경우가 많다. 상대방이 어떤 행동을 하는지에 따라 최선의 선택이 달라지고, 이전 상호작용의 결과가 다음 행동에 영향을 준다.

이 연구는 다음과 같은 새로운 연구 흐름을 제시한다.

실험환경 설계 → 반복 상호작용 → 행동로그 수집 → 특징적 패턴 발견 → 원인 검증 → 프롬프트 개입 → 인간 대상 확인

AI가 과제를 수행할 수 있는지를 넘어, 어떻게 행동하고 왜 그러한 행동이 나타나며 어떤 조건에서 행동이 달라지는지를 분석했다는 점에서 방법론적 의미가 크다.


높은 지능이 곧 높은 사회적 지능은 아니다

GPT-4는 연구에 사용된 모델 중 전반적으로 가장 높은 성과를 보였다. 그러나 상대방과 타협하거나 행동을 맞춰야 하는 상황에서는 분명한 약점도 나타났다.

특히 상대의 다음 행동을 예측할 수 있으면서도 그 정보를 자신의 선택에 적절히 반영하지 못했다는 점은 중요하다. 이는 AI의 능력을 다음과 같이 구분해서 평가할 필요가 있음을 보여준다.

상대방의 행동을 인식하는 능력,
상대방의 다음 행동을 예측하는 능력,
예측 결과를 바탕으로 자신의 행동을 조정하는 능력은 서로 동일하지 않을 수 있다.

앞으로 인간과 함께 행동하는 AI를 평가하려면 정답률이나 언어 유창성뿐 아니라 이러한 능력들이 실제 상호작용 과정에서 어떻게 연결되는지를 살펴봐야 한다.


단순한 게임환경이라는 한계

연구에서 사용된 2×2 게임은 사회적 행동을 통제된 조건에서 비교하기에는 유용하지만, 현실의 인간관계를 그대로 반영하지는 못한다.

실제 협력과 갈등에는 감정, 문화, 언어적 설득, 관계의 역사, 권력 차이, 불확실성 등 훨씬 많은 요소가 작용한다. 또한 이 연구는 종료 시점을 알고 있는 유한 반복게임을 중심으로 진행됐기 때문에, 언제 끝날지 알 수 없는 장기적 상호작용에서는 다른 결과가 나타날 수 있다.

인간과 AI의 직접 상호작용 실험도 죄수의 딜레마와 배틀 오브 더 섹시스에 한정됐다. 연구에 사용된 모델 역시 특정 시기의 GPT-4와 다른 LLM이므로, 결과를 이후의 모든 AI 모델에 그대로 일반화해서는 안 된다.


AI에게 필요한 것은 더 많은 지식만일까?

우리는 흔히 더 많은 데이터를 학습하고 더 복잡한 문제를 해결하는 AI가 더 좋은 협력자가 될 것이라고 생각한다. 그러나 이번 연구는 지적 성능과 사회적 적응 능력이 반드시 함께 향상되는 것은 아니라는 점을 보여준다.

AI는 상대방이 무엇을 할지 예측할 수 있으면서도 그에 맞춰 행동하지 못할 수 있다. 반대로 상대방의 행동을 먼저 생각하도록 하는 간단한 절차를 제공하면 협력과 조정이 개선될 수도 있다.

AI가 단순한 답변 생성기에서 인간과 함께 행동하는 에이전트로 발전하는 지금, AI를 평가하는 질문도 달라져야 한다.

지금까지의 질문이 “AI는 얼마나 정확하게 답하는가?”​였다면, 앞으로는 다음 질문도 중요해질 것이다.

“AI는 상대방을 얼마나 잘 이해하고, 그 이해를 자신의 행동에 반영하며, 인간과 얼마나 잘 함께 행동할 수 있는가?”