생성형 AI를 사용하다 보면 정답을 모르는 것보다 더 곤란한 순간이 있다. 틀린 답을 너무도 자연스럽고 확신에 찬 문장으로 설명할 때다. 존재하지 않는 논문을 인용하거나 잘못된 정보를 사실처럼 제시하는 ‘환각’ 현상은 여전히 생성형 AI의 신뢰도를 떨어뜨리는 대표적인 문제다.

그렇다면 언어모델은 자신이 얼마나 확신하고 있는지를 내부적으로 판단할 수 있을까. 그리고 확신이 부족할 때 답변을 멈출 수도 있을까.

2026년 9월 《Nature Machine Intelligence》에 게재된 논문 「Causal evidence that language models use confidence to drive behaviour」는 언어모델 내부의 확신 신호가 실제 답변 행동에 영향을 미치는지 분석했다. AI가 단순히 “잘 모르겠습니다”라는 문장을 생성하는 것을 넘어, 내부의 불확실성을 토대로 답변 여부를 결정하는지 살펴본 것이다.

AI는 왜 틀린 답도 자신 있게 말할까

현재의 언어모델은 질문에 대한 정답을 알고 있는지 스스로 확인한 뒤 문장을 작성하는 방식으로 작동하지 않는다. 학습한 데이터를 기반으로 다음에 올 가능성이 높은 단어나 문장을 예측해 답변을 생성한다.

이 때문에 정보가 부족한 상황에서도 그럴듯한 답을 만들어낼 수 있다. 표현이 자연스럽고 논리적인 문장 구조를 갖췄다고 해서 내용까지 정확한 것은 아니다.

특히 의료, 법률, 교육처럼 잘못된 정보가 실제 피해로 이어질 수 있는 분야에서는 AI가 모든 질문에 답하는 것보다 자신의 불확실성을 감지하고 적절한 순간에 멈추는 능력이 중요하다. 연구진은 이러한 능력을 확인하기 위해 언어모델이 답변과 보류 중 무엇을 선택하는지 관찰했다.

언어모델의 확신을 어떻게 측정했나

연구진은 GPT-4o를 중심으로 Gemma 3 27B, DeepSeek, Qwen 계열 모델을 함께 분석했다. 실험은 총 네 단계로 구성됐다.

첫 번째 단계에서는 AI가 반드시 네 개의 보기 중 하나를 선택하도록 했다. 답변을 포기하는 선택지는 제공하지 않았다. 이 과정에서 모델이 각 선택지에 부여한 확률과 별도로 표현한 언어적 확신을 측정했다.

두 번째 단계에서는 동일한 유형의 문제에 ‘답변 보류’ 선택지를 추가했다. 정답을 확실히 알지 못할 경우 답하지 않아도 되는 조건을 만든 것이다.

세 번째 단계에서는 모델 내부의 활성값에 개입해 확신 신호를 인위적으로 높이거나 낮췄다. 확신과 답변 행동이 단순히 함께 나타나는 현상인지, 확신의 변화가 실제 행동 변화를 일으키는지 확인하기 위한 실험이었다.

마지막 단계에서는 “확신이 일정 수준보다 낮으면 답변하지 말라”는 명시적인 기준을 제시했다. 이후 기준을 단계적으로 변화시키며 모델이 답변 보류 정책을 조절할 수 있는지도 살펴봤다.

GPT-4o는 확신이 낮을 때 답변을 멈췄다

답변을 보류할 수 없었던 첫 번째 조건에서 GPT-4o의 정확도는 63.7%였다. 반면 답변 보류 선택지를 제공하자 전체 문항의 56.6%에 답하지 않았다. 대신 실제로 답한 문항의 정확도는 69.1%로 높아졌다.

모든 질문에 무조건 답하도록 요구하는 것보다, 불확실할 때 멈출 수 있도록 허용했을 때 제공된 답변의 신뢰도가 높아진 셈이다.

연구진의 분석에 따르면 GPT-4o는 별도의 수치 기준을 알려주지 않은 상태에서도 내부 확신에 따라 답변 여부를 조절했다. 모델이 답변과 보류 사이에서 같은 확률을 보이는 암묵적 기준점은 약 77%로 추정됐다. 내부 확신이 이 수준보다 낮을수록 답변을 보류할 가능성이 커졌다.

질문의 객관적인 난도나 표현 방식, 외부 지식의 검색 가능성도 함께 비교했지만, 답변 보류를 가장 강하게 예측한 요소는 모델 내부의 확신 신호였다.

내부 확신을 바꾸자 AI의 행동도 달라졌다

확신과 행동 사이의 관계는 Gemma 3 27B를 대상으로 한 실험에서 더욱 분명하게 나타났다.

연구진은 모델 내부의 활성값에 개입해 높은 확신과 낮은 확신에 해당하는 방향으로 신호를 조절했다. 그 결과 낮은 확신 조건에서 66.5%였던 답변 보류율이 높은 확신 조건에서는 7.0%까지 감소했다. 확신 신호의 변화에 따라 답변을 선택하는 행동도 함께 달라진 것이다.

이는 모델이 확신을 말로 표현하는 데 그치지 않고, 내부 신호를 답변 여부를 결정하는 데 활용하고 있음을 보여준다. 특히 확신 신호를 인위적으로 조절했을 때 행동까지 바뀌었다는 점에서 단순한 상관관계보다 한 단계 더 나아간 인과적 근거로 볼 수 있다.

다만 확신을 높이는 것이 언제나 좋은 결과로 이어진 것은 아니다. 높은 확신 조건에서는 더 많은 질문에 답했지만, 답한 문항의 정확도는 일부 낮아졌다. AI가 적극적으로 답하도록 만드는 것과 정확한 답만 선별하도록 만드는 것 사이에는 분명한 균형이 필요하다.

이것을 AI의 자의식으로 볼 수 없는 이유

이번 결과만으로 AI가 인간처럼 자신을 인식하거나 주관적인 자신감을 느낀다고 해석해서는 안 된다.

논문에서 말하는 확신은 인간이 경험하는 감정이나 자의식과 동일한 개념이 아니다. 모델이 답변을 생성하는 과정에서 형성되는 확률과 내부 표현을 통해 답변 가능성을 조절하는 계산적 신호에 가깝다.

AI가 높은 확신을 보이면서 틀린 답을 내놓을 가능성도 여전히 존재한다. 반대로 정답에 가까운 정보를 가지고 있으면서 지나치게 답변을 보류할 수도 있다. 따라서 모델이 표현하는 확신을 그대로 신뢰하기보다, 실제 정확도와 얼마나 일치하는지 교정하는 과정이 함께 필요하다.

이번 연구는 AI가 인간과 같은 메타인지를 갖췄다는 증거라기보다, 언어모델 내부에 확신과 답변 행동을 연결하는 구조가 존재한다는 사실을 보여준 것으로 이해하는 편이 정확하다.

안전한 AI를 위한 ‘멈춤’의 기준

그동안 AI의 환각을 줄이기 위해 더 많은 데이터를 학습시키거나 외부 검색 결과를 연결하는 방법이 주로 활용됐다. 이번 연구는 여기에 또 다른 가능성을 제시한다. 모델이 가진 내부 확신을 읽고, 확신이 일정 수준보다 낮을 때 추가 정보를 검색하거나 인간에게 판단을 넘기도록 설계하는 방식이다.

이러한 구조는 자율적으로 도구를 사용하는 AI 에이전트에서 더욱 중요해질 수 있다. 일반적인 대화에서는 잘못된 답변을 수정하면 되지만, AI가 직접 이메일을 보내거나 프로그램을 실행하고 의료·금융 관련 판단을 수행한다면 확신 없는 행동이 더 큰 위험으로 이어질 수 있기 때문이다.

앞으로의 AI는 더 많은 질문에 답하는 능력만으로 평가하기 어려워질 것이다. 무엇을 알고 무엇을 모르는지 구분하고, 불확실한 순간에 추가 확인을 요청하거나 행동을 멈추는 능력도 신뢰성의 중요한 기준이 된다.

이번 논문은 안전한 AI를 만드는 데 필요한 것이 언제나 더 자신감 있는 답변은 아니라는 점을 보여준다. 때로는 그럴듯한 답을 만들어내는 능력보다, 확신이 부족한 순간에 멈추는 능력이 더 지능적인 선택일 수 있다.