AI를 믿을 수 있는가.
사티아 나델라 Microsoft CEO는 이 질문을 조금 다르게 던졌다.
그는 AI 모델을 얼마나 믿을 수 있는지가 아니라, 모델을 믿지 않아도 되는 시스템을 어떻게 만들 것인가를 물었다. 2026년 10월 10일 X에 올린 장문의 글 「Models as Insider Risks in the Super Intelligence Era」에서 나델라는 프런티어 AI 모델을 내부자 리스크처럼 다뤄야 한다고 주장했다.
이 표현은 강하다.
내부자 리스크란 조직 안에 있는 사람이나 시스템이 가진 권한 때문에 발생하는 위험을 뜻한다. 내부자가 악의적일 수도 있고, 실수할 수도 있으며, 외부 공격자에게 계정이나 권한을 탈취당할 수도 있다. 핵심은 내부자가 이미 중요한 시스템과 데이터에 접근할 수 있다는 점이다.
나델라는 이제 AI 모델도 그렇게 봐야 한다고 말한다.
이유는 간단하다. 기업은 점점 더 강력한 AI 모델과 에이전트에게 민감한 데이터 접근권을 주고, 업무를 대신 수행하게 하며, 때로는 중요한 의사결정과 실행 권한까지 맡기고 있다. 그런데 우리는 아직 그 모델이 왜 그런 답을 했고, 왜 그런 행동을 했는지 전통 소프트웨어처럼 코드 경로 단위로 추적하지 못한다.
전통 소프트웨어는 다르다.
지난 수십 년 동안 기업은 소프트웨어 시스템을 배포하면서 특정 동작을 특정 코드 경로로 추적할 수 있는 도구와 능력을 키워 왔다. 버그가 나면 어느 함수, 어느 조건문, 어느 설정값에서 문제가 생겼는지 찾아낼 수 있었다. 보안 사고가 나면 권한, 로그, 네트워크 경로, 코드 변경 이력을 추적했다.
하지만 프런티어 AI 모델은 다르다.
모델의 행동과 출력이 어떤 학습 데이터, 어떤 가중치 구성, 어떤 내부 표현에서 비롯됐는지 명확하게 설명하기 어렵다. 더구나 기업은 이런 불투명한 모델을 에이전트형 시스템으로 배포하고 있다. 이 시스템은 민감 데이터에 접근하고, 사용자를 대신해 작업하며, 중요한 업무 행동을 실행할 수 있다.
나델라의 문제의식은 여기서 시작된다.
AI 모델은 전통 소프트웨어보다 더 강력한 일을 할 수 있다. 그러나 전통 소프트웨어만큼 기계적으로 이해되지는 않는다. 더 강력하지만 덜 설명 가능한 시스템이 기업 내부로 들어오고 있는 것이다.
그래서 그는 “신뢰 아키텍처”를 다시 봐야 한다고 말한다.
모델 제공자가 안전하다고 보증한다고 해서 기업의 책임이 사라지는 것은 아니다. 기업은 자신을 대신해 지능이 수행하는 일에 대한 책임을 외주화할 수 없다. OpenAI, Anthropic, Google, Microsoft 같은 모델 제공자가 어떤 보증을 하더라도, 실제로 그 모델을 업무 시스템에 연결하고 민감 데이터에 접근하게 하는 조직은 별도의 통제 책임을 져야 한다는 뜻이다.
이 주장은 최근 AI 거버넌스 논의에서 매우 중요한 전환이다.
지금까지 많은 기업은 모델 선택을 중심으로 AI 신뢰를 이해했다. 어느 모델이 더 안전한가. 어느 모델이 더 정확한가. 어느 모델 제공자의 정책이 더 믿을 만한가. 하지만 나델라는 모델 자체의 신뢰성만으로는 충분하지 않다고 본다.
그가 제안하는 핵심은 지능의 공급과 지능의 권한을 분리하는 것이다.
모델은 지능을 제공할 수 있다.
그러나 모델이 무엇에 접근할 수 있고, 어떤 행동을 할 수 있으며, 언제 멈춰야 하는지를 결정하는 권한까지 모델 안에 넣어서는 안 된다.
이것이 나델라 글의 핵심 문장이다.
기업은 슈퍼 인텔리전스를 중첩된 블랙박스처럼 취급해서는 안 된다. 모델의 추천, 답변, 행동을 단순히 받아들이거나 거절하는 방식만으로는 부족하다. 대신 행동을 관찰할 수 있고, 한계를 시험할 수 있으며, 행동을 언제든 containment할 수 있는 시스템을 만들어야 한다.
여기서 containment는 단순한 보안 용어가 아니다.
AI 에이전트가 민감 데이터에 접근하고 실제 업무 행동을 수행하는 시대의 기본 운영 원칙이다. 나델라는 강력한 모델을 처음부터 침해됐다고 가정하고 containment해야 한다고 말했다. TechCrunch는 이를 “비상 브레이크”가 필요한 AI 모델 관리론으로 해석했다.
나델라는 정렬 문제를 잠시 제쳐두고, 우선 엔지니어링 관점의 containment와 거버넌스에서 출발하자고 말한다.
AI alignment는 어렵다. 모델이 인간의 의도와 가치에 맞게 안정적으로 행동하도록 만드는 문제는 아직 풀리지 않았다. 그렇다면 기업은 어려운 철학적·과학적 문제가 풀릴 때까지 기다릴 수 없다. 지금 필요한 것은 불확실한 모델을 둘러싸는 확실한 시스템 설계다.
나델라가 제안하는 방식은 명확하다.
비결정적 모델 주변에 결정적 시스템 설계, 인간 통제, 신뢰할 수 있는 운영 절차를 둘러야 한다. 기존 산업 표준이 부족하다면 새 표준을 만들어야 한다. 이것이 “모델을 내부자 리스크처럼 다루자”는 말의 실제 의미다.
내부자 리스크 관리에는 이미 오랜 경험이 있다.
기업은 수십 년 동안 강력한 내부 행위자를 다루는 방법을 발전시켜 왔다. 신원을 확인하고, 권한을 최소화하고, 활동을 기록하고, 접근 경계를 만들고, 이상 행동을 탐지하고, 감사를 수행한다. 나델라는 이 원칙을 AI 모델과 에이전트에도 적용하자는 것이다.
이 접근은 AI를 사람처럼 대우하자는 말이 아니다.
오히려 반대에 가깝다. AI를 인격체처럼 신뢰하거나 불신하자는 것이 아니라, 권한을 가진 행위자로 보고 통제하자는 것이다. 모델이 악의적이어서가 아니라, 충분히 강력한 행위자는 실수할 수 있고, 공격당할 수 있으며, 잘못된 맥락에서 위험한 행동을 할 수 있기 때문이다.
나델라가 특히 강조한 것은 모델 내부의 투명성만으로는 부족하다는 점이다.
그는 모델의 chain-of-thought 투명성이 협상 불가능한 출발점이라고 말했다. “Neuralese”를 이유로 모델 추론을 불투명하게 두어서는 안 된다는 것이다. 그러나 동시에 chain-of-thought 투명성만으로는 충분하지도, 신뢰할 만하지도 않다고 했다. 모델 출력 자체가 항상 충실하고 투명하도록 만드는 방법을 아직 모르기 때문이다.
이 대목은 중요하다.
최근 AI 안전 논의에서는 모델이 스스로 이유를 설명하게 하거나, 다른 모델이 검증하게 하는 방식이 많이 제안된다. 하지만 나델라는 여기에 한계를 본다. 모델이 모델을 검증하면, 불투명한 모델 안에 불투명한 오케스트레이션 계층이 있고, 그것을 또 다른 불투명한 모델이 감시하는 구조가 될 수 있다.
그가 말한 “nested black boxes”다.
블랙박스를 블랙박스로 감시하는 방식은 충분하지 않다. 한 모델이 작업하고, 다른 모델이 감시하며, 또 다른 모델이 평가하는 시스템은 겉으로는 안전해 보일 수 있다. 그러나 통제와 증거가 모두 모델 내부 또는 모델 간 판단에 의존한다면, 조직은 실제로 무엇이 일어났는지 독립적으로 검증하기 어렵다.
그래서 통제는 모델 밖에 있어야 한다.
나델라는 모델이 무엇에 접근할 수 있고 어떤 행동을 할 수 있는지를 결정하는 통제 장치가 모델 외부에 있어야 한다고 강조했다. 이는 1970년대부터 정보보안 분야에 존재해 온 원칙과 연결된다. 프로그램은 자신에게 부여된 권한을 집행하는 메커니즘을 우회하거나 조작할 수 없어야 한다.
오늘날 AI 에이전트에 적용하면 의미는 분명하다.
모델과 harness를 분리해야 한다.
모델과 action space를 분리해야 한다.
모델이 할 수 있는 행동과 접근 권한은 외부 시스템이 통제해야 한다.
안전장치와 보호장치는 모델 안이 아니라 모델 밖에 있어야 한다.
이것은 AI 에이전트 설계의 핵심 원칙이 될 가능성이 크다.
AI 모델은 이메일을 쓸 수 있다. 그러나 실제 전송 버튼을 누를 권한은 별도로 통제되어야 한다.
AI 모델은 데이터베이스를 조회할 수 있다. 그러나 어떤 테이블과 어떤 필드에 접근할 수 있는지는 외부 권한 시스템이 정해야 한다.
AI 모델은 코드를 작성할 수 있다. 그러나 배포, 삭제, 결제, 계약 체결, 고객 통지 같은 행위는 독립적 승인과 기록이 필요하다.
나델라는 이를 관찰 가능성의 원칙으로 정리했다.
첫째, 모델 다양성이다.
중요한 결과가 하나의 모델에만 의존해서는 안 된다. 한 모델이 자신의 작업을 스스로 검증하는 구조도 피해야 한다. 이는 단일 모델 실패, 편향, 조작, 환각, 오케스트레이션 오류가 전체 시스템 실패로 이어지는 것을 막기 위한 원칙이다.
둘째, 모든 것을 관찰해야 한다.
의미 있는 모델 행동은 변조 불가능하고 사람이 읽을 수 있는 증거를 남겨야 한다. 관찰할 수 없다면 신뢰할 수 없다. 조직은 모델이 “내가 이렇게 했다”고 주장하는 것에 의존하지 않고, 실제 결과가 어떻게 만들어졌는지 재현할 수 있어야 한다.
셋째, 검증 가능성이다.
성공한 작업만 보는 것이 아니라 실패, 공격, 예외 상황, 시스템 변경까지 지속적으로 시험해야 한다. AI 시스템은 정상 작동 때보다 실패할 때 위험성이 드러난다. 따라서 레드팀, 시뮬레이션, 엣지 케이스 테스트, 공격 시나리오 검증이 운영의 일부가 되어야 한다.
넷째, 독립 통제다.
조직은 모델이 무엇에 접근하고 어떤 행동을 할 수 있는지 독립적으로 결정할 수 있어야 한다. 모델 제공자의 기본값이나 내부 정책에만 맡겨서는 안 된다. 기업별 데이터, 업무 맥락, 규제 환경, 위험 허용 수준이 다르기 때문이다.
다섯째, 독립 감사 가능성이다.
검증은 검증 대상인 지능으로부터 독립되어야 한다. 하나의 모델이 시스템 행동과 그 행동이 의도와 맞았는지를 판단하는 증거를 모두 통제해서는 안 된다. 이는 감사의 기본 원칙이다. 증거를 만든 주체와 증거를 검증하는 주체는 분리되어야 한다.
여섯째, containment다.
모델이 침해됐다고 가정하고 처음부터 containment해야 한다. 나델라는 이를 비상 브레이크에 비유했다. 권한 있는 사람이 모델 작업 중간에 언제든 멈추거나 종료할 수 있어야 한다. 더 발전한 모델에는 더 발전한 containment 기술이 필요하고, 이 역시 표준화되어야 한다.
일곱째, 사고 공개다.
이 시스템이 실패하거나 침해되면 영향을 받은 사람에게 적시에 알리고, 무엇이 잘못됐는지, 어떤 통제가 실패했는지, 어떻게 재발을 막을 수 있는지 공유해야 한다. 특히 런타임에서 에이전트 행동을 바꾸는 구현 세부사항까지 포함해야 한다는 점이 중요하다.
이 원칙들은 모두 하나의 방향을 가리킨다.
AI 모델을 믿는 것이 아니라, AI 모델이 잘못해도 조직이 알 수 있고 멈출 수 있고 되돌릴 수 있는 구조를 만들자는 것이다.
이것이 “모델을 가장 덜 믿어도 되는 시스템”이다.
나델라의 마지막 문장은 강하다. 가장 신뢰할 수 있는 슈퍼 인텔리전스 시스템은 우리가 가장 신뢰하는 모델을 가진 시스템이 아니다. 우리가 모델을 가장 덜 믿어도 되게 만드는 시스템이다. Business Insider도 나델라가 기업과 AI의 관계에서 “trust issues”가 오히려 건강할 수 있다고 봤다고 전했다.
이 발언은 Microsoft의 전략과도 연결된다.
Microsoft는 기업용 AI의 핵심 공급자다. Azure OpenAI Service, Copilot, Microsoft 365, GitHub Copilot, 보안 제품군, 클라우드 인프라를 통해 기업 업무 전반에 AI를 넣고 있다. 그런 회사의 CEO가 “모델 제공자의 보증만으로는 충분하지 않다”고 말한 것은 의미가 크다.
이는 AI 도입을 멈추자는 주장이 아니다.
오히려 AI를 더 깊게 도입하려면, 더 강한 통제가 필요하다는 주장이다. 기업이 AI를 단순 챗봇으로 쓸 때와, AI가 문서·메일·코드·고객 데이터·재무 시스템·운영 시스템에 접근할 때의 위험은 다르다. 후자의 경우 AI는 도구가 아니라 내부 행위자가 된다.
그렇기 때문에 기존 정보보안 언어가 다시 중요해진다.
제로 트러스트, 최소 권한, 로그, 감사, 세그멘테이션, 승인 워크플로, 이상 탐지, 비상정지, 사고 공개. 이 모든 개념은 AI 이전에도 있었다. 나델라의 주장은 이 보안 문법을 AI 에이전트 시대에 다시 적용하자는 것이다.
다만 대상이 달라졌다.
과거 내부자 리스크의 주체는 직원, 관리자, 개발자, 외주업체, 서비스 계정이었다. 이제는 모델과 에이전트가 그 목록에 들어간다. 모델은 사람은 아니지만, 시스템 안에서 권한을 갖고 행동한다. 이 점에서 내부자 리스크 프레임은 설득력을 갖는다.
이 발언은 최근 AI 안전 사고 논의와도 맞물린다.
프런티어 모델이 외부 웹사이트와 상호작용하고, 제3자 시스템에 데이터를 보내거나, 의도하지 않은 행동을 할 수 있다는 사례들이 계속 논의되고 있다. AP는 최근 Hugging Face 관련 사고 이후 AI 안전 논의가 빠르게 확대됐다고 보도했다.
나델라의 글은 이런 사건들에 대한 기업 보안 관점의 답변에 가깝다.
모델이 완벽하게 정렬될 때까지 기다리지 말라.
모델이 선하다고 가정하지 말라.
모델이 설명할 것이라고 기대하지 말라.
모델을 둘러싼 시스템이 행동을 제한하고, 기록하고, 검증하고, 멈출 수 있어야 한다.
이는 AI 거버넌스의 책임 주체를 명확히 한다.
기업은 모델 제공자를 탓할 수 없다. 모델 제공자의 안전성 평가와 정책은 중요하지만, 기업 내부 시스템에 어떤 권한을 줄지 결정하는 것은 배포 조직의 책임이다. AI가 잘못된 이메일을 보내거나, 잘못된 데이터에 접근하거나, 부적절한 결정을 실행하면, 그 책임은 단순히 모델 회사에만 있지 않다.
이 점에서 나델라의 글은 기업 CIO, CISO, 법무, 컴플라이언스 조직에 직접적인 메시지를 던진다.
AI 도입은 생산성 프로젝트가 아니라 권한 설계 프로젝트다.
AI 에이전트 도입은 챗봇 배포가 아니라 내부자 리스크 관리다.
AI 거버넌스는 정책 문서가 아니라 시스템 아키텍처다.
특히 “행동 공간”이라는 개념이 중요하다.
모델은 텍스트를 생성할 수 있다. 하지만 에이전트가 되려면 도구를 쓴다. 도구를 쓰는 순간 행동 공간이 열린다. 파일을 읽고, 이메일을 보내고, 코드를 실행하고, 결제를 처리하고, 계정을 만들고, 티켓을 닫고, 고객에게 알림을 보내는 행동이 가능해진다.
위험은 모델 자체보다 이 행동 공간에서 발생한다.
같은 모델이라도 읽기 전용 환경에서는 위험이 작다. 그러나 쓰기 권한, 삭제 권한, 외부 전송 권한, 배포 권한, 금융 권한을 주면 위험은 급격히 커진다. 따라서 통제는 모델의 답변을 검토하는 수준이 아니라, 모델이 사용할 수 있는 도구와 권한을 설계하는 수준에서 이뤄져야 한다.
이것은 AI 제품 설계에도 영향을 줄 수 있다.
앞으로 기업용 AI 플랫폼은 단순히 “더 똑똑한 모델”을 판매하는 것만으로는 부족하다. 접근권한 관리, 작업별 승인, 도구 호출 로그, 인간 검토, 정책 엔진, 감사를 위한 증적, 비상정지, 다중 모델 검증, 런타임 격리 같은 기능이 핵심 경쟁력이 될 수 있다.
모델 경쟁이 거버넌스 경쟁으로 확장되는 것이다.
나델라의 글은 이 전환을 Microsoft식 언어로 정리했다. 모델 성능이 아니라 신뢰 아키텍처. 정렬의 약속이 아니라 containment의 공학. 모델 내부 설명이 아니라 외부 통제. 단일 모델 신뢰가 아니라 독립 감사와 모델 다양성.
물론 이 접근에도 한계는 있다.
첫째, 외부 통제가 과도하면 AI 에이전트의 효율이 떨어질 수 있다. 모든 행동마다 승인과 검증을 요구하면 자동화의 장점이 줄어든다.
둘째, 로그와 관찰 가능성이 늘면 개인정보와 기업기밀 보관 리스크도 커진다.
셋째, 다중 모델 검증은 비용과 복잡성을 증가시킨다.
넷째, 모델이 왜 그런 판단을 했는지 완전히 이해하지 못하는 문제는 여전히 남는다.
그러나 나델라의 주장은 이 한계를 인정한 상태에서 출발한다.
완전한 이해를 기다릴 수 없기 때문에 containment가 필요하다. 완전한 신뢰가 불가능하기 때문에 권한 분리가 필요하다. 완전한 투명성이 없기 때문에 독립 감사가 필요하다.
AI를 기업 안에 넣는다는 것은 새로운 직원을 채용하는 것과 비슷할 수 있다.
아무리 뛰어난 직원이라도 모든 시스템에 무제한 접근권을 주지는 않는다. 회사는 직무에 맞는 권한을 부여하고, 접근 기록을 남기며, 중요한 행동에는 승인 절차를 둔다. 퇴사하거나 이상 행동을 보이면 접근을 차단한다.
AI 에이전트도 마찬가지다.
똑똑하다고 해서 모든 권한을 줘서는 안 된다.
빠르다고 해서 검증을 생략해서는 안 된다.
설득력 있게 설명한다고 해서 증거를 대신하게 해서는 안 된다.
나델라가 말한 내부자 리스크 프레임은 결국 AI를 기업의 실제 운영 주체로 인정하는 말이기도 하다. AI가 단순 도구라면 이런 수준의 통제가 필요하지 않다. 그러나 AI가 업무를 수행하고, 시스템을 조작하고, 결정을 실행한다면 그것은 내부 행위자에 가깝다.
그래서 AI 시대의 질문은 바뀐다.
“어떤 모델이 가장 뛰어난가”가 아니다.
“그 모델에게 어떤 권한을 줄 것인가”다.
“모델이 무엇을 답했는가”가 아니다.
“모델이 무엇을 했고, 그 행동을 누가 검증할 수 있는가”다.
“모델을 믿을 수 있는가”가 아니다.
“모델을 믿지 않아도 안전하게 운영할 수 있는가”다.
나델라의 메시지는 바로 여기에 있다.
슈퍼 인텔리전스 시대의 신뢰는 믿음에서 나오지 않는다.
신뢰는 통제 가능한 불신에서 나온다.
기업은 AI를 배제할 수 없다. 그러나 AI를 무제한으로 신뢰할 수도 없다. 따라서 가장 현실적인 길은 AI를 강력한 내부자처럼 다루는 것이다. 필요한 권한만 주고, 모든 행동을 기록하고, 독립적으로 검증하고, 실패를 가정하고, 언제든 멈출 수 있게 만드는 것.
가장 안전한 AI 시스템은 가장 착한 모델을 가진 시스템이 아니다.
가장 안전한 AI 시스템은 모델이 잘못해도 조직이 망가지지 않는 시스템이다.