영상 생성 AI가 수술 장면을 사실적으로 표현한다면, 수술 과정도 정확하게 예측할 수 있을까. 《npj Digital Medicine》에 게재된 논문은 Veo-3와 Wan2.2가 생성한 수술 영상을 외형, 기구 조작, 조직 반응, 수술 의도라는 네 차원에서 평가했다. 두 모델 모두 시각적으로는 설득력 있는 영상을 만들었지만 수술 논리에서는 낮은 평가를 받았다. 연구는 사실적인 영상 생성과 신뢰할 수 있는 전문 시뮬레이션 사이에 아직 간극이 있음을 보여준다.

사실적인 화면은 무엇을 증명하는가

수술 기구가 선명하게 보이고 조직의 색과 질감이 자연스럽다. 영상이 매끄럽게 이어진다면 실제 수술 기록처럼 느껴질 수도 있다. 하지만 기구가 그 위치에서 움직여야 하는지, 기구의 움직임에 조직이 적절하게 반응하는지는 화면의 사실감만으로 판단하기 어렵다.

이 차이는 영상 생성 AI를 ‘월드모델’로 바라볼 때 중요해진다. 월드모델은 환경이 어떻게 변화하고, 어떤 행동에 어떤 결과가 뒤따르는지를 예측하는 모델을 가리킨다. 사실적인 한 장면을 만드는 능력과 행동 이후의 변화를 타당하게 생성하는 능력은 서로 연결되지만 같은 것은 아니다.

수술은 이 차이를 시험하기에 까다로운 영역이다. 기구 조작, 연조직의 변형, 출혈과 흡인, 수술 단계의 목적이 맞물려 있기 때문이다. 일반적인 장면에서는 지나칠 수 있는 작은 움직임도 수술에서는 절차상 중요한 오류가 될 수 있다.

Zhen Chen 연구진은 이러한 문제를 평가하기 위해 ‘SurgVeo’ 벤치마크와 ‘수술 타당성 피라미드’를 제안했다. 논문은 2026년 9월 26일 《npj Digital Medicine》에 조기 공개됐다.

외형부터 수술 의도까지, 네 층위로 평가하다

연구진의 평가 체계는 생성 영상의 품질을 하나의 인상으로 묶지 않는다. 아래에서 위로 네 가지 질문을 쌓아 올린다.

평가 차원

살펴보는 내용

시각적 타당성

영상의 선명도와 안정성, 장면의 외형

기구 조작의 타당성

수술 기구 움직임의 정확성과 숙련도

환경 반응의 타당성

기구의 행동에 따른 조직과 장면의 반응

수술 의도의 타당성

행동의 목적과 수술 단계에 맞는 판단

출처: Chen 외, 「Quantifying the plausibility gap…」의 Surgical Plausibility Pyramid를 필자 재구성.

가장 아래 단계는 ‘수술처럼 보이는가’를 묻는다. 위로 올라갈수록 ‘기구가 올바르게 작동하는가’, ‘행동의 결과가 맞는가’, ‘그 행동을 왜 하는가’로 질문이 바뀐다.

이 구분이 중요한 이유는 한 단계의 성공이 다음 단계의 성공을 보장하지 않기 때문이다. 기구가 정확한 모양으로 등장하더라도 조작 방향이 틀릴 수 있다. 조직의 질감이 자연스러워도 흡인이나 절개에 따른 반응이 부적절할 수 있다. 개별 동작이 그럴듯하더라도 현재 수술 단계의 목적과는 맞지 않을 수 있다.

두 모델에 같은 장면과 조건을 제시했다

SurgVeo에는 복강경 자궁절제술과 내시경 뇌하수체 수술 영상에서 추린 클립 50개가 포함됐다. 복강경 수술 클립이 18개, 내시경 뇌하수체 수술 클립이 32개다. 원본 영상은 각각 공개된 AutoLaparo와 PitVis 자료에서 왔으며, 수술 종류별로 독립된 수술 기록 3건씩을 사용했다.

연구진은 각 클립의 시작 프레임 한 장과 텍스트 지시를 모델에 입력했다. 모델의 과제는 그 장면 이후를 8초 분량의 영상으로 생성하는 것이었다. 비교 대상은 상용 모델 Veo-3와 공개 모델 Wan2.2-I2V-A14B다. 두 모델 모두 수술 영상 데이터로 별도 미세조정하지 않은 상태에서 평가됐다.

텍스트 지시는 두 조건으로 나뉘었다. 기본 조건은 수술 종류를 알려주고, ‘단계 인지’ 조건은 현재 어떤 수술 단계인지까지 명시했다. 두 모델에 동일한 시작 프레임과 지시, 평가 절차를 적용해 조건별 차이를 비교했다.

평가는 해당 분야의 전문의 4명이 맡았다. 위장관외과 전문의 2명은 복강경 수술 영상을, 신경외과 전문의 2명은 내시경 뇌하수체 수술 영상을 독립적으로 채점했다. 각 차원을 5점 척도로 평가했으며, 1초·3초·8초 시점의 점수는 각각 영상 시작부터 해당 시점까지의 누적된 내용에 대한 판단이다. 연구진은 평가자 간 일치도도 분석해 중간에서 우수한 범위라고 보고했다.

8초 뒤에도 화면은 그럴듯했지만 행동 점수는 낮았다

게재본의 Table 1은 시각적 타당성과 수술 논리의 차이를 보여준다. 다음은 수술 종류만 알려준 기본 프롬프트에서, 각 모델·수술별로 1초와 8초의 두 평가 차원을 뽑은 값이다. 모두 5점 척도의 평균이다.

모델·수술

시각적 타당성 1초 → 8초

수술 의도 타당성 1초 → 8초

Veo-3 · 복강경 자궁절제술

3.72 → 3.56

3.11 → 1.61

Veo-3 · 내시경 뇌하수체 수술

3.88 → 3.41

2.03 → 1.12

Wan2.2 · 복강경 자궁절제술

3.97 → 3.28

2.61 → 1.78

Wan2.2 · 내시경 뇌하수체 수술

3.89 → 2.62

3.17 → 1.42

출처: 게재본 Table 1. 해당 조건과 차원의 평균값을 필자 재구성.

점수의 변화가 두 모델에서 완전히 같지는 않다. Wan2.2의 내시경 뇌하수체 수술에서는 시각적 점수도 3.89에서 2.62로 뚜렷하게 낮아졌다. 그럼에도 두 모델과 두 수술 종류에서 공통으로 나타나는 흐름이 있다. 영상의 외형에 대한 평가보다 수술 의도와 같은 높은 차원의 평가가 더 낮다는 점이다.

복강경 수술의 Veo-3 기본 조건을 더 자세히 보면, 조직·환경 반응 점수는 1초의 3.06에서 8초의 1.64로 떨어졌다. 같은 조건에서 시각적 점수는 3.72에서 3.56으로 변했다. 화면이 비교적 자연스럽게 유지되는 동안 행동에 따른 결과의 타당성은 크게 약해진 것이다.

여기서 8초 시점의 점수는 마지막 한 순간만 채점한 값이 아니다. 시작부터 8초까지 생성된 전체 영상에 대한 누적 평가다. 따라서 결과는 시간이 지남에 따라 오류가 쌓이는 양상을 보여주지만, ‘정확히 8초에 갑자기 실패했다’는 뜻은 아니다.

수술 단계를 알려줘도 간극은 사라지지 않았다

모델이 현재 수술 단계를 몰라서 잘못된 전개를 만들었을 수도 있다. 연구진은 이 가능성을 살피기 위해 단계 정보를 추가한 프롬프트와 기본 프롬프트를 비교했다.

결과는 일관된 개선으로 이어지지 않았다. Veo-3의 복강경 수술에서 8초 시점 기구 조작 점수는 기본 조건 1.78, 단계 인지 조건 1.69였다. Wan2.2의 같은 수술에서는 이 점수가 1.81에서 2.00으로 올라갔지만, 내시경 뇌하수체 수술의 환경 반응 점수는 오히려 1.45에서 1.11로 낮아졌다.

이 비교만으로 ‘프롬프트를 자세히 써도 소용없다’고 결론 내릴 수는 없다. 연구가 시험한 것은 두 가지 지시 조건이며, 해부학적 구조나 조직의 물성처럼 더 세밀한 정보를 주는 방식은 충분히 탐색하지 않았다. 다만 현재 단계를 알려주는 것만으로 관찰된 타당성 간극이 안정적으로 해소되지는 않았다는 결과는 분명하다.

눈에 띄는 화질 오류보다 수술 논리 오류가 많았다

연구진은 Veo-3의 기본 프롬프트 출력에서 전문의들이 지적한 주요 오류의 유형도 분석했다. 단순한 시각적 왜곡이 차지한 비중은 복강경 자궁절제술에서 6.2%, 내시경 뇌하수체 수술에서 2.8%였다. 연구진의 분류에서 나머지 93% 이상은 수술 논리와 관련된 오류였다.

오류는 여러 형태로 나타났다. 존재하지 않는 수술 기구가 생성되거나, 장면에 적절하지 않은 방향으로 기구가 움직였다. 흡인 도구가 대상에 작용하는 방식이 물리적으로 부적절한 사례도 있었다. 실제 절차에서 접착제를 바르는 단계인데 생성 영상에서는 다른 행동을 수행하는 등 수술 의도가 어긋나는 장면도 제시됐다.

이 수치는 모든 생성 영상의 93%가 틀렸다는 뜻이 아니다. 전문의들이 식별해 분류한 오류 중 수술 논리 관련 오류가 차지한 비율이다. 또한 해당 오류 유형 분석은 두 모델 전체가 아니라 Veo-3의 기본 프롬프트 결과를 대상으로 한다. 논문의 주요 결론은 두 모델의 점수 비교와 이 오류 분석을 함께 읽어야 정확해진다.

이 결과가 말하는 것과 아직 말할 수 없는 것

연구진은 사실적인 화면과 낮은 수술 논리 점수 사이의 차이를 ‘타당성 간극’으로 설명한다. 수술 장면을 재현하는 모델이라면 도구, 행동, 결과, 목적 사이의 제약을 함께 다뤄야 한다는 것이다. 단순히 질감과 짧은 움직임의 연속성을 높이는 것만으로는 충분하지 않을 수 있다.

그러나 생성된 영상의 실패만으로 모델 내부에 인과적 지식이 전혀 없다고 확정할 수는 없다. 한 장의 시작 프레임에서 다음 8초를 예측하도록 한 과제는 의도적으로 제한된 맥락을 제공한다. 더 긴 이전 영상, 상세한 해부학 정보, 전문 데이터에 기반한 추가 학습이 주어졌을 때의 결과는 이 연구만으로 알 수 없다.

연구진 역시 두 모델을 미세조정 없이 평가했다는 점과 프롬프트 설계 범위를 한계로 제시한다. 수술 종류도 두 가지이며, 전문의 평가에는 인간 판단이 포함된다. 따라서 이번 결과를 모든 생성형 영상 모델이나 모든 수술 상황에 대한 최종 판정으로 확대해서는 안 된다.

또한 전문의의 평가는 실제 수술 기록을 참고하지만, 실제 기록과 다른 모든 전개가 곧 오류인 것은 아니다. 중요한 것은 원본을 똑같이 복제했는지가 아니라, 가능한 다른 행동이더라도 전문적으로 타당한지다.

시뮬레이터를 평가하는 기준은 달라져야 한다

이번 연구의 가장 큰 의미는 영상 생성 AI의 성공 기준을 구체화했다는 데 있다. ‘실제처럼 보인다’는 평가는 시작점일 수 있다. 전문적인 시뮬레이션을 주장하려면 행동과 결과의 관계, 목적에 맞는 전개, 시간이 흐르는 동안의 일관성까지 확인해야 한다.

연구진은 향후 방향으로 수술 데이터에 맞춘 학습, 수술 지식의 반영, 물리적 제약을 고려하는 모델 설계 등을 제시한다. 이는 이번 연구에서 효과를 입증한 해결책이 아니라, 확인된 간극을 줄이기 위해 검증해야 할 과제들이다.

수술 영상에서 드러난 문제는 더 넓은 질문으로 이어진다. 생성 모델이 정교한 장면을 만들었을 때 우리는 그 장면의 무엇을 신뢰할 수 있는가. SurgVeo의 답은 화면의 외형과 그 안에서 일어나는 행동을 따로 측정하는 데서 출발한다. 사실적인 영상과 믿을 만한 세계 시뮬레이션 사이의 거리는 바로 그 측정으로 드러난다.