개인용 컴퓨터를 고를 때, 성능은 오랫동안 가장 중요한 기준이었다. 새로운 프로그램이나 게임이 나올 때마다 더 빠른 CPU와 GPU, 더 많은 메모리가 필요했고, 몇 년이 지나 성능이 부족해지면 컴퓨터를 바꾸는 일이 자연스러웠다. PC에서 무언가를 하려면 그만큼의 계산 능력이 내 컴퓨터 안에 있어야 했기 때문이다.
하지만 대다수의 사람들이 컴퓨터를 사용하는 장소와 방식이 달라지면서 PC의 모습도 바뀌었다. 책상 앞에 앉아 사용하는 데스크톱보다 어디서든 펼쳐 쓸 수 있는 노트북이 개인용 컴퓨터의 중심으로 올라왔고, 일상적인 인터넷 이용의 상당 부분은 스마트폰과 태블릿으로 옮겨갔다. Omdia의 전 세계 PC 출하량 추이를 보면 2016년부터 2025년까지 데스크톱 출하량은 줄어든 반면, 노트북 출하량은 전체적으로 증가했다. 2025년에는 노트북 출하량이 데스크톱의 세 배를 훌쩍 넘어섰다.

인터넷과 클라우드의 확산은 이런 변화를 더 밀어붙였다. 문서는 웹에서 작성하고, 파일은 클라우드에 저장하며, 음악과 영상도 직접 보관하기보다 스트리밍으로 이용하는 일이 많아졌다. 프로그램을 설치하지 않아도 브라우저만 있으면 할 수 있는 일이 늘었고, 무거운 계산도 필요한 순간 데이터센터의 컴퓨팅 자원을 빌려 처리할 수 있게 됐다. PC의 성능이 중요하지 않아진 것은 아니지만, 적어도 모든 계산을 내 컴퓨터가 직접 해야 할 이유는 줄어들었다.
생성형 AI도 처음에는 이 흐름의 연장선에 있었다. ChatGPT나 Claude를 사용할 때 실제 모델이 돌아가는 곳은 대부분 사용자의 PC가 아니라 거대한 데이터센터다. 사용자는 질문을 보내고 결과를 받을 뿐, 그 사이에 필요한 막대한 계산은 클라우드가 처리한다. 스마트폰이나 가벼운 노트북에서도 거대한 AI 모델을 사용할 수 있었던 것도 이 때문이다.
그런데 최근에는 이와 반대 방향의 움직임도 커지고 있다. 모델을 직접 PC에 내려받아 실행하는 ‘로컬 AI’가 빠르게 사용하기 쉬워지면서다. 몇 년 전 게임이나 영상 편집을 위해 구입했던 데스크톱, 이전 세대의 워크스테이션, Apple Silicon을 탑재한 Mac처럼 충분한 GPU와 메모리를 갖춘 컴퓨터라면 AI 때문에 새로운 용도가 생길 수 있다.
사람이 직접 사용하는 컴퓨터로서는 뒤로 밀려났던 PC가, 이번에는 AI를 위한 계산 장치로 다시 쓰이기 시작한 것이다.
AI가 클라우드에서 PC로 내려온다
PC에서 AI 모델을 실행하는 것 자체는 새로운 일이 아니다. 개발자와 연구자들은 오래전부터 자신의 컴퓨터에서 머신러닝 모델을 학습하거나 실행해왔다. 다만 환경을 구성하고 모델을 직접 관리해야 했기 때문에 일반적인 PC 사용 방식과는 거리가 있었다.
최근 달라진 것은 이 과정의 문턱이 빠르게 낮아지고 있다는 점이다. Ollama나 LM Studio 같은 프로그램을 이용하면 다양한 AI 모델을 자신의 PC에 내려받아 직접 실행할 수 있다. 그 기반에는 여러 종류의 CPU와 GPU에서 언어모델을 실행할 수 있도록 개발된 오픈소스 프로젝트 llama.cpp 같은 기술도 있다. 복잡한 개발 환경을 직접 구성하지 않아도 로컬에서 AI를 사용할 수 있는 방법이 늘어나고 있는 것이다. 이런 움직임은 별도의 AI 프로그램에만 머물지 않는다. Microsoft도 Foundry Local과 Windows ML을 통해 Windows PC에서 AI 모델을 직접 실행할 수 있는 환경을 확대하고 있다. 로컬 AI가 일부 개발자의 실험을 넘어 일반적인 PC의 새로운 사용 방식으로 들어오기 시작했다는 점에서 의미가 있다.

여기서 한 단계 더 나아가면 PC 자체를 AI 서버처럼 사용할 수도 있다. 로컬에서 실행한 모델을 API로 열어두면 다른 프로그램이나 기기가 해당 모델을 불러 사용할 수 있다. 평소 인터넷 너머의 데이터센터에 보내던 요청을 이제 같은 방이나 집 안에 있는 PC가 처리할 수 있는 것이다.
Apple은 최근 이 흐름이 어디까지 갈 수 있는지를 조금 극단적인 형태로 보여줬다. WWDC26에서 공개한 MLX-LM Server를 이용하면 Mac에서 언어모델을 실행하고 다른 프로그램이 API를 통해 접근하도록 만들 수 있다. 한 대의 Mac이 모델을 실행하는 컴퓨터이면서 동시에 다른 프로그램에 AI 기능을 제공하는 서버가 되는 구조인데, 심지어 한 대로 부족하면 여러 대를 묶을 수도 있다. Apple은 MLX의 분산 추론 기능을 이용해 여러 Mac에 하나의 모델을 나눠 실행하는 방법도 시연했다. 실제 시연에서는 총 1조 개의 파라미터를 가진 Kimi 2.6 모델이 등장했다. 8비트로 양자화해도 모델 가중치에 약 1TB의 메모리가 필요해 한 대의 M3 Ultra에는 들어가지 않지만, 네 대의 Mac에 나누면 실행할 수 있었다. 여러 Mac에서 모델을 돌리고 다른 MacBook에서 원격으로 이용하는 모습도 함께 보여줬다.

하지만 여기서 중요한 것은 Mac의 성능 자체가 아니다. 개인용 컴퓨터를 사용하는 방식이 달라지고 있다는 점이다. 예전에는 사람이 PC 앞에 앉아 프로그램을 실행했다면, 이제는 한쪽에 컴퓨터를 켜두고 AI 모델을 계속 실행한 뒤 다른 컴퓨터나 프로그램이 그 계산 능력을 가져다 쓰는 방식도 가능해졌다. PC가 사람이 직접 사용하는 기계인 동시에, 다른 기기에 계산 능력을 제공하는 작은 AI 서버가 되기 시작한 것이다.
안 쓰던 PC에 새로운 일이 생겼다
이 변화는 데스크톱에서 특히 흥미롭다. 몇 년 전 게임이나 영상 편집을 위해 구입한 PC라면 주력 컴퓨터 자리에서는 밀려났더라도 여전히 상당한 GPU 성능을 가지고 있을 수 있다. 최신 게임을 최고 옵션으로 실행하거나 최신 작업용 PC와 성능을 겨루기는 어려워도, 하드웨어에 맞는 크기의 AI 모델을 계속 실행하는 용도로는 다시 사용할 여지가 생긴다.
사용 방식도 이전과 다르다. AI 서버로 사용하는 컴퓨터 앞에 사람이 계속 앉아 있을 필요는 없다. 모델을 실행해두고 같은 네트워크에 있는 노트북이나 다른 PC에서 접속할 수 있기 때문이다. 평소 업무에는 가볍고 배터리가 오래가는 노트북을 사용하면서, 책상 아래나 다른 방에 있는 데스크톱의 GPU가 실제 AI 계산을 담당하는 식이다.
이런 사용법은 이미 로컬 AI 프로그램에도 반영되고 있다. LM Studio는 모델을 API 서버로 실행할 수 있을 뿐 아니라 GUI 없이 백그라운드에서 작동시키는 기능도 제공한다. 모니터가 없는 GPU 장비에 모델을 띄워놓고 다른 기기에서 사용할 수 있다는 뜻이다.

LM Link를 이용하면 다른 컴퓨터에서 실행되는 모델을 자신의 노트북에서 불러와 사용할 수도 있다. Ollama 역시 모델을 백그라운드에서 실행하고 API를 통해 다른 프로그램과 연결할 수 있다. 로컬에서 돌아가는 모델을 코딩 도구나 다른 AI 애플리케이션에 연결하는 것도 가능하다. ‘AI 서버’라고 해서 반드시 데이터센터의 거대한 랙을 떠올릴 필요는 없는 것이다.
여기서 한때 책상에서 밀려났던 데스크톱의 특징이 오히려 장점으로 바뀐다. 노트북처럼 작고 가벼울 필요가 없고, 배터리 사용 시간을 걱정할 필요도 없다. 그래픽카드를 교체하거나 추가할 수 있는 제품도 많고, 냉각이나 저장공간을 확장하기도 상대적으로 쉽다. 무엇보다 한곳에 두고 오랫동안 켜놓는 용도에 적합하다.
하드웨어를 평가하는 기준도 달라진다. 예전에는 최신 게임을 얼마나 잘 돌리는지가 중요했다면, 로컬 AI에서는 그래픽카드의 VRAM도 중요한 조건이 된다. 모델이 커질수록 더 많은 메모리가 필요하기 때문에, 최신 GPU가 아니더라도 충분한 VRAM을 갖췄다면 새로운 쓰임이 생길 수 있다.
Mac에서는 구조가 조금 다르다. Apple Silicon은 CPU와 GPU가 하나의 통합 메모리 풀을 공유하기 때문에 메모리가 큰 제품에서는 상당한 용량을 AI 모델에 활용할 수 있다. 반면 일반적인 Windows 데스크톱에서는 시스템 RAM과 그래픽카드의 VRAM이 나뉘어 있어 GPU에 얼마나 많은 메모리가 달려 있는지가 더 직접적인 제약이 된다.
물론 모든 오래된 PC가 AI 서버로 다시 쓰일 수 있는 것은 아니다. 새 PC에 밀려 사용 빈도는 줄었더라도, AI 모델을 실행할 만한 GPU와 메모리를 갖춘 컴퓨터라면 이야기가 달라진다.
이런 PC를 다른 용도로 활용하는 것 자체는 낯선 일이 아니다. 이전에도 남는 컴퓨터를 NAS나 홈서버, 미디어 서버로 바꿔 파일을 저장하거나 영상을 전송하고, 게임 서버를 돌리는 경우가 있었다. 로컬 AI는 여기에 새로운 역할을 하나 더한다. 이제는 문서를 분석하고 코드를 살펴보거나, 질문에 답하고 다른 프로그램의 요청을 처리하는 AI 서버로도 활용할 수 있다.
흥미로운 점은 사람이 데스크톱을 직접 사용하는 시간은 줄어들었지만, 그 안의 계산 능력을 활용할 방법은 오히려 하나 더 생겼다는 것이다.
구독료 대신 전기료를 내는 것일까
로컬 AI가 주목받는 데에는 비용 문제도 있다. 클라우드 AI는 강력한 모델을 별도의 장비 없이 바로 사용할 수 있지만, API를 많이 호출할수록 비용도 늘어난다. 특히 AI 에이전트처럼 하나의 작업을 수행하기 위해 모델을 여러 차례 호출하거나 긴 문맥을 반복해서 처리하는 프로그램에서는 사용량이 빠르게 증가할 수 있다.
로컬 AI의 비용 구조는 다르다. 물론 처음부터 PC를 새로 구입한다면 상당한 하드웨어 비용이 필요하고, 모델을 실행하는 동안 전력도 소비하겠지만, 이미 가지고 있는 PC를 이용한다면 모델에 질문을 한 번 더 보낸다고 매번 토큰 비용이 추가되는 것은 아니다. 클라우드에서 사용량에 따라 지불하던 비용의 일부가 하드웨어와 전력 비용으로 바뀌는 것이다.
Apple도 새로운 Mac을 로컬 AI 장비로 소개하면서 클라우드 AI의 토큰 비용을 신경 쓰지 않고 모델을 실행할 수 있다는 점을 강조하고 있다. 하지만 이것이 로컬 AI가 항상 더 저렴하다는 뜻은 아니다. 비싼 GPU를 새로 구입해 가끔 모델을 돌리는 것보다 필요할 때 클라우드를 이용하는 편이 경제적인 경우도 많다.
비용보다 더 분명한 차이는 데이터를 어디에서 처리하느냐에 있다. 회사의 코드나 내부 문서, 개인적인 자료처럼 외부 AI 서비스에 보내기 부담스러운 정보라면 자신의 PC 안에서 모델과 데이터를 함께 처리할 수 있다. 인터넷 연결이 없는 환경에서도 사용할 수 있고, 특정 업무에 필요한 작은 모델을 계속 켜두는 것도 가능하다.
그렇다고 로컬 AI가 클라우드를 밀어내는 것은 아니다. 더 크고 강력한 모델이 필요할 때는 여전히 클라우드를 이용할 수 있다. 그래서 ‘구독료가 전기료로 바뀐다’는 표현은 재미있지만, 이 변화의 전부를 설명하지는 못한다. 한동안 데이터센터의 몫으로 여겨졌던 AI의 계산을 개인 컴퓨터도 다시 맡기 시작했다는 점이 더 중요하다.
개인 컴퓨터의 역할이 한 바퀴 돌아왔다
초기의 개인용 컴퓨터에서는 프로그램과 데이터뿐 아니라 대부분의 계산도 내 컴퓨터 안에서 이루어졌다. 인터넷과 웹이 발전하면서 데이터와 프로그램의 일부가 서버로 이동했고, 클라우드 시대에는 개인이 직접 갖추기 어려운 계산 능력까지 필요할 때 빌려 쓰는 일이 자연스러워졌다.
생성형 AI는 처음에는 이 흐름을 더 강하게 만드는 것처럼 보였다. 거대한 모델을 개인이 직접 실행하기 어려웠기 때문에 스마트폰이나 가벼운 노트북으로 데이터센터의 AI를 호출하는 방식이 자연스러웠다. 어떤 컴퓨터를 가지고 있는지보다 어떤 AI 서비스에 접속할 수 있는지가 더 중요해 보이기도 했다.
하지만 모델이 다양해지고 양자화 기술과 로컬 AI 소프트웨어가 발전하면서 모든 AI 작업에 거대한 데이터센터가 필요한 것은 아니게 됐다. 비교적 작은 모델이나 특정 목적에 맞춘 모델은 개인용 컴퓨터에서도 실행할 수 있고, 한 대의 PC를 계속 켜두고 여러 기기가 그 계산 능력을 공유하는 방식도 점점 쉬워지고 있다.
그러면서 개인용 컴퓨터의 성능도 다시 다른 의미를 갖기 시작했다. 로컬 AI에서는 GPU와 메모리, 메모리 대역폭 같은 물리적인 성능이 어떤 모델을 실행할 수 있는지를 결정한다. 앞으로 컴퓨터를 고를 때 “게임이 얼마나 잘 돌아가는가”나 “영상 편집이 얼마나 빠른가”와 함께 “어떤 AI 모델을 로컬에서 돌릴 수 있는가”가 하나의 기준이 될 수도 있다.

한동안 개인용 컴퓨터는 직접 계산하는 기계보다 클라우드의 서비스와 컴퓨팅 자원을 이용하는 창구로서의 역할이 커졌다. 로컬 AI는 이 흐름에 작은 변화를 만들고 있다. 모든 계산을 클라우드에 맡기는 대신, PC가 처리할 수 있는 AI 작업은 다시 그 안에서 실행하기 시작한 것이다. 그렇다고 클라우드가 사라지는 것은 아니다. 거대한 모델은 여전히 데이터센터에서 돌아가고, 개인용 컴퓨터에서도 그 성능에 맞는 AI 작업을 직접 처리할 수 있게 됐다.
돌고 돌아, AI 시대에 개인용 컴퓨터가 다시 ‘직접 계산하는 기계’로 주목받고 있다.

