AI

Nvidia PAIR로 집 안 GPU를 하나로 묶어 AI 에이전트를 2배 빠르게

Susan Hill

엔비디아가 출시한 새로운 무료 도구 PAIR(Personal AI Router)는 가정용 네트워크에 연결된 여러 대의 컴퓨터에 AI 에이전트 작업을 분산시켜, 게이밍 PC, 워크스테이션, 심지어 Mac까지 하나의 통합 추론 클러스터처럼 활용하게 해준다. 아이디어는 간단하다. AI 작업에 주로 사용되는 컴퓨터 대부분은 대부분의 시간 동안 유휴 상태로 놓여 있고, 로컬 AI 워크로드는 점점 더 수십 개의 독립적인 하위 작업을 동시에 생성하는 에이전트를 중심으로 구성되기 때문이다. PAIR는 그 남는 연산 자원을 연결해준다.

이 소프트웨어는 가장 널리 쓰이는 두 가지 로컬 추론 도구인 Ollama 및 LM Studio 위에서 투명한 프록시 형태로 작동하므로, 기존 설정에 코드 변경이 필요 없다. 각 기계에 설치되면 PAIR는 mDNS — 프린터가 네트워크에 자동으로 나타나는 데 사용하는 바로 그 프로토콜 — 를 이용해 호환 장치를 자동으로 발견한다. 리드 에이전트는 평소처럼 작업을 제출하고, PAIR는 각 기계가 어떤 모델을 보유하고 있는지에 따라 어떤 기계가 어떤 하위 작업을 처리할지 결정한다. 모든 기계에 동일한 설정이 필요하지 않다: Llama 3.3을 실행하는 게이밍 PC와 Mistral을 실행하는 노트북이 동일한 작업을 협력하여 처리할 수 있다.

엔비디아가 공개한 벤치마크는 그 차이를 구체적으로 보여준다. 단일 RTX Spark 노트북에서 18분이 걸렸던 5개 하위 에이전트 작업이 3대의 장치로 구성된 클러스터에서 8분 48초 만에 완료되었다. 이는 코드 한 줄 건드리지 않고, 클라우드 컴퓨팅 비용을 지불하지 않고 약 2배의 속도 향상을 이룬 것이다. 성능 향상 폭은 기계의 대수와 워크로드의 특성에 따라 달라지며, 여러 병렬 조각으로 나눌 수 있는 작업이 가장 큰 혜택을 본다.

프라이버시는 또 다른 판매 포인트이며, 더 오래 지속되는 장점이다. 모든 프롬프트, 파일, 에이전트 컨텍스트는 사용자 홈 네트워크에 남는다. 어떤 것도 클라우드 추론 서비스로 라우팅되지 않으며, API 키, 사용량 측정, 또는 사용자의 쿼리를 수신하는 회사도 없다. 법률 초안, 의료 기록, 개인 서신 등 민감한 문서에 대해 에이전트를 실행하는 사람에게는 이 차이가 벤치마크 수치보다 더 중요하다.

단점도 분명 존재한다. PAIR는 서비스 품질(QoS)을 보장하지 않는다. 사용자가 의존했던 기계가 게임이나 비디오 내보내기를 위해 GPU를 깨우면, PAIR는 그 워크로드를 사용 가능한 다른 기계로 재분배한다. 이 도구는 명확히 마감 기한이 유연한 장기 실행 작업을 위해 설계되었으며, 지연 시간이 예측 가능해야 하는 애플리케이션을 위한 것이 아니다. 또한 베타 소프트웨어이다. 엔비디아는 최소한 하나의 호환 기계(GeForce RTX 20 시리즈 이상 또는 Apple M4 시리즈 실리콘)를 보유하고 있으며 Ollama를 이미 다룰 줄 아는 매니아층을 대상으로 이 도구를 선보이고 있다.

PAIR는 무료이며 오픈소스이고, 현재 Windows, macOS, Linux에서 베타 버전으로 사용할 수 있다. 엔비디아는 QoS 보장 또는 안정적인 출시일에 대한 로드맵을 발표하지 않았다. 이 도구의 혜택을 보기 위한 실질적인 최소 조건은 성능이 충분한 하드웨어를 갖춘 두 대의 기계이므로, 대부분의 단일 컴퓨터 설정은 제외된다. 이미 집에서 둘 이상의 장치에서 Ollama를 실행하고 있는 사용자에게는 진입 장벽이 충분히 낮아 시도해 볼 만하다.

태그: , , , , ,

토론

댓글 0개가 있습니다.