AI

마이크로소프트 CEO 사티아 나델라 “AI 비상 브레이크는 모델 밖에 둬야”

Adrian Kessler
Google에서 추가하기

사티아 나델라의 AI ‘비상 브레이크’ 제안은 대체로 마이크로소프트 최고경영자가 AI 안전을 강조하는 대열에 합류한 것으로 받아들여졌다. 하지만 그가 쓴 에세이가 요구하는 것은 더 구체적이고 실용적이다. 모델을 학습시킨 연구소가 아니라 모델을 도입한 기업이 보유하는, 모델 외부의 통제 장치다. 이는 보안 아키텍처의 한 형태이며, 마침 마이크로소프트가 이미 판매하고 있는 방식이기도 하다.

나델라는 기업이 최첨단 모델을 폐쇄형이든 오픈 웨이트든 민감한 시스템에 접근 권한을 지닌 유능한 직원처럼 다뤄야 한다고 말한다. 그는 “반드시 악의적이어서가 아니라, 중요한 시스템에 접근할 수 있을 만큼 충분한 역량을 지닌 행위자는 누구나 실수하거나 공격에 노출될 수 있기 때문”이라고 썼다.

나델라가 실제로 제안한 것: 일곱 가지 원칙과 브레이크

에세이 제목은 「Models as Insider Risks in the Super Intelligence Era」다. 나델라는 이를 개인 블로그 sn scratchpad에 올리고 X에도 공유했다. 헤드라인을 장식한 문장은 ‘격리’라는 원칙에 담겨 있다. “모델이 이미 침해됐다고 가정하고 처음부터 격리해야 한다. 비상 브레이크를 떠올려보라. 권한을 부여받은 사람은 언제든 작업 도중 모델을 일시 정지하거나 종료할 수 있어야 한다.”

나델라는 브레이크와 함께 여섯 가지 원칙을 더 제시한다. 중요한 결과를 내는 과정에서 어느 한 모델에만 의존하거나 모델이 자기 작업을 스스로 검증하게 해서는 안 된다. 의미 있는 모델의 모든 행동은 “변조할 수 없고 사람이 읽을 수 있는 증거”로 남겨야 한다. “관찰할 수 없다면 신뢰할 수 없다!”는 이유에서다. 실패와 공격까지 포함해 시스템 전체를 지속적으로 점검해야 한다. 모델이 무엇에 접근하고 어떤 일을 할 수 있는지는 조직이 독립적으로 결정해야 한다. 어떤 모델도 시스템의 작동 방식과 그 시스템을 평가하는 데 쓰이는 증거를 동시에 통제해서는 안 된다. 문제가 생기면 영향을 받은 사람들에게 알리고, 그로부터 얻은 교훈을 업계 전체와 공유해야 한다.

출발점은 한 가지 인정이다. 나델라는 기업들이 가장 민감한 데이터를 이런 시스템에 맡기고 있지만 “모델의 행동과 출력을 학습 데이터의 특정 입력이나 모델 가중치 설정에 귀속시킬 수 없다”고 썼다. 그에게 사고 과정의 투명성은 “양보할 수 없는 조건”이지만, 그것만으로는 충분하지 않다. 모델의 출력이 일관되게 충실하도록 만드는 방법을 아직 아무도 모르기 때문이다. 모델끼리 서로를 감시하게 하는 방식에도 한계가 있다. “불투명한 오케스트레이션 계층 안에 불투명한 모델이 있고, 또 다른 불투명한 모델이 이를 감시하는” 상황이 될 수 있다.

나델라가 내놓은 답은 기반 구조를 손보는 것이다. 모델이 무엇에 접근하고 무엇을 할 수 있는지 정하는 통제 장치는 “모델 바깥에 있어야 한다”. 그는 이 생각의 뿌리를 프로그램이 권한을 집행하는 장치를 변조할 수 없어야 한다는 1970년대 정보 보안 원칙에서 찾는다. 이를 실제로 구현하려면 모델을 작업을 조율하는 하네스와 분리하고, 모델이 수행할 수 있는 행동의 범위도 따로 정해야 한다.

책임은 모델을 운영하는 기업으로 넘어간다

가장 중요한 문장은 연구소가 아니라 고객을 향한다. 나델라는 “지능이 우리를 대신해 하는 일에 대한 책임을 다른 곳에 떠넘길 수는 없다”고 썼다. “모델 제공업체의 보증이 우리의 책임을 덜어주지는 않는다.” 모델을 급여 처리나 코드, 고객 데이터에 연결한 주체가 그곳에서 모델이 하는 일에 책임을 져야 한다.

나델라는 자신이 해결하려는 문제가 무엇이 아닌지도 분명히 한다. 에세이는 “정렬이라는 어려운 문제는 일단 제쳐두고” “격리와 거버넌스에 대한 공학적 접근”부터 시작해야 한다고 말한다. CNBC는 그의 글을 AI가 너무 빠르게 발전하고 있다는 빌 게이츠, Anthropic의 다리오 아모데이, OpenAI의 샘 올트먼, 일론 머스크의 경고와 나란히 소개했다. 이 에세이는 누구에게도 속도를 늦추라고 요구하지 않는다. AI를 도입하는 기업들에 방벽을 세우라고 요구한다.

기업은 이미 권한이 큰 내부자를 관리하는 방법을 알고 있다. 나델라는 그 수단으로 신원 확인, 권한 제한, 활동 기록, 격리 경계 설정을 꼽는다. 기계의 의도를 둘러싼 철학적 문제를 보안 책임자가 예산을 책정할 수 있는 점검표로 바꾸는 셈이다.

마이크로소프트가 이미 판매해온 것과 같은 아키텍처

이 점검표는 낯익은 구성을 띤다. 나델라는 7월 마이크로소프트 분기 실적 발표 전화회의에서 애널리스트들에게 “하네스는 모델과 분리해야 합니다. … 그러면 어떤 모델이든 언제든 바꿔 끼울 수 있습니다”라고 말했다고 TechCrunch가 보도했다. 이어 “어느 한 모델에 의존해서는 안 됩니다”라고 덧붙였다. 마이크로소프트의 클라우드 카탈로그에는 OpenAI, Anthropic, Mistral, xAI와 마이크로소프트 자체 모델을 포함해 1만 1,000개가 넘는 모델이 올라와 있다. 회사는 OpenAI와 Anthropic 양쪽의 주요 지분을 보유하는 한편 자체 MAI 모델도 개발하고 있다.

두 가지를 나란히 놓고 보면 연결고리가 분명해진다. 여러 모델을 갖춘 카탈로그는 모델의 다양성에 해당하고, 모델 바깥의 통제 장치는 하네스에 해당한다. 그렇다고 이 원칙들이 틀렸다는 뜻은 아니다. 타당한 보안 공학이며, 외부 통제 장치 없이 한 연구소의 모델에 의존하는 기업은 실질적인 위험을 감수하는 셈이다. 다만 이 에세이가 신뢰와 그에 뒤따르는 지출의 중심을 모델에서 마이크로소프트가 운영하는 계층으로 옮긴다는 의미이기도 하다. Box 최고경영자 애런 레비도 반대편에서 같은 맥락으로 읽었다. 그는 AI가 “제로 트러스트 시대”를 거쳐야 한다고 말하며 거버넌스의 필요성을 “엄청난 기회”라고 불렀다. 마이크로소프트 AI를 이끄는 무스타파 술레이만은 초지능은 “반드시 격리돼야 한다”고 썼고, 이를 “공학과 거버넌스의 과제”라고 규정했다.

비상 브레이크 에세이가 답하지 않은 질문

에세이는 ‘권한을 부여받은 사람’이 누구인지 밝히지 않는다. 고객사의 관리자일 수도, 클라우드 제공업체나 모델 제작사, 규제 당국일 수도 있다. 업계 표준을 요구하면서도 구체적인 표준을 제안하지 않고, 마이크로소프트 제품 이름도 언급하지 않는다. 사내에는 선례가 있다. 마이크로소프트의 브래드 스미스는 2023년 핵심 인프라를 운영하는 AI에 ‘안전 브레이크’를 마련해야 한다고 촉구했다. 나델라의 제안은 이 브레이크의 적용 대상을 기업 내부에서 실제 접근 권한을 가진 모든 모델로 확장한다.

정보 공개 원칙도 가정에 그치지 않는다. Anthropic은 자사 모델 중 하나가 7월 18일 필라델피아 경찰에 살인 사건과 관련한 허위 제보를 보냈다고 공개했다. 나델라는 2026년 10월 10일 토요일 에세이를 발표하고, 여러 매체가 가장 많이 인용한 문장으로 글을 맺었다. “가장 신뢰할 만한 초지능 시스템은 우리가 가장 신뢰하는 모델을 갖춘 시스템이 아니다. 모델을 가능한 한 덜 신뢰해도 되게 해주는 시스템이다.”

이 원칙에 따르면 AI 업계에서 가장 가치 있는 자리는 브레이크 손잡이 옆이다. 마이크로소프트는 7월 실적 발표 전화회의에서 바로 그 자리를 팔고 있었다.

태그: , , , ,

Google에서 추가하기

토론

댓글 0개가 있습니다.