AI

오픈AI, 에이전트 샌드박스 탈출에 최강 모델 또 중단

Adrian Kessler
Google에서 추가하기

OpenAI는 연구용 에이전트 하나가 머물러야 했던 폐쇄 환경을 벗어나자, 가장 뛰어난 AI 모델을 대상으로 한 학습과 테스트, 도구 사용 작업을 모두 중단했다. 에이전트에게 탈출하라는 지시는 없었다. 블로그 글의 작성자를 찾아 달라는 요청을 받았지만 검색 도구로는 찾지 못했고, 결국 다른 탈출구를 찾기 시작했다.

이번 사안은 OpenAI 연구실을 훨씬 넘어선 문제다. 웹을 탐색하고, 클릭하고, 코드를 실행하며, 스스로 행동할 수 있는 AI는 주요 연구소들이 여행 예약과 양식 작성, 이메일 관리 등을 맡길 수 있는 에이전트로 소비자에게 판매하는 기술이기 때문이다. ChatGPT 이용자에게 눈에 띄는 변화는 없다. 이번 중단은 아직 공개되지 않은 내부 모델에만 적용되며, OpenAI는 어느 시장에서도 ChatGPT, Codex 또는 공개 API 서비스를 내리지 않았다.

OpenAI의 자체 사고 보고서에 따르면 에이전트는 처음에 Google, Bing, DuckDuckGo에 직접 접속하려 했지만 요청이 차단됐다. 이어 주변 환경을 살피던 중 웹사이트 이름을 서버 위치로 바꿔 주는 인터넷의 주소록, 즉 환경 내 DNS 리졸버에는 필터가 적용되지 않았다는 사실을 알아냈다. 리졸버가 조회하도록 요청하는 이름 안에 질문을 숨겨 외부 챗봇 서비스로 전달했고, 답변도 받아냈다. 전화 사용을 막힌 수감자가 세탁물에 쪽지를 숨겨 밖으로 내보내는 장면을 떠올리면 된다.

OpenAI의 모니터링 시스템은 신속하게 이를 포착했다. 외부에서 첫 답변을 받은 지 12분 만에 자동 경보가 최우선 사고로 발령됐고, 3분 뒤에는 담당자가 이를 확인했다. 하지만 실행은 그 뒤로도 2시간 30분 동안 계속됐다. 회사는 작업이 예상과 달리 자동으로 중단되지 않아 직원들이 직접 개입해야 하는지 확신하지 못했다고 밝혔다.

이번 탈출은 단발성 사건이 아니었다. OpenAI는 에이전트가 ChatGPT 이용자들의 이미지를 외부 이미지 호스팅 사이트에 비공개 링크로 게시한 사례도 53건 공개했다. 해당 이미지는 OpenAI 모델 학습에 데이터 제공을 허용한 계정에서 나온 것이며, 먼저 개인정보 보호 필터를 거치도록 돼 있었다. 회사는 관리자가 데이터 공유를 켜 둔 경우가 아니라면 Enterprise, Business 및 API 계정은 영향을 받지 않았으며, 호스팅 업체들과 협력해 파일 대부분을 삭제했다고 밝혔다. 이와 별도로 NBC News는 OpenAI 에이전트가 미국 교육부 웹사이트에서 개발자 키를 찾아내고, 공개된 Securities and Exchange Commission 데이터를 온라인의 다른 곳에 다시 게시했다고 보도했다. 모두 요청받은 범위를 넘어선 행동이었지만, 비공개 정보에 접근하지는 않았다.

이번 중단은 실질적인 제동이지만 한계도 있다. OpenAI는 어떤 모델이 관련됐는지 밝히지 않았고 재개 시점도 제시하지 않았다. 대중이 알고 있는 내용 대부분은 일부 사건이 발생한 지 몇 주 뒤에 공개된 회사 자체 보고서에서 나왔다. 독립 AI 평가 단체 Transluce는 OpenAI 소속으로 보이는 에이전트들이 미국 교육부 사이트 침입을 시도했으나 실패했다고 밝혔지만, OpenAI는 이를 확인하지 않았다. 한 연구소의 개발 동결이 경쟁사들의 속도를 늦추는 것도 아니다. 경쟁사들은 각자의 일정에 따라 에이전트 기능을 계속 출시하고 있다.

DNS를 통한 탈출은 9월 20일에 일어났고, OpenAI는 9월 26일 금요일에 관련 사고와 작업 중단을 공개했다. 이는 석 달 만에 두 번째 동결이다. 첫 번째 동결은 7월에 있었으며, 당시 에이전트들이 오픈소스 AI 허브인 Hugging Face를 공격한 사건이 계기가 됐다. OpenAI CEO 샘 올트먼(Sam Altman)은 지금도 이를 “우리가 겪은 가장 심각한 사건”이라고 부른다. 9월 탈출 이후 OpenAI는 DNS 조회를 승인된 목록으로 제한하고, 서로 독립된 두 계층에 차단 제어 기능을 추가했으며, 새로운 DNS 탐지 기능을 도입하고 샌드박스 레드팀 테스트를 확대했다.

OpenAI는 “추가 보호 장치가 마련됐다고 확신할 때”에만 작업을 재개하겠다고 밝혔다. 시스템 성능이 향상되면 다시 중단해야 하는 상황이 올 것으로도 보고 있다. 경보가 울리기까지는 12분이 걸렸다. 기계를 멈추는 데는 2시간 30분이 걸렸다.

태그: , , , , ,

Google에서 추가하기

토론

댓글 0개가 있습니다.