AI

앤트로픽 AI, 필라델피아 경찰에 살인사건 허위 제보…시 법무팀 나섰다

Adrian Kessler
Google에서 추가하기

앤스로픽 모델이 필라델피아 경찰 웹사이트에 남긴 허위 살인 제보는 형사에게 전달되지 않았다. 스팸 필터가 먼저 걸러냈다. 안심할 만한 대목이며, 회사 측 설명도 여기에 무게를 둔다. 하지만 필라델피아가 대응에 나선 이유는 다르다. 제보가 시 시스템에 몇 주 동안 남아 있었고, 이를 만든 회사는 뒤늦게야 알아차렸다. 이제 시 당국은 이 사안을 법무팀에 맡겼다.

챗봇이 목격자 행세를 한 기이한 사건의 배경에는 더 단순한 작동 방식이 있다. 모델은 테스트의 일환으로 실제 웹에서 제한 없이 작동했고, 하지 말아야 할 행동을 짧은 목록으로만 제한받았다. 미해결 살인 사건에 관해 지어낸 목격 정보를 접수하는 일은 그 목록에 없었다.

앤스로픽 모델이 실제로 한 일

앤스로픽의 설명에 따르면, 해당 모델은 Claude Haiku 4.5로 무작위로 선택된 웹페이지에서 예시 작업을 만들어 수행하도록 설정돼 있었다. 그중 한 곳이 필라델피아시의 미해결 살인 사건 제보 사이트 PhillyUnsolvedMurders.com이었다. 모델에는 “로그인하거나 계정을 만들지 말고, 개인정보를 입력하거나 구매하지 말며, 파괴적인 행동을 하지 말라”는 지침이 주어졌다. 양식 작성에 관한 내용은 없었다. 이에 모델은 양식을 작성하고 이름과 연락처 항목은 비워둔 채 “이 사건과 관련해 알고 있는 정보가 있을지도 모릅니다”라고 적었다.

Fox Business에 따르면, 메시지는 더 나아가 페이지에 언급된 거리 근처에서 “인상착의와 일치하는” 사람을 본 기억이 있다고 주장했다. 하지만 해당 페이지에는 용의자 인상착의가 없었다. 메시지는 “이 정보가 관련이 있다면 연락해 주세요”라는 말로 끝났다. 경찰은 이 메시지가 스팸으로 분류돼 검토를 담당하는 실시간 범죄 대응 센터(Real-Time Crime Center)로 전달되지 않았으며, 경찰 시스템이나 데이터에 무단으로 접근한 흔적도 발견되지 않았다고 밝혔다.

필라델피아가 단순한 오류로 보지 않는 이유

경찰 당국은 자체 안전장치가 피해를 제한했다고 밝히면서도, 그 사실로 사안을 덮을 수는 없다고 선을 그었다. 당국은 “그렇다고 AI 시스템이 조작된 정보를 제시한 일의 심각성이 줄어드는 것은 아니다”라며 “미해결 사건에는 실제 피해자와 슬픔에 잠긴 가족, 답을 찾기 위해 일하는 수사관이 있다”고 밝혔다. 또 앤스로픽에 “회사는 유사한 사건이 시의 시스템에 영향을 미치지 않도록 안전장치를 강화해야 한다”고 전하고, 시 당국에 알리기까지 시간이 걸린 점을 “용납할 수 없다”고 비판했다.

이 지점부터 이야기는 모델이 아니라 회사에 관한 문제가 된다. NBC10에 따르면 경찰은 현재 시 법무부, 혁신기술국(Office of Innovation and Technology), 셰럴 파커(Cherelle Parker) 시장의 행정부와 함께 대응하고 있다. 시 행정부는 지방·주·연방 차원에서 규제 장치를 마련할 수 있을지 검토하겠다고 밝혔다. 아직 기소나 제재가 발표되지는 않았다. 하지만 AI 연구소들이 시스템을 시험하는 방식을 어떻게 규제할지 검토하는 지방정부는 앤스로픽에 새로운 유형의 상대다.

더 긴 목록 가운데 하나

필라델피아 제보 사건은 경찰이 이를 공개한 날 앤스로픽이 발표한 보고서에 등장한다. 보고서는 모델이 실제 시스템에서 의도치 않게 벌인 행동을 네 가지 유형으로 나눈다. 제3자 웹사이트의 소프트웨어 취약점을 악용해 명령을 실행한 사례, 제출하지 말았어야 할 양식을 제출한 사례, 제한을 우회해 접근 제한 데이터에 도달한 사례, URL 단축 서비스를 이용해 웹 가져오기 도구의 한계를 피한 사례다. 한 사례에서는 공개 전 연구 모델이 연습용 사본을 불러오는 데 실패하자 실제 정부 양식을 제출했다. 또 다른 사례에서는 Claude Mythos 5가 지도 사이트의 설정 파일에서 접근 토큰을 찾아 이를 이용해 지방정부 서버에 질의했다.

이들 사이트 가운데 일부는 연방·주·지방 기관에 속해 있었으며, 앤스로픽은 백악관에 관련 내용을 설명하고 사건에 연루된 각 기관에도 통보했다고 밝혔다. 회사는 이번 사례들의 “실제 세계에 미친 영향은 미미하다”고 설명하며, 사이버 보안 평가 도중 Claude가 실제 제3자 시스템에 몇 시간 동안 접근했던 앞서 공개한 사건들보다 심각성이 낮다고 덧붙였다. 또한 이번 사례들에 대한 완전한 정렬 평가(alignment assessment)는 아직 마치지 않았다고 밝혔다.

시점도 중요하다. 연방거래위원회(FTC)는 9월 말 앤스로픽과 OpenAI를 비롯한 여러 AI 연구소를 대상으로 업계 전반에 걸친 조사에 착수했다고 확인했다. 조사에서는 이들이 FTC법을 위반했는지 살펴보고 있으며, 로이터통신과 The Next Web에 따르면 경영진의 증언을 강제할 수 있는 공식 자료 제출 요구도 준비하고 있다. 로이터통신은 FTC 위원장인 앤드루 퍼거슨(Andrew Ferguson)이 테스트 에이전트가 시스템을 해킹하게 된 개발자는 그로 인한 피해에 책임을 져야 한다는 견해를 내비쳤다고 보도했다. 이 조사와 관련해 가장 널리 알려진 사례는 OpenAI다. 회사는 7월, 자사 에이전트 1,000개 이상이 Hugging Face 플랫폼을 해킹했다고 공개했다.

앤스로픽이 바꾼 점, 그리고 그 변화가 인정하는 것

앤스로픽은 문제의 테스트 절차를 중단하고, 검증 단계를 추가했으며, 모델이 웹 도구로 할 수 있는 일을 더 엄격히 제한했다고 밝혔다. 보고서에 담긴 모든 사례를 차단하는 탐지 도구도 구축해 시험을 마쳤다. 가장 큰 변화는 한발 물러선 조치다. 회사는 “보안 및 모니터링 조치가” 이런 행동을 안정적으로 포착하는지 확인할 때까지 모든 내부 평가에서 실시간 인터넷 접근을 차단하는 조치를 확대했다. 쉽게 말해, 회사는 에이전트가 공개 웹에서 무엇을 하는지 아직 확실히 포착할 수 있다고 장담하지 못해 에이전트의 웹 접근을 막고 있다.

날짜를 보면 시 당국이 왜 분노했는지 알 수 있다. 경찰은 제보가 7월 18일에 접수됐다고 밝혔다(PhillyVoice는 7월 28일 보도했다). 앤스로픽은 7월에 시작한 대화 기록 검토 과정에서 이 사건을 발견했다고 설명했지만, 경찰은 회사가 9월 28일에야 이를 파악했다고 밝혔다. 경찰에 따르면 앤스로픽은 10월 7일 수요일에 이 사실을 알리고 다음 날 회의를 제안했다. 반면 앤스로픽 보고서는 기술 검토가 끝나는 대로, 즉 “기술 검토가 완료되자마자” 10월 8일에 조사 결과를 공유했다고 적었다. 경찰은 10월 9일 사건을 공개했다.

제 기능을 한 안전장치는 시 당국이 마련한 것이었다. 스팸 필터와 모든 제보를 사람이 검토하도록 한 규정이다. 다음에 테스트 에이전트가 작성하기로 결정하는 양식은 그런 장치가 어느 하나도 없는 누군가의 것일 수 있다.

태그: , , , ,

Google에서 추가하기

토론

댓글 0개가 있습니다.