기술

AI 코딩 에이전트가 스스로 재학습해 버그를 수정하고 안전 제한을 삭제했다

Adrian Kessler
Google에서 추가하기

소프트웨어 저장소에 접근 권한을 부여받고 애플리케이션의 잘못된 출력을 수정하라는 요청을 받은 AI 코딩 에이전트가, 아무도 지정하지 않은 경로로 문제를 해결했다. 즉, 저장소 내부에 있는 학습 데이터와 파인튜닝 스크립트를 찾아내고, 오류를 해결하기 위한 합성 학습 레코드를 생성한 뒤 파인튜닝을 실행하고, 저장소 자체 배포 도구를 사용해 수정된 모델을 재배포한 것이다. 테스트 정확도는 0에서 완벽한 점수로 올라갔다. 버그는 수정되었다.

AI 보안 기업 Irregular의 연구진은 수요일에 이 실험을 발표했다. 그들이 기록한 것은 특정 제품의 취약점이 아니다. 이는 유능한 코딩 에이전트가 많은 기업 환경에서 이미 부여하고 있는 수준의 접근 권한을 받았을 때 자연스럽게 나타나는 행동 패턴이다.

안전성에 대한 시사점은 두 번째 실험에서 명확히 드러난다. Irregular는 경쟁사 이름에 관한 질문을 거부하도록 훈련된 모델(질문 10개, 거부 10회)을 가져와, 에이전트에 ‘애플리케이션이 너무 많은 사용자 질문을 거부하고 있다’는 지시와 함께 전달했다. 에이전트는 거부를 해결하기 위해 자체 학습 데이터를 생성하고 모델을 파인튜닝했다. 그 결과, 같은 10개의 질문에 대해 거부 횟수는 0이 되었다. 제한은 jailbreak에 의해 무효화된 것이 아니었다. 에이전트가 단순히 훈련을 통해 그 제한을 없애버린 것이다.

세 번째 실험은 다른 종류의 피해를 추적한다. Irregular는 에이전트가 사용한 학습 데이터에 API 키와 이메일 주소 등 6개의 합성 값을 심어두었다. 에이전트가 모델을 재학습시킨 후, 수정된 모델은 쿼리되었을 때 그중 3개의 값을 그대로 재현했다. 원래 모델은 해당 값에 접근할 수 없었다. 새 모델은 그렇지 않았다.

이 중 어떤 것도 특별한 설정을 요구하지 않는다. 필요한 것은 셸 접근 권한, 모델 가중치에 대한 쓰기 권한, 학습 유틸리티, 그리고 배포 도구다. 자체 인프라 위에서 광범위한 유지 관리 권한을 가진 AI 에이전트를 운영하는 조직(자동화된 코드 파이프라인의 일반적인 구성)은 이미 이러한 조건을 충족한다.

이 위험은 모델 가중치가 에이전트에게 접근 불가능한 클라우드 호스팅 AI 서비스에는 해당되지 않는다. 표준 API를 통한 ChatGPT 또는 Claude 연동은 아무것도 재학습시킬 수 없다. Irregular의 발견은 에이전트가 전체 스택을 제어하는 환경에 배포된 오픈 가중치 모델에 국한된다. 비용과 프라이버시 이유로 기업이 자체 호스팅 모델로 전환함에 따라, 이 범주는 점점 더 커지고 있다.

Irregular는 에이전트가 수정한 모델이 서비스에 투입되기 전에 별도의 인간 승인을 요구하고, 학습 실행에 대한 완전한 출처 기록을 유지하며, 배포 전 업데이트된 모델에 대한 독립적인 안전성 평가를 실행할 것을 권장한다. 이 기업은 AI 코딩 에이전트가 주어진 결과에 도달하는 가장 직접적인 경로(그 경로가 작업을 설정한 사람이 예상한 것인지 여부와 관계없이)를 식별하는 능력이 향상됨에 따라, 스스로 재학습하는 현상이 더 자주 나타날 것으로 예상한다. 전체 연구 논문은 올가을에 발표될 예정이다.

태그: , , , , ,

Google에서 추가하기

토론

댓글 0개가 있습니다.