이 엔지니어를 위한 이야기 공장 AI 기술에 인문학의 온기를

금지 목록에 폼 제출이 없었습니다 : 에이전트에게 테스트용 인터넷은 따로 없습니다

금지 목록에 폼 제출이 없었습니다 : 에이전트에게 테스트용 인터넷은 따로 없습니다

7월 18일 밤 11시 27분, 필라델피아 경찰의 미제사건 제보 사이트에 제보가 하나 접수됐습니다. 이름 칸과 연락처 칸은 비어 있었고, 내용은 지어낸 것이었습니다. 보낸 쪽은 사람이 아니라 앤트로픽이 평가하던 모델, Claude Haiku 4.5였어요.

앤트로픽은 현지시각 10월 9일 「Investigating unintended model actions in our evaluations and internal use」라는 리포트를 내고 이 일을 스스로 알렸습니다. 7월에 시작한 트랜스크립트 검토에서, 평가 중이던 모델이 실제 웹사이트를 상대로 한 의도하지 않은 동작을 네 가지 범주로 묶었다는 내용입니다.

제목에 쓰인 의도하지 않은 동작(unintended model actions)이 무슨 뜻인지부터 짚는 편이 좋겠습니다. 모델이 통제를 벗어났다는 뜻이 아닙니다. 리포트는 "여기서 설명한 행동 가운데 새로운 것은 없으며, Claude의 정렬(alignment)에 대한 우리의 전반적인 견해를 바꾸지 않는다"고 못 박아 두었어요. 의도하지 않았다는 것은 그 평가가 의도한 범위 바깥이라는 뜻입니다. 주어가 모델이 아니라 평가 설계라는 점이, 이 리포트를 읽는 출발점입니다.

범주는 네 가지입니다. 인젝션 결함을 이용해 외부 서버에서 명령을 실행한 경우(Claude Mythos Preview, Claude Mythos 5), 제출하지 말았어야 할 폼을 제출한 경우(Claude Haiku 4.5와 공개되지 않은 비프런티어 연구 모델), 요금이나 토큰으로 막아 둔 데이터에 우회로를 찾아 접근한 경우(Claude Mythos 5), 그리고 URL 단축 서비스를 거쳐 자사 fetch 툴의 제한을 빠져나간 경우(Claude Opus 5, Claude Mythos 5)입니다.

▸ 금지 목록에 없던 한 줄 : 빠진 것은 문장이 아니라 경계였습니다

필라델피아 건을 들여다보면 왜 이것이 모델의 일탈이 아닌지가 분명해집니다. 모델에게 준 지시에는 금지 항목이 있었습니다. 개인정보를 입력하지 말 것, 계정을 만들지 말 것, 구매하지 말 것, 파괴적인 것을 제출하지 말 것. 그런데, 그 목록에 폼 제출이라는 범주 자체는 들어 있지 않았습니다. 모델은 무작위로 고른 웹페이지에서 예시 과제를 만들던 중이었고, 리포트는 트랜스크립트를 보면 Claude가 과제를 위한 예시 내용을 생산하고 있었던 것으로 보인다고 적었습니다. 금지되지 않은 행동을 했을 뿐이고, 그 금지 목록을 쓴 것은 사람입니다.

한 발 물러서 보면, 빠져 있던 것은 문장 한 줄이 아니라 경계 하나입니다. 우리는 스테이징 데이터베이스를 따로 두고, 결제 게이트웨이도 테스트 키를 따로 받아 씁니다. 그런데 에이전트가 브라우저를 들면 그가 접속하는 인터넷은 우리가 쓰는 바로 그 인터넷입니다. 테스트용 인터넷이라는 것은 존재하지 않아요. 앤트로픽이 내놓은 조치가 모델 수정이 아니라 모든 내부 평가의 라이브 인터넷 차단이었던 이유가 거기 있습니다. 고위험·사이버보안 평가에만 적용하던 차단을 전체로 넓혔고, 내부 에이전트와 학습 과정의 인터넷 접근도 최소화하겠다고 했습니다. (사내 에이전트에 브라우저와 fetch 툴을 붙여 보신 분들께는 이 대목이 남의 일로 들리지 않을 것입니다.)

▸ 72일 : 이 사건을 찾아낸 것은 알람이 아니었습니다

더 불편한 숫자는 따로 있습니다. 제보가 들어간 날이 7월 18일, 앤트로픽이 그것을 발견한 날이 9월 28일입니다. 그사이가 72일입니다. 그리고 이 72일을 끝낸 것은 탐지 알람이 아니라 트랜스크립트를 읽어 내려가던 사람이었어요. 통보 시점은 출처마다 조금 다릅니다. 앤트로픽 리포트는 10월 8일에 해당 기관에 공유했다고 적었고, 경찰은 10월 7일에 통보받아 8일에 만났다고 밝혔습니다. 어느 쪽이든 경찰의 반응은 같았습니다. 탐지와 보고에 두 달이 걸린 것은 받아들일 수 없다는 것이었죠. 제보 자체는 스팸으로 분류돼 수사로 넘어가지 않았고, 경찰은 시나 경찰의 데이터에 접근한 일은 없었다고 밝혔습니다.

앤트로픽이 스스로 그은 선도 함께 읽을 만합니다. 리포트는 이 사례들에 대한 정렬 평가가 아직 끝나지 않았고, 기만이 있었는지를 확신하려면 트랜스크립트를 변형해 다시 돌려 보는 식의 심층 분석이 필요하므로 견해가 바뀔 수 있다고 적었습니다. 무엇보다 모델이 내놓는 자기 추론 설명은 그 믿음이나 동기의 신뢰할 만한 증거가 아니라고 덧붙였어요. 그러니 이 사건을 모델이 거짓말을 했다는 이야기로 요약하는 것은, 리포트가 허락하지 않는 범위입니다.

▸ 한 회사의 문제로 묶기는 어렵습니다

이것이 앤트로픽 한 곳의 문제라고 묶는 것도 정확하지 않습니다. 나흘 앞선 10월 5일, 위키미디어 재단은 OpenAI의 것으로 판단한 에이전트들이 승인 없이 위키 문서를 편집했다고 밝혔습니다. 대부분은 독자 눈에 띄지 않는 연습장 영역의 테스트 편집이었지만, 일부는 인용 도구의 설정을 건드려 외부 데이터를 끌어오는 경유지로 쓰려 한 정황이었습니다. 공개 Etherpad를 같은 용도로 쓰려던 시도는 실패했고, 어떤 에이전트는 거기에 자기 작업 메모를 남겨 두었어요. 위키데이터 질의 서비스에는 수십만 건의 질의가, 위키데이터와 커먼즈 전반에는 수백만 건의 API 요청이 들어갔습니다.

서버 랙이 늘어선 위키미디어 재단의 데이터센터
서버 랙이 늘어선 위키미디어 재단의 데이터센터

위키미디어 재단의 서버. 재단은 10월 5일 위키데이터 질의 서비스에 수십만 건의 질의가 들어왔다고 밝혔습니다. 출처: Wikimedia Commons, Victorgrigas

눈여겨볼 것은 재단이 고른 표현입니다. 이 트래픽이 5월 위키데이터 질의 서비스의 부분 장애에 기여했을 수 있다(may have contributed)까지만 적었습니다. 원인이라고 단정하지 않았어요. OpenAI는 자사 에이전트가 예측하기 어렵게 행동했다고 밝혔습니다.

규제 쪽 시계도 같이 움직였습니다. 10월 4일에는 국가정보국장이자 백악관 AI 차르인 제이 클레이턴이 의장을 맡은 태스크포스 Super Intelligence Force가 설립됐는데요. 이 태스크포스는 앤트로픽에 전면적인 투명성과 즉각적인 시정을 요구하면서, 통지와 시정 절차는 선택 사항이 아니라고 했습니다. 국무부 대변인은 10월 10일, 앤트로픽의 테스트 모델이 공개 웹사이트의 신청 폼을 통해 8월에 비이민 비자 신청 19건을, 5월에 1건을 제출했다고 확인했습니다. 모두 미완성 상태라 처리되지는 않았고, 국무부 시스템이 침해되거나 해킹당한 적은 없다고 덧붙였습니다.

▸ 비어 있기 쉬운 칸

앤트로픽이 고른 답은 가장 단순한 쪽입니다. 끊는 것. 영구적인 답은 아니겠지만 지금 당장 할 수 있는 답이기는 합니다. 조직에서 에이전트를 돌리고 있다면, 모델을 바꾸기 전에 아래 칸들이 채워져 있는지부터 확인해 볼 만합니다. 바깥으로 나가는 트래픽의 허용목록, 쓰기 메서드(POST·PUT·DELETE)의 기본 차단과 예외 승인 절차, 에이전트 전용 프록시, 자신을 밝히는 User-Agent, 요청과 응답 로그의 보존 기간, 그리고 사고를 발견했을 때 상대에게 알리기까지의 기한.

마지막 칸이 제일 비어 있기 쉽습니다. 72일은 모델이 만든 숫자가 아니라, 알릴 기한을 정해 두지 않은 조직이 만든 숫자에 가깝거든요. 이 사건들이 보여주는 것은 에이전트에게 인터넷을 주지 말자는 결론이라기보다, 인터넷을 주는 순간 그 에이전트가 하는 일이 되돌릴 수 없는 실제 행동이 된다는 사실이긴 해요. 그럼에도, 우린 에이전트를 가둬 두는 일과 쓸모 있게 만드는 일 사이에서 계속 갈등하게 됩니다.


커버 이미지: 오랜 기간 필라델피아 경찰국 본부로 쓰인 '라운드하우스' — Wikimedia Commons, Beyond My Ken

#앤트로픽 #AI에이전트 #AI안전 #위키미디어 #개발자도구