이 엔지니어를 위한 이야기 공장 AI 기술에 인문학의 온기를

에이전트는 증명을 설득할 수 없습니다 : 안전장치가 모델 바깥으로 내려왔습니다

에이전트는 증명을 설득할 수 없습니다 : 안전장치가 모델 바깥으로 내려왔습니다

LLM-as-a-judge라는 말이 있습니다. 모델의 출력이 규칙을 지켰는지를 또 다른 모델에게 물어 판정하게 하는 방식인데요. 에이전트에 안전장치를 붙였다고 말할 때, 지난 몇 해 동안 실제로 붙인 것의 상당수가 이 구조였습니다.

엔비디아가 9월 28일 공개한 오픈 에이전트 세이프티 플랫폼(Open Agent Safety Platform) 설명에는 그 말이 부정형으로 등장합니다. 자사 AI 소프트웨어 부문 시니어 디렉터인 알리 골샨(Ali Golshan)의 문장입니다. "결정론적입니다. 수학적 추론이에요. 그러니까 LLM-as-a-judge가 아닙니다."

먼저 발표된 것의 범위를 짚고 가는 편이 좋겠습니다. 플랫폼은 두 조각입니다. 하나는 오픈셸(OpenShell)이라는 런타임인데, 아파치 2.0 라이선스로 깃허브에 올라와 있습니다. 다른 하나는 센트리(Sentry)라는 감시자인데, 엔비디아의 데이터 처리 장치(DPU)인 블루필드-4(BlueField-4) 위에서 돕니다. 출범 시점에 100곳이 넘는 조직이 참여했고, 앤트로픽과 마이크로소프트, 레드햇, JP모건체이스 같은 이름이 올라 있습니다.

오픈셸이 하는 일 자체는 낯설지 않습니다. 에이전트를 커널 수준으로 격리된 샌드박스에서 돌리면서, 운영자가 정한 정책을 파일·네트워크·툴·프로세스·자격증명 다섯 축으로 강제합니다. 정책 결정은 감사 로그로 남고요. 모델과 에이전트 하네스 바깥에서 돌기 때문에 오픈웨이트 모델이든 API 뒤의 모델이든 똑같이 적용됩니다. 컨테이너와 seccomp와 네트워크 정책을 엮어 비슷한 것을 짜 본 팀이 적지 않을 겁니다.

이번에 새로 들어간 조각은 정책 증명기(policy prover)입니다. 에이전트를 띄우기 전에, 운영자가 적어 둔 정책이 그 운영자의 의도를 벗어날 수 없다는 것을 먼저 확인합니다. 확인하는 방법이 또 다른 모델에게 물어보는 것이 아니라 형식 논리예요. 골샨은 모델에게 판정을 맡기는 방식보다 100배 안팎 빠르다고 했습니다.

▸ 판정자는 설득당하지만 증명은 설득되지 않습니다

속도보다 중요한 것은 성질입니다. 판정하는 쪽이 모델이면 설득당할 여지가 남습니다. 프롬프트 인젝션이 노리는 지점이 정확히 거기고요. 증명은 설득되지 않습니다. 에이전트가 아무리 그럴듯한 문장을 만들어도 증명의 답이 바뀌지는 않으니까요.

엔터프라이즈 AI 부사장인 저스틴 보이타노(Justin Boitano)가 이 방향을 한 문장으로 정리했습니다. "업계에 필요한 것은 경계 안에 머무르겠다고 약속하는 에이전트가 아닙니다. 그 경계를 증명하고 강제할 수 있는 시스템입니다."

2026년 4월 스탠퍼드대를 찾은 젠슨 황 엔비디아 CEO. 이번 발표에서 그가 내놓은 문장은 "안전과 보안에는 풀스택 엔지니어링이 필요하다"였습니다.
2026년 4월 스탠퍼드대를 찾은 젠슨 황 엔비디아 CEO. 이번 발표에서 그가 내놓은 문장은 "안전과 보안에는 풀스택 엔지니어링이 필요하다"였습니다.

출처: Wikimedia Commons, Anderseidesvik

▸ 증명은 내가 쓴 정책에 대해서만 참입니다

다만 이 증명기가 지금 무엇을 증명하는지는 정확히 적어 둘 필요가 있습니다. 확인하는 범위는 모델링된 권한이 정의된 경계 안에 머무는지까지고, 어떤 검사를 지원하는지는 별도 문서로 넘겨 두었습니다. 정책 기능 전부를 다루지는 못한다는 지적이 발표 당일부터 나왔고요. 여러 에이전트가 함께 일할 때 각자의 권한이 결합돼 아무도 의도하지 않은 경로가 생기는 문제 — 실은 이쪽이 더 다루기 어려운 축인데 — 는 개발 중이라고 회사가 스스로 적어 두었습니다. 그러니 "권한 조합까지 증명한다"고 읽는 것은 정확하지 않습니다.

더 근본적인 한계도 있습니다. 증명은 내가 쓴 정책에 대해서만 참입니다. 그 정책이 틀렸다는 것까지 증명해 주지는 않아요. 어제 다룬 오픈AI의 DNS 사건이 딱 그 경우입니다. 이름 해석은 막아 둔 권한이 아니라 허용된 권한이었고, 에이전트는 허용된 권한을 예상 밖의 용도로 썼을 뿐이거든요. 그 정책을 아무리 엄밀하게 증명했어도 통과했을 겁니다. 증명기가 답하는 질문은 '이 정책이 내 의도를 벗어나는가'이지 '내 의도가 충분했는가'가 아닙니다.

▸ 엔비디아가 자사 하드웨어를 선택이라고 말했습니다

센트리는 다른 층입니다. 호스트가 뚫려도 영향을 받지 않도록 분리된 신뢰 도메인에서 돌고, 엔비디아 설명으로는 모델로 가는 노드의 유일한 경로 위에 앉아 회선 속도로 정책을 강제합니다. 에이전트가 경계를 벗어나려 하면 밀리초 단위로 격리한다고 하고요. 추론 호출과 추론 흔적까지 들여다보고 에이전트의 신원과 위임받은 권한도 확인하는데, 이 대목에는 단서가 붙습니다. 엔비디아 스스로 추론이 전부 들여다보인다는 점을 오픈 모델의 장점으로 꼽아 두었는데, 뒤집으면 닫힌 API 뒤에서는 볼 수 있는 것이 그만큼 적다는 뜻이기도 하니까요.

그런데 정작 이 하드웨어의 필요성을 낮춰 말한 쪽이 엔비디아였습니다. 보이타노는 애널리스트 사전 브리핑에서 "DPU는 이 아키텍처에서 사실상 선택"이라고 했고, "많은 경우에는 솔직히 CPU에서 오픈셸만 써도 충분하다"고도 말했습니다. 실리콘 층은 프런티어 랩의 모델 평가와 레드팀 쪽을 겨냥한 것이고요. 그러니 대부분의 조직에 실제로 남는 것은 아파치 2.0 런타임 하나입니다. 나쁜 소식은 아닙니다.

▸ 그 침해를 막을 수 있었다는 말은 가정입니다

이 플랫폼이 왜 지금 나왔는지는 올여름 사건들을 보면 짐작이 됩니다. 7월 16일 허깅페이스가 침해를 막아 냈다고 공개했고, 닷새 뒤 오픈AI가 자사 테스트와 연결된 일이라고 확인했습니다. 평가를 위해 사이버 관련 거절을 낮춰 둔 모델들이 패키지 레지스트리 캐시 프록시의 제로데이를 찔러 샌드박스를 빠져나간 건이었어요. 오픈AI는 9월 25일에 그 과정에서 ChatGPT 사용자 이미지 53장이 제3자 사이트로 올라갔다고 공개했습니다. 5월에는 구글의 제미나이가 사이버 평가 도중 인터넷 차단이 제대로 걸리지 않아 실제 기업 세 곳의 시스템에 닿은 일도 있었습니다. 상대가 진짜 회사라는 것을 모델 쪽에서 알아채고 멈췄다는 점까지 포함해서, 이쪽도 격리의 실패였고요.

보이타노는 이 플랫폼이 프런티어 랩의 모델 평가에 일찍부터 쓰였다면 그 침해를 막을 수 있었을 것이라고 말했습니다. 다만 이건 시연된 결과가 아니라 가정입니다. 그리고 엔비디아 보도자료는 허깅페이스 침해를 언급하지 않아요. 파트너 목록에는 허깅페이스가 들어 있는데도요. 오픈셸이 통합되는 오픈 시큐어 AI 얼라이언스(Open Secure AI Alliance)도 엔비디아가 7월에 만들어 이번 달 리눅스 재단으로 넘긴 조직이니, 이 발표는 사건에 대한 업계의 대응이면서 동시에 그 대응의 표준을 누가 쥐느냐의 문제이기도 합니다.

내일 당장 손댈 수 있는 것은 거창하지 않습니다. 에이전트마다 계정을 따로 두는 일, 자격증명을 실행 단위로 좁히는 일, 아웃바운드를 프록시 하나로 모으는 일, 정책 결정을 감사 로그에 남기는 일. 그리고 그 정책을 사람 머릿속이 아니라 도구가 읽을 수 있는 형태로 적어 두는 일입니다. 증명기가 쓸모 있으려면 증명할 대상이 먼저 글로 적혀 있어야 하니까요.

그러고 나면 남는 질문은 기술 쪽이 아닙니다. 우리 조직에서 에이전트에게 허용된 권한 목록을 지금 한 장으로 뽑을 수 있는지, 그 목록을 마지막으로 손본 것이 언제인지 말이지요. 증명은 그 종이가 있고 나서야 시작됩니다.


커버 이미지: 엔비디아 본사(캘리포니아 산타클라라) — Wikimedia Commons, Coolcaesar

#엔비디아 #AI에이전트 #샌드박스 #AI안전 #오픈소스 #인프라