
92%가 66%로 떨어집니다. 단어 열 개 중 하나를 동의어로 바꿔 놓았을 때의 이야기고요. 넷 중 하나를 바꾸면 17%까지 내려갑니다.
OpenAI가 현지시각 10월 5일 공개한 텍스트 워터마크 textGrain의 성능표에 적힌 숫자입니다. 같은 보고서에는 오탐률 1%를 기준으로 심리학 분야 지문 400토큰을 약 95%, 200토큰을 약 80% 잡아낸다는 숫자도 함께 있어요. 발표의 요지는 이렇습니다. 앞으로 몇 주에 걸쳐 유럽연합 안의 ChatGPT와 Codex 사용자에게 요금제와 무관하게 워터마크가 적용됩니다. API는 발표 당일부터 전 세계 어디서나 켤 수 있지만 기본값은 꺼짐이고요. 약 20쪽짜리 기술 보고서가 함께 나왔습니다.
왜 지금인지부터 짚는 편이 좋겠습니다. EU AI 법(규정 2024/1689) 제50조 2항의 의무가 2026년 8월 2일에 발효됐습니다. 조항이 요구하는 것은 생성형 AI 제공자가 자사 시스템의 출력물을 "기계가 판독할 수 있는 형식으로 표시하고, 인공적으로 생성되거나 조작된 것으로 탐지 가능하도록" 보장하라는 것인데요. 이미 시장에 나와 있던 시스템은 제111조 4항에 따라 12월 2일까지 시간을 받았고, ChatGPT가 거기에 해당합니다.
여기서 용어를 한 번 고정하고 가야 합니다. 조항이 요구하는 것은 표시이지 탐지가 아닙니다. 정확히는, 제공자가 자기가 만들어 내보내는 출력물에 기계가 읽을 수 있는 자국을 남기라는 요구예요. 임의의 글을 집어넣으면 AI가 썼는지 알려 주는 장치를 만들라는 요구가 아니고요. 둘은 비슷하게 들리지만 쓸 수 있는 자리가 전혀 다릅니다.
▸ 숨은 문자를 넣지 않기로 한 선택이 양쪽을 다 결정했습니다
textGrain이 작동하는 방식이 그 차이를 잘 보여 줍니다. 언어 모델은 다음 토큰을 고를 때 확률 분포에서 난수로 뽑는데요. textGrain은 그 난수를 비밀 키와 앞서 나온 토큰들에서 유도한 유사난수로 바꿔 놓습니다. 어휘 전체를 여러 블록으로 나눈 뒤 어느 블록에서 뽑을지를 최적수송(optimal transport) 문제로 풀고, 선택된 블록 안에서는 토큰들의 원래 상대 확률을 그대로 보존해요. 그래서 문장은 평소와 다르지 않게 읽히고, OpenAI는 모델 성능에 유의미한 변화가 없었다고 밝혔습니다. 신호는 수백 번의 작은 쏠림으로 누적되고, 비밀 키를 가진 탐지기는 생성에 쓰인 모델이 무엇이었는지 몰라도 그 쏠림을 읽어 냅니다.
설계상의 중요한 선택이 하나 있습니다. 숨은 문자나 보이지 않는 공백을 끼워 넣지 않는다는 것이에요. 신호를 운반하는 것은 단어 선택 그 자체입니다. 덕분에 복사해서 붙여 넣어도 워터마크는 그대로 살아남습니다. 그런데 바로 같은 이유로, 단어를 바꾸면 신호도 함께 사라집니다. 맨 앞의 두 숫자가 그 뜻이에요. 복사와 붙여넣기에 강한 성질과 바꿔 쓰기에 약한 성질은 서로 다른 두 가지 결함이 아니라 한 가지 설계의 양면입니다.

종이 워터마크는 빛에 비춰야 보입니다. 1787년 에든버러판 번스 시집에 쓰인 손으로 뜬 종이에 남은 자국인데요. 글의 내용이 아니라 어느 제지소에서 뜬 종이인지를 알려 줍니다. 출처: Wikimedia Commons, Rosser1954
▸ 검출되면 뜻이 있지만, 검출되지 않으면 아무 뜻도 없습니다
그 양면성을 안고 보면 OpenAI가 발표문에 함께 적어 둔 단서들이 달리 읽힙니다. 회사는 워터마크가 사용자를 식별하지 않는다고 했고, 인간의 기여도를 측정하지 않는다고 했고, 소유권이나 책임을 성립시키지 않는다고 했습니다. 그리고 가장 중요한 한 줄이 있어요. 워터마크가 없다는 사실은 사람이 썼다는 증거가 되지 않습니다.
그러니 이 장치의 판정은 한쪽으로만 유효합니다. 워터마크가 검출되면 그 글은 OpenAI의 창구를 통과했을 가능성이 높습니다. 검출되지 않으면요? 사람이 썼을 수도 있고, 다른 회사의 모델이 썼을 수도 있고, OpenAI 모델이 썼는데 번역을 거쳤거나 길이가 짧았거나 수식이 많았을 수도 있습니다. 영어 프롬프트 500개를 EU의 나머지 23개 공식 언어로 번역해 본 시험에서 탐지율은 루마니아어 42.2%부터 스페인어 69.0%까지 흩어졌어요. 400토큰짜리 수학 지문은 약 60%고요. OpenAI는 워터마크 강도를 조절할 수 있게 해 두고, 탐지율이 60%에 못 미친 언어에서는 강도를 올렸다고 밝혔습니다. 탐지가 안정적으로 작동하는 하한선으로 제시된 200토큰은 EU 실행규약이 "매우 짧은 텍스트"를 의무에서 빼 준 기준과 맞춰 둔 숫자입니다.
탐지기를 누가 쥐는지도 같은 방향을 가리킵니다. 출시 시점에 탐지기는 공개되지 않았습니다. 쓰려면 신청해야 하고, 승인된 연구자와 전문기관에만 열립니다. 코넬대학교의 존 틱스턴(John Thickstun), 취리히 연방공과대학교의 마르틴 베체프(Martin Vechev), 그리고 슬로바키아 켐펠렌 지능기술연구소(KInIT)의 연구진이 먼저 이름을 올렸어요. 공개 검사기를 내놓지 않은 이유로 회사가 든 것은 미탐과 오탐이 실제 피해를 낳을 수 있다는 점이었습니다. 접근 범위는 EU 실행규약에 따라 차차 넓어질 예정이고요.
결국 많은 사람이 이 기술에서 가장 먼저 떠올릴 쓰임새, 그러니까 이 글을 사람이 썼는지 판정해 누군가의 채용이나 성적을 가르는 일은 지금 할 수 없습니다. 도구가 닫혀 있어서이기도 하지만, 더 근본적으로는 회사가 그 도구로 그런 판정을 할 수 없다고 먼저 적어 두었기 때문이에요. 회사는 검출 결과가 글의 정확성을 보증하지도, 계정이나 프롬프트를 특정하지도 않는다고 못 박았습니다.
▸ 경계를 긋는 것은 기술이 아니라 관할권과 기본값입니다
그렇다면 표시되는 글과 표시되지 않는 글을 가르는 선은 어디에 그어질까요. 기술이 아니라 관할권과 기본값이 긋습니다. ChatGPT와 Codex에서는 EU 사용자만 자동으로 적용받습니다. API에서는 전 세계가 켤 수 있지만 꺼진 채로 시작하고, 조직이나 프로젝트 설정에서 직접 켜야 합니다. 적용 대상 모델을 넓히는 작업은 아직 진행 중이고요.
앤트로픽은 다른 선택을 했습니다. 8월 2일 이후에 나온 Claude 모델은 생성하는 모든 텍스트에 SynthID-Text 기반 워터마크를 넣고, 기본으로 켜져 있으며, 사용자가 끌 수 없고, 적용 범위는 전 세계입니다. 다만 이것을 더 엄격한 태도라고 단정할 수는 없습니다. 회사가 밝힌 이유는 지역별로 적용 범위를 신뢰성 있게 한정할 방법이 아직 없다는 것이었으니까요. 더 정확한 표현은, 한쪽은 범위를 좁힐 수 있어서 좁혔고 다른 쪽은 좁힐 수 없어서 넓혔다는 쪽입니다. 구형 모델을 12월 2일까지 맞춰야 하는 처지는 두 회사가 같습니다. 참고로 SynthID-Text는 구글 딥마인드가 고안해 2024년 10월 네이처에 실은 방식이고, 구글은 그 구현을 오픈소스로 풀어 두었습니다.
여기까지 정리하면 이 자국이 실제로 증언하는 내용이 분명해집니다. "이 글은 AI가 썼다"가 아니라 "이 글은 저 회사의 창구를, 표시 기능이 켜진 상태로 통과했다"입니다. 탐지기라기보다 출처 표시에 가깝고, 제50조 2항이 요구한 것도 원래 그것이었어요.
▸ 생성 시점에 남기지 않은 기록은 탐지 시점에 생기지 않습니다
그래서 API로 모델을 불러 제품을 만드는 쪽에는 숙제가 하나 남습니다. 기본값이 꺼짐이라는 말은, 지금 우리 서비스가 내보내는 문장에는 아무 자국도 없다는 뜻입니다. 켤지 말지는 각자가 정할 문제고, 유럽에 서비스를 내보내는 경우라면 그 결정이 규정 해석과도 얽히겠죠. 그런데 그 결정과 무관하게 필요한 것이 따로 있습니다. 출처 기록을 탐지 시점이 아니라 생성 시점에 남기는 일이에요. 어떤 요청이 어떤 모델로 갔고 응답이 언제 나왔는지, 그 응답이 어느 화면과 어느 문서로 흘러갔는지. 요청 식별자와 모델 이름·버전, 타임스탬프, API 게이트웨이 로그, 그리고 문서 저장소 쪽의 생성 이력 필드. 워터마크보다 훨씬 평범한 구성요소들이지만, 동의어 사전 한 번에 지워지지 않는다는 점에서는 더 튼튼합니다.
이번 발표를 두고 이제 AI가 쓴 글을 가려낼 수 있게 됐다고 읽는 것은 정확하지 않습니다. 그렇다고 바꿔 쓰기 한 번에 무너지니 소용없다고 묶는 것도 정확하지 않고요. 규정이 요구한 것은 가려내는 장치가 아니라 남기는 자국이었고, 자국은 자국이 할 수 있는 일까지만 합니다. 그럼에도 마음이 편하지만은 않은 지점이 하나 남습니다. API에서 표시를 일부러 켜는 쪽은 애초에 숨길 생각이 없던 조직일 테고, 반대쪽에서 자국을 지우는 비용은 동의어 몇 개면 충분하다는 것. 아무 자국도 남기지 않는 세상보다는 분명 낫습니다. 다만 여기서 남는 것은 결론이라기보다 자세의 문제예요. 자국이 있을 때 할 수 있는 말과 없을 때 할 수 있는 말은 서로 다릅니다. 그럼에도 우린 그 둘을 같은 무게로 다루고 싶은 유혹과 한동안 싸우게 될 겁니다.
커버 이미지: 유럽연합 집행위원회 본부(베를레몽 빌딩), 브뤼셀 — Wikimedia Commons, EmDee
전체 사이트에서 댓글·관련 글을 함께 보시려면
이야기 공장에서 보기 →