
오픈AI가 챗GPT가 생성한 글에 사람 눈에는 보이지 않는 ‘텍스트 워터마크’를 적용한다. 경쟁사 앤스로픽이 AI 모델 클로드에 워터마크를 도입한 데 이어 생성형 AI 기업들의 콘텐츠 출처 표시가 확산하는 모습이다.
5일(현지시간) 오픈AI는 공식 블로그를 통해 향후 수 주일에 걸쳐 유럽연합(EU) 지역의 챗GPT와 코덱스가 생성하는 일부 텍스트에 워터마크를 적용한다고 밝혔다. 무료·유료를 포함한 모든 요금제가 대상이다. 다만 출시 초기에는 EU에만 적용하고 전 세계 기본 기능으로 확대하지는 않는다.
이번 조치는 생성형 AI 사업자에게 AI가 만든 텍스트를 기계가 식별할 수 있는 방식으로 표시하도록 요구하는 EU AI법에 대응하기 위한 것이다. 오픈AI는 이날부터 전 세계 애플리케이션 프로그래밍 인터페이스(API) 고객에게도 일부 모델의 텍스트 워터마크 기능을 선택적으로 제공한다. API에서는 기본 설정이 비활성화돼 있다.
오픈AI의 워터마크 기술 ‘텍스트그레인(textGrain)’은 텍스트에 별도의 문자나 기호를 삽입하는 방식이 아니다. AI가 단어를 선택할 때 미세한 통계적 신호가 남도록 해 전용 탐지기가 이를 확인하는 방식이다. 이 때문에 사용자가 생성된 글을 복사해 다른 곳에 붙여넣어도 워터마크 신호가 남을 수 있다. 오픈AI는 워터마크 적용 여부가 모델 성능에 의미 있는 차이를 만들지는 않았다고 설명했다.
다만 탐지에는 한계가 있다. 오픈AI 실험에서 400토큰 분량 글의 단어 10%를 동의어로 바꾸자 워터마크 탐지율은 약 92%에서 66%로 떨어졌고, 25%를 바꾸면 17%까지 낮아졌다. 짧은 글이나 수학처럼 표현 선택의 폭이 좁은 문장, 번역된 글도 탐지가 쉽지 않다. 이에 오픈AI는 초기에는 승인된 연구자와 전문기관에만 탐지 도구를 제공할 방침이다.
앞서 앤스로픽도 지난 8월 클로드의 생성 텍스트에 워터마크를 적용한다고 발표했다. 다만 앤스로픽은 지역별 적용이 기술적으로 어렵다는 이유로 EU에 국한하지 않고 전 세계에서 워터마크를 적용하기로 했다.
오픈AI는 워터마크가 발견됐다고 해서 해당 글의 작성자나 이용자를 특정할 수 있는 것은 아니며, 워터마크가 탐지되지 않았다고 사람이 직접 작성한 글이라는 의미도 아니라고 강조했다. 텍스트가 수정되거나 번역되면 신호가 약해질 수 있기 때문이다.



