서론
Anthropic이 Claude의 새로운 텍스트 워터마크 작동 방식을 막 설명했을 때, AI 출처 추적 신호 제거에 집중하는 오픈소스 저장소가 GitHub에서 빠르게 주목을 받기 시작했다.
해당 프로젝트 guillaumemeyer/watermarks-remover 는 사용자가 소유한 텍스트와 파일에서 여러 범주의 AI 출처 추적 표식을 제거하기 위한 에이전트 스킬 및 Python 서비스라고自称한다. 원본 기사가 데이터를 캡처한 시점에 이 저장소는 약 11,000개의 GitHub Star를 획득했으며, 상당히 기술적인 출처 추적 주제를 AI 생성 콘텐츠, 사용자 통제, 워터마크 시스템의 지속 가능성에 관한 더 넓은 논쟁으로 전환시켰다.

원본 기사는 이 프로젝트를 Claude 워터마크가 하룻밤 사이에 사실상 무력화되었음을 보여주는 증거로 간주한다. 이 제목은 기존 증거가 뒷받침할 수 있는 결론보다 훨씬 극적이다.
더 정확한 결론은 다음과 같다: 서로 다른 출처 추적 시스템은 각기 다른 방식으로 무력화되며, 어떤 단일 표시 방법도 모든 변환 하에서 생존을 보장할 수 없다. Anthropic은 자체적으로 워터마크 감지의 한계를 인정했고, Google은 SynthID를 파괴 불가능이 아닌 견고함으로 설명했으며, OpenAI는 출처 추적 신호가 때때로 제거될 수 있음을 명확히 경고했고, C2PA는 불멸의 DRM 계층이 아닌 출처 추적 표준으로 설계되었다.
따라서 이 GitHub 프로젝트가 흥미로운 이유는 모든 AI 워터마크가 쓸모없다는 것을 증명해서가 아니라, 오픈소스 연구자들이 여러 출처 추적 계층 뒤에 숨은 가정을 얼마나 빠르게 시험할 수 있는지를 보여주기 때문이다.
프로젝트가 인기를 끈 이유
이 저장소가 등장한 시점은 절묘했다.
2026년 8월 14일, Anthropic은 향후 Claude 모델에 사용할 계획인 텍스트 워터마크에 대한 상세한 설명을 발표했다. 4일 후, BAAI가 공동 발표한 기사는 watermarks-remover를 오픈소스 커뮤니티에서 빠르게 부상하는 반례 사례로 부각시켰다.

저장소 자체 문서는 단일한 범용 "Claude 워터마크"가 아니라 여러 다른 범주의 출처 추적 신호를 대상으로 한다고 설명한다.
그 적용 범위 매트릭스는 이러한 신호를 여러 주요 범주로 분류한다:
- 보이지 않거나 비정형적인 유니코드 및 텍스트 형식 표식
- 통계적 토큰 샘플링 워터마크
- C2PA, EXIF, XMP 및 문서 메타데이터
- 외부 연구 백엔드를 통한 일부 이미지 수준 워터마크 방법

이 구분은 중요하다. 이러한 메커니즘은 완전히 다른 계층에서 작동하기 때문이다.
파일에서 메타데이터를 제거하는 것과 통계적 텍스트 워터마크를 약화시키는 것은 같은 문제가 아니다. 마찬가지로, 이미지 픽셀을 변경하는 것과 보이지 않는 유니코드 문자를 삭제하는 것은 근본적으로 다르다.
이 프로젝트는 MIT 라이선스로 배포되며,
그 README는 이 도구를 사용자 소유 콘텐츠의 프라이버시 및 위생 관리 도구로 명확히 위치시킨다.
Anthropic의 워터마크는 숨은 문자 트릭이 아니다
이 저장소가 왜 그렇게 많은 관심을 받았는지 이해하려면 Anthropic이 실제로 무엇을 발표했는지 먼저 파악해야 한다.
Claude의 텍스트 워터마크는 단순히 출력에 숨은 문자열, 제로 폭 문자 또는 비밀 태그를 붙이는 것이 아니다.
Anthropic은 자체 워터마크가 SynthID-Text를 기반으로 한다고 밝혔으며, 이는 Google DeepMind가 제안하고 2024년 《네이처》 저널에 발표한 통계적 워터마크 방법이다.
대규모 언어 모델은 본래 확률에서 선택한다
언어 모델은 단어 토큰 단위로 텍스트를 생성한다.
각 단계에서 모델은 가능한 다음 토큰에 확률을 할당한다. 어떤 토큰은 매우 높은 확률을 가질 수 있고, 다른 토큰은 합리적일 수 있으며, 대부분은 매우 낮은 확률을 가진다.
정상적인 생성 과정은 이후 무작위성을 사용하여 이러한 가능성 중에서 선택한다.
통계적 워터마크는 통제된 방식으로 그 무작위성의 출처를 수정한다. 텍스트는 독자에게 여전히 자연스럽게 보이지만, 토큰 선택의 시퀀스는 해당 키를 가진 감지기가 식별할 수 있는 통계적 패턴을 포함할 수 있다.
Google DeepMind의 SynthID-Text 설명도 유사하다: 생성 과정에서 토큰 확률 점수를 조정하여 보이는 문자를 추가하지 않고도 감지 가능한 신호를 임베딩한다.

Anthropic의 "주사위 대신 원주율 사용" 비유
Anthropic은 보드 게임을 활용한 비유를 사용했다.
상상해 보자. 플레이어가 일반적으로 주사위를 굴려 이동 칸 수를 결정한다고. 게임은 진정한 무작위 주사위를 사용하는 대신, 은밀하게 원주율과 같은 알려진 수열의 숫자를 사용한다.
플레이어에게 이동은 여전히 무작위로 보인다. 그러나 그 수열을 아는 사람은 이후 패턴을 검사하고 그 무작위성 출처가 사용되었는지 추정할 수 있다.
Claude의 워터마크는 동일한 전체적인 접근 방식을 따른다: 텍스트에 보이는 태그를 삽입하는 대신 토큰 선택 뒤의 통계적 과정을 변경한다.
워터마크가 증명할 수 있는 것과 없는 것
Anthropic은 감지기의 의미에 대해 신중한 입장을 취한다.
워터마크 감지기는 Claude가 특정 텍스트에 기여했을 가능성을 추정하도록 설계되었다. 이는 텍스트가 인간이 작성했는지 여부를 증명하지 않으며, 다른 모든 AI 시스템이 생성한 텍스트를 자동으로 식별하지도 않는다.
감지는 짧은 텍스트와 모델이 선택할 수 있는 합리적인 어휘가 제한된 고도로 제약된 사실적 텍스트에서 신뢰도가 낮아진다.
교정도 또 다른 약점 시나리오다. Claude가 구두점이나 몇 개의 단어만 수정한 경우, 통계적 워터마크가 감지될 수 있을 만큼 충분한 모델 선택 텍스트가 없을 수 있다.
이러한 주의 사항이 중요한 이유는 원본 기사가 이 시스템을 거의 절대적으로 설명했기 때문이다. Anthropic의 자체 문서는 그러한 주장을 하지 않는다.
오픈소스 프로젝트가 문제를 계층별로 구성하는 방식
이 저장소는 출처 추적 제거 연구를 계층별로 구성한다.
이 기사는 이 구조를 유지한다. 기술적 논쟁을 이해하는 데 도움이 되기 때문이지만, 이 기사는 워터마크 우회를 위한 작동 지침을 제공하지 않는다.
출처 시스템. 서로 다른 메커니즘을 구분하는 것이 중요하다.
1계층: 보이지 않는 텍스트 위생 처리
가장 단순한 범주의 표식이 가장 이해하기 쉽다.
텍스트에는 비정상적인 공백, 양방향 제어 문자, 태그 문자 또는 기타 유니코드 형식 기호를 포함하여 보이지 않거나 시각적으로 모호한 문자가 포함될 수 있다.
이 코드베이스는 이러한 범주의 문자를 감지하고 정규화하는 결정론적 텍스트 위생 계층을 설명한다.
이는 Claude의 새로운 SynthID 방식 통계적 워터마크와는 완전히 다르다.
Anthropic은 자체 워터마크가 숨은 문자에 의존하지 않는다고 명시했으므로, 유니코드 정리만으로는 Anthropic이 설명한 통계적 신호를 무력화할 수 없을 것으로 예상된다.
이것이 코드베이스가 유니코드 정리와 통계적 워터마크를 별개의 계층으로 취급하는 이유 중 하나다.
2계층: 통계적 워터마크는 재작성 문제다
통계적 텍스트 워터마크는 신호가 파일 메타데이터나 숨은 문자가 아닌 토큰 선택 패턴에 존재하기 때문에 처리하기 훨씬 어렵다.
코드베이스 문서는 대규모 재작성 또는 패러프레이징을 관련 공격 범주로 언급한다. 상위 수준의 원칙은 간단하다: 충분히 많은 토큰 선택이 다른 모델이나 샘플링 과정에 의해 재생성된다면, 원래의 통계적 패턴은 약화될 수 있다.
이는 통계적 워터마크 연구에서 예상치 못한 특성이 아니다. 워터마크 견고성은 일반적으로 재작성, 번역, 편집, 재생성과 같은 변환에 대해 평가된다.
균형도 마찬가지로 중요하다: 더 강한 재작성은 의미, 용어, 스타일, 사실적 정확성 또는 저자 신호를 변경할 수도 있다.
원문은 이러한 품질 저하 위험을 간략히 언급했는데, 이는 성공적인 탐지 회피 실험이 자동으로 무손실 변환으로 간주되어서는 안 되는 주요 이유 중 하나다.
왜 "워터마크가 제거되었다"는 증명이 어려운가
Anthropic은 아직 공개용 Claude 워터마크 탐지 API를 출시하지 않았다. 회사는 탐지기 연동이 추후 제공될 것이라고 밝혔다.
이는 현재 외부 프로젝트가 Anthropic의 프로덕션 키와 탐지기를 대상으로 권위 있는 엔드투엔드 테스트를 수행할 수 없음을 의미한다.
watermarks-remover 프로젝트 자체는 통계적 워터마크 범주多处에서 "최선의 노력"이라는 표현을 사용한다. 이러한 표현은 완전한 제거를 보장한다고 주장하는 것보다 기술적으로 더 책임감 있는 태도다.
공식 탐지기와 재현 가능한 평가 조건이 제공되기 전까지, Claude 워터마크가 "완전히 지워졌다"는 어떤 주장도 신중하게 받아들여야 한다.
세 번째 계층: C2PA와 파일 메타데이터
코드베이스의 또 다른 독립된 부분은 파일 수준의 출처 데이터를 다룬다.
여기에는 이미지와 문서 같은 형식과 연관된 메타데이터가 포함되며, C2PA Content Credentials, EXIF, XMP, 문서 속성 등이 해당한다.
C2PA는 디지털 자산의 출처와 이력을 기록하기 위한 개방형 표준이다. 콘텐츠의 출처, 처리된 도구, 시간에 따른 변화에 대한 서명된 정보를 담을 수 있다.
중요한 차이점은 C2PA 메타데이터와 임베디드 통계적 워터마크가 같은 개념이 아니라는 것이다.
OpenAI의 현재 출처 문서도 동일한 구분을 하고 있다.
차이점. OpenAI가 지원하는 생성 이미지는 C2PA 콘텐츠 자격 증명과 SynthID 워터마크를 동시에携带할 수 있다. OpenAI는 메타데이터가 편집, 변환, 공유 또는 스크린샷 과정에서 손실되거나 제거될 수 있는 반면, 임베디드 워터마크는 일부 변환 후에도 유지될 수 있다고 밝힌다.
이것이 현대 출처 추적 시스템이 단순히 메타데이터에만 의존하지 않고 점점 더 다양한 신호를 결합하는 이유다.
C2PA는 출처 추적 메커니즘이지, 디지털 권리 관리가 아니다
C2PA 사양은 검증 가능한 출처 정보를 기록하도록 설계되었다.
이는 제거 불가능한 디지털 권리 관리 시스템으로 설계된 것이 아니다.
C2PA 설명 문서는 콘텐츠 자격 증명이 XMP, EXIF 같은 표준 메타데이터 형식과 병행하여 작동한다고 명시한다. 파일은 변환 과정에서 메타데이터를 잃을 수 있으며, 이때 생태계는 검증, 영구 바인딩, 워터마크 또는 기타 보조 신호에 의존하여 복원력을 높인다.
따라서 메타데이터를 제거할 수 있는 도구는 메타데이터 기반 출처 메커니즘의 알려진 한계를 보여줄 뿐이며, 그 자체로 더 넓은 C2PA 모델을 부정하지 않는다.
이미지 수준 워터마크는 또 다른 별도의 연구 분야다
원문은 이후 텍스트와 메타데이터에서 이미지 워터마크로 전환한다.
이것은 또 다른 독립된 문제다.
Google의 SynthID 이미지 워터마크는 인지할 수 없는 신호를 생성된 이미지 콘텐츠에 직접 임베드한다. Google은 이 워터마크가 크롭, 필터, 프레임 레이트 변화, 손실 압축과 같은 일반적인 수정 후에도 탐지 가능하도록 설계되었다고 밝힌다.
이 오픈소스 저장소는 재생성 공격 및 잠재적 또는 픽셀 수준 워터마크 평가를 기반으로 한 외부 연구 시스템을 인용한다.
이 프로젝트는 또한 MarkDiffusion을 참조하는데, 이는 잠재 확산 모델의 생성형 워터마크 연구를 위한 오픈소스 툴킷이다.

MarkDiffusion 자체는 단순한 "워터마크 제거기"가 아니다. 그 목적은 더 포괄적이다: 생성형 워터마크 알고리즘을 구현, 시각화, 평가하는 것, 여기에는 탐지 가능성, 견고성, 출력 품질이 포함된다.
이는 워터마크 연구가 항상 문제의 양면을 포함해 왔다는 것을 상기시킨다:
출처 신호 임베드
↓
편집 또는 변환 적용
↓
신호가 존속하는지 테스트
↓
품질과 탐지 가능성 측정
↓
워터마크 개선
견고한 워터마크는 실제 변환 테스트를 거친 후에야 의미를 가진다.
MarkLLM은 텍스트 워터마크를 위한 연구 프레임워크를 제공한다
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
이 저장소는 또한 MarkLLM을 참조하는데, 이는 칭화대 연구진과 협력자들이 개발한 오픈소스 툴킷으로, 대규모 언어 모델 워터마크 방법을 구현하고 평가한다.
MarkLLM은 KGW, SynthID-Text, Unigram, SWEET, SIR 등 여러 클래스의 텍스트 워터마크 알고리즘을 지원한다.
그 역할이 중요한 이유는 연구자들에게 다음과 같은 질문을 탐구할 수 있는 공통 환경을 제공하기 때문이다:
- 워터마크의 탐지 가능성은 어느 정도인가?
- 텍스트 품질에 미치는 영향은 무엇인가?
서로 다른 워터마크 알고리즘은 어떻게 비교되는가?
이러한 연구 배경은 "워터마크 대 워터마크 제거기"라는 단순한 프레임워크보다 훨씬 가치가 있다.
실제 기술 문제는 탐지 가능성, 견고성, 품질, 프라이버시, 상호운용성, 오탐지 위험 사이의 지속적인 균형이다.
이 프로젝트는 범위가 넓지만 모든 것을 포함하지는 않는다
GitHub의 적용 범위 매트릭스는 야심 차지만 명확한 한계도 포함한다.
일부 메커니즘은 최선의 노력으로 분류된다. 일부 이미지 방법은 외부 백엔드에 의존한다. 일부 카테고리의 마커는 범위 밖이다. 서로 다른 벤더는 서로 다른 제품과 모달리티에서 서로 다른 출처 시스템을 노출한다.
이는 OpenAI 관련 주장에 특히 중요하다.
이 저장소는 벤더 적용 범위에 OpenAI 관련 출처 표면을 나열하지만, 이는 OpenAI가 현재 모든 생성 텍스트에서 보편적인 비가시적 통계 워터마크를 사용한다는 증거로 해석되어서는 안 된다.
OpenAI 2026년 공식 문서에 따르면, 지원되는 이미지는 C2PA 메타데이터와 SynthID를 사용하고, 지원되는 오디오는 SynthID를 사용한다. OpenAI는 또한 텍스트를 포함한 여러 모달리티로 출처 작업을 확장하고 있다고 밝히지만, 적용 범위는 제품, 모델, 내보내기 경로, 파일 형식, 날짜에 따라 다르다.
따라서 "OpenAI의 숨은 마커를 제거했다"는 주장은 너무 광범위하며, 콘텐츠 유형과 출처 메커니즘을 특정하지 않으면 정확하지 않다.
Claude가 출처 신호 제거를 거부할 수 있는 이유
원문에는 사용자가 Claude에게 제거 도구를 조작하도록 요청했다가 거부당했다는 사용자 스크린샷이 포함되어 있다.
이러한 행동은 많은 AI 제공업체가 출처 시스템을 분석하는 것과 사용자가 이를 우회하도록 직접 돕는 것 사이에서 취하는 보안 정책 구분과 일치한다.
사용자는 자신이 소유한 파일의 메타데이터나 프라이버시 민감 필드를 검사할 정당한 이유가 있다. 동시에 출처 신호는 진위성, 사기 방지, 플랫폼 투명성, 규정 준수에 중요할 수 있다.
따라서 이러한 프로젝트의 가장 안전한 용도는 연구, 상호운용성 테스트, 프라이버시 검토, 또는 자신이 소유한 콘텐츠에 대한 통제된 평가다. 합성 콘텐츠를 독립적인 인간 창작물로 위장하거나 공개 요구 사항을 회피하는 것이 아니다.
원문은 다른 모델이 이의 없이 이 프로젝트를 설치했다고 추가로 주장한다. 이러한 일화는 사용자 보고 행동일 뿐, 신뢰할 수 있는 교차 모델 정책 기준이 아니므로, 특정 국가의 모델이 워터마크 제거를 "허용"하고 다른 회사의 모델은 그렇지 않다는 주장으로 일반화되어서는 안 된다.
Anthropic이 전 세계적으로 워터마크를 추가하는 이유
정책 배경은 EU 인공지능법이다.
제50조는 합성 오디오, 이미지, 비디오 또는 텍스트를 생성하는 시스템 제공업체가 해당 출력을 기계 판독 가능하게 만들고, 인공 생성 또는 조작된 콘텐츠로 탐지될 수 있도록 요구하며, 법률의 상세한 범위와 예외 조항이 적용된다.
제50조의 투명성 의무는 2026년 8월 2일부터 적용된다.
유럽위원회는 또한 AI 생성 콘텐츠 투명성에 관한 자발적 《행동 강령》을 발표하여 제공업체와 배포자가 규정 준수를 입증하도록 돕고 있다.
Anthropic은 이 행동 강령에 서명했으며, 규정 준수 작업의 일환으로 텍스트 워터마크를 구현하고 있다고 밝혔다.
왜 유럽 이외의 사용자도 동일한 시스템을 보게 되는가
원문의 이 부분은 기본적으로 정확하지만, 표현이 대립적이다.
Anthropic은 8월 14일 게시물에서 출시 시점에 전 세계적으로 워터마크를 적용한다고 밝혔는데, 이는 시스템을 지역별로 제한할 지속적인 방법이 아직 없기 때문이다.
Anthropic은 또한 다른 방안을 계속 평가할 것이라고 밝혔다.
따라서 전 세계적 배포는 사용자 행동에서 추론된 것이 아니라, Anthropic이 직접적으로 밝힌 내용이다.
EU 규칙은 "모든 콘텐츠에 워터마크"보다 더 넓다
원문은 AI법을 하나의 요구 사항으로 단순화했다.
실제 법적 프레임워크는 더 세밀하다.
제50조는 특정 AI 시스템의 제공업체와 배포자에게 투명성 의무를 부과한다. 유럽위원회 2026년 지침은 제공업체가 AI 생성 또는 조작 콘텐츠의 탐지를 위해 기계 판독 가능한 마커를 추가해야 하며, 배포자는 딥페이크 및 특정 AI 생성 출판물 등의 경우 별도의 라벨링 의무가 있다고 설명한다.
《실천 강령》은 자발적이다. 그 아래의 제50조 의무는 자발적이지 않다.
Anthropic, Google, OpenAI와 같은 기업들이 출처 추적 시스템에 투자하는 이유를 논할 때, 이 차이는 중요합니다.
논쟁의 핵심은 실제로 저자성, 출처 추적, 사용자 통제에 관한 것입니다
원문의 마지막 부분은 사용자들이 소위 '네트워크 브랜드'가 자신의 작품에 붙는 것을 싫어한다고 주장합니다.
여기에는 분명 긴장이 존재하지만, 어느 한쪽의 가장 강한 표현보다 더 복잡합니다.
한 사람이 수 시간을 들여 연구하고, 개요를 작성하고, 문서를 작성한 다음 AI 모델을 편집 목적으로만 사용할 수 있습니다. Anthropic도 이러한 상황을 인정하며, 가벼운 교정은 모델 생성 텍스트가 너무 적게 남아 워터마크가 강력하게 등록되지 않을 수 있다고 밝혔습니다.
이러한 미묘한 차이는 중요합니다.
AI를 사용한다고 해서 저자성, 소유권 또는 창의적 기여에 대한 문제가 자동으로 해결되지는 않습니다. 출처 추적 신호는 더 좁은 질문에 답합니다: 이 콘텐츠를 생성하거나 수정할 때 특정 도구가 관여했을 가능성이 있는가?
이러한 신호는 작품이 정확한지, 독창적인지, 합법적인지, 윤리적인지, 인간 주도적인지, 또는 전문적 가치가 있는지를 결정하지 않습니다.
OpenAI도 검증 문서에서 같은 관점을 제시합니다: 출처 추적 신호의 감지는 지원되는 OpenAI 도구가 파일을 생성하거나 내보냈음을 나타낼 수 있지만, 진위성, 소유권 또는 맥락을 확인하지는 않습니다.
워터마크와 워터마크 제거는 여전히 고양이와 쥐 게임입니다
원문의 결론은 제목보다 더 설득력 있습니다: 이는 아직 판가름 나지 않은 경쟁입니다.
Anthropic은 아직 공개 텍스트 워터마크 감지기를 출시하지 않았습니다. 따라서 GitHub 프로젝트는 Anthropic의 프로덕션 감지기와 키를 대상으로 제거 효과를 결정적으로 입증할 수 없습니다.
마찬가지로, 연구자들이 어떤 변환이 워터마크 시스템을 약화시키는지 발견함에 따라 워터마크 시스템도 계속 진화할 것입니다.
미래의 그림은 완벽한 워터마크 하나가 아닙니다.
그것은 계층화된 출처 추적 스택입니다:
| 계층 | 기여 | 주요 한계 |
|---|---|---|
| 통계적 텍스트 워터마크 | 생성 과정에 내장된 감지 가능한 신호 | 충분히 무거운 변환에서 약화됨; 짧은 텍스트 처리 어려움 |
| 미디어 워터마크 | ||
| 이미지/오디오/비디오 콘텐츠에 내장된 신호 | 알고리즘과 변환에 따라 견고성이 달라짐 | |
| C2PA 콘텐츠 자격 증명 | 서명된 출처 및 편집 이력 | 메타데이터가 손실되거나 제거될 수 있음 |
| 플랫폼 라벨 | 사용자에게 즉시 공개 | 라벨이 내보낸 콘텐츠에 전파되지 않을 수 있음 |
| 검증 서비스 | 여러 출처 신호를 동시에 확인 | 지원되는 공급업체 및 형식에 따라 적용 범위가 달라짐 |
성숙한 시스템은 단일 기술만 신뢰하지 않고 여러 기술을 결합할 수 있습니다.
확정된 사항과 여전히 주장에 불과한 사항
Anthropic이 확정한 사항
- 향후 Claude 모델은 SynthID-Text 기반 텍스트 워터마크를 사용할 것입니다.
- 이 워터마크는 숨겨진 문자를 삽입하는 대신 토큰 생성 중 사용되는 무작위성의 통계적 원천을 변경합니다.
- 짧은 샘플과 가벼운 편집 또는 사실적 텍스트의 경우 감지 신뢰도가 낮습니다.
- Anthropic은 워터마크 감지 API를 제공할 계획입니다.
- Anthropic은 출시 시 시스템을 전 세계적으로 적용하는데, 현재로서는 지역별로 안정적으로 범위를 한정할 수 없기 때문입니다.
- 이 배포는 EU AI 법 및 투명성 행동 강령의 준수 요구 사항과 관련이 있습니다.
GitHub 저장소에서 확인된 사항
watermarks-remover는 MIT 라이선스를 사용합니다.- 해당 저장소는 단일 워터마크가 아닌 여러 유형의 AI 출처 신호를 대상으로 합니다.
- 문서는 유니코드 정리, 통계적 워터마크 변환, 파일 메타데이터, 이미지 수준 연구 백엔드를 구분하여 설명합니다.
- 통계적 워터마크 처리는 여러 곳에서 보장이 아닌 '최선의 노력'으로 설명됩니다.
- 프로젝트의 명시된 용도는 사용자가 자신이 소유한 콘텐츠에 대한 개인정보 보호 및 위생 처리를 위한 것입니다.
Google DeepMind에서 확인된 사항
- SynthID는 AI 생성 텍스트, 이미지, 오디오, 비디오에 워터마크를 추가할 수 있습니다.
- SynthID-Text는 생성 과정에서 토큰 확률 점수를 변경합니다.
- 이미지 및 미디어 워터마크는 일련의 일반적인 변환을 견딜 수 있도록 설계되었지만, Google은 절대적으로 파괴 불가능하다고 주장하지 않습니다.
OpenAI에서 확인된 사항
- 지원되는 OpenAI 생성 이미지에는 C2PA 콘텐츠 자격 증명과 SynthID 워터마크가 모두 포함될 수 있습니다.
- 지원되는 OpenAI 생성 오디오에는 SynthID가 포함될 수 있습니다.
- OpenAI는 메타데이터가 제거될 수 있으며 어떤 단일 출처 기술도 완벽하지 않다고 명시적으로 밝히고 있습니다.
주의해서 접근해야 할 주장
- Anthropic의 프로덕션 감지기가 공개적으로 테스트되기 전에 Claude의 워터마크가 '완전히 해독되었다'는 주장.
- 프로젝트가 모든 SynthID 또는 통계적 워터마크 제거를 보장한다는 주장.
- OpenAI가 모든 제품에서 보편적인 보이지 않는 텍스트 워터마크를 사용한다는 주장.
- 모든 모델 제공업체가 출처 제거에 대해 동일한 정책을 가지고 있다는 주장.
- 워터마크가 감지되지 않았다는 것이 콘텐츠가 인간이 작성했다는 증거라는 주장.
자주 묻는 질문
Claude의 새로운 텍스트 워터마크란 무엇인가요?
Claude의 텍스트 워터마크는 Google DeepMind의 SynthID-Text 방식을 기반으로 한 통계적 워터마크입니다. 생성 과정에서 토큰 선택 확률을 변경하여 관련 키를 가진 감지기가 Claude가 특정 텍스트 생성에 관여했을 가능성을 추정할 수 있게 합니다.
Claude의 워터마크는 보이지 않는 유니코드 문자를 사용하나요?
아니요. Anthropic은 새 워터마크가 숨겨진 문자에 의존하지 않는다고 밝혔습니다. 보이지 않는 유니코드 정리는 별도의 텍스트 위생 범주에 속하며, SynthID 방식의 통계적 신호 자체를 대상으로 하지 않습니다.
오픈소스 프로젝트가 Claude의 워터마크를 확실히 해독했다고 볼 수 있나요?
아직 단정할 수 없습니다. Anthropic은 공개 감지 API를 아직 출시하지 않았으므로, 독립 프로젝트는 프로덕션 환경의 감지기와 키를 대상으로 결과를 충분히 검증할 수 없습니다. 해당 코드베이스 자체도 통계적 워터마크 범주에 대해 최선의 노력이라는 표현을 사용합니다.
SynthID와 C2PA의 차이점은 무엇인가요?
SynthID는 생성 콘텐츠에 워터마크 신호를 내장하는 반면, C2PA 콘텐츠 자격 증명은 디지털 자산에 서명된 출처 정보와 편집 이력을 첨부합니다. 두 방식은 상호 보완적입니다: 메타데이터는 더 풍부한 맥락을 담을 수 있고, 내장형 워터마크는 메타데이터가 제거된 변환 과정에서도 생존할 수 있습니다.
C2PA 메타데이터를 파일에서 삭제할 수 있나요?
메타데이터는 편집, 형식 변환, 내보내기, 공유 플랫폼 또는 의도적 제거로 인해 손실될 수 있습니다. 이는 알려진 한계이며, 따라서 출처 시스템은 점점 콘텐츠 자격 증명을 내장형 워터마크 및 검증 서비스와 결합하고 있습니다.
Anthropic은 왜 EU 밖에서도 Claude 워터마크를 적용하나요?
Anthropic은 현재 시스템을 특정 지역으로 안정적으로 한정할 방법이 없기 때문에 워터마크를 전 세계적으로 도입하고 있다고 밝혔습니다. 회사는 다른 옵션을 계속 평가할 것이라고 말했습니다.
EU AI 법은 AI 생성 콘텐츠의 감지 가능성을 요구하나요?
제50조는 특정 생성형 AI 시스템 제공업체가 관련 합성 출력물을 기계 판독 가능한 형태로 표시하고 인공 생성 또는 조작된 것으로 감지될 수 있도록 보장해야 한다고 요구합니다. 투명성 의무는 2026년 8월 2일부터 적용되며, 상세한 지침과 준수를 지원하는 자발적 행동 강령이 함께 제공됩니다.
워터마크가 없다는 것이 콘텐츠가 인간이 작성했다는 증거인가요?
아니요. Anthropic, Google, OpenAI는 모두 출처 감지를 확률적 또는 신호 기반으로 설명하며 인간 저자성의 증거로 보지 않습니다. 지원되지 않는 형식, 너무 짧은 샘플, 콘텐츠 변환 또는 기타 제한으로 인해 신호가 없을 수 있습니다.
관련 도구
- Anthropic Claude 텍스트 워터마크: SynthID-Text 기반 워터마크, 한계, 전 세계 도입에 대한 Anthropic의 공식 설명.
- Google DeepMind SynthID: AI 생성 텍스트, 이미지, 오디오, 비디오에 대한 워터마킹과 감지에 대한 Google의 공식 개요.
- C2PA: 콘텐츠 자격 증명 및 상호 운용 가능한 미디어 출처를 위한 공식 표준 기구.
- MarkLLM: LLM 워터마크 알고리즘 구현 및 평가를 위한 오픈소스 연구 도구 키트.
- MarkDiffusion: 잠재 확산 모델에서 생성 워터마크를 위한 오픈소스 연구 도구 키트.
- C2PA 코파일럿: 콘텐츠 자격 증명과 상호 운용 가능한 미디어 출처를 위한 공식 표준 기구.
watermarks-remover: 원문 기사에서 논의된 MIT 라이선스 코드 저장소로, 자체 문서에서는 사용자가 소유한 콘텐츠를 대상으로 하는 사용 사례로 용도를 규정하고 있습니다.
관련 링크
- Anthropic: Claude 텍스트 워터마크 작동 방식: Claude 워터마크 설계, 탐지 한계, EU 규정 준수 근거 및 전 세계 확대에 관한 주요 소스.
- Google DeepMind: SynthID: SynthID가 텍스트 및 기타 미디어 콘텐츠를 표시하는 방식을 설명하는 주요 소스.
- EU AI 생성 콘텐츠 투명성 실천 강령: 제50조 투명성 의무 준수를 지원하는 유럽위원회 지침.
- EU 인공지능법, 규정(EU) 2024/1689: 합성 콘텐츠의 기계 판독 가능 표시 및 탐지에 관한 제50조 요구 사항을 포함한 공식 법률 문서.
- OpenAI: 콘텐츠 출처 추적의 발전: C2PA, SynthID, 검증 및 단일 출처 신호의 한계에 대한 OpenAI의 설명.
- C2PA 기술 사양: 콘텐츠 자격 증명의 공식 사양 및 구현 지침.
- MarkLLM GitHub 저장소: 다양한 LLM 워터마크 및 견고성 방법을 다루는 연구 프레임워크.
요약
AI 출처 추적 제거에 특화된 오픈소스 저장소가 Anthropic이 Claude에 곧 적용할 SynthID 기반 텍스트 워터마크 기술 원리를 발표한 지 불과 며칠 만에 GitHub에서 빠르게 인기를 얻었습니다. 이러한 시점은 극적이지만, Claude 워터마크가 완전히 무력화되었다는 주장을 뒷받침할 증거는 없습니다.
더 유용한 교훈은 출처 추적이 계층화되어 있다는 점입니다. 보이지 않는 유니코드, 통계적 텍스트 워터마크, C2PA 메타데이터, 임베디드 미디어 워터마크는 각각 고유한 장점과 실패 모드를 가진 서로 다른 메커니즘입니다. 한 신호를 제거할 수 있는 기술은 다른 신호에는 효과가 없을 수 있으며, 워터마크를 약화시키는 강한 변환은 동시에 콘텐츠 자체의 품질도 저하시킬 수 있습니다.
Anthropic, Google, OpenAI, C2PA, MarkLLM 및 MarkDiffusion은 모두 동일한 더 포괄적인 결론을 가리킵니다: 출처 추적은 단일 영구 표시에 의존하기보다 신호와 검증 도구의 조합으로 작동할 때 가장 효과적이라는 것입니다.
AI 워터마크는 절대적으로 무적이 아니며, 워터마크 제거도 완전한 삭제가 아닙니다. 진짜 문제는 현실적인 변환 조건에서도 실용성을 유지하는 출처 추적 메커니즘을 구축하는 것입니다.



