Date: 2026-08-15
Topic: AI
Primary source: Anthropic
Anthropic은 2026년 8월 14일 앞으로 출시할 Claude 모델이 생성하는 글에 통계적 워터마크를 적용한다고 밝혔다. 화면에 표시되는 문구나 숨은 문자를 결과물에 덧붙이는 방식이 아니라, 모델이 다음 단어를 고를 때 사용하는 무작위 선택 과정에 일정한 패턴을 남긴다. 이용자는 평소와 같은 답변을 보지만, 키를 가진 탐지 도구는 충분히 긴 글에서 Claude가 관여했을 가능성을 계산할 수 있다.
이번 조치는 8월 2일부터 적용된 유럽연합 AI법의 생성물 표시 의무에 대응하기 위한 것이다. Anthropic은 유럽에서만 기능을 켜고 끄는 안정적인 방법이 아직 없어 출시 시점에는 전 세계에 적용할 계획이다. 다만 기존 모델에는 전환 기간이 있으며, 해당 모델에도 앞으로 몇 달에 걸쳐 워터마크를 추가한다.
워터마크는 작성자나 조직, 대화 내용을 식별하지 않으며 Claude가 글 전체를 썼다는 사실도 증명하지 않는다. Anthropic은 이를 판별할 탐지 API를 추후 제공할 예정이다. 따라서 이용자에게 당장 보이는 변화는 작지만, AI 기업이 생성물의 출처를 기술적으로 설명하고 규제기관과 플랫폼이 이를 확인하는 방식에는 적지 않은 변화가 예상된다.
News Brief
- 적용 대상은 앞으로 출시될 Claude 모델의 텍스트 출력이다. 2026년 8월 2일 이전에 출시된 모델은 EU법상 전환 기간을 적용받는다.
- 워터마크는 텍스트 뒤에 기호나 숨은 문자를 붙이지 않는다. 문맥상 자연스러운 여러 단어 가운데 하나를 고르는 과정에 키 기반의 통계적 규칙을 사용한다.
- Anthropic은 내부 시험에서 내용, 창의성, 가독성에 실질적인 품질 저하를 발견하지 못했다고 설명했다. 추가 토큰이 필요하지 않아 이용 가격도 바뀌지 않는다는 입장이다.
- 탐지 결과는 Claude가 글 작성이나 편집에 관여했을 확률을 보여줄 뿐이다. 작성자 신원, 소유권, 법적 책임을 판정하는 기능은 아니다.
- 이미지·SVG 등 지원 파일에는 텍스트 워터마크 대신 암호학적으로 서명된 C2PA 출처 메타데이터가 붙는다.
Key Details
언어 모델은 매 순간 다음에 올 토큰을 하나씩 선택한다. 정답이 하나로 정해지지 않은 문장에서는 뜻과 품질이 비슷한 후보가 여럿 생긴다. Claude의 워터마크는 이 후보를 고를 때 일반 난수 대신 비밀 키와 앞선 문맥을 이용한다. 개별 단어만 보면 차이가 없지만 선택이 충분히 쌓이면 탐지 가능한 통계적 흔적이 된다.
이 방식은 Google DeepMind가 2024년 공개한 SynthID-Text 접근법을 바탕으로 한다. 워터마크가 적용되더라도 다음과 같은 한계가 있다.
| 상황 | 탐지에 미치는 영향 |
|---|---|
| 짧은 답변 | 단어 선택 횟수가 적어 판단 신뢰도가 낮다 |
| 사실 위주의 문장 | 정답 선택지가 좁아 워터마크가 드물게 남는다 |
| 코드 | 정확한 문법과 명칭이 중요해 적용할 여지가 작다 |
| 문법·문장부호만 교정 | Claude가 새로 고른 단어가 적어 흔적이 약할 수 있다 |
| 번역 | 모든 단어를 Claude가 선택하므로 워터마크가 적용된다 |
| 가벼운 편집 | 흔적이 일부 남을 수 있지만 완전한 재작성은 제거할 수 있다 |
Anthropic이 제공할 탐지 API도 만능 판별기는 아니다. 회사의 키를 이용해 Claude의 관여 가능성만 추정하며, 다른 회사의 모델이 쓴 글인지 또는 사람이 직접 쓴 글인지는 판정할 수 없다. Claude가 초안을 작성한 경우와 사람이 쓴 글을 대폭 고친 경우도 구분하지 못한다.
Background
EU 집행위원회에 따르면 생성형 AI 사업자와 이용 조직이 생성 콘텐츠를 표시하고 라벨링하도록 돕는 투명성 행동강령에는 2026년 7월 말 기준 약 190개 조직이 서명했다. Anthropic 외에도 Google, Meta, Microsoft, Mistral, OpenAI 등이 관련 조항의 서명자 명단에 포함됐다. 생성 콘텐츠 표시 의무는 8월 2일부터 적용되기 시작했다.
워터마크와 흔히 말하는 ‘AI 문체 탐지기’는 원리가 다르다. 기존 탐지 서비스는 반복되는 표현이나 문장 구조를 보고 AI 작성 가능성을 추정하지만, 공식 워터마크 탐지는 모델이 생성 과정에서 심은 통계 패턴과 비밀 키가 일치하는지 확인한다. 전자는 외부에서 문체를 관찰하고, 후자는 모델 제공자가 남긴 출처 단서를 검사한다는 차이가 있다.
Core Lens
이번 변화의 핵심은 모든 AI 글을 완벽히 적발하는 데 있지 않다. 모델 제공자가 자신의 출력에 대해 확인 가능한 출처 단서를 남기기 시작했다는 데 있다.
What It Means
이 기술은 교육기관이나 언론사, 콘텐츠 플랫폼이 AI 사용 여부를 판단할 때 참고할 근거를 하나 더 제공한다. 그러나 탐지 결과를 곧바로 부정행위의 증거로 사용하기에는 한계가 분명하다. 짧은 글과 사실 답변, 코드, 가벼운 교정은 흔적이 약할 수 있고, 충분히 다시 쓴 글에서는 워터마크가 사라질 수 있기 때문이다.
또 하나의 변화는 표시 책임이 이용자 안내문을 넘어 모델의 생성 과정으로 들어왔다는 점이다. 지금까지는 작성자가 ‘AI로 만들었다’고 밝히는 방식에 크게 의존했다면, 앞으로는 모델과 파일 자체가 출처 확인을 돕는 구조가 늘어날 수 있다. 텍스트에는 통계적 워터마크, 이미지와 파일에는 C2PA 같은 서명 메타데이터가 병행되는 형태다.
What To Watch
- Anthropic이 탐지 API의 이용 대상, 비용, 오탐 처리 절차를 어떻게 설계하는지
- 한국어처럼 영어와 토큰 구조가 다른 언어에서도 탐지 성능이 동일하게 유지되는지
- 다른 AI 기업의 워터마크가 서로 호환되거나 공통 검증 체계로 연결되는지
- 학교·기업·플랫폼이 확률적 결과를 징계나 콘텐츠 제한에 사용할 때 어떤 이의제기 절차를 마련하는지
- 복사, 번역, 요약, 공동 편집을 거친 콘텐츠에서 ‘AI가 관여했다’는 표시를 어디까지 요구할지