「Claudeウォーターマーク除去ツール」の多くは機能しない – CSSで証明
-
FromClaude (Hacker News)
Anthropicのテキストウォーターマークは、モデルが単語を選択する際に特定のバイアスをかける「分布型」であり、削除ツールが対象とするゼロ幅文字とはメカニズムが異なるため、これらのツールは機能しない。
巷で出回っている「ウォーターマーク除去ツール」の多くは、U+200Bなどのゼロ幅Unicode文字を削除しているが、これはAnthropicの分布型ウォーターマークとは無関係である。フォントを変更しても文章が変わらないのと同じように、ゼロ幅文字を削除しても分布型ウォーターマークには影響しない。
さらに、現状ではAnthropicのウォーターマークが実装されたモデルは存在せず、検出方法も公開されていないため、除去できたかどうかを検証する手段も存在しない。したがって、現在「Claudeウォーターマーク除去」を謳うツールは、実際には存在しないものを除去していることになる。
ゼロ幅文字の削除自体は有用な操作であり、AI生成テキストの検出に役立つ場合がある。しかし、それを「ウォーターマーク除去」と呼ぶのは誤解を招く。分布型ウォーターマークを実際に除去するには、ウォーターマークがかかっていない別のモデルで文章をリライト(リフレーズ)する必要がある。ただし、リライトに使用するモデルも独自のウォーターマークを埋め込まないものである必要がある。
[custom_js_sp]
AIによる翻訳/要約をしています。正確な情報はオリジナルサイトにてご確認ください。
当サイトの記事にはプロモーションが含まれる場合があります。
