【Ask HN】Anthropicのウォーターマークは、我々が考えているよりずっと単純なものかもしれない?
-
FromAnthropic (Hacker News)
AnthropicがClaudeの出力にウォーターマークを実装する計画について、生成品質への影響はないと述べている。
筆者は、これが単純なハッシュフィンガープリンティングである可能性を提案している。
具体的には、生成されたテキストを重複するチャンクに分割し、各チャンクのハッシュ値を計算してデータベースに保存する。
後でテキストが提出された際に同様の処理を行い、データベース内のハッシュ値と一致するチャンクの数を数える。
この方法なら、少々の編集があっても多くのチャンクが一致する可能性がある。
また、トークン生成中に変更を加える必要がないため、Anthropicの「品質トレードオフなし」という要件を満たす。
課題としては、その規模での誤検出率(false-positive rate)の扱いが挙げられる。
筆者は、この単純なアプローチがAnthropicのウォーターマーク戦略を説明できるのか、あるいは他に考慮すべき点があるのか疑問を呈している。
[custom_js_sp]
AIによる翻訳/要約をしています。正確な情報はオリジナルサイトにてご確認ください。
当サイトの記事にはプロモーションが含まれる場合があります。
