Исследовательница Lasso Security Андреа Сипосова протестировала конфигурацию SynthID-Text на шести языковых моделях с открытыми весами. Она сравнивала ответы, полученные с водяным знаком и без него.
В нескольких случаях модели с водяным знаком чаще выполняли вредоносные запросы, которые без него отклоняли. Эффект был особенно заметен в экспериментах, где запросы сочетались с инъекциями промптов.
Сипосова назвала этот эффект «дрейфом выборки». По её объяснению, изменение процедуры выбора токенов может влиять не только на формулировку ответа, но и на выбор инструментов ИИ-агентами и передаваемых этим инструментам аргументов.
Поведение моделей также различалось в зависимости от секретного ключа, использованного при создании водяного знака. Таким образом, результаты для одной конфигурации ключа не обязательно воспроизводились с другой.
В работе применялся немодифицированный процессор SynthIDTextWatermarkLogitsProcessor от Hugging Face. Claude и конкретная реализация SynthID-Text, которую Anthropic намерена использовать в будущих моделях, не тестировались.
