OpenAI в ближайшие недели начнёт добавлять невидимые водяные знаки в тексты, создаваемые и обрабатываемые ChatGPT и Codex в Евросоюзе.
Механизм получит название textGrain. Он не добавляет в текст скрытые символы, пробелы или специальную пунктуацию. Вместо этого система незаметно изменяет статистический характер выбора слов и отдельных фрагментов слов моделью, формируя сигнал, который затем может обнаружить специальный детектор.
Водяной знак сможет указывать на то, что система OpenAI сгенерировала или обработала часть текста. При этом он не позволит определить, какая именно доля материала была написана человеком, насколько сильно текст редактировался вручную и кому принадлежит авторство.
Метка не будет содержать информацию о конкретном пользователе, его аккаунте, запросах или переписке с ChatGPT. Она не предназначена и для проверки достоверности текста.
OpenAI отдельно предупреждает, что отсутствие обнаруженного водяного знака не доказывает человеческое происхождение материала. Сигнал может быть потерян из-за редактирования, перевода, небольшой длины текста или использования моделей, для которых технология не применяется.
Точность обнаружения заметно зависит от объёма и характера текста. При целевом уровне ложных срабатываний в 1% система во время испытаний обнаруживала водяной знак примерно в 80% текстов объёмом 200 токенов и примерно в 95% текстов на 400 токенов в таких областях, как психология.
В текстах с более ограниченным выбором формулировок результат оказался хуже. В качестве примера OpenAI приводит математические материалы, где статистический сигнал обнаруживать значительно сложнее.
Даже относительно небольшое редактирование резко снижает эффективность проверки. В испытаниях на текстах объёмом 400 токенов замена 10% слов синонимами снизила вероятность обнаружения водяного знака с 92% до 66%. После замены четверти слов показатель падал до 17%.
Поэтому детектор textGrain на первом этапе не станет общедоступным. Подать заявку на доступ смогут одобренные исследователи и экспертные организации, которые будут участвовать в оценке надёжности технологии и способов её ответственного использования.
Для пользователей ChatGPT и Codex водяные знаки в ближайшие недели начнут внедрять во всех тарифных планах в странах Евросоюза. Глобальным стандартом по умолчанию технология пока не станет.
Для клиентов OpenAI API возможность использовать маркировку запускается по желанию по всему миру для отдельных моделей. По умолчанию водяные знаки в API будут отключены.
Компания утверждает, что в проведённых тестах применение textGrain не привело к существенному ухудшению качества ответов моделей. OpenAI планирует в дальнейшем опубликовать технологию с открытым исходным кодом.
Водяные знаки станут частью более широкой системы определения происхождения контента OpenAI. Для изображений компания уже использует метаданные Content Credentials стандарта C2PA и невидимые водяные знаки SynthID, а для поддерживаемого аудио применяется SynthID.
В OpenAI подчёркивают, что ни один из этих инструментов сам по себе не позволяет достоверно установить авторство или степень участия искусственного интеллекта. Водяной знак является лишь техническим сигналом о вероятном использовании системы OpenAI при создании или обработке текста.
Подписаться на канал · Поддержать канал