• OpenAI начала внедрять технологию невидимых водяных знаков для текстовых ответов своих моделей.
  • В течение ближайших недель функцию добавят в поддерживаемые версии ChatGPT и Codex в ЕС.
  • API-клиенты по всему миру уже могут добровольно включить водяные знаки для отдельных моделей.

Компания OpenAI представила подход к нанесению невидимых водяных знаков на текст, который компания разработала в ответ на требования Закона ЕС об искусственном интеллекте. Технология должна помочь определять, был ли текст создан или обработан системами OpenAI.

Согласно требованиям ЕС, поставщики генеративного ИИ должны обеспечивать машиночитаемую идентификацию созданного контента.

OpenAI заявила, что в течение ближайших недель добавит невидимые водяные знаки в текстовые ответы поддерживаемых версий ChatGPT и Codex для пользователей в Европейском Союзе.

На глобальном уровне функция также станет доступной для клиентов API. Они смогут добровольно включить нанесение водяных знаков для отдельных моделей. По умолчанию функция будет оставаться выключенной.

Система под названием textGrain добавляет в выбор слов модели невидимый статистический сигнал. Специальный детектор анализирует текст и определяет, содержит ли он этот сигнал. По оценкам OpenAI, textGrain показал результаты на уровне или лучше других протестированных подходов, в частности SynthID для текста. При этом компания подчеркивает, что результаты лабораторных тестов не гарантируют такой же эффективности в реальных условиях.

В частности, при уровне ложных срабатываний в 1% детектор находил водяной знак примерно в 80% отрывков на 200 токенов и около 95% отрывков на 400 токенов в темах вроде психологии. Для математики показатели были ниже из-за меньшей свободы выбора слов.

Редактирование также существенно влияет на работу детектора. Замена 10% слов синонимами снизила уровень обнаружения водяного знака примерно с 92% до 66%. Если заменить 25% слов, показатель падал до 17%.

Водяной знак не определяет автора текста

OpenAI подчеркнула, что технология позволяет получить лишь ограниченный сигнал о происхождении текста. В частности, результат проверки не показывает:

  • какой вклад в текст внес человек;
  • кому принадлежит текст и кто несет за него ответственность;
  • кто именно пользовался системой OpenAI;
  • какой запрос или разговор стали источником текста;
  • является ли информация в тексте правдивой или неправдивой.

В то же время отсутствие водяного знака не будет означать, что текст написал человек. Причиной может быть недостаточный объем текста, редактирование, перевод, использование другой модели или создание материала до внедрения технологии.

Детектор пока не будет общедоступным

OpenAI открыла прием заявок на доступ к детектору для утвержденных исследователей и экспертных организаций.

Компания объяснила это риском ложных положительных и отрицательных результатов. На начальном этапе инструмент будет доступен индивидуально, чтобы оценить его надежность и способы ответственного использования.

OpenAI также планирует сделать технологию textGrain открытой, чтобы другие разработчики могли создавать собственные решения на ее основе. По словам компании, во время тестирования новой передовой модели Astra существенной разницы в результатах бенчмарков с водяными знаками и без них не выявили.

Компания отметила, что ни один отдельный метод не может обеспечить полную проверку происхождения контента. Поэтому OpenAI планирует и дальше совершенствовать выявление водяных знаков, в частности оценивать их устойчивость к редактированию и переводу.

В будущем компания также хочет лучше разграничивать помощь ИИ при создании текста и полное авторство ИИ.

Напомним, ранее мы сообщали, что OpenAI стремится привлечь $30 млрд при оценке в $1,4 трлн.

Сообщение OpenAI внедрит водяные знаки для текста ChatGPT в ЕС появились сначала на INCRYPTED.