Вариантов работы с нейросетями много, поэтому регулировать нужно каждый
Обучение, контекст и поиск по базе ИИ-модели— это три разных режима. Проще всего показать разницу на одной книге. Так, при обучении материал «растворяется» в весах (веса в нейросетях — это числовые коэффициенты, которые определяют силу и важность связи между нейронами. — «ВМ») модели.
Это примерно как если человек прочитал книгу: у него обогатился словарный запас, появились новые обороты, он стал точнее формулировать. Но самой книги в голове нет, дословно он ее не перескажет. Модель также хранит не тексты, а статистические связи. При работе через контекст книгу кладут человеку на стол. Он с ней работает, пока она открыта, потом ее уносят — и в памяти не остается почти ничего. В саму модель материал при этом не попадает, он живет столько, сколько длится сессия. А поиск по базе — это когда книга стоит на вашей полке, а модель каждый раз подходит и заглядывает в нужную страницу. Оригинал остается у владельца.
Правовые последствия у этих трех режимов работы с нейросетями разные, а норма обсуждается одна. Если ее напишут про обучение, она не покроет два других — а именно в них сегодня работает большинство компаний: свои модели с нуля почти никто не обучает, берут готовые и подключают к ним свои данные. Доказать попадание конкретного материала в датасет (это структурированный и обработанный массив данных) технически очень сложно. После обучения в модели нет ни текстов, ни изображений — есть числа.
При этом способы обнаружить заимствование существуют: например, метод атаки на определение принадлежности, когда на основе запросов к модели определяется, входила ли конкретная выборка в ее обучающий набор или заранее подложенные аудитором в материал в качестве приманки уникальные метки. Но результат вероятностный и надежен в некоторых случаях.
Например, если материал редкий, и его много раз повторяли в обучении ИИ, или модель его буквально запомнила. Для одной статьи или фотографии среди миллиардов документов доказательства, скорее всего, не будет. Проблема симметричная: правообладателю нечего предъявить, а разработчику нечем оправдаться. Поэтому регулирование логичнее строить не вокруг факта попадания в датасет, а вокруг происхождения данных и раскрытия источников. Между обучением и воспроизведением есть еще один слой.
Попросите у крупной ИИ-модели полный текст книги — она откажет. У них стоят ограничения на дословное переиспользование защищенных материалов. Но это решение разработчика, а не требование закона, и у открытых моделей на своем оборудовании такие ограничения можно ослабить. И этот момент тоже хорошо бы учесть при разработке закона.