Компаниям уже сейчас стоит разобраться, какие материалы они используют при работе с искусственным интеллектом, откуда эти данные получены и на каких условиях их можно применять. Опрошенные эксперты сходятся в том, что бизнесу необходимо провести инвентаризацию контента, собрать подтверждающие документы и заранее распределить ответственность с разработчиками и подрядчиками.
Катерина Игрунова, CEO & Founder M.A.F.I.A. Agency, считает, что развитие ИИ сделало заметнее уже существующую для компаний проблему с происхождением контента и правами на него.
«На мой взгляд, ИИ не столько создал новую проблему, сколько сделал заметнее старую: многие компании не могут объяснить, откуда появляется их контент и кому принадлежат права на него», — говорит Катерина Игрунова.
По ее словам, в единый архив прав стоит собирать договоры, технические задания и акты, условия передачи исключительных прав или лицензии, согласия авторов, фотографов, моделей и исполнителей, а также документы и сведения о стоковых материалах. Для созданных с помощью ИИ материалов Игрунова предлагает сохранять исходный бриф, историю генераций, выбранные варианты и последующую ручную доработку. В договорах с подрядчиками и разработчиками, по ее мнению, необходимо отдельно определять ответственность за входные данные и конечный результат.
Данильчик Артур, руководитель отдела маркетинга WMT AI, первым этапом подготовки называет определение всех массивов данных, которые используются в работе с ИИ: обучающих выборок, корпоративных хранилищ, контента для промтов и агентных сценариев.
«Затем разделить данные на категории: собственные материалы компании, данные клиентов, закупленный/лицензированный контент, открытые источники. И для каждой категории уточнить: кто владелец, какие ограничения уже прописаны, какие наборы нельзя использовать даже в тестовом контуре», — считает Данильчик.
Для подтверждения законности использования данных, по его словам, компании нужен не один документ, а система. В нее могут входить реестр источников, договоры с правообладателями и поставщиками контента, а при работе с персональными данными или пользовательским контентом — пользовательские соглашения, оферты или отдельные согласия. В договорах Данильчик также предлагает заранее определять, кто отвечает за происхождение обучающих данных и действия сторон в случае нарушения прав третьих лиц.
Петр Сухоруких, основатель международного репутационного агентства «Невидимка», эксперт по антикризисному PR, также считает важным документально фиксировать происхождение используемых материалов.
«Главным доказательством служит грамотный трудовой договор или контракт с подрядчиком, где прямо прописан переход исключительных прав на созданный контент к вашей компании. Я настаиваю на том, чтобы к нему обязательно шли акты приема-передачи каждого конкретного текста или изображения», — уверен эксперт.
Для цифровых данных он предлагает сохранять исходные файлы с метаданными и фиксировать дату создания через внутренние корпоративные программы. При покупке права на использование чужого архива, по словам Сухоруких, нужен лицензионный договор с разрешением на машинное обучение. При этом ответственность за обучающие данные в контрактах с поставщиками ИИ он предлагает возлагать на разработчика.
Генеральный директор ООО «Рокет груп» (Rocket Group) Борис Латкин считает, что аудит используемых для обучения и работы моделей наборов данных компаниям стоит проводить уже сейчас.
«Необходимо понимать происхождение каждого массива, правовые основания его использования, действующие ограничения и условия передачи третьим лицам. В перспективе такой реестр станет такой же обязательной частью управления ИИ, как сегодня реестр программного обеспечения или информационных систем», — поделился мнением Борис Латкин.
Отдельное внимание, по его мнению, необходимо уделить договорам с разработчиками и поставщиками ИИ. Заказчику важно понимать, какие данные применялись при обучении модели, есть ли необходимые права на их использование и кто будет отвечать в случае претензий.
Дамир Фейзуллов, директор по Digital & Social Media коммуникационного агентства PR Partner, также предлагает начинать подготовку с инвентаризации данных, не дожидаясь дополнительных разъяснений.
«Компании необходимо понимать, какие материалы используются для обучения и дообучения моделей, откуда они получены и на каком основании. Отдельно нужно проверить корпоративные архивы, фотобанки, документы клиентов, персональные данные и коммерческую тайну», — отметил эксперт.
Фейзуллов также обращает внимание на информацию, которую сотрудники загружают в публичные нейросети. Для каждого набора данных он предлагает создать своего рода паспорт с указанием источника, даты получения, правообладателя, условий лицензии, допустимых способов использования и срока хранения. Подтверждением законности могут служить договоры, акты передачи прав, лицензии, согласия и технические журналы.
ИИ-инженер, управляющий партнёр компании «Зинин, Штурбин и партнёры» Тим Зинин предлагает при аудите корпоративной базы распределить документы по происхождению и отдельно работать с материалами, основания использования которых пока неясны.
«Практический порядок такой: пройти по папкам и разметить каждый источник в одной из трёх категорий — создано внутри компании, получено от подрядчика по договору, взято из внешнего источника без ясного основания. Третья категория остаётся за пределами индекса до выяснения», — рассказал Тим Зинин.
Происхождение данных, по его словам, можно фиксировать через акт с подрядчиком с перечнем переданных материалов, поле «источник» в системе хранения и лог загрузки в индекс с датой и ответственным сотрудником. До подписания договора с поставщиком ИИ-сервиса Зинин также рекомендует выяснять, используются ли запросы и загруженные документы для дообучения модели, можно ли отключить эту опцию и доступна ли выгрузка индекса и логов.
Таким образом, в подготовке к возможному уточнению правил спикеры выделяют несколько практических задач: инвентаризацию используемых данных и контента, фиксацию их происхождения и правовых оснований, создание реестров и архивов подтверждающих документов, а также более четкое распределение ответственности между заказчиками, подрядчиками и поставщиками ИИ-сервисов.

