Реестр для нейросетей: разработчиков ИИ в России хотят заставить отчитываться за каждый скачанный байт данных
В России разрабатывается законопроект, который кардинально усложнит жизнь создателям отечественных нейросетей. Власти обсуждают идею обязать разработчиков отчитываться о том, на каких данных обучался их алгоритм.
Если инициативу одобрят, создателям ИИ придется раскрывать происхождение датасетов: откуда взяли информацию, когда собрали, какой объем и в каком формате. Обсуждается даже создание единого «реестра отечественного ИИ», куда будут сливаться все эти отчеты. Официальная цель благая — защита авторских прав, прозрачность и предотвращение использования алгоритмов в преступных целях.
Представители Сбера, Яндекса и VK (входящие в Альянс в сфере ИИ) уже бьют тревогу. Проблема в том, что современные языковые модели обучаются на миллиардах текстов, картинок и кода, собранных со всего интернета.
Составить подробный бюрократический отчет на каждый терабайт спарсенных данных физически невозможно. Бизнес предупреждает: такое требование либо затормозит развитие ИИ в России из-за гигантских расходов на комплаенс, либо превратится в формальную «отписку» для проверяющих органов, не имеющую реального смысла.
Пока закон находится в стадии рамочного обсуждения, но тренд очевиден — «серая» эпоха работы с чужими данными заканчивается.
Обучать собственные модели на нелицензионных базах данных (статьях конкурентов, книгах, закрытых форумах) станет рискованно. Если к вам придут с проверкой, придется доказывать легальность происхождения информации.
Отечественные нейросети могут стать более «стерильными». Если разработчиков заставят фильтровать датасеты под угрозой штрафов, ИИ будет отказываться генерировать контент на спорные темы или использовать стили конкретных авторов.
Источник: kommersant