大模型训练数据合规新规出台著作权保护成核心焦点
2025年7月,国家网信办联合版权局发布《生成式人工智能训练数据安全管理办法》,针对大模型训练数据的采集、使用、存储等环节制定明确规范,其中著作权保护和个人信息授权两大条款引发行业广泛关注。该办法的出台填补了此前《生成式人工智能服务管理暂行办法》在训练数据输入端的监管空白,预计将使大模型训练数据合规成本提升30%,但长期将推动行业健康发展。 办法明确了训练数据使用的“三重授权原则”:使用受著作权保护的作品需获得权利人明确授权,无法联系权利人的需通过著作权集体管理组织备案,使用开源数据需符合开源协议要求。针对《纽约时报》诉OpenAI等国际纠纷,办法特别规定,境外大模型在华提供服务的,其训练数据中包含的中文作品需符合中国《著作权法》要求。同时,办法建立了训练数据“白名单”制度,...