德里高院判决:AI训练数据版权争议中的“合理使用”边界再定义
社区讨论 · 政策

德里高院判决:AI训练数据版权争议中的“合理使用”边界再定义

老邓老邓7月28日2026/07/28 88 浏览

我注意到一个有意思的细节:德里高等法院在认定OpenAI使用ANI内容训练AI不构成侵权时,援引了“非表达性使用”(non-expressive use)这一概念。这一术语在NLP领域并不常见,但在版权法语境下,它恰好对应了AI训练过程中对文本的统计处理本质——模型并不“阅读”或“理解”文章,而是提取其背后的分布特征。

从“表达性使用”到“非表达性使用”:一个关键的区分

法官Amit Bansal认为,AI训练过程中对版权作品的使用不涉及向公众传播原作品,而是将其转化为训练数据中的数值向量。这一逻辑与NLP社区中关于“预训练是否构成侵权”的经典讨论高度吻合。事实上,2023年Google Research的论文《On the Legality of Training Data for Large Language Models》就曾指出,当模型参数仅编码统计规律而非完整复制原文时,其行为更接近“合理使用”而非“复制”。德里高院的判决相当于在司法层面验证了这一技术视角。

但这里有一个容易被忽视的实验设计问题:如果模型在推理时恰好生成了与ANI原文高度相似的句子(即所谓的“记忆化”现象),那么“非表达性”的边界就会变得模糊。Carlini等人2021年的论文《Extracting Training Data from Large Language Models》已经证明,通过特定提示词,确实可以从GPT-2中提取出训练集中的原文片段。德里高院并未讨论这一边界情况,或许是因为ANI未能提供具体证据证明OpenAI的模型确实生成了受版权保护的完整段落。

对比baseline:美国fair use与印度fair dealing的差异

另一个值得关注的点是印度法律中“fair dealing”与美国“fair use”的差异。美国四要素测试包括“使用目的和性质”“作品性质”“使用比例”“对市场的影响”。而印度版权法第52条则列出了具体情形,包括“研究或私人使用”“批评或评论”等。德里高院将AI训练解释为“研究”用途,这一类比在技术上并不严谨——商业公司的模型训练显然不是纯粹学术研究。但法院可能更看重的是训练行为本身不向公众再现原作品,这一点与《纽约时报》诉OpenAI案中美国地方法院部分法官的倾向一致。

从方法论角度看,这暴露了一个系统性的偏差:版权法传统上以“表达”为核心,而AI训练恰恰是“非表达”的统计计算。如果法律体系无法及时更新对“使用”的定义,那么类似判决将严重依赖法官对技术原理的理解深度。德里高院在此案中表现出的技术理解水准,至少比某些欧洲法院判决中混淆“缓存”与“复制”的案例要高明。

数据集偏差与法律风险:NLP研究的现实考量

作为带过5届研究生的人,我注意到这类判决对NLP数据集构建的直接影响。目前学术界常用的预训练数据集(如C4、Pile)中大量包含新闻网站内容,而这类网站通常明确声明“禁止用于AI训练”。德里高院的判决相当于为印度境内使用这类数据提供了法律依据,但数据集的“地域限制”问题随之而来:一个模型在印度训练可能合法,但在欧盟训练可能违反GDPR或版权指令。

这提醒我们,实验设计中的“数据集偏差”不仅包括统计偏差,还包括法律风险偏差。在论文中报告“数据集来源是否获得授权”或许应该成为未来NLP领域的规范。遗憾的是,目前多数顶会论文仅关注数据清洗和去重,对版权合规性近乎沉默。

德里高院的判决不具有全球约束力,但它为“AI训练数据是否受版权制约”提供了又一个实证样本。当技术事实与法律原则发生冲突时,法院选择了尊重技术本质。这一倾向值得所有NLP研究者关注——我们构建的每一个embedding向量,都可能在法庭上被重新定义。

原文链接:https://www.ithome.com/0/982/520.htm

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧
德里高院判决:AI训练数据版权争议中的“合理使用”边界再定义 - 物界前沿论坛