AREX Feed Article
NVIDIA遭股东衍生诉讼:指控黄仁勋隐瞒盗版训练数据风险,AI版权责任延伸至芯片层
2026年7月31日,NVIDIA股东Jessica Berliner在美国伊利诺伊州北区联邦地区法院提起股东衍生诉讼,将CEO黄仁勋(Jensen Huang)及12名董事会成员列为被告,指控其明知公司使用盗版数据集训练AI模型却作出虚假陈述,人为抬高股价,致使公司面临大量版权诉讼和潜在巨额赔偿责任。
这份长达108页的诉状称,NVIDIA在训练其Megatron系列大语言模型、视觉语言模型及语音克隆模型时,使用了来自"The Pile"数据集的训练材料,其中包括从盗版书库Bibliotik抓取的近20万本盗版书籍(Books3子集),以及从YouTube抓取的视频内容和数千小时未经同意的语音录音。Berliner指出,黄仁勋和董事会成员虽未亲自抓取数据,但负有直接或间接控制这些非法行为的责任。
虚假陈述与股价波动
诉状指控的核心在于,NVIDIA多年来向美国证券交易委员会(SEC)提交的代理声明中,多次强调公司专注于信息安全和隐私保护,致力于推进"可信赖AI"(trustworthy AI),但却刻意隐瞒其训练数据来源未获必要授权的事实。Berliner认为这些陈述"具有重大虚假性和误导性",让市场和股东误以为NVIDIA在AI开发中遵守了所有法律——包括版权法。
这一系列虚假陈述的后果是股价被人为抬高。NVIDIA股价从2024年1月的约624美元飙升至2024年6月的1,208美元。然而,随着版权诉讼不断堆积,股价持续下跌。诉状指出:"股价下跌是被告欺诈行为的性质和程度最终暴露于投资者和市场的直接结果。"
Berliner提出的诉讼请求包括违反信义义务和证券违规,要求法院责令NVIDIA采取一切必要措施改善内部合规程序,并追缴黄仁勋及董事会成员不当获取的利益。据诉状披露,黄仁勋在2023年至2025年间个人收入达1.204亿美元,持有股票价值1,739亿美元。NVIDIA截至发稿时未回应置评请求。
版权风险的全产业链扩散
NVIDIA案的独特之处在于,它将AI版权责任链条从模型开发商延伸到了芯片和基础设施层。NVIDIA不仅是AI芯片供应商,其自身也训练AI模型——这使得针对数据处理层的追责成为可能。此案是继Adobe和微软高管遭遇类似诉讼后,第四起"版权股东衍生诉讼"(copyright shareholder derivative lawsuit),预示这一新型诉讼策略正在向更多AI产业链公司蔓延。
与此同时,全球范围内训练数据版权执法正在同步加速。7月20日,加州北区联邦法院法官最终批准了Anthropic与作者集体诉讼的15亿美元和解——这是史上最大的版权集体诉讼和解。和解基金覆盖约48.2万部作品,每部约3,000美元。法院在该案中明确认定,从LibGen和PiLiMi等盗版书库下载书籍不构成合理使用,和解协议不涵盖AI模型输出侵权和2025年8月25日之后的未来行为。
慕尼黑法院Suno判决的国际连锁反应
7月31日——即NVIDIA诉讼提起的同一天——慕尼黑地区法院就GEMA诉Suno案作出里程碑式判决。法院认定,Suno通过"流媒体抓取"(stream-ripping)技术从YouTube提取受版权保护的音乐作品用于AI训练,构成侵权;AI模型通过"记忆化"(memorisation)过程将原创作品以可复现形式保留在模型内,不受文本与数据挖掘例外条款保护。法院同时裁定,即使训练发生在美国,"合理使用"抗辩也不成立——因为简单的文本提示即可生成与原作实质性相似的输出。
该判决是欧洲法院首次对美国境内AI训练行为主张管辖权,与Anthropic和解案共同表明:法院正将"训练数据获取"与"模型训练"作为两个独立法律行为分别审查。即使模型训练本身可能构成转换性使用,数据获取阶段的版权违规仍将独立承担法律责任。
对AI产业链而言,版权合规已从模型公司的专有问题演变为芯片供应商、数据中间商和云计算基础设施提供商共同面临的系统性风险。