
美国司法部9月1日向纽约南区联邦地区法院提交一份《美国政府利益声明》,首次明确支持OpenAI。司法部提出,利用网络上的公开文本进行大语言模型(LLM)训练,通常属于版权法中的“合理使用”范畴,不应被普遍认定为版权侵权。
这一表态是回应2023年12月,《纽约时报》率先起诉OpenAI与微软未经许可,使用数百万篇报道训练聊天机器人,并寻求数十亿美元赔偿。之后,美国多家知名媒体和作家、记者等参与起诉。
尽管司法部站在人工智能(AI)大公司一边,但并不等同于最终法庭判决,因此,AI训练是否可以不付版权费,在法律上仍未定论。不过,司法部的站队可能影响未来全球AI发展与知识产权保护的博弈,当然也关系到现实中每个人的生活和权益。
客观地看,美国司法部的“利益声明”并没有直接违背知识产权的基本原则,而是在知识产权制度中的“促进创新”与“保护版权”这两大核心原则的天平上,倾向前者,但这一声明对知识产权也表现出明显漠视。正如《纽约时报》发言人指出,政府此举是“站在少数市值兆元的AI巨头一边,牺牲无数创作者利益”。
美国司法部支持OpenAI的理由有好几条,合理使用、立足国家安全与竞争力、避免垄断壁垒,但最重要的似乎是合理使用。司法部认为,AI在训练过程中对文字作品进行充分转换并形成全新的计算参数与内容,方式符合美国版权法中“合理使用”的根本原则。
然而,这个理由忽略AI公司一个重要行为,它们使用大量已发表的知识内容训练AI,并非单纯阅读学习,而是在训练AI模式后,拥有巨大的完成各类工作、任务的算力、能力,而AI模型本身就是一种优质技术产品,或生产力,也因此可以售卖给无数使用者。所以,AI公司搜取大量知识内容来训练AI,不是单纯阅读而是在训练模型后盈利,而且是巨额利润。
中国电商平台天猫现在已开启“AI空间站”,汇集阿里云、智谱、Kimi和MiniMax等中国大模型厂商的服务,消费者只要在淘宝搜索Token(词元)或进入充值中心,就能直接购买AI模型服务。
从这个最基本的角度看,AI训练是一种高度组织化的商业资源掠夺与产品替代。既然AI公司采用无数人的知识内容来赚钱,也必须为利用知识内容付费。这可以体现为几个方面。
首先,AI公司是将人类原创作品作为商业原材料倒进机器里,熔炼出一个价值数千亿美元的商业产品(AI模型)。但是,任何生产和商业行为都要支付原材料成本。这正如食品加工商用麦面生产出各式馒头、包子出售一样,首先必须采购小麦,向种植者付费。同理,汽车工厂须要买钢材,晶片工厂须要买硅片。如果没有人类已发表的高质量知识内容,AI模型就只是一个空壳。AI公司拒绝付费,无异于无偿征用他人知识资产,来构建自己的商业帝国。
其次,AI公司采用人类知识内容训练AI后,还会在市场上与其他产品产生直接竞争并替代其他产品。AI不仅从无数作者和媒体的内容学到知识,还能在前端直接生成极其相似的替代品。过去用户想知道某个深度调查或专业知识,必须点击原作者网站,付费获取内容,即便免费,原作者也会获得流量和广告费。现在AI直接把答案告诉用户,后者不再访问原网站,创作者的生路被直接砍断。用别人的产品训练自己,反过来在市场上砸掉原作者饭碗的行为,完全违背版权法中关于“不能实质损害原作品市场价值”的核心底线。
第三,在经济领域,AI公司还可以利用不平衡的资本实现掠夺,通过售卖巨大算力和全能服务,向用户收取各种费用,赚取高额商业利润,但利润源泉是无数创作者的劳动结晶,他们没有分到一分钱。这是一种畸形现象,在经济学上就是典型的不正当竞争和剥削,当然不值得肯定,反而须要限制和否定。
绕开散户 向“大咖”付费
尽管美国司法部站队OpenAI,但在声明中也承认,无论训练本身是否属于合理使用,AI公司为了获得实时更新的新闻、付费墙内的专业数据库、结构化的语料,依然必须与各大媒体签署数亿美元的商业授权许可协议,以规避合规风险并提升模型精确度。
在商业压力下,AI公司其实也无法躲避完全不付费的道德和法律风险。为了确保不被法院作出不利判决,OpenAI、谷歌等AI巨头已开始选择性地付费。它们的策略是,绕开大量散户创作者,向掌握大量版权的“大咖”付费。OpenAI与新闻集团达成价值超2.5亿美元的合作,也与Reddit、美联社、《金融时报》等媒体巨头签了数千万至数亿美元不等的长期商业内容许可协议。
现在,AI公司一边在法庭上让司法部帮自己摇旗呐喊,争取不付费的特权,一边在私底下给各大媒体塞钱。这就说明,把他人知识当免费午餐的时代正在走向终结。
但是,AI公司还想继续占无数散户创作者的便宜,为了解决这个问题,有人提议建立像音乐版权那样的“AI集体版权管理组织”,由AI公司按调用量统一向创作者分成,以保障散户创作者的权益。
但是,音乐作品使用是在明面上,而AI训练像是一个黑盒。大模型在吞噬数亿篇文章后,融合成为无数个参数。在AI最终输出一段话、一篇文章或方案时,无法证明某一特定创作者的作品贡献比率,无法溯源导致版权费无从在创作者之间公平分配。
不过,建立AI集体版权管理组织,更可能演变成一种数码时代的创作者低保或产业税,即AI巨头出钱买平安,行业组织拿钱救济创作者,以此维持人类原创生态不至于彻底枯竭。
可行的方案或许是,由国家立法对AI公司强制征税,统一补贴创作者群体。二是开发技术手段(如数码水印),让AI在调用数据时,进行精细的微量结算。
尽管有万般艰难,但值得尝试去做,数码时代不能让AI把“强者愈强,弱者愈弱;多者愈多,少者愈少”的马太效应,进一步扩大化。
作者是北京学者