法官驳回谷歌试图利用 DMCA 阻止其搜索结果被抓取的诉讼

法官驳回谷歌试图利用 DMCA 阻止其搜索结果被抓取的诉讼

Hacker News 摘要

原标题:Judge Rejects Google's Attempt to DMCA Its Way Out of Being Scraped

案件背景

在2026年7月,一名法官驳回了谷歌试图通过 DMCA(数字千年版权法案)来阻止其他公司抓取其搜索结果的诉讼。这起案件引起了广泛关注,因为谷歌整个商业帝国的根基正是建立在抓取互联网网页的基础之上,现在起诉其他公司抓取自己的数据被认为具有讽刺意味。

随着 AI 时代的到来,各种数据的价值愈发凸显。许多平台开始在原本开放的互联网部分设置限制或收费项目,这虽然主要针对 AI 公司,但也波及了普通开发者和研究人员。

争议核心:SerpAPI 及其运营模式

案件的被告是 SerpAPI。正如其名称所示,该公司旨在为搜索引擎结果页面提供未经授权的 API。通过这种方式,开发者(如 AI 公司 Perplexity)可以通过 SerpAPI 获取谷歌的搜索结果数据,而无需直接与谷歌达成商业协议。

在此之前,Reddit 也曾起诉过 SerpAPI。Reddit 声称 SerpAPI 允许其他公司通过抓取谷歌来间接获取 Reddit 的内容,违反了 DMCA 的反规避条款。然而,Reddit 的诉讼存在逻辑缺陷:用户持有帖子版权而非 Reddit 本身,且 SerpAPI 抓取的是谷歌而非 Reddit。

谷歌的法律主张与 SearchGuard

谷歌在几个月后发起了针对 SerpAPI 的类似诉讼。谷歌声称 SerpAPI 绕过了其名为 SearchGuard 的技术保护措施,从而违反了 DMCA 第 1201 条(反规避条款)。

根据法庭文件的描述,SearchGuard 的工作原理类似于一种验证码(CAPTCHA)系统:

• 当谷歌收到来自识别不到的来源的查询时,会发送一个 JavaScript 挑战。

• 该代码要求用户的浏览器发送特定的环境信息(即解题过程)。

• 人类用户的浏览器会自动且无缝地完成这一过程。

• 大规模运行的自动化系统通常无法完成这种挑战,从而被拒绝访问搜索结果。

法官驳回诉讼的理由

法官在裁决中明确指出,谷歌在这一案件中没有合法的版权主张。尽管谷歌可以针对某些更细窄的主张重新起诉,但目前的申诉被完全驳回。

1. 搜索结果并非版权作品

DMCA 第 1201 条旨在保护受版权法保护的作品。然而,谷歌搜索结果本质上是互联网上公开信息的汇编。法官认为,谷歌并未证明整个搜索结果页面受到版权法的保护。虽然搜索结果中偶尔出现的知识面板(Knowledge Panel)可能包含谷歌从第三方获得许可的版权图像,但这些内容并非始终存在。

2. 缺乏版权所有者的授权

DMCA 1201 要求技术措施必须在版权所有者的授权下实施。谷歌在实施 SearchGuard 时,并未获得搜索结果中涉及到的成千上万个第三方版权所有者的明确授权。因此,谷歌不能单方面声称该技术措施是为了保护这些第三方的版权。

3. 法律的过度扩张

DMCA 1201 最初是为了保护数字版权管理(DRM)而设计的。谷歌试图将其扩展到保护公开网页的访问控制,这超出了法律的初衷。法官指出,如果受控的内容本身不受版权法保护,那么 DMCA 就不适用。

行业影响与后续发展

虽然谷歌可能会针对其拥有版权的特定内容(如知识面板中的特定元素)重新提起诉讼,但其范围将非常有限。如果诉讼范围缩小,SerpAPI 理论上可以通过调整抓取策略,避开这些具有版权的部分来继续运营。

SerpAPI 对裁决结果表示欣慰,认为这维护了互联网开放获取可用信息的创始原则。他们强调,这种开放性对于推动创新以及确保所有人都能从数据中获益至关重要。

文章最后评论道,谷歌的行为被视为在获得成功后拆掉梯子。作为一家依靠抓取技术起家的公司,谷歌现在转向通过诉讼来限制后来的创新者,反映出一种年轻公司追求创新、老牌公司倾向诉讼的趋势转变。


原文:https://www.techdirt.com/2026/07/27/judge-rejects-googles-attempt-to-dmca-its-way-out-of-being-scraped/

评论:https://news.ycombinator.com/item?id=49073513

Report Page