"Google and Reddit do not own the Internet," web scraper says after court win5 days agohttps://arstechnica.com/tech-policy/2026/07/google-wont-give-up-odd-war-against-...谷歌正在利用《数字千年版权法》起诉SerpApi,指控其规避反抓取技术并出售抓取的搜索结果,尽管搜索结果本身不受版权保护。Reddit也对SerpApi和Perplexity提起了类似诉讼,指控它们从谷歌搜索结果中抓取Reddit内容。两家公司都将《数字千年版权法》作为打击AI抓取行为的工具,尽管该法律并非为此目的而设计。这些诉讼旨在阻止恶意抓取行为,这些行为破坏了权利所有者对其内容的控制,并削弱了谷歌从搜索服务中获利的能力。
Cloudflare Threatens to Cut Google Off from Their Publishers in Searches21 days agohttps://www.nakedcapitalism.com/2026/07/cloudflare-threatens-to-cut-google-off-f...人工智能和谷歌爬虫正积极地窃取受版权保护的内容,降低网站性能,并导致验证码的使用增加。Cloudflare将默认阻止新的和免费层级网站上的多功能爬虫(如谷歌爬虫)访问带有广告的页面,旨在保护内容。包括《今日美国》在内的出版商因缺乏许可协议和搜索流量下降,考虑从谷歌除名。人工智能爬虫应对内容使用支付巨额费用,例如在一项集体诉讼和解中,作者从Anthropic获得了3,000美元。更多...
An Update on the scraper situation22 days agohttps://lwn.net/SubscriberLink/1080822/990a8a5e2d379085/AI机器人网络通过住宅代理进行的爬虫攻击正在压垮网站,利用数百万台通常未被主人知晓的受感染设备制造过量流量。像Bright Data等公司提供'道德'住宅代理网络,利用免费VPN或SDK将用户设备变为爬虫终端。这种爬取行为被认为是由训练AI模型的数据需求增长所驱动,推动方包括企业和政府机构等多种实体。网站正在实施防御措施,如Anubis工作量证明系统、验证码、付费墙和登录关卡,以减轻爬虫影响。更多...