Common Crawl8 days agohttps://commoncrawl.orgCommon Crawl 提供了免费的、开放的网络爬虫数据存储库。它是一家成立于 2007 年的 501(c)(3) 非营利组织。它为研究者们提供了便捷的、大规模的网络数据提取、转换和分析服务。
Stealth Crawlers Are Not a Threat to the Open Web. Bills Targeting Them Would Be16 hours agohttps://www.eff.org/deeplinks/2026/07/stealth-crawlers-are-not-threat-open-web-b...隐身爬虫是自动化工具,它们匿名收集公开的网络数据;它们并非恶意,而是用于调查性新闻、学术研究和网络安全等有益用途。匿名爬虫支持公共利益工作,例如The Markup对亚马逊反竞争行为的调查以及ProPublica对价格引导的揭露。纽约的“隐身爬虫保护法案”将使匿名爬取新闻网站的行为非法,允许出版商在没有不当行为证据的情况下揭露爬虫。此类立法威胁开放网络、用户隐私和有价值的研究,同时未能解决过度激进爬虫这一真正问题。存在更好的解决方案,例如针对有害爬虫行为的技术措施,这些措施不妨碍对公共信息的匿名访问。