主页 > 互联网 > 正文

为防AI训练滥用其内容,多家美国主流媒体封禁互联网档案馆时光机工具

2026-04-14 09:25:10来源:Techweb编辑:李川峰

扫一扫

分享文章到微信

扫一扫

关注豌豆财经网微信公众号

  4 月 14 日消息,据 Wired 报道,本月,《USA Today》刊发了一篇出色的报道,揭露了美国移民与海关执法局如何拖延披露其拘留政策影响的关键信息。报道作者利用互联网档案馆(Internet Archive)的“时光机(Wayback Machine)”工具,整理并分析了该机构的拘留统计数据,追踪其在特朗普政府时期的变化。这只是“时光机”为公共利益保存信息的无数案例之一,这款工具会抓取并留存网页内容。而据“时光机”负责人马克 · 格雷厄姆称,这件事本身“颇具讽刺意味”。

  《USA Today》集团(前身为甘尼特集团,运营着同名报纸及 200 多家其他媒体),却禁止“时光机”存档其内容。格雷厄姆表示:“他们能完成这篇调查报道,正是因为‘时光机’的存在。可与此同时,他们却在封禁访问权限。”

  近期,其他多家美国主流新闻机构也开始限制“时光机”存档其报道,其中包括《纽约时报》。据人工智能检测初创公司 Originality AI 分析,目前已有 23 家主流新闻网站屏蔽了“ia_archiverbot”—— 这是互联网档案馆为“时光机”项目使用的网络爬虫。社交平台 Reddit 也采取了同样做法。另有媒体以其他方式加以限制:《卫报》并未屏蔽爬虫,但将其内容排除在互联网档案馆 API 之外,并在“时光机”界面中过滤相关文章,导致普通用户更难查阅其存档内容。

  《USA Today》集团发言人拉克-玛丽 · 安东强调,此举“并非专门针对互联网档案馆”,而是该机构全面封禁所有爬虫程序的举措之一。《卫报》商务与授权总监罗伯特 · 哈恩则称,该报正与互联网档案馆沟通,原因是“担忧人工智能公司可能滥用为存档目的抓取的内容”。

  如今,记者们正自发抵制这一趋势。本周,电子前沿基金会、为未来而战等倡导组织联合记者声援“时光机”。该联盟收集到逾百名在职记者的签名,他们认可这款工具的价值,并向互联网档案馆递交了支持信。联署者既有知名电视主播蕾切尔 · 玛多,也包括独立媒体记者。信中写道:“在过去,记者会查阅地方报纸或公共图书馆的实体档案,调取历史报道,追溯当下事件的来龙去脉。如今大量报纸关停,地方公共图书馆又缺乏明确途径保存纯数字新闻,守护新闻记录的责任越来越多地落在互联网档案馆身上。”

  联署人、《拦截》播客监制劳拉 · 弗林表示,互联网档案馆在其职业生涯中是“不可或缺的工具”,在事实核查与音频片段检索方面发挥了关键作用。另一位联署人、《芝加哥读者》撰稿人米科 · 卡波拉尔称,撰写老牌乐队与文化人物相关报道时,“时光机”能提供已消失的旧时粉丝网站内容,否则这些资料将彻底湮没。

  卡波拉尔还表示,这款工具在其工会组织者工作中同样实用。“我在工会组织工作中大量使用‘时光机’,查找旧招聘信息,对比公司宣称的招聘岗位与实际分配的工作内容,或是查看不同职位在不同时期的调整情况。这些帖子还能帮我们追踪机构内部长期的薪资波动。”

  其他出版商则以担忧科技公司利用互联网档案馆数据训练人工智能模型为由,为封禁“时光机”的决定辩护。《纽约时报》发言人格雷厄姆 · 詹姆斯称:“问题在于,互联网档案馆中的时报内容正被人工智能公司用于训练,违反版权法,与我们形成直接竞争。”(时报方面未说明这是既成事实,还是仅为假设性担忧。)

  Reddit 此前也曾表示,对人工智能的担忧同样促使其屏蔽“时光机”爬虫。出版商与人工智能公司之间正围绕 AI 工具未经许可使用其内容训练的合法性展开激烈博弈;美国逾百起人工智能版权诉讼中,多数都聚焦这一问题。科技公司会抓取全网内容,而“时光机”拥有海量资料,因此被视为极具吸引力的数据来源。

  据IT之家了解,互联网档案馆已成立 30 年,存档网页超一万亿个。这家非营利机构自 2020 年以来历经多场重大法律诉讼。最近,其与一批主流音乐出版商达成和解,后者曾就其“伟大 78 转唱片”项目(存档老式录音)索赔高达 7 亿美元。尽管目前暂无重大经济处罚风险,但越来越多媒体机构封禁“时光机”,仍对其使命构成严重威胁。

  目前尚无公开工具能与“时光机”媲美。若其持续失去主流新闻来源的访问权限,其存档工作将大幅受损,早期数字历史记录会变得难以查阅,甚至彻底遗失。值得注意的是,这款工具曾被用于针对《纽约时报》的报道:2016 年,该报因修改一篇关于佛蒙特州联邦参议员、时任总统候选人伯尼 · 桑德斯的文章编辑内容而受到质疑,这些修改正是通过“时光机”首次被追踪到的。

  若类似事件如今发生,监督类媒体记者可能难以用同样方式追溯时报旧文版本。功能受限的“时光机”不仅不利于监督新闻业,还会对司法体系造成打击,该工具存档的网页在美国各类诉讼中常被作为证据引用。

  互联网档案馆的马克 · 格雷厄姆并未放弃希望,认为部分当前封禁其爬虫的出版商最终可能改变态度。他表示,这家非营利机构正与《纽约时报》等媒体“沟通协商”。但就目前而言,格雷厄姆称:“毫无疑问,公共网络越来越多的内容被封锁,正在削弱社会了解世界真相的能力。”

     投稿邮箱:lukejiwang@163.com   详情访问豌豆财经网:http://www.wdyxw.com.cn

相关推荐
科技行业掀大规模裁员潮!员工成AI训练燃料:被 科技行业掀大规模裁员潮!员工成AI训练燃料:被

3月31日消息,“我今天被裁员了。如果有人知道有适合我的职缺,请告诉我。谢

互联网2026-03-31

“心灵鸡汤”出版商控诉苹果、谷歌等公司非法 “心灵鸡汤”出版商控诉苹果、谷歌等公司非法

3 月 19 日消息,路透社昨日(3 月 18 日)发布博文,图书出版商“心灵鸡汤”于

互联网2026-03-19

消息称原阿里千问后训练负责人郁博文加盟字节 消息称原阿里千问后训练负责人郁博文加盟字节

3月12日消息,据界面新闻消息,原阿里通义实验室Qwen(千问)大模型后训练负

互联网2026-03-12

还好意思说别人蒸馏?马斯克抨击 Anthropic 大规模 还好意思说别人蒸馏?马斯克抨击 Anthropic 大规模

IT之家 2 月 24 日消息,人工智能公司 Anthropic 指控中国开发者窃取其 Claude 聊天

互联网2026-02-24

迪士尼法务部出手,称字节跳动Seedance 2.0盗用漫 迪士尼法务部出手,称字节跳动Seedance 2.0盗用漫

2 月 14 日消息,字节跳动本周四发布了新一代视频创作模型 Seedance 2.0。 Seedan

互联网2026-02-14

蚂蚁灵波开源具身大模型LingBot-VLA 后训练代码全 蚂蚁灵波开源具身大模型LingBot-VLA 后训练代码全

1月28日消息,蚂蚁集团旗下灵波科技今日宣布全面开源具身大模型 LingBot-VLA。

互联网2026-01-28

豆包手机助手回应安全隐私问题:内容不存储不 豆包手机助手回应安全隐私问题:内容不存储不

1月27日消息,昨日晚间,豆包手机助手官方发文回应手机助手的安全与隐私问题

互联网2026-01-27

智谱联手华为开源新模型登顶Hugging Face,国产芯 智谱联手华为开源新模型登顶Hugging Face,国产芯

今日,智谱AI宣布,其与华为联合开源的新一代图像生成模型GLM-Image,在开源上

互联网2026-01-16

智谱:用华为芯片全程训练的大模型GLM-Image登顶 智谱:用华为芯片全程训练的大模型GLM-Image登顶

1月16日消息,国内AI大模型企业智谱发文称:首个在国产芯片上全程训练的SOT

互联网2026-01-16

马斯克引领“比基尼换装”风潮惹争议,xAI承认 马斯克引领“比基尼换装”风潮惹争议,xAI承认

1 月 3 日消息,埃隆・马斯克旗下 xAI 本周为 Grok 推出了新图像编辑功能,允许

互联网2026-01-03