最近出现了一件事
3月12日,OpenClaw创始人Peter 在 X 平台公开发文直言:“Kinda... I got an email once from folks complaining that my rate limits block them from scraping fast enough. They copy yet they don't support the project in any way.”(差不多吧…… 我曾经收到过一封邮件,有人抱怨我的速率限制让他们没法足够快地抓取数据。他们抄袭,却不以任何方式支持这个项目。)
随后他直接 @腾讯混元官方账号喊话:“@TencentHunyuan would you be up for helping out a bit, instead of driving my server costs into 5 digit?”(@腾讯混元 你们能不能搭把手帮衬一下,而不是把我的服务器成本硬生生推高到五位数?)
![]()
腾讯则表示否认抄袭,表示SkillHub始终公开透明地以本地镜像站点的身份运营,且一直将ClawHub标注为内容来源。
![]()
上线首周,SkillHub为用户承载了180GB的访问流量(对应87万次下载),而仅从官方源站拉取1GB内容。

对于这件事情我的评价就是离谱到家了
Clawhub采取MIT开源协议,该协议允许商业使用和无限制分发,只需保留版权声明。这意味着腾讯在遵守协议条款的前提下,利用开源内容构建本土化服务,是合规的。
MIT 许可协议
版权所有 (c) 2026 Peter Steinberger
特此免费授予任何获得本软件及相关文档文件(以下简称“软件”)副本的人士, 无限制地处理该软件的权利,包括但不限于使用、复制、修改、合并、发布、 分发、再许可和/或出售软件副本的权利, 并允许软件的接收者进行上述操作,但须遵守以下条件:
上述版权声明及本许可声明应包含于 本软件的所有副本或实质性部分中。
本软件按“原样”提供,不作任何明示或 默示的保证,包括但不限于对适销性、 特定用途适用性及不侵权的保证。在任何情况下, 作者或版权持有者均不对因本软件、 本软件的使用或与本软件相关的 任何索赔、损害或其他 责任承担责任,无论该责任是基于合同、侵权或其他原因产生。
如果腾讯没在流量上撒谎的话
他甚至还算帮Clawhub一把了
针对腾讯的回应和网友 “镜像站已帮你降低 99.4% 带宽成本” 的提问,Peter 又来了一句:“这不是重点。我们可以同步数据,让这件事正式化,同步下载统计数据。但礼貌的做法是主动询问。”
![]()
那到底是谁先说的自己的账单超过五位数呢?
好难猜啊

再结合他对百度说的话
我的评价是
Peter:我没钱,打钱
腾讯和百度都不是什么好鸟,但是非得选一个
应该所有人都会选腾讯吧
这件事告一段落
互联网前夜的黑暗与带宽饥渴
人类对于“镜子”(Mirror)贯穿了从远古冶金到现代赛博空间的漫长历史。
在的数千年里,镜子仅仅是日常起居的工具
镜子能照出你的样貌
那么,镜像站到底是什么?
镜像站的诞生,并非灵光一现,而是早期互联网发展过程中,为解决核心痛点而逐步演化的必然结果。
它的需求,早在互联网的前身 ARPANET 时代就已经埋下。
ARPANET由美国国防部高级研究计划局(ARPA)于20世纪60年代末至70年代初开发,旨在连接计算机与各大学及研究机构的研究人员。
ARPANET 的建立旨在实现资源共享,让不同地理位置的研究者能够共享昂贵的计算机算力。同时,它也带有意识形态战争背景下的军事考量,即构建一个分布式架构
Apache 项目与第一个官方镜像系统
低带宽时代的通信壁垒
1971年4月16日,由 Abhay Bhushan 编写的 RFC 114 正式发布,定义了FTP的最初规范。

这是互联网历史上最早的应用层协议之一,它的核心目标是实现计算机之间的文件高效共享,为后来的镜像站提供了最核心的技术基础。
在 ARPANET 时代,网络的核心用途是学术与军事研究,文件传输是最核心的需求之一。
但早期的 FTP 操作复杂,仅能在少数科研机构的计算机之间使用,直到 80 年代,匿名 FTP的出现彻底改变了这一局面 —— 用户无需账号密码,即可通过 FTP 协议访问远程服务器,免费下载公开的文件与资源。
注意是公开的文件
这一创新让全球用户自由获取数字资源成为可能,也催生了对 “分布式文件副本” 的强烈需求。
20世纪80年代末至90年代初,互联网正处于从封闭的学术军工网络向商业和公众过渡的关键时期。
早期的硬件条件极大地限制了大型数据的流动。
在1994年左右,普通个人计算机用户通常面对的是笨重的大头显示器,并通过传统的电话线和调制解调器拨号上网。

当时的标准拨号连接速度仅为14.4 kbps(千比特每秒) 。在这种极其微弱的带宽下,即便是传输一张1 MB大小的普通文件,在没有任何网络拥堵的理想状态下,也需要大约 10 到 15 分钟
1990年,运行了20年的ARPANET正式退役,美国国家科学基金会网络(NSFNET)接管了骨干网 。
![]()
尽管NSFNET骨干网的速度宣称比ARPANET快至少25倍,但在面对多媒体内容和不断膨胀的软件体积时,依然显得力不从心 。
1990年时,全球仅有约0.05%的人口连接到网络 。
在这样脆弱的基础设施之上,跨大西洋或跨太平洋的数据请求通常会“三高”
高延迟、高丢包、高拥堵
这种带宽瓶颈对于早期软件开发者而言是致命的。
早期开源分发的物理极限
Linux内核的创始人Linus Torvalds曾回忆道,在1991年9月他开始捣鼓Linux时,芬兰与美国之间只有一条区区64 kbps的跨洋链路 。
幸运的是,当时的Linux 0.11版本源代码极其精简,仅有93 KB大小。
但即便如此,由于全欧洲的研究者都必须共享这条极其狭窄的链路,下载时间依然受到严重影响 。
如果所有的全球用户都直接向美国或欧洲的单一源服务器发起下载请求,不仅源服务器会瞬间起飞,高昂的国际流量结算费用也燃爆他们的钱包。
因此,突破地理与带宽的物理极限,将数据提前复制到靠近用户的本地网络,成为了早期互联网得以继续发展的唯一技术出路。
协议之争与信息分发雏形
FTP
在90年代,Wu-ftpd(由华盛顿大学开发)是互联网上最受欢迎的FTP守护进程,被广泛应用于各地的匿名FTP站点和Linux发行版的软件库托管中 。
尽管Wu-ftpd后来暴露出极差的安全历史(如著名的"Site Exec"漏洞),促使后人开发了ProFTPD等更安全的替代品,但FTP协议本身长达几十年的生命力,构成了早期镜像站生态的绝对底层通信基石 。
Gopher
在FTP之外,1991年由明尼苏达大学(其吉祥物正是Golden Gopher)的Mark P. McCahill团队开发的Gopher协议,提供了另一种革命性的信息分发范式 。
![]()
Gopher是一个基于菜单驱动的通信协议,它施加了严格得多的层级结构,极其适合当时广泛使用的远程文本终端 。

但,Gopher的辉煌是短暂的。
1989年,Tim Berners-Lee在CERN使用一台贴着“不要关机”标签的NeXT计算机写出了万维网的第一个提案 。
![]()
1994年4月,万维网的HTTP协议在NSFnet骨干网的数据包传输量上首次超越了Gopher(Web升至第9位,Gopher降至第11位);
1995 年初,Apache Group(Apache 软件基金会的前身)发布了 Apache HTTP Server,这款开源的 Web 服务器软件凭借其稳定性、灵活性,迅速取代了 NCSA HTTPd,成为全球最流行的 Web 服务器软件。
但随之而来的,是全球用户爆发式的下载需求。
Apache 团队很快发现,单台主下载服务器完全无法承载来自全球的流量。
跨洋访问更是卡到起飞
![]()
为了解决这个问题,Apache 团队开始联合全球的高校、科研机构与科技公司,邀请它们贡献服务器与带宽,建立全球统一的官方镜像系统
1995 年 4 月,Apache 的第一批镜像站正式上线。这是互联网历史上第一个系统化、标准化、有完整管理体系的镜像站网络,标志着镜像站从零散的副本,正式成为一种成熟的互联网服务。
所有镜像站定期从主站同步最新的软件安装包,确保内容与主站一致,同步延迟通常不超过 24 小时;
镜像站分布在全球不同的国家与地区,用户可以根据自己的地理位置,选择就近的镜像站下载,大幅降低访问延迟;
所有镜像站的带宽与服务器由合作机构自愿赞助,Apache 团队无需承担高昂的带宽成本,同时实现了全球流量的负载分流。
Apache 镜像系统的成功,彻底证明了镜像站模式的可行性。
到 1997 年,Apache 的全球镜像站已经达到 66 个,Apache 团队专门成立了 mirror@邮件列表,制定镜像同步的标准,优化镜像站的服务质量。
而 Apache HTTP Server 也凭借完善的镜像网络,实现了全球范围的快速普及,从 1996 年 4 月开始,一直保持着全球 Web 服务器市占率第一的位置,镜像站功不可没。
李·麦克劳克林的 mirror.pl 脚本
在90年代初期至中期,由伦敦帝国理工学院的Lee McLoughlin编写的Perl脚本——mirror是全球镜像站点的绝对统治者 。
mirror.pl 的工作原理相对直接:它调用系统本地的FTP客户端工具,连接到远程FTP服务器,通过递归读取远程目录列表,比对本地文件与远程文件的大小和修改时间戳 。
![]()
如果远程文件较新或大小不一致,mirror.pl就会触发下载,并在本地执行复杂的正则表达式重命名、压缩甚至权限修改 。
站点管理员通常通过定时任务,在网络负载最低的深夜自动运行该脚本 。
虽然mirror.pl使镜像站的自动化管理成为可能,但基于传统FTP的同步存在一个致命缺陷:缺乏文件级别的差分更新能力。
如果一个几十兆字节的大型归档文件中只有几个字节发生改变,FTP协议依然需要重新传输整个巨型文件,这在低带宽时代造成了极大的资源浪费。
Rsync的诞生
1996年6月,Andrew Tridgell与Paul Mackerras发布了rsync
![]()
Andrew Tridgell
这场底层技术的革命彻底颠覆了文件同步的范式 。
![]()
rsync 是一个用C语言编写的单线程应用,其最伟大的创新在于其独创的差分传输算法 。
与mirror.pl粗暴的整体文件替换不同
rsync 在发现源文件与目标文件存在差异时,会将文件划分为多个块,并在两端分别计算这些块的校验和。
通过交换校验和,两端的rsync进程能够精确锁定文件中发生变化的部分 。
最终,在网络链路上实际传输的仅仅是那些发生更改的字节数据,而不是整个文件 。
这使得需要几个小时的同步,在几分钟之内就能完成
除了网络开销优化,rsync 还引入了诸多为现代镜像站量身定制的特性:
透明隧道支持:能够无缝搭载于SSH等加密远程Shell协议之上执行同步 。
多层压缩算法:支持Zstandard、LZ4或Zlib进行额外的数据压缩 。
原生守护进程(rsyncd):允许服务器在后台运行,并通过原生的**rsync://**协议对外提供匿名的模块化数据推送与拉取服务,这成为了现代Linux发行版架设公开镜像站的标配模式 。
原子操作保证:对于像Yum、Apt这样的包管理器,仓库的元数据(Metadata)与实际包文件的一致性至关重要。旧版的同步工具往往在同步进行一半时被客户端访问,导致解析错误。而rsync可以通过复杂的目录处理顺序调整以及后台原子级别的延迟重命名机制,确保镜像站在任何瞬间对外呈现的数据状态都是一致且不可分割的 。
至今,rsync 依然是绝大多数Linux镜像站以及系统备份任务中最核心的工具。
即便后来出现了Rclone、Restic等针对现代对象存储的云同步工具
rsync 在点对点文件树克隆领域的效率和可靠性依然无法被撼动
成为互联网基础设施
Linux
随着Linux的崛起
Linux 从极客的玩具,变成了服务器、桌面端的主流操作系统
没有人会用Windows建服务器
Linux 的核心优势之一,是用户只需一行命令,即可从软件源中下载、安装、更新软件。
而这些软件源的底层,就是全球分布的镜像站网络。
对于 Linux 发行版来说,镜像站不是 “锦上添花” 的加速工具,而是整个系统正常运行的必需基础设施。
从软件分发到全数字领域覆盖
在 Linux 发行版的推动下,镜像站的应用场景快速扩展,覆盖了互联网的几乎所有数字资源领域:
![]()
中国开源镜像生态的崛起
国际出口带宽的掣肘
20世纪90年代初,中国接入国际互联网的通道极其狭窄。
1993年3月2日,中国科学院高能物理研究所与斯坦福大学直线加速器中心(SLAC)正式开通了一条64K专线,由中国国家自然科学基金委员会出资30万元人民币支持,这才使得中国数百名科学家能够使用国际电子邮件 。
![]()
国内的第一台Cisco路由器
《中国 Internet 发展年表》:“1993 年 3 月 2日,中国科学院高 能物理研究所租用AT&T公司的国际卫星信道建立 的接入美国 SLAC 国家实验室的 64K 专线正式开 通,成为我国部分连入 Internet 的第一根专线。这 根专线在1994年4月中国正式连入Internet后,也实现了 Internet 的全线连通。”
1994年,清华大学领头建立了中国教育和科研计算机网(CERNET),这是中国首个采用TCP/IP协议的全国性互联网骨干网,并于1995年11月正式建成CERNET骨干网 。
然而,在当时的中国,由于国际海缆带宽极度稀缺且费用极其昂贵
各大高校和科研机构面临着严峻的钱包危机
如果中国开发者和学生试图直接跨洋从美国或欧洲的源服务器下载Linux发行版源代码、大型编译器集或科研数据集
不仅下载速度常以数KB/s计算
且很容易因网络不稳定而中断
同时还会消耗学校极其宝贵的国际出口带宽
为了打破这种物理限制与经济壁垒
将海外庞大的开源仓库整体“搬运”回国内
并利用相对充裕且免费的CERNET教育网内网带宽进行高速分发
成为了中国学术界唯一的突围之路
在过去二十多年里,这些默默运行在各大学数据中心、日夜通过rsync与海外源站进行字节级对齐的高校镜像站,构成了中国庞大的IT从业人员的底层代码温床。
GeoDNS技术的引入
随着各大开源项目在全球范围内部署了数十乃至上百个镜像站点,如何将终端用户的下载请求智能地路由到距离其物理位置最近、网络状况最佳的服务器上,成为了网络工程的新挑战。
早期的做法非常原始——在项目官网列出一张长长的超链接列表
由用户根据自己的国家手动、选择
这种方式体验极差
毕竟你更可能点的是著名的
而不是更适合你的
DNS层面的地理寻址
为了解决全球请求的负载均衡问题,GeoDNS(地理位置域名系统)应运而生。

GeoDNS通常作为DNS服务器软件的补丁包实现
它深度集成了GeoIP或GeoLite等地理位置数据库
提取发出请求的客户端IP地址
并与GeoIP数据库进行比对
以确定该IP所在的国家或经纬度
基于这种地理位置匹配
GeoDNS会动态生成并返回一个距离用户最近的服务器IP地址
灾难恢复
镜像站与传统备份的本质区别
镜像不再局限于公共软件库的文件下载中转站
而是演变为确保业务连续性的模式
备份和镜像是两种常见的数据保护和管理方式,它们在概念、用途和应用场景上存在显著差异。
备份是将云服务器或硬盘在某一时间点的状态、配置和数据保存下来,主要用于数据恢复和安全保障。它的目标是防止数据丢失,提升系统的高可用性。备份的数据通常存储在与服务器分离的对象存储中,即使删除原始硬盘,备份仍然保留。备份可以用于恢复数据到原始服务器,也可以创建新的磁盘或镜像。
当主数据中心遭遇网络攻击、停电或自然灾害而彻底瘫痪时
镜像站点可以在无需冗长重启与数据恢复的情况下
实现瞬时故障转移
直接接管用户流量

从而将业务中断时间降至最低
满足高可用性的严苛要求
接下来我们来看看几个倒霉蛋
倒霉蛋
Ma.Gnolia
请问Ma.gnolia是啥(o**O)?
从 2005 年到 2009 年,Ma.gnolia是一个新兴的社交书签网站。在当时,它凭借能够存储书签网页快照以及在不同用户间分享书签群组的能力,与其竞争对手区分开来。
作为开放标准的早期采用者,它在领域内是先驱,所有人都期待它能占据并保持社交书签市场的大部分份额。
然而,2009 年 1 月,灾难降临。
Ma.gnolia服务器在完全宕机中丢失了所有数据。
由于数据损坏,所有用户数据都无法恢复,导致网站实际上已经死亡。
尽管他们有一个现场备份,但备份也重复了损坏,并且没有异地备份可以用来恢复服务器。
该企业最终在 2010 年永久关闭,仅因一次宕机就被彻底淘汰。
英国政府丢失囚犯数据
你会认为监狱是安全的地方。尤其是由英国政府运营的监狱。
但在2009年,英国内政部丢失了全国所有囚犯的机密信息,包括超过40,000名犯有暴力犯罪和性犯罪的严重罪犯。
那么他们最初是如何丢失罪犯数据的呢?一名员工将所有数据从安全服务器传输到 U 盘上。然后,他们丢失了 U 盘。U 盘中的数据未加密。这绝对值得被列入最严重的数据丢失灾难名单。
一块包含2500万人个人信息的磁盘,在邮寄途中丢失
你会以为英国政府丢失囚犯信息已经够糟糕了。
但更糟糕的是, 2008 年,他们发布了一块包含 2500 万个人记录的磁盘……然后在运输途中丢失了
这些信息包括出生日期、地址、银行账户和全国保险号码。更糟糕的是,它还包含了所有英国申领儿童福利的家庭信息,包括1550万儿童的信息。而且它也没有被安全加密。
2600万美国退伍军人数据丢失,多年联邦诉讼
美国政府也并非不受数据丢失之害。2006年,美国退伍军人事务部的一名数据分析员家中,笔记本电脑和外接硬盘被盗。
这本来可能不是什么大事,但偏偏上面有 2650 万 名军事退伍军人和军事人员的个人信息。这意味着姓名、出生日期、社会保障号码等。这是美国政府历史上最大的安全漏洞——也是现代最严重的数据丢失灾难之一。
整个事件引发了全国范围的搜寻。最终,在公开提供 5 万美元悬赏后,笔记本电脑被找到了。
虽然 FBI 宣布数据幸运地未被访问,但该事件导致代表那些笔记本电脑上有数据的男男女女提起集体诉讼。
经过三年的诉讼,退伍军人事务部不得不支付 2000 万美元,以解决这起数据丢失事件。
三星
你以为像三星这样的电信巨头会知道备份数据。

但在 2014 年 4 月,当韩国的三星数据中心被烧毁时,人们才意识到三星并没有这样做。
起初,人们以为几小时的手机停机是最糟糕的后果……直到三星意识到它没有备份仅存储在韩国服务器上的某些数据。
中心化网络与去中心化镜像
向CDN前进
2021年10月,Apache软件基金会正式宣布终结其运行了长达20多年的全球镜像站点系统,全面拥抱商业CDN来分发其包括Hadoop、OpenOffice等在内的超350个开源项目软件 。
CDN(Content Delivery Network,内容分发网络)是一组分布在不同地理位置的服务器网络,旨在通过将内容缓存到离用户更近的地方,提高网站的加载速度、稳定性和安全性。
![]()
ASF表示,镜像站在56k拨号时代是唯一可行的分发手段,但在当今宽带时代,由Fastly或Cloudflare等提供的现代CDN技术能够为用户带来更低的延迟、更稳健的连接以及更好的安全保障 。
![]()
不可替代
完整存档
CDN 虽然替代了镜像站的加速功能,但并没有让镜像站消失。
相反,在开源生态、学术存档、信息安全等领域,镜像站的价值反而更加凸显,因为它有着 CDN 无法替代的核心优势:
CDN 的核心是缓存,只会保留高频访问的内容,而镜像站是主站的完整副本,会长期保存所有的历史版本、历史资源。
对于学术资源、数字存档来说,完整的长期存档是核心需求,镜像站是不可替代的。
比如古腾堡计划、arXiv 的镜像站,依然在全球范围内运行,确保了数字资源的永久可访问。
公益基础设施
绝大多数开源项目、社区都没有足够的预算支付商业 CDN 的费用,而全球高校、机构、社区自愿维护的镜像站,完全公益免费,是开源生态最核心的基础设施。
对于 Linux 发行版、PyPI、npm、Maven 等开源软件仓库来说,镜像站依然是它们向全球用户提供服务的核心渠道。
信息自由
就比如说某图书馆,和某档案
镜像站的未来
镜像站的本质是互联网 “开放、平等、协作、共享” 精神的具象化体现。
从诞生之初,镜像站就不是由商业公司驱动的,而是由全球的高校、科研机构、志愿者社区自愿维护,免费向所有用户提供服务 —— 它们贡献自己的服务器、带宽、人力,只为了让数字资源能够更平等、更稳定、更广泛地传播给全球的每一个用户,没有商业盈利,没有流量变现,只有纯粹的共享精神。
面向未来,镜像站并不会被新技术淘汰,而是会以新的形式持续演进
IPFS(星际文件系统)等分布式存储技术,本质上就是镜像站理念的延伸 —— 它通过全球的节点,将文件的副本分布式存储,实现内容的永久保存、全球可访问,与镜像站的核心目标一脉相承。
结语
在当今云计算时代
尽管集中化的商业CDN架构在企业数据分发上已经势不可挡
但镜像站作为互联网诞生之初的原始隐喻与开源世界最重要的去中心化基石
依然在全球各地的机房机架上发出恒久的轰鸣
从 ARPANET 时代的 FTP 文件传输,到如今全球分布式的开源镜像网络,镜像站始终在互联网的底层,默默支撑着数字世界的运转。
它用最朴素的 “复制与同步”,实现了互联网最核心的价值 —— 让信息自由、平等地流动,抵达世界的每一个角落。
[!IMPORTANT]
信息来源网络
信息来源
*********
USTC Open Source Software Mirror - 中国科学技术大学,
Downloads slow, why mirrors and not CDN? - Site Feedback - Developer Forum - Blender,
A short history of the Web | CERN,
Gopher, The Competing Standard To WWW In The '90s Is Still Worth Checking Out | Hackaday,
Before the Web There Was Gopher - IEEE Computer Society,
What is GeoDNS and how does it work? - ClouDNS Blog - Cloud DNS,
Running Global Mirror for an unplanned failover and failback - IBM
--- 本文使用小黑盒编辑器辅助排版 ---
更多游戏资讯请关注:电玩帮游戏资讯专区
电玩帮图文攻略 www.vgover.com
