【发布时间】:2012-03-27 17:28:04
【问题描述】:
我在~2 个月前第一次输入a package on PyPi,并从那时起进行了一些版本更新。本周我注意到下载计数记录,并惊讶地发现它已被下载数百次。在接下来的几天里,我更惊讶地看到下载次数有时会增加数百每天,尽管这是一个小众统计测试工具箱。特别是,旧版本的软件包会继续被下载,有时下载速度比最新版本更高。
这是怎么回事?
PyPi 的下载计数是否存在错误,或者是否有大量爬虫抓取开源代码(就像我的一样)?
【问题讨论】:
-
恭喜!我没有看到我的包的这种行为......我看到了一些机器人下载,但没有那么多(新版本可能有 10-100 个?)。也许你真的有用户?!幂律很时髦……
-
不可能这么时髦!我还同时上传了another,非常专业的科学分析包(avalanchetoolbox),它的行为非常相似(所有版本在 1.5 个月内下载超过 1,000 次)。世界上没有 1,000 人会觉得这个包裹很有趣,所以肯定有问题。由于 avalanchetoolbox 依赖于幂律,也许一个真正对包感兴趣的人设置了一个 cron 作业来自动检查和下载更新,而这个作业有问题?
-
抱歉,喝茶迟到了,但是 stackoverflow 有点永恒,不是吗?我注意到,PyPI 提供了一个 windows .exe 二进制文件,并且只有 tar.gz 包格式作为你的 powerlaw 包的源包格式。如果您要提供 .zip、.tar.bz2 和 .tar.gz(均作为源格式),则可以通过减去一点来获得 some 提示。 假设:Windows 用户使用 .zip。大多数 .tar.gz 和 .tar.bz2 相同数量的下载可能源于镜像。有意义吗?
-
PyPI-Stats.com 的结果似乎是合理的。
标签: python web-crawler pypi