打开APP
userphoto
未登录

开通VIP,畅享免费电子书等14项超值服

开通VIP
Larbin 一种高效的搜索引擎爬虫工具:Search Engine搜索引擎研究

Larbin 一种高效的搜索引擎爬虫工具::[Search Engine]


离开dallas已经整整十天了,基本上除了到处见见人之外基本上没有其它的时间来学习新知识,也没有空将要完成的工作收尾。

Niu.la ,Booso,luliang.dhs.org 和 wespoke 相继宕机,看来年底各个地方的维护都不力。

itseek的开发者多次问起 larbin 的事情,我就在这里对larbin做一个简单的介绍。因为相对于复杂的系统来讲,larbin具有高度的可配置性,和良好的工作效率。

1]larbin的简介
larbin是一种开源的网络爬虫/网络蜘蛛,由法国的年轻人 Sébastien Ailleret独立开发。larbin目的是能够跟踪页面的url进行扩展的抓取,最后为搜索引擎提供广泛的数据来源。

Larbin只是一个爬虫,也就是说larbin只抓取网页,至于如何parse的事情则由用户自己完成。另外,如何存储到数据库以及建立索引的事情 larbin也不提供。

latbin最初的设计也是依据设计简单但是高度可配置性的原则,因此我们可以看到,一个简单的larbin的爬虫可以每天获取500万的网页,实在是非常高效。

2] Larbin的性能特征
高效是我对 larbin 的评价。
今年四月份的时候我对larbin的性能做过一个测试,luliang.dhs.org是我自己常用的服务器,CPU 为1G,内存512,其它的性能一般,因为是三年前购置的。

我将我自己的网页 六翼作为入口,运行larbin进行5层内的url的抓取。

当时纪录的一些数据:
Internet IO: 500-700k/per second (我想大约我的网络下载的瓶颈了吧)
CPU top: 5%-15%
disk consume: 1M/s ,基本上一个小时爬 3个G 的网页。差不多20万的页面
url 解析: 200万-300万每小时

3] larbin 的作用
很多人初见 larbin 不知道从哪里下手,那么我来简单介绍一下 larbin 的功能和实际应用。
1. larbin 获取单个、确定网站的所有联结,甚至可以镜像一个网站。
2. larbin建立 url 列表群,例如针对所有的网页进行 url retrive后,进行xml的联结的获取。或者是 mp3 。
3. larbin 定制后可以作为搜索引擎的信息的来源(例如可以将抓取下来的网页每2000一组存放在一系列的目录结构里面)。

总归,larbin应当是一个被广大搜索引擎爱好者应当引起注意的一个产品,虽然其功能逐渐被 Nutch 所接受和替代,但是其在爬虫上的优美设计的确值得称道。

本站仅提供存储服务,所有内容均由用户发布,如发现有害或侵权内容,请点击举报
打开APP,阅读全文并永久保存 查看更多类似文章
猜你喜欢
类似文章
【热】打开小程序,算一算2024你的财运
关于开源的网络爬虫/网络蜘蛛larbin结构分析的一篇非常不错的文章
网络爬虫,你知道多少?
搜索引擎中网络爬虫的设计分析
SEO之搜索引擎爬虫
33款可用来抓数据的开源爬虫软件工具
开源爬虫Labin,Nutch,Neritrix介绍和对比
更多类似文章 >>
生活服务
热点新闻
分享 收藏 导长图 关注 下载文章
绑定账号成功
后续可登录账号畅享VIP特权!
如果VIP功能使用有故障,
可点击这里联系客服!

联系客服