学习网络爬虫(1)

王朝学院·作者佚名  2016-08-27
窄屏简体版  字體:   |    |    |  超大  

初学网络爬虫,请多多指教

以下是我觉得有用的资源总结,资源均来自网上

编程语言:java

使用网络爬虫:spiderman

Spiderman 是一个Java开源Web数据抽取工具。它能够收集指定的Web页面并从这些页面中提取有用的数据。

Spiderman主要是运用了像XPath,正则表达式等这些技术来实数据抽取。

Spiderman开源中国链接(含文档及下载):http://www.oschina.net/p/spiderman

Spiderman Java 爬虫示例:http://my.oschina.net/laiweiwei/blog/99937

【最新更新支持频道分页、文章分页】【抛砖引玉】抓取OSC的问答数据展现垂直爬虫的能力 :http://my.oschina.net/laiweiwei/blog/100866

XPath JAVA用法总结及代码样例 :http://www.open-open.com/lib/view/open1397717612656.html

w3school XPath教程 :http://www.w3school.com.cn/xpath/index.asp

 
 
免责声明:本文为网络用户发布,其观点仅代表作者个人观点,与本站无关,本站仅提供信息存储服务。文中陈述内容未经本站证实,其真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
 
© 2005- 王朝網路 版權所有 導航