问题描述
急问,谢谢
解决方案
解决方案二:
就是一个程序,到互联网上抓网页。
解决方案三:
网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁,自动索引,模拟程序或者蠕虫。 这些处理被称为网络抓取或者蜘蛛爬行。很多站点,尤其是搜索引擎,都使用爬虫提供最新的数据,它主要用于提供它访问过页面的一个副本,然后,搜索引擎就可以对得到的页面进行索引,以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务,例如检查链接,确认html代码;也可以用来抓取网页上某种特定类型信息,例如抓取电子邮件地址(通常用于垃圾邮件)。 一个网络蜘蛛就是一种机器人,或者软件代理。大体上,它从一组要访问的URL链接开始,可以称这些URL为种子。爬虫访问这些链接,它辨认出这些页面的所有超链接,然后添加到这个URL列表,可以称作检索前沿。这些URL按照一定的策略反复访问。
解决方案四:
引用2楼yali4313的回复:
网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁,自动索引,模拟程序或者蠕虫。 这些处理被称为网络抓取或者蜘蛛爬行。很多站点,尤其是搜索引擎,都使用爬虫提供最新的数据,它主要用于提供它访问过页面的一个副本,然后,搜索引擎就可以对得到的页面进行索引,以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务,例如检查链接,确认html代码;也可以用来抓取网页上某种特定类型信息,例如抓取电子邮件地址(通常用于垃圾邮件)。 一个网络蜘蛛就是一种机器人,或者软件代理。大体上,它从一组要访问的URL链接开始,可以称这些URL为种子。爬虫访问这些链接,它辨认出这些页面的所有超链接,然后添加到这个URL列表,可以称作检索前沿。这些URL按照一定的策略反复访问。
up
解决方案五:
参考
解决方案六:
就像毛毛虫啊,呵呵
解决方案七:
解决方案八:
就是一群人有一天在网上实在无聊了,说:“咱们养只蜘蛛吧,教会这只蜘蛛把咱们需要的并且人家允许被收集的信息都收集起来,如果有人要找信息,就从咱们这儿找索引。”然后这只蜘蛛被越养越大,后来很多人都效仿第一群人,养蜘蛛的人越来越多,不过都没有第一批人养得好。
解决方案九:
了解。。。
解决方案十:
引用7楼walkghost的回复:
就是一群人有一天在网上实在无聊了,说:“咱们养只蜘蛛吧,教会这只蜘蛛把咱们需要的并且人家允许被收集的信息都收集起来,如果有人要找信息,就从咱们这儿找索引。”然后这只蜘蛛被越养越大,后来很多人都效仿第一群人,养蜘蛛的人越来越多,不过都没有第一批人养得好。
哈哈,你比我无聊啊
解决方案十一:
网络爬虫对网页而言,重在采集内容从一个网页入口,分析链接,一层一层的遍历,或者从一组网页入口,或者从一个rss源列表开始爬rss;获取每个页面的源码保存在磁盘或者数据库里;遍历抓下来的网页进行处理,比如提取正文,消重等;根据用途把处理后的文本进行索引、分类、聚类等操作
解决方案十二:
找个google的工程师问问。
解决方案十三:
根据连接找网页,再根据网页中的连接找网页
解决方案十四:
引用2楼yali4313的回复:
网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁,自动索引,模拟程序或者蠕虫。 这些处理被称为网络抓取或者蜘蛛爬行。很多站点,尤其是搜索引擎,都使用爬虫提供最新的数据,它主要用于提供它访问过页面的一个副本,然后,搜索引擎就可以对得到的页面进行索引,以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务,例如检查链接,确认html代码;也可以用来抓取网页上某种特定类型信息,例如抓取电子邮件地址(通常用于垃圾邮件)。 一个网络蜘蛛就是一种机器人,或者软件代理。大体上,它从一组要访问的URL链接开始,可以称这些URL为种子。爬虫访问这些链接,它辨认出这些页面的所有超链接,然后添加到这个URL列表,可以称作检索前沿。这些URL按照一定的策略反复访问。
解决方案十五:
类似搜索引擎的查找网页
解决方案:
抓网页的
解决方案:
该回复于2010-02-23 16:32:25被版主删除
解决方案:
主要是抓页面数据回去用的还有就是偷别人的东西
解决方案:
引用7楼walkghost的回复:
就是一群人有一天在网上实在无聊了,说:“咱们养只蜘蛛吧,教会这只蜘蛛把咱们需要的并且人家允许被收集的信息都收集起来,如果有人要找信息,就从咱们这儿找索引。”然后这只蜘蛛被越养越大,后来很多人都效仿第一群人,养蜘蛛的人越来越多,不过都没有第一批人养得好。
up
解决方案:
引用10楼wuyq11的回复:
网络爬虫对网页而言,重在采集内容从一个网页入口,分析链接,一层一层的遍历,或者从一组网页入口,或者从一个rss源列表开始爬rss;获取每个页面的源码保存在磁盘或者数据库里;遍历抓下来的网页进行处理,比如提取正文,消重等;根据用途把处理后的文本进行索引、分类、聚类等操作
挺全
解决方案:
百度一下不就知道啦,就是网页信息抓取程序把
解决方案:
百度一下。
解决方案:
聪明的人太多了,呵呵!