网络爬虫是什么

问题描述

急问，谢谢

解决方案

解决方案二：
就是一个程序，到互联网上抓网页。
解决方案三：
网络爬虫（又被称为网页蜘蛛，网络机器人，在FOAF社区中间，更经常的称为网页追逐者），是一种按照一定的规则，自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁，自动索引，模拟程序或者蠕虫。　　这些处理被称为网络抓取或者蜘蛛爬行。很多站点，尤其是搜索引擎，都使用爬虫提供最新的数据，它主要用于提供它访问过页面的一个副本，然后，搜索引擎就可以对得到的页面进行索引，以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务，例如检查链接，确认html代码；也可以用来抓取网页上某种特定类型信息，例如抓取电子邮件地址（通常用于垃圾邮件）。　　一个网络蜘蛛就是一种机器人，或者软件代理。大体上，它从一组要访问的URL链接开始，可以称这些URL为种子。爬虫访问这些链接，它辨认出这些页面的所有超链接，然后添加到这个URL列表，可以称作检索前沿。这些URL按照一定的策略反复访问。
解决方案四：
引用2楼yali4313的回复:

网络爬虫（又被称为网页蜘蛛，网络机器人，在FOAF社区中间，更经常的称为网页追逐者），是一种按照一定的规则，自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁，自动索引，模拟程序或者蠕虫。　　这些处理被称为网络抓取或者蜘蛛爬行。很多站点，尤其是搜索引擎，都使用爬虫提供最新的数据，它主要用于提供它访问过页面的一个副本，然后，搜索引擎就可以对得到的页面进行索引，以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务，例如检查链接，确认html代码；也可以用来抓取网页上某种特定类型信息，例如抓取电子邮件地址（通常用于垃圾邮件）。　　一个网络蜘蛛就是一种机器人，或者软件代理。大体上，它从一组要访问的URL链接开始，可以称这些URL为种子。爬虫访问这些链接，它辨认出这些页面的所有超链接，然后添加到这个URL列表，可以称作检索前沿。这些URL按照一定的策略反复访问。

up
解决方案五：
参考
解决方案六：
就像毛毛虫啊，呵呵
解决方案七：

解决方案八：
就是一群人有一天在网上实在无聊了，说：“咱们养只蜘蛛吧，教会这只蜘蛛把咱们需要的并且人家允许被收集的信息都收集起来，如果有人要找信息，就从咱们这儿找索引。”然后这只蜘蛛被越养越大，后来很多人都效仿第一群人，养蜘蛛的人越来越多，不过都没有第一批人养得好。
解决方案九：
了解。。。
解决方案十：
引用7楼walkghost的回复:

就是一群人有一天在网上实在无聊了，说：“咱们养只蜘蛛吧，教会这只蜘蛛把咱们需要的并且人家允许被收集的信息都收集起来，如果有人要找信息，就从咱们这儿找索引。”然后这只蜘蛛被越养越大，后来很多人都效仿第一群人，养蜘蛛的人越来越多，不过都没有第一批人养得好。

哈哈，你比我无聊啊
解决方案十一：
网络爬虫对网页而言,重在采集内容从一个网页入口，分析链接，一层一层的遍历，或者从一组网页入口，或者从一个rss源列表开始爬rss；获取每个页面的源码保存在磁盘或者数据库里；遍历抓下来的网页进行处理，比如提取正文，消重等；根据用途把处理后的文本进行索引、分类、聚类等操作
解决方案十二：
找个google的工程师问问。
解决方案十三：
根据连接找网页，再根据网页中的连接找网页
解决方案十四：
引用2楼yali4313的回复:

网络爬虫（又被称为网页蜘蛛，网络机器人，在FOAF社区中间，更经常的称为网页追逐者），是一种按照一定的规则，自动的抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁，自动索引，模拟程序或者蠕虫。　　这些处理被称为网络抓取或者蜘蛛爬行。很多站点，尤其是搜索引擎，都使用爬虫提供最新的数据，它主要用于提供它访问过页面的一个副本，然后，搜索引擎就可以对得到的页面进行索引，以提供快速的访问。蜘蛛也可以在web上用来自动执行一些任务，例如检查链接，确认html代码；也可以用来抓取网页上某种特定类型信息，例如抓取电子邮件地址（通常用于垃圾邮件）。　　一个网络蜘蛛就是一种机器人，或者软件代理。大体上，它从一组要访问的URL链接开始，可以称这些URL为种子。爬虫访问这些链接，它辨认出这些页面的所有超链接，然后添加到这个URL列表，可以称作检索前沿。这些URL按照一定的策略反复访问。

解决方案十五：
类似搜索引擎的查找网页
解决方案：
抓网页的
解决方案：
该回复于2010-02-23 16:32:25被版主删除
解决方案：
主要是抓页面数据回去用的还有就是偷别人的东西
解决方案：
引用7楼walkghost的回复:

就是一群人有一天在网上实在无聊了，说：“咱们养只蜘蛛吧，教会这只蜘蛛把咱们需要的并且人家允许被收集的信息都收集起来，如果有人要找信息，就从咱们这儿找索引。”然后这只蜘蛛被越养越大，后来很多人都效仿第一群人，养蜘蛛的人越来越多，不过都没有第一批人养得好。

up
解决方案：
引用10楼wuyq11的回复:

网络爬虫对网页而言,重在采集内容从一个网页入口，分析链接，一层一层的遍历，或者从一组网页入口，或者从一个rss源列表开始爬rss；获取每个页面的源码保存在磁盘或者数据库里；遍历抓下来的网页进行处理，比如提取正文，消重等；根据用途把处理后的文本进行索引、分类、聚类等操作

挺全
解决方案：
百度一下不就知道啦,就是网页信息抓取程序把
解决方案：
百度一下。
解决方案：
聪明的人太多了,呵呵!

时间： 2024-09-19 20:40:54

网络爬虫是什么

问题描述

解决方案

网络爬虫是什么的相关文章

用Python语言实现网络爬虫

用Python编写网络爬虫（九）：百度贴吧的网络爬虫（v0.4）源码及解析

用Python编写网络爬虫（八）：糗事百科的网络爬虫（v0.2）源码及解析

用Python编写网络爬虫（六）：一个简单的百度贴吧的小爬虫

用Python编写网络爬虫（五）：urllib2的使用细节与抓站技巧

用Python编写网络爬虫（四）：Opener与Handler的介绍和实例应用

用Python编写网络爬虫（三）：异常的处理和HTTP状态码的分类

用Python编写网络爬虫（二）：利用urllib2通过指定的URL抓取网页内容

用Python编写网络爬虫（一）：抓取网页的含义和URL基本构成

网络爬虫-怎么使用pycharm来抓取旅游网站的信息