爬虫的定义和使用场景

# 爬虫的基础概念

如今，人工智能，大数据离我们越来越近，很多公司在开展相关的业务，但是人工智能和大数据中有一个东西非常重要，那就是数据，但是数据从哪里来呢？

首先我们来看下面这个例子：

新浪指数

这是微博的微指数 (opens new window)的一个截图，他把在微博上的用户的微博和评论中的关键词语做了提取，然后进行了统计，然后根据统计结果得出某个词语的流行趋势，之后进行了简单的展示

类似微指数的网站还有很多，比如百度指数，阿里指数，360指数等等，这些网站有非常大的用户量，他们能够获取自己用户的数据进行统计和分析

那么对于一些中小型的公司，没有如此大的用户量的时候，他们该怎么办呢？

在上面的来源中：人工的方式费时费力，免费的数据网站上的数据质量不佳，很多第三方的数据公司他们的数据来源往往也是爬虫获取的，所以获取数据最有效的途径就是通过爬虫爬取

百度新闻 (opens new window),一家并不是做新闻的公司，这个网站上的新闻数据从哪里来的呢？通过点击，我们可以发现，他的新闻数据都是其他网站上的，在百度新闻上仅仅做了展示

如果后续我们要做一个网站，天天新闻，是不是也可以这样做呢

那么同样的，我们后续想要做一个和网易云音乐 (opens new window)类似的音乐网站，是不是也可以这样来做呢？

通过前面的列子，能够总结出，爬虫获取的数据的用途：

网络爬虫（又被称为网页蜘蛛，网络机器人）就是模拟浏览器发送网络请求，接收请求响应，一种按照一定的规则，自动地抓取互联网信息的程序。

原则上,只要是浏览器(客户端)能做的事情，爬虫都能够做