大数据平台>大数据技术与应用>python抓取新浪微博数据

使用python抓取新浪微博数据

作者: afenxi来源: afenxi时间:2017-03-18 16:37:02

摘要：本篇文章是python爬虫系列的第四篇，介绍如何登录抓取新浪微博的信息。

本篇文章是python爬虫系列的第四篇，介绍如何登录抓取新浪微博的信息。并对其中的关键内容进行提取和清洗。使用python抓取新浪微博数据-数据分析网

开始前的准备工作

首先是开始之前的准备工作，与前面的文章相比，我们除了导入库文件，还把设置登录页URL，以及登录用户密码也放在了准备工作中。下面分别来说明。

导入所需的库文件，第一个是requests，用于请求和页面抓取，第二个是re正则库，用于从页面的代码中提取所需要的信息。第三个是pandas库，用来进行拼表以及数据导出。

#导入requests库(请求和页面抓取)

import requests

#导入正则库（从页面代码中提取信息）

import re

#导入pandas库(用于创建数据表和导出csv)

import pandas as pd

开始抓取前，先找到新浪微博的登陆页面地址，PC端的页面内容较多，我们选择通过移动端页面登陆微博。地址是http://m.weibo.cn/，点击登陆后，跳转到登陆页面地址https://passport.weibo.cn/signin/login，这是我们要提交用户名和密码进行登陆的地址。此外还需要找到要抓取页面的URL地址。这里我们抓取“蓝鲸碎碎念”的微博首页。http://weibo.com/askcliff/home 使用python抓取新浪微博数据-数据分析网

#设置登陆用户名和密码

payload = )

#导出为csv文件

weibo.to_csv(weibo.csv)

看过还想看

可能还想看