技术文章 > Python爬虫 >  爬虫实战 > 正文

python爬虫实战之爬取百度首页的简单实现

宋雪维

“百度一下,你就知道”、“有问题找度娘”等网络语言的传播使百度搜索引擎随着互联网的发展出现在人们的生活中,当我们遇到问题,我们习惯打开百度,在百度首页上输出问题,按回车键即可得到答案,那你知道如何使用python爬虫爬取百度首页吗?本文就用if语句带领大家开始python爬虫爬取百度首页的实战练习。

第一步:导入requests模块

import requests

第二步:指定URL并进行UA伪装

#如果当前python文件作为入口程序执行时,则执行if语句下的代码if  __name__=='__main__':
    # 指定URL
    url = 'https://www.baidu.com'
    # 进行UA伪装,模拟浏览器,注意要将相应的User-Agent封装在一个字典中
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:34.0) Gecko/20100101 Firefox/34.0'
    }

第三步:向服务器发起请求,get方法返回一个响应对象

  response = requests.get(url=url, headers=headers)

第四步:获取字符串类型的响应数据

page_text = response.text

第五步:持久化存储,写入文件

 with open('./baidu.html', 'w', encoding='utf8') as fp:
        fp.write(page_text)
    print('百度首页爬取成功!!!')

以上就是python爬虫实战之爬取百度首页的简单实现,是不是很简单,大家快尝试看看吧·更多python爬虫实战学习推荐:python实战教程

免费视频教程
本教程部分素材来源于网络,版权问题联系站长!
相关文章
  python itemgetter函数实现字典排序
  python中numpy.empty()函数的用法
  列表解析式在python中拼接列表
  python中如何使用numpy.zeros()函数?
  python编程从入门到实践pdf免费查看
  python中numpy.ones()函数怎么用?
  python实战:爬取网站的购买记录
  Python爬虫后获取重定向url的方法有哪些?
相关视频章节
  CSS基础-属性选择器
  CSS基础-类选择器
  CSS基础-id选择器
  .CSS基础-派生选择器
  CSS基础-介绍及语法
视频教程分类