备案控制台

开发者社区开发与运维文章正文

Python爬虫之BeautifulSoup

2017-06-14 1157

版权

版权声明：

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 上一篇博文中提到用正则表达式来匹配数据项，但是写起来容易出错，如果有过DOM开发经验或者使用过jQuery的朋友看到BeautifulSoup就像是见到了老朋友一样。

上一篇博文中提到用正则表达式来匹配数据项，但是写起来容易出错，如果有过DOM开发经验或者使用过jQuery的朋友看到BeautifulSoup就像是见到了老朋友一样。

安装BeautifulSoup

Mac安装BeautifulSoup很简单，打开终端，执行以下语句，然后输入密码即可安装

sudo easy_install beautifulsoup4

改代码

#coding=utf-8
import urllib
from bs4 import BeautifulSoup

# 定义个函数 抓取网页内容
def getHtml(url):
    webPage = urllib.urlopen(url)
    html = webPage.read()
    return html

# 定义一个函数 抓取网页中的图片
def getNewsImgs(html):
    # 创建BeautifulSoup
    soup = BeautifulSoup(html, "html.parser")
    # 查找所有的img标签
    urlList = soup.find_all("img")
    length = len(urlList)
    # 遍历标签 下载图片
    for i in range(length):
        imgUrl =  urlList[i].attrs["src"]
        urllib.urlretrieve("http://www.abc.edu.cn/news/"+imgUrl,'news-%s.jpg' % i)

# 获取网页
html = getHtml("http://www.abc.edu.cn/news/show.aspx?id=21430&cid=5")
# 抓取图片
getNewsImgs(html)

效果：换了一个新闻，抓取了新闻中的三张图片_{O(∩_∩)O}~

爬虫抓图片.gif

文章标签：

Python

Web App开发

数据采集

关键词：

Python爬虫

爬虫python

Python BeautifulSoup

爬虫beautifulsoup

Python爬虫beautifulsoup

yungfan

目录

相关文章

叫个什么名字

|

4天前

|

数据采集 XML 数据处理

使用Python实现简单的Web爬虫

本文将介绍如何使用Python编写一个简单的Web爬虫，用于抓取网页内容并进行简单的数据处理。通过学习本文，读者将了解Web爬虫的基本原理和Python爬虫库的使用方法。

叫个什么名字

53 13 13

东方睿赢

|

4天前

|

XML 前端开发数据格式

BeautifulSoup 是一个 Python 库，用于从 HTML 和 XML 文件中提取数据

【5月更文挑战第10天】BeautifulSoup 是 Python 的一个库，用于解析 HTML 和 XML 文件，即使在格式不规范的情况下也能有效工作。通过创建 BeautifulSoup 对象并使用方法如 find_all 和 get，可以方便地提取和查找文档中的信息。以下是一段示例代码，展示如何安装库、解析 HTML 数据以及打印段落、链接和特定类名的元素。BeautifulSoup 还支持更复杂的查询和文档修改功能。

东方睿赢

23 1 1

1941623231718325

|

2天前

|

数据采集数据挖掘 Python

使用Python构建简单网页爬虫的技术指南

【5月更文挑战第17天】使用Python构建简单网页爬虫的教程，涉及`requests`和`BeautifulSoup4`库。首先安装所需库，然后发送HTTP GET请求获取HTML内容。利用`BeautifulSoup`解析HTML，找到目标元素，如`<h2>`标签内的新闻标题。处理相对链接，将它们转化为绝对URL。添加异常处理以应对网络问题，同时遵循网站的`robots.txt`规则。此爬虫适用于数据分析和市场研究等场景。

1941623231718325

22 7 7

小白学大数据

|

4天前

|

数据采集 Web App开发数据处理

Lua vs. Python：哪个更适合构建稳定可靠的长期运行爬虫？

Lua vs. Python：哪个更适合构建稳定可靠的长期运行爬虫？

小白学大数据

198 4 4

小白学大数据

|

4天前

|

数据采集 Web App开发 Java

Python 爬虫：Spring Boot 反爬虫的成功案例

Python 爬虫：Spring Boot 反爬虫的成功案例

小白学大数据

35 0 0

叫个什么名字

|

4天前

|

数据采集 Python

使用Python实现简单的Web爬虫

本文将介绍如何使用Python编写一个简单的Web爬虫，用于抓取网页上的信息。通过分析目标网页的结构，利用Python中的requests和Beautiful Soup库，我们可以轻松地提取所需的数据，并将其保存到本地或进行进一步的分析和处理。无论是爬取新闻、股票数据，还是抓取图片等，本文都将为您提供一个简单而有效的解决方案。

叫个什么名字

21 0 0

叫个什么名字

|

4天前

|

数据采集存储 XML

如何利用Python构建高效的Web爬虫

本文将介绍如何使用Python语言以及相关的库和工具，构建一个高效的Web爬虫。通过深入讨论爬虫的基本原理、常用的爬虫框架以及优化技巧，读者将能够了解如何编写可靠、高效的爬虫程序，实现数据的快速获取和处理。

叫个什么名字

24 0 0

小白学大数据

|

4天前

|

数据采集 Web App开发数据可视化

Python爬虫技术与数据可视化：Numpy、pandas、Matplotlib的黄金组合

Python爬虫技术与数据可视化：Numpy、pandas、Matplotlib的黄金组合

小白学大数据

227 0 0

冷冻工厂

|

4天前

|

存储 XML 自然语言处理

Python网络数据抓取（4）：Beautiful Soup

Python网络数据抓取（4）：Beautiful Soup

冷冻工厂

23 2 2

东方睿赢

|

4天前

|

数据采集存储大数据

Python爬虫：数据获取与解析的艺术

本文介绍了Python爬虫在大数据时代的作用，重点讲解了Python爬虫基础、常用库及实战案例。Python因其简洁语法和丰富库支持成为爬虫开发的优选语言。文中提到了requests（发送HTTP请求）、BeautifulSoup（解析HTML）、Scrapy（爬虫框架）、Selenium（处理动态网页）和pandas（数据处理分析）等关键库。实战案例展示了如何爬取电商网站的商品信息，包括确定目标、发送请求、解析内容、存储数据、遍历多页及数据处理。最后，文章强调了遵守网站规则和尊重隐私的重要性。

东方睿赢

30 2 2

热门文章

最新文章

高德地图爬虫实践：Java多线程并发处理策略

【AI大模型应用开发】【LangChain系列】实战案例2：通过URL加载网页内容 - LangChain对爬虫功能的封装

使用Python打造爬虫程序之破茧而出：Python爬虫遭遇反爬虫机制及应对策略

Golang爬虫代理接入的技术与实践

Python爬虫面试：requests、BeautifulSoup与Scrapy详解

【专栏】随着技术发展，Scrapy将在网络爬虫领域持续发挥关键作用

人工智能：原理、应用与Python代码实现

Python小项目：利用tkinter开发测手速小游戏

人工智能：原理、应用与Python代码示例

流畅的 Python 第二版（GPT 重译）（一）(1)

请简述Python中的垃圾回收机制。

Python中如何实现二分查找？请提供代码示例。

Python中如何实现列表去重？请提供至少两种方法

Python中的装饰器：概念、用法和实例

Python中的装饰器：概念、用法及实例

使用Python实现图像处理中的边缘检测算法

Python中如何实现字符串反转？请提供至少两种方法。

在Python中，如何创建一个迭代器？

请解释Python中的迭代器和生成器的区别？并分别举例说明。

在Python中，如何使用装饰器重写类的方法？

相关课程

更多

Python语言基础 - 列表、元组、字典、集合

Python Web 框架 Django 快速入门

Python Web开发基础

Python爬虫实战

Python开发基础入门

Python网络爬虫实战

相关电子书

更多

From Python Scikit-Learn to Sc

Data Pre-Processing in Python:

双剑合璧-Python和大数据计算平台的结合

相关实验场景

更多

Python新手入门

Python入门

Python选择及循环结构

Python新手入门（Anolis OS）

Python网络通信程序典型应用

下一篇

2024年阿里云免费云服务器及学生云服务器申请教程参考