嘗試用Python3爬取網(wǎng)頁(yè)圖片的過(guò)程記錄

alin 發(fā)布于2019-07-31 11:12 / 408人閱讀

摘要：上有一個(gè)關(guān)于下載百度貼吧里的美女圖片的練習(xí)題，最近正好在學(xué)爬蟲(chóng)相關(guān)的知識(shí)，拿來(lái)練練手。這是我的目標(biāo)網(wǎng)頁(yè)。

Github上有一個(gè)關(guān)于下載百度貼吧里的美女圖片的練習(xí)題，最近正好在學(xué)爬蟲(chóng)相關(guān)的知識(shí)，拿來(lái)練練手。
這是我的目標(biāo)網(wǎng)頁(yè)。
最開(kāi)始的時(shí)候我在網(wǎng)上找到一個(gè)類(lèi)似的案例，代碼如下圖：

稍作修改，運(yùn)行之后得到七十多張圖片，結(jié)果一看接近一半是用戶(hù)頭像～
方法太過(guò)簡(jiǎn)單粗暴，決定使用美麗的湯——BeautifulSoup重寫(xiě)一下（這湯真香）
觀察了一下頁(yè)面的源代碼，發(fā)現(xiàn)所有用戶(hù)發(fā)的圖片都是class=“BDE_Image”的，這樣就可以區(qū)分頭像和帖子里的圖片了，隨便寫(xiě)寫(xiě)的代碼：

from urllib.request import urlretrieve
from urllib.request import urlopen
from bs4 import BeautifulSoup

def get_image(url):
    html = urlopen(url).read().decode("utf-8")
    bsObj = BeautifulSoup(html, "lxml")
    myimg = bsObj.find_all("img", class_="BDE_Image")
    num = 1
    for img in myimg:
        link = img.get("src")
        pic_name = str(num) + ".jpg"
        urlretrieve(link, pic_name)
        print("Success!" + pic_name)
        num += 1

    return None

url = "http://tieba.baidu.com/p/2166231880"
get_image(url)

這次得到了49張圖片

代碼上傳到了我的Github

交流群：435414286

GPU云服務(wù)器云服務(wù)器 python爬取網(wǎng)頁(yè)圖片爬取網(wǎng)頁(yè) 云盾爬取網(wǎng)頁(yè) java網(wǎng)頁(yè)爬取數(shù)據(jù)

文章版權(quán)歸作者所有，未經(jīng)允許請(qǐng)勿轉(zhuǎn)載,若此文章存在違規(guī)行為，您可以聯(lián)系管理員刪除。

轉(zhuǎn)載請(qǐng)注明本文地址：http://systransis.cn/yun/44783.html

相關(guān)文章

Python3網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)---36、分析Ajax爬取今日頭條街拍美圖

摘要：上一篇文章網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)數(shù)據(jù)爬取下一篇文章網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)動(dòng)態(tài)渲染頁(yè)面抓取本節(jié)我們以今日頭條為例來(lái)嘗試通過(guò)分析請(qǐng)求來(lái)抓取網(wǎng)頁(yè)數(shù)據(jù)的方法，我們這次要抓取的目標(biāo)是今日頭條的街拍美圖，抓取完成之后將每組圖片分文件夾下載到本地保存下來(lái)。上一篇文章：Python3網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)---35、 Ajax數(shù)據(jù)爬取下一篇文章：Python3網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)---37、動(dòng)態(tài)渲染頁(yè)面抓取:Selenium 本節(jié)我們...

Leck1e 2019-07-31 10:36 評(píng)論0 收藏0
首次公開(kāi)，整理12年積累的博客收藏夾，零距離展示《收藏夾吃灰》系列博客

摘要：時(shí)間永遠(yuǎn)都過(guò)得那么快，一晃從年注冊(cè)，到現(xiàn)在已經(jīng)過(guò)去了年那些被我藏在收藏夾吃灰的文章，已經(jīng)太多了，是時(shí)候把他們整理一下了。那是因?yàn)槭詹貖A太亂，橡皮擦給設(shè)置私密了，不收拾不好看呀。 ...

Harriet666 2021-09-10 10:51 評(píng)論0 收藏0
爬蟲(chóng) - 收藏集 - 掘金

摘要：在這之前，還是有必要對(duì)一些概念超輕量級(jí)反爬蟲(chóng)方案后端掘金前言爬蟲(chóng)和反爬蟲(chóng)日益成為每家公司的標(biāo)配系統(tǒng)。爬蟲(chóng)修煉之道——從網(wǎng)頁(yè)中提取結(jié)構(gòu)化數(shù)據(jù)并保存（以爬取糗百文本板塊所有糗事為例） - 后端 - 掘金歡迎大家關(guān)注我的專(zhuān)題：爬蟲(chóng)修煉之道上篇爬蟲(chóng)修煉之道——編寫(xiě)一個(gè)爬取多頁(yè)面的網(wǎng)絡(luò)爬蟲(chóng)主要講解了如何使用python編寫(xiě)一個(gè)可以下載多頁(yè)面的爬蟲(chóng)，如何將相對(duì)URL轉(zhuǎn)為絕對(duì)URL，如何限速，...

1fe1se 2019-07-31 10:58 評(píng)論0 收藏0
Python3網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)---35、 Ajax數(shù)據(jù)爬取

摘要：所以說(shuō)，我們所看到的微博頁(yè)面的真實(shí)數(shù)據(jù)并不是最原始的頁(yè)面返回的，而是后來(lái)執(zhí)行后再次向后臺(tái)發(fā)送了請(qǐng)求，拿到數(shù)據(jù)后再進(jìn)一步渲染出來(lái)的。結(jié)果提取仍然是拿微博為例，我們接下來(lái)用來(lái)模擬這些請(qǐng)求，把馬云發(fā)過(guò)的微博爬取下來(lái)。上一篇文章：Python3網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)---34、數(shù)據(jù)存儲(chǔ)：非關(guān)系型數(shù)據(jù)庫(kù)存儲(chǔ):Redis下一篇文章：Python3網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)---36、分析Ajax爬取今日頭條街拍美圖 ...

Thanatos 2019-07-31 10:36 評(píng)論0 收藏0
Python3網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)---19、代理基本原理

摘要：所以使用代理隱藏真實(shí)的，讓服務(wù)器誤以為是代理服務(wù)器的在請(qǐng)求自己。參考來(lái)源由于涉及到一些專(zhuān)業(yè)名詞知識(shí)，本節(jié)的部分內(nèi)容參考來(lái)源如下代理服務(wù)器維基百科代理百度百科上一篇文章網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)和下一篇文章網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)使用發(fā)送請(qǐng)求上一篇文章：Python3網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)---18、Session和Cookies下一篇文章：Python3網(wǎng)絡(luò)爬蟲(chóng)實(shí)戰(zhàn)---20、使用Urllib：發(fā)送請(qǐng)求我們?cè)谧雠老x(chóng)...

gougoujiang 2019-07-31 10:34 評(píng)論0 收藏0