亚洲精品久久久中文字幕-亚洲精品久久片久久-亚洲精品久久青草-亚洲精品久久婷婷爱久久婷婷-亚洲精品久久午夜香蕉

您的位置:首頁/技術文章
文章詳情頁

Selenium結合BeautifulSoup4編寫簡單的python爬蟲

瀏覽:2日期:2022-07-06 09:40:35

在學會了抓包,接口請求(如requests庫)和Selenium的一些操作方法后,基本上就可以編寫爬蟲,爬取絕大多數網站的內容。

在爬蟲領域,Selenium永遠是最后一道防線。從本質上來說,訪問網頁實際上就是一個接口請求。請求url后,返回的是網頁的源代碼。

我們只需要解析html或者通過正則匹配提取出我們需要的數據即可。

有些網站我們可以使用requests.get(url),得到的響應文本中獲取到所有的數據。而有些網頁數據是通過JS動態加載到頁面中的。使用requests獲取不到或者只能獲取到一部分數據。此時我們就可以使用selenium打開頁面來,使用driver.page_source來獲取JS執行完后的完整源代碼。

例如,我們要爬取,diro官網女包的名稱,價格,url,圖片等數據,可以使用requests先獲取到網頁源代碼:訪問網頁,打開開發者工具,我們可以看到所有的商品都在一個

標簽里,展開這個li標簽,我們可找到商品名稱,價格,url,圖片鏈接等信息

Selenium結合BeautifulSoup4編寫簡單的python爬蟲

從html格式的源碼中提取數據,有多種選擇,可以使用xml.etree等等方式,bs4是一個比較方便易用的html解析庫,配合lxml解析速度比較快。

bs4的使用方法為

from bs4 import BeautifulSoupsoup = BeautifulSoup(網頁源代碼字符串,’lxml’)soup.find(...).find(...)soup.findall()soup.select(’css selector語法’)

soup.find()可以通過節點屬性進行查找,如,soup.find(’div’, id=’節點id’)或soup.find(’li’, class_=’某個類名’)或soup.find(’標簽名’, 屬性=屬性值),當找到一個節點后,還可以使用這個節點繼續在其子節點中查找。soup.find_all()是查找多個,同樣屬性的節點,返回一個列表。soup.select()是使用css selector語法查找,返回一個列表。

以下為示例代碼:

from selenium import webdriverfrom bs4 import BeautifulSoupdriver = webdriver.Chrome()driver.get(’https://www.dior.cn/zh_cn/女士精品/皮具系列/所有手提包’)soup = BeautifulSoup(driver.page_source, ’lxml’)products = soup.select(’li.is-product’)for product in products: name = product.find(’span’, class_=’product-title’).text.strip() price = product.find(’span’, class_=’price-line’).text.replace(’¥’, ’’).replace(’,’,’’) url = ’https://www.dior.cn’ + product.find(’a’, class_=’product-link’).attrs[’href’] img = product.find(’img’).attrs[’src’] sku = img.split(’/’)[-1] print(name, sku, price)driver.quit()

運行結果,如下圖:

Selenium結合BeautifulSoup4編寫簡單的python爬蟲

注:本例中,也可以使用requests.get()獲取網頁源代碼,格式和使用selenium加載的稍有不同。

一般簡單爬蟲編寫的步驟為:

進入列表頁,打開開發者工具,刷新頁面及向下滾動,查看新產品加載,是否能抓到XHR數據接口(直接返回JSON格式所有產品數據的接口) 如果有這種接口,嘗試修改參數中的分頁值,和請求總數值,看看是否能從一個接口返回所有的商品數據 如果只有Doc類型的接口返回頁面,嘗試使用requests.get()請求頁面,分析響應文本,是否包含所有商品數據 如果requests獲取不到商品數據或數據不全可以使用selenium加載頁面,然后使用bs4解析提取,如果有多個頁面,循環逐個操作即可。

以上就是Selenium結合BeautifulSoup4編寫簡單的python爬蟲的詳細內容,更多關于python 爬蟲的資料請關注好吧啦網其它相關文章!

標簽: Python 編程
相關文章:
主站蜘蛛池模板: 久久精品综合国产二区 | 免费国产调教视频在线观看 | 2022日本卡一卡二新区 | 日韩在线视频免费播放 | 草草视频在线免费观看 | 欧美一级大黄特黄毛片视频 | 日操夜操天天操 | 日本粉色视频 | 簧片视频在线观看 | 中国在线观看免费的www | 亚洲欧美成人一区二区在线电影 | 日本一区二区三区四区无限 | 一级毛片一级毛片一级毛片 | 日本最新伦中文字幕 | 国产成人拍精品视频网 | 亚洲大片 | 夜色55夜色66亚洲精品网站 | 狠狠操在线视频 | 色中文在线| 国产精品v免费视频 | 日韩精品亚洲人成在线播放 | 日本在线不卡免费视频一区 | 久久精品视频免费看 | 国产在线一区二区三区欧美 | 欧美特黄特色aaa大片免费看 | 欧美特级毛片a够爽 | 精品国产调教最大网站女王 | 成人视屏在线 | 亚洲欧美日韩国产综合久 | 手机在线看片不卡中文字幕 | 国产 麻豆 欧美亚洲综合久久 | 国产成人精品一区二三区在线观看 | 免费三级黄色 | 中文字幕亚洲视频 | 91麻豆视频网站 | japanesefree高清日本乱 | 日鲁夜鲁鲁狠狠综合视频 | 91在线视频免费91 | 国产制服丝袜在线观看 | 网红主播大秀一区二区 | 亚洲国产成人久久一区久久 |