javascript - node爬取微博
問題描述
剛接觸node,想寫個爬蟲,爬取新浪微博評論,但是發(fā)現(xiàn)頁面是由JS動態(tài)生成的,用http模塊爬取不到,然后用phantomjs爬取,(聽說會比較慢,運行了近15分鐘,這也太慢了,不知是否寫錯),還是不行,問一下有什么辦法能夠爬取類似于新浪微博的網(wǎng)頁嗎?
let page=require('webpage').create();let url='http://weibo.com/1713926427/Etq2WnSiR?filter=hot&root_comment_id=0&type=comment';/*page.settings = { javascriptEnabled: true, loadImages: false, webSecurityEnabled: false, userAgent: ’Mozilla/5.0 (Windows NT 6.3; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/34.0.1847.137 Safari/537.36 LBBROWSER’};*/page.open(url,(status)=>{ console.log('Status:'+status); if(status=='success'){let val = page.evaluate(()=>{ var list_box=document.querySelector('.list_box'); console.log(list_box); return list_box});console.log(val) }else{console.log('failed') } phantom.exit();});
問題解答
回答1:自己寫過微博的爬取,有兩種思路
仔細看一下應(yīng)該是有接口去獲取相應(yīng)數(shù)據(jù)的然后用正則去匹配
微博提供了開發(fā)者API接口的,雖然用著比較麻煩
相關(guān)文章:
1. MySQL數(shù)據(jù)庫中文亂碼的原因2. php - mysql連表統(tǒng)計查詢3. MySQL分表之后如何做排序的問題4. mysql - 連續(xù)的24條sql語句,一條條查,還是union all好?5. mysql主從復(fù)制 REPLICATE_DO_DB 參數(shù)從服務(wù)器reboot后每次都回滾為初始設(shè)置6. MySQL不知道錯哪里了?7. mysql事務(wù)日志的一些問題8. Mysql存儲過程問題9. 數(shù)據(jù)庫 - mysql boolean型無法插入true10. phpstuty 修改完監(jiān)聽端口,apache無法啟動
