网页爬虫 - Python爬虫看到这个Javascript,如何从中找到我需要的URL?
本文介绍了网页爬虫 - Python爬虫看到这个Javascript,如何从中找到我需要的URL?的处理方法,对大家解决问题具有一定的参考价值,需要的朋友们下面随着小编来一起学习吧!
问题描述
问 题
想下载http://www.manhuatai.com/doupocangqiong/191.html
里面的图片。
看到这个,因为不会javascript,所以不懂imgpath的value那串E&3G&F7&:7&:8&F8&B1&C5&F9&9C&9E&F8&B:&C:&3G2:2&F9&BG&:ETN&3G
是什么意思,其中有几话我发现是直接http://mhpic.zymk.cn/comic/
+value
+页数
+.jpg-mht.middle
就能得到图片的url,但是还有很多都不能这样来获取。
<script>var mh_info={imgpath:"E&3G&F7&:7&:8&F8&B1&C5&F9&9C&9E&F8&B:&C:&3G2:2&F9&BG&:ETN&3G",startimg:1,totalimg:21,mhid:"doupocangqiong",mhname:"斗破苍穹",pageid:1292901,pagename:"第191话 魔炎高手",pageurl:"191",readmode:1,maxpreload:5,defaultminline:1,domain:"zymk.cn",comic_size:"-mht.middle"};</script>
而我需要的url是http://mhpic.zymk.cn/comic/D%2F%E6%96%97%E7%A0%B4%E8%8B%8D%E7%A9%B9%2F191%E8%AF%9DSM%2F1.jpg-mht.middle
解决方案
使用selenium就可以很容易做到这件事情
from selenium import webdriver
browser = webdriver.Chrome()
browser.get('http://www.manhuatai.com/doupocangqiong/191.html')
img=browser.find_element_by_xpath('//img[@data-bd-imgshare-binded="1"]')
print img.get_attribute('src')
# 即打印出:
# http://mhpic.zymk.cn/comic/D%2F%E6%96%97%E7%A0%B4%E8%8B%8D%E7%A9%B9%2F191%E8%AF%9DSM%2F1.jpg-mht.middle
关于selenium可以看看Python爬虫利器五之Selenium的用法
这篇关于网页爬虫 - Python爬虫看到这个Javascript,如何从中找到我需要的URL?的文章就介绍到这了,希望我们推荐的答案对大家有所帮助,也希望大家多多支持IT屋!
查看全文