python获取js动态加载数据的方法-创新互联
创新互联www.cdcxhl.cn八线动态BGP香港云服务器提供商,新人活动买多久送多久,划算不套路!
在芜湖县等地区,都构建了全面的区域性战略布局,加强发展的系统性、市场前瞻性、产品创新能力,以专注、极致的服务理念,为客户提供网站设计、成都网站建设 网站设计制作按需定制,公司网站建设,企业网站建设,品牌网站设计,成都全网营销,成都外贸网站建设,芜湖县网站建设费用合理。这篇文章给大家分享的是有关python获取js动态加载数据的方法的内容。小编觉得挺实用的,因此分享给大家做个参考。一起跟随小编过来看看吧。
我们在做网页抓取的时候,一般来说使用urllib和urllib2就能满足大部分需求。
但是有时候我们遇见那种使用js动态加载的网页。就会发现urllib只能抓出一个部分内容空白的网页。就像下面百度图片的结果页:
审查元素之后,发现百度图片中,显示图片的div为:pullimages
这个div里面的内容是动态加载的。而使用urllib&urllib2是抓取不到的。
要抓取动态加载的元素,首先考虑使用selenium来调用浏览器进行抓取。
而我们运行的环境是linux,最理想的方法是在无界面情况下进行抓取,所以使用selenium+phantomjs来进行无界面抓取。
phantomjs是什么呢?它是一个基于webkit内核的无头浏览器,即没有UI界面,即它就是一个浏览器。
selenium和phantomjs的安装配置可以google,这里就略过不谈了。
代码如下:
from selenium import webdriver driver = webdriver.PhantomJS(executable_path='/bin/phantomjs/bin/phantomjs') #如果不方便配置环境变量。就使用phantomjs的绝对路径也可以 driver.get('http://image.baidu.com/i?ie=utf-8&word=%E5%91%A8%E6%9D%B0%E4%BC%A6') #抓取了百度图片,query:周杰伦 driver.page_source #这就是返回的页面内容了,与urllib2.urlopen().read()的效果是类似的,但比urllib2强在能抓取到动态渲染后的内容。 driver.quit()
到这里。就抓取动态页面成功了。
感谢各位的阅读!关于python获取js动态加载数据的方法就分享到这里了,希望以上内容可以对大家有一定的帮助,让大家可以学到更多知识。如果觉得文章不错,可以把它分享出去让更多的人看到吧!
网站题目:python获取js动态加载数据的方法-创新互联
文章来源:http://ybzwz.com/article/dhdepj.html