nodejs单页面爬虫(二)--解决编码问题-创新互联
上次写的爬虫虽然数据爬下来了,但是有乱码问题。查了相关的书之后,找到解决办法。重新写了一下,好像比之前更简洁了。
在繁昌等地区,都构建了全面的区域性战略布局,加强发展的系统性、市场前瞻性、产品创新能力,以专注、极致的服务理念,为客户提供成都网站制作、成都做网站 网站设计制作定制制作,公司网站建设,企业网站建设,品牌网站建设,营销型网站建设,外贸营销网站建设,繁昌网站建设费用合理。解决办法是:引入iconv-lite模块,用来转换编码的网页内容。
这次跟着书上用了request模块,而不是用原来的http模块。 var request = require('request'); var cheerio = require('cheerio'); var iconv = require('iconv-lite'); //博客标题 request({ url:'http://qmkkd.blog.51cto.com/', encoding:null },function(err,res,body){ if(err) return console.log(err); body = iconv.decode(body,'gbk'); //根据网页内容创建DOM操作对象 var $ = cheerio.load(body); //读取博文类别列表 var bloglist = []; $('.blogList .artHead h4 a').each(function(){ var $me = $(this); var name = $me.text().trim(); bloglist.push(name); }); //输出结果 console.log(bloglist); });
结果如下:
另外有需要云服务器可以了解下创新互联scvps.cn,海内外云服务器15元起步,三天无理由+7*72小时售后在线,公司持有idc许可证,提供“云服务器、裸金属服务器、高防服务器、香港服务器、美国服务器、虚拟主机、免备案服务器”等云主机租用服务以及企业上云的综合解决方案,具有“安全稳定、简单易用、服务可用性高、性价比高”等特点与优势,专为企业上云打造定制,能够满足用户丰富、多元化的应用场景需求。
网页名称:nodejs单页面爬虫(二)--解决编码问题-创新互联
标题路径:http://ybzwz.com/article/dhdepg.html