详解nodejs爬虫程序解决gbk等中文编码问题

使用nodejs写了一个爬虫的demo，目的是提取网页的title部分。

遇到最大的问题就是网页的编码与nodejs默认编码不一致造成的乱码问题。nodejs支持utf8, ucs2, ascii, binary, base64, hex等编码方式，但是对于汉语言来说编码主要分为三种，utf-8,gb2312,gbk。这里面gbk是完全兼容gb2312的，因此在处理编码的时候主要就分为utf-8以及gbk两大类。（这是在没有考虑到其他国家的编码情况，比如日本的Shift_JIS编码等，同时这里这个iconv-lite模块支持的编码方法有限）。

首先说一下浏览器显示网页内容的时候是如何处理编码问题的。服务器和客户端进行通信，服务端将网页按照指定的编码方式（比如gbk）编码成为二进制码流（即我们使用wireshark抓包看到额16进制码流）传送给我们的客户端。客户端则会根据网页源码中所规定的编码方式，由浏览器调用对应的解码器，将二进制码流解码后显示出来。而编码方式通常在网页中是如下内容表示：


<meta http-equiv="Content-Type" content="text/html; charset=UTF-8"/>

或者


<meta charset=utf-8"/>

如果客户端是nodejs爬虫请求程序，由于nodejs默认的编码方式是utf-8，因此爬虫程序将接收到的二进制码流以字符串（默认方式utf-8）显示的时候则会显示乱码。这个时候需要将原始的二进制码流按照网页原来的编码方式解码，则不会出现乱码。

因此解决方法如下：

将接收到的网页源码以二进制的方式存储下来，处理二进制数据流使用Buffer全局对象。


res.on('data', function(data) {  htmlData.push(data);
  htmlDataLength += data.length;
 });
var bufferHtmlData = Buffer.concat(htmlData,htmlDataLength);

然后对这些二进制的数据调用对应的解码程序。iconv-lite模块用于解码，cheerio模块用于解析网页内容。


decodeHtmlData = iconv.decode(bufferHtmlData,'gbk');
var $ = cheerio.load(decodeHtmlData, {decodeEntities: false});
 $('title','head').each(function(i, e) {  htmlHeadTitle = $(e).text();
  console.log(htmlHeadTitle);
 });

上述bufferHtmlData为二进制码流，decodeHtmlData为将二进制码流通过gbk编码规则转换为unicode编码对应的数字（即usc2字节流），然后在转换为对应的字符串。下述为iconv-lite源码中解码部分，地址在这里:


fromEncoding: function(buf) {
          buf = ensureBuffer(buf);
          var idx = 0, len = 0,
            newBuf = new Buffer(len*2),unicode,gbkcode;
          for (var i = 0, _len = buf.length; i < _len; i++, len++) {
            if (!!(buf[i] & 0x80)) {//the high bit is 1, so this byte is gbkcode's high byte.skip next byte								  1/2    1 2 下一页 尾页

详解nodejs爬虫程序解决gbk等中文编码问题

office向程序发送命令时出现错误解决方法

什么是刻录技术

什么是重复数据删除技术？

吉吉影音怎么卸载吉吉影音卸载教程

搜狗输入法不见了解决方法

世界之窗浏览器怎么设置主页

火狐浏览器怎么样

qq邮箱怎么发匿名邮件 qq邮箱匿名邮件如何发

qq怎么发语音消息

3秒钟教你qq校友图标怎么点亮和怎么灭

office向程序发送命令时出现错误解决方法

什么是刻录技术

什么是重复数据删除技术？

吉吉影音怎么卸载吉吉影音卸载教程

搜狗输入法不见了解决方法

世界之窗浏览器怎么设置主页

火狐浏览器怎么样

qq邮箱怎么发匿名邮件 qq邮箱匿名邮件如何发

qq怎么发语音消息

3秒钟教你qq校友图标怎么点亮和怎么灭

详解nodejs爬虫程序解决gbk等中文编码问题

office向程序发送命令时出现错误解决方法

什么是刻录技术

什么是重复数据删除技术？

吉吉影音怎么卸载 吉吉影音卸载教程

搜狗输入法不见了解决方法

世界之窗浏览器怎么设置主页

火狐浏览器怎么样

qq邮箱怎么发匿名邮件 qq邮箱匿名邮件如何发

qq怎么发语音消息

3秒钟教你qq校友图标怎么点亮和怎么灭

office向程序发送命令时出现错误解决方法

什么是刻录技术

什么是重复数据删除技术？

吉吉影音怎么卸载 吉吉影音卸载教程

搜狗输入法不见了解决方法

世界之窗浏览器怎么设置主页

火狐浏览器怎么样

qq邮箱怎么发匿名邮件 qq邮箱匿名邮件如何发

qq怎么发语音消息

3秒钟教你qq校友图标怎么点亮和怎么灭

吉吉影音怎么卸载吉吉影音卸载教程

吉吉影音怎么卸载吉吉影音卸载教程