Python中还原JavaScript的escape函数编码后字符串的方法

遇到一个问题需要用Python把JavaScript中escape的中文给还原，但找了大半天，也没有找到答案，只好自己深入研究解决方案。
我们先来看在js中escape一段文字的编码

复制代码代码如下:

          
           a = escape('这是一串文字'); 
  
           alert(a);

输出：

复制代码代码如下:

%u8FD9%u662F%u4E00%u4E32%u6587%u5B57

咋一看，就感觉有点类似json格式，我们来看看标准的json格式编码同样的汉子“这是一串文字”

复制代码代码如下:

          
           # encoding=utf-8 
  
           import json 
  
           a = '这是一串文字' 
  
           print json.dumps(a)

输出：

复制代码代码如下:

"\u8fd9\u662f\u4e00\u4e32\u6587\u5b57"

经过对比，其实就是js escape编码每个汉子都是“%u”符号加4位字符编码，而json编码每个汉子都是“\u”符号加4位字符编码，这样的话，我们可以利用字符串替换操作还原json格式，然后再使用json模块loads就好

复制代码代码如下:

          
           # encoding=utf-8 
  
           import json 
  
           # js escape 字符串编码 
  
           c = '%u8FD9%u662F%u4E00%u4E32%u6587%u5B57' 
  
           # 还原Json对象 
  
           jsonObj =  '"'+"".join([(i and "\\"+i) for i in c.split('%')])+'"' 
  
           print json.loads(jsonObj)

特别记得在把“%”替换为“\”符号以后还要再使用双引号把字符串包一下，才能算是一个json对象，然后才能json.loads出来
后来，好不容易在一个站点上看到了更简便的方法。代码如下：

复制代码代码如下:

          
           # encoding=utf-8 
  
           c = '%u8FD9%u662F%u4E00%u4E32%u6587%u5B57' 
  
           print "".join([(len(i)>0 and unichr(int(i,16)) or "") for i in c.split('%u')])

它的思路其实都差不多，把“%u”号替换掉，剩下每一个都是4位固定长度的字符编码，最后在unichr反编码回中文字符。

更多文章、技术交流、商务合作、联系博主

微信扫码或搜索：z360901061

微信扫一扫加我为好友

QQ号联系： 360901061

您的支持是博主写作最大的动力，如果您喜欢我的文章，感觉我的文章对您有帮助，请用微信扫描下面二维码支持博主2元、5元、10元、20元等您想捐的金额吧，狠狠点击下面给点支持吧，站长非常感激您！手机微信长按不能支付解决办法：请将微信支付二维码保存到相册，切换到微信，然后点击微信右上角扫一扫功能，选择支付二维码完成支付。

【本文对您有帮助就好】元

2元

5元

10元

20元

自定义