2013-05-22

Python中unescape JavaScript中escape的字符

遇到一个问题需要用Python把JavaScript中escape的中文给还原，但找了大半天，也没有找到答案，只好自己深入研究解决方案。

我们先来看在JavaScript中escape一段文字的编码

a = escape('这是一串文字');
console.log(a); // Output: %u8FD9%u662F%u4E00%u4E32%u6587%u5B57

Output:

%u8FD9%u662F%u4E00%u4E32%u6587%u5B57

一看就感觉有点类似json格式，我们来看看标准的json格式编码同样的汉字这是一串文字

# encoding=utf-8
import json
a = '这是一串文字'
print json.dumps(a) # Output: \u8fd9\u662f\u4e00\u4e32\u6587\u5b57

Output:

\u8fd9\u662f\u4e00\u4e32\u6587\u5b57

经过对比，其实就是JavaScript escape编码每个汉子都是%u符号加4位字符编码，而json编码每个汉子都是\u符号加4位字符编码，这样的话，我们可以利用字符串替换操作还原json格式，然后再使用json模块loads就好

# encoding=utf-8
import json
 
# js escape 字符串编码
c = '%u8FD9%u662F%u4E00%u4E32%u6587%u5B57'
 
# 还原Json对象
jsonObj =  '"'+"".join([(i and "\\"+i) for i in c.split('%')])+'"'
 
print json.loads(jsonObj)

特别记得在把%替换为\符号以后还要再使用双引号把字符串包一下，才能算是一个json对象，然后才能json.loads出来

后来，好不容易在一个站点上看到了更简便的方法。代码如下:

# encoding=utf-8
c = '%u8FD9%u662F%u4E00%u4E32%u6587%u5B57'
print "".join([(len(i)>0 and unichr(int(i,16)) or "") for i in c.split('%u')])

它的思路其实都差不多，把%u号替换掉，剩下每一个都是4位固定长度的字符编码，最后在unichr反编码回中文字符。

琼台博客

Python中unescape JavaScript中escape的字符

推荐文章