Python中還原JavaScript的escape函數編碼後字串的方法_python

來源:互聯網
上載者:User

遇到一個問題需要用Python把JavaScript中escape的中文給還原,但找了大半天,也沒有找到答案,只好自己深入研究解決方案。
我們先來看在js中escape一段文字的編碼

複製代碼 代碼如下:

a = escape('這是一串文字');
alert(a);

輸出:
複製代碼 代碼如下:

%u8FD9%u662F%u4E00%u4E32%u6587%u5B57

咋一看,就感覺有點類似json格式,我們來看看標準的json格式編碼同樣的漢子“這是一串文字”
複製代碼 代碼如下:

# encoding=utf-8
import json
a = '這是一串文字'
print json.dumps(a)

輸出:
複製代碼 代碼如下:
"\u8fd9\u662f\u4e00\u4e32\u6587\u5b57"

經過對比,其實就是js escape編碼每個漢子都是“%u”符號加4位字元編碼,而json編碼每個漢子都是“\u”符號加4位字元編碼,這樣的話,我們可以利用字串替換操作還原json格式,然後再使用json模組loads就好
複製代碼 代碼如下:

# encoding=utf-8
import json
 
# js escape 字串編碼
c = '%u8FD9%u662F%u4E00%u4E32%u6587%u5B57'
 
# 還原Json對象
jsonObj =  '"'+"".join([(i and "\\"+i) for i in c.split('%')])+'"'
 
print json.loads(jsonObj)

特別記得在把“%”替換為“\”符號以後還要再使用雙引號把字串包一下,才能算是一個json對象,然後才能json.loads出來
後來,好不容易在一個網站上看到了更簡便的方法。代碼如下:
複製代碼 代碼如下:

# encoding=utf-8
c = '%u8FD9%u662F%u4E00%u4E32%u6587%u5B57'
print "".join([(len(i)>0 and unichr(int(i,16)) or "") for i in c.split('%u')])

它的思路其實都差不多,把“%u”號替換掉,剩下每一個都是4位固定長度的字元編碼,最後在unichr反編碼回中文字元。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.