為生存而奔跑

:: 首頁 :: 聯系 :: 聚合

:: 管理

271 Posts :: 0 Stories :: 58 Comments :: 0 Trackbacks

這里是幾個主要非英文語系字符范圍

2E80～33FFh：中日韓符號區。收容康熙字典部首、中日韓輔助部首、注音符號、日本假名、韓文音符，中日韓的符號、標點、帶圈或帶括符文數字、月份，以及日本的假名組合、單位、年號、月份、日期、時間等。

3400～4DFFh：中日韓認同表意文字擴充A區，總計收容6,582個中日韓漢字。

4E00～9FFFh：中日韓認同表意文字區，總計收容20,902個中日韓漢字。

A000～A4FFh：彝族文字區，收容中國南方彝族文字和字根。

AC00～D7FFh：韓文拼音組合字區，收容以韓文音符拼成的文字。

F900～FAFFh：中日韓兼容表意文字區，總計收容302個中日韓漢字。

FB00～FFFDh：文字表現形式區，收容組合拉丁文字、希伯來文、阿拉伯文、中日韓直式標點、小符號、半角符號、全角符號等。

比如需要匹配所有中日韓非符號字符,那么正則表達式應該是^[\u3400-\u9FFF]+$
理論上沒錯, 可是我到msn.co.ko隨便復制了個韓文下來, 發現根本不對, 詭異
再到msn.co.jp復制了個'お', 也不得行..

然后把范圍擴大到^[\u2E80-\u9FFF]+$, 這樣倒是都通過了, 這個應該就是匹配中日韓文字的正則表達式了, 包括我們臺灣省還在盲目使用的繁體中文

而關于中文的正則表達式, 應該是^[\u4E00-\u9FFF]+$, 和論壇里常被人提起的^[\u4E00-\u9FA5]+$很接近

需要注意的是論壇里說的^[\u4E00-\u9FA5]+$這是專門用于匹配簡體中文的正則表達式, 實際上繁體字也在里面, 我用測試器測試了下'中華人民共和國', 也通過了, 當然, ^[\u4E00-\u9FFF]+$也是一樣的結果

posted on 2010-10-03 14:38 baby-fly 閱讀(1068) 評論(0) 編輯收藏引用所屬分類: 技術

只有注冊用戶登錄后才能發表評論。


相關文章: signed和unsigned的比較一個微軟面試題--關于位結構體在VS2005下查看匯編代碼 C++中的++i與i++ C++: 二維數組作函數參數中文正則表達式表示盜版xp驗證程序(key.vbs) Google App Engine使用的流程 static_cast、dynamic_cast、reinterpret_cast、和const_cast 虛函數

網站導航: 博客園 IT新聞 BlogJava 博問 Chat2DB 管理

青青草原综合久久大伊人导航_色综合久久天天综合_日日噜噜夜夜狠狠久久丁香五月_热久久这里只有精品