一.漢字轉拼音的現狀
首先應該說,漢字轉拼音是個強需求,例如聯絡人按拼音字母排序/篩選;例如目的地(典型如機票購買)
按拼音首字母分類等等。但是這個需求的解決方案,但好像沒聽過什麼巧妙的實現(特別是瀏覽器端),大概都需要一個龐大的字典。
具體到JavaScript,查查github和npm,比較優秀的處理漢字轉拼音的庫有pinyin
和pinyinjs,可以看到,兩者都自帶了龐大的字典。
這些字典動輒幾十上百KB(有的甚至幾MB),想在瀏覽器端使用還是需要一些勇氣的。所以當我們碰到漢字轉拼音的需求,也不怪我們第一個反應就是拒絕需求(或是服務端實現)。
現在,如果我告訴你可以瀏覽器端300行程式碼實現漢字轉拼音,是不是不可置信?
二.從安卓4.2.2聯絡人程式碼說起
#再次強調這篇部落格-利用Android源碼,輕鬆實現漢字轉拼音功能。
今天和大家分享一個從Android系統原始碼提取出來的漢字轉成拼音實現方案,只要一個類,560多行代碼就可以讓你輕鬆實現漢字轉成拼音的功能,且無需其他任何第三方依賴。
是不是打破了你的思維定勢:難道有什麼強大的演算法可以拋棄字典?
第一遍看完博客,稍有些失望,並沒有什麼演算法解析,只是介紹了從安卓程式碼發現的這幾百行程式碼。第二遍時帶著移植到JavaScript的想法閱讀程式碼,算是弄清楚了原理,於是開始了踩坑的移植之旅。
三.手把手教你300行JavaScript程式碼實現漢字轉拼音
首先直指核心:為什麼有漢字轉拼音必須有龐大字典的思維定勢?
因為漢字的排布和拼音並有什麼關聯,例如在漢字區間\u4E00-\u9FFF,前一個可能是ha,後一個可能就是ze,沒有辦法從漢字的unicode關聯到拼音,所以只能有一個龐大的字典記錄每個漢字(或常用漢字)的拼音。
但是,假設我們可以把所有漢字按拼音排序,例如按'A','AI','AN','ANG','AO','BA',...,'ZUI',' ZUN','ZUO'排序,那麼,我們只需要記住每個相同拼音的漢字隊列的第一個漢字就好了。那麼,所需要的字典就會很小(覆蓋所有拼音即可,拼音數量本身不多)。
現在,難點就是把漢字按拼音排序了。很幸運,ICU/在地化相關的API提供了這個排序API(如果沒有方便的排序/比較方法,那麼本篇文章可能就不會出現了)。
所以,這就是為什麼300行可以實現漢字轉拼音:Intl.CollatorAPI:Intl.Collator內部實作了本土化相關的字串排序。我們透過Intl.Collator.prototype.compare可以把所有漢字基本上都按照拼音來排序。
邊界漢字表:記錄了排序的邊界點。此漢字表的每個漢字都是排序後相同拼音的漢字集合的首個漢字(Eachunihansisthefirstonewithinsamepinyinwhencollatoriszh_CN)。
說到這裡,可能還是有沒說清楚的地方,所以直接上一段程式碼:
有興趣的同學可以執行node--icu-data-dir=node_modules/full-icu上面的腳本.js看看,然後看看是不是得到了基本按照拼音排序的漢字表。
這裡有幾點要注意:
我再次加粗了“基本”,因為我們得到的漢字列表並沒有完全按照拼音來排序,中間偶爾有一些其它拼音的漢字插入,這點在製作邊界表時要額外注意。
上面腳本裡得出的表是所有漢字的排序,其中有些和安卓程式碼裡HanziToPinyin.java的表有不同,所以需要更新HanziToPinyin.java的表。 (從Java到JavaScript的最大的坑和工作量:更正邊界表)
相信大家都看到了核心代碼:constCOLLATOR=newIntl.Collator(['zh-Hans-CN']),Intl.Collator
(這裡指定locale是中國zh-Hans-CN)正是能把漢字依拼音排序的關鍵,它是依照locale-specific順序,排序字串的InternationalizationAPI。
執行腳本時請先npmifull-icu,這個依賴會自動安裝缺少的中文支援並提示如何指定ICU資料檔來執行腳本。
1.ICUICU即InternationalComponentsforUnicode,為應用程式提供Unicode和國際化支援。
ICUisamature,widelyusedsetofC/C++andJavalibrariesprovidingUnicodeandGlobalizationsupportforsoftwareapplications.ICUiswidelyportableandgivesapplicationsthesameresultsonallplatformsandbetweenC/C++andJava0.##stris#S;#Sid; ingtotheconventionsandstandardsofaparticularlanguage,regionorcountry. ICU'scollationisbasedontheUnicodeCollationAlgorithmpluslocale-specificcomparisonrulesfromtheCommonLocaleDataRepository,acomprehensivesourceforthistypeofdata.
在現代瀏覽器上,一般ICU內建了對使用者本地語言的支持,我們直接使用即可。
但對node.js來說,通常情況下,ICU只包含了一個子集(通常是英文),所以我們需要自行加入對中文的支援。一般來說,可以透過npminstallfull-icu安裝full-icu
來安裝缺少的中文支援。 (參見上面node--icu-data-dir=node_modules/full-icu)。
2.IntlAPI上一小節應該基本上講清楚了國際化/在地化相關的知識,這裡再補充一下內建API的使用。怎麼查看使用者語言和Runtime是否支援這個語言? Intl.Collator.supportedLocalesOf(array|string)
傳回包含支援(不用回退到預設locale)的locales的
陣列
,參數可以是陣列或字串,為想要測試的locales(即BCP47languagetag)。
建構Collator
透過Intl.Collator.prototype. compare,我們可以按語言指定的順序來排序字串。而中文中,這個排序恰好絕大多數都是按拼音的順序來的,'A','AI','AN','ANG','AO','BA','BAI','BAN' ,'BANG','BAO','BEI','BEN','BENG','BI','BIAN','BIAO','BIE','BIN','BING','BO',' BU','CA','CAI','CAN',...
# 顯然,這個邊界表是有問題的,需要修正。
找到這個漢字,是'\u72c5'/'狅',加上前後各一個字,['\u4eb2','\u72c5','\u828e']/["親","狅", "芎"]
。
搜尋
,'\u72c5'/'狅'可以讀qing,但現在多讀kuang,這應該是錯誤的原因了。 根據最初得到那張所有漢字的排序表,qing的第一個漢字是'\u9751'/'靑'。 改動後,轉換失敗的只剩104了。
【相關推薦】
1.
Javacript免費影片教學#分享15個常用的js正規表示式透過javascript實作搜尋工具列的實例詳解Javascript中關於async以及awai的用法具體介紹以上是JavaScript解決漢字轉拼音的實例詳解的詳細內容。更多資訊請關注PHP中文網其他相關文章!

是的,JavaScript的引擎核心是用C語言編寫的。 1)C語言提供了高效性能和底層控制,適合JavaScript引擎的開發。 2)以V8引擎為例,其核心用C 編寫,結合了C的效率和麵向對象特性。 3)JavaScript引擎的工作原理包括解析、編譯和執行,C語言在這些過程中發揮關鍵作用。

JavaScript是現代網站的核心,因為它增強了網頁的交互性和動態性。 1)它允許在不刷新頁面的情況下改變內容,2)通過DOMAPI操作網頁,3)支持複雜的交互效果如動畫和拖放,4)優化性能和最佳實踐提高用戶體驗。

C 和JavaScript通過WebAssembly實現互操作性。 1)C 代碼編譯成WebAssembly模塊,引入到JavaScript環境中,增強計算能力。 2)在遊戲開發中,C 處理物理引擎和圖形渲染,JavaScript負責遊戲邏輯和用戶界面。

JavaScript在網站、移動應用、桌面應用和服務器端編程中均有廣泛應用。 1)在網站開發中,JavaScript與HTML、CSS一起操作DOM,實現動態效果,並支持如jQuery、React等框架。 2)通過ReactNative和Ionic,JavaScript用於開發跨平台移動應用。 3)Electron框架使JavaScript能構建桌面應用。 4)Node.js讓JavaScript在服務器端運行,支持高並發請求。

Python更適合數據科學和自動化,JavaScript更適合前端和全棧開發。 1.Python在數據科學和機器學習中表現出色,使用NumPy、Pandas等庫進行數據處理和建模。 2.Python在自動化和腳本編寫方面簡潔高效。 3.JavaScript在前端開發中不可或缺,用於構建動態網頁和單頁面應用。 4.JavaScript通過Node.js在後端開發中發揮作用,支持全棧開發。

C和C 在JavaScript引擎中扮演了至关重要的角色,主要用于实现解释器和JIT编译器。1)C 用于解析JavaScript源码并生成抽象语法树。2)C 负责生成和执行字节码。3)C 实现JIT编译器,在运行时优化和编译热点代码,显著提高JavaScript的执行效率。

JavaScript在現實世界中的應用包括前端和後端開發。 1)通過構建TODO列表應用展示前端應用,涉及DOM操作和事件處理。 2)通過Node.js和Express構建RESTfulAPI展示後端應用。

JavaScript在Web開發中的主要用途包括客戶端交互、表單驗證和異步通信。 1)通過DOM操作實現動態內容更新和用戶交互;2)在用戶提交數據前進行客戶端驗證,提高用戶體驗;3)通過AJAX技術實現與服務器的無刷新通信。


熱AI工具

Undresser.AI Undress
人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover
用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool
免費脫衣圖片

Clothoff.io
AI脫衣器

Video Face Swap
使用我們完全免費的人工智慧換臉工具,輕鬆在任何影片中換臉!

熱門文章

熱工具

SecLists
SecLists是最終安全測試人員的伙伴。它是一個包含各種類型清單的集合,這些清單在安全評估過程中經常使用,而且都在一個地方。 SecLists透過方便地提供安全測試人員可能需要的所有列表,幫助提高安全測試的效率和生產力。清單類型包括使用者名稱、密碼、URL、模糊測試有效載荷、敏感資料模式、Web shell等等。測試人員只需將此儲存庫拉到新的測試機上,他就可以存取所需的每種類型的清單。

mPDF
mPDF是一個PHP庫,可以從UTF-8編碼的HTML產生PDF檔案。原作者Ian Back編寫mPDF以從他的網站上「即時」輸出PDF文件,並處理不同的語言。與原始腳本如HTML2FPDF相比,它的速度較慢,並且在使用Unicode字體時產生的檔案較大,但支援CSS樣式等,並進行了大量增強。支援幾乎所有語言,包括RTL(阿拉伯語和希伯來語)和CJK(中日韓)。支援嵌套的區塊級元素(如P、DIV),

SublimeText3 Linux新版
SublimeText3 Linux最新版

記事本++7.3.1
好用且免費的程式碼編輯器

DVWA
Damn Vulnerable Web App (DVWA) 是一個PHP/MySQL的Web應用程序,非常容易受到攻擊。它的主要目標是成為安全專業人員在合法環境中測試自己的技能和工具的輔助工具,幫助Web開發人員更好地理解保護網路應用程式的過程,並幫助教師/學生在課堂環境中教授/學習Web應用程式安全性。 DVWA的目標是透過簡單直接的介面練習一些最常見的Web漏洞,難度各不相同。請注意,該軟體中