Rumah >Java >javaTutorial >Bagaimanakah saya boleh mengalih keluar Tanda Diakritik daripada Teks di Jawa?
Banyak aplikasi perlu menangani teks yang mengandungi tanda diakritik, seperti aksen, tilde dan umlaut. Tanda ini boleh menyukarkan pemprosesan dan pencarian data, kerana ia boleh mewakili sebutan berbeza bagi aksara asas yang sama.
Untuk memudahkan teks yang mengandungi tanda diakritik, satu pendekatan biasa ialah menormalkan ia menggunakan Borang Normalisasi Unicode NFD (Borang Normal Terurai). Proses ini menguraikan aksara komposit kepada aksara asasnya dan sebarang diakritik yang berkaitan.
Setelah dinormalisasi, diakritik boleh dialih keluar menggunakan ungkapan biasa. Contohnya, ungkapan biasa Java berikut sepadan dan mengalih keluar semua tanda diakritik dan aksara pengubah suai lain:
Pattern diacriticsAndFriendsPattern = Pattern.compile("[\p{InCombiningDiacriticalMarks}\p{IsLm}\p{IsSk}\u0591-\u05C7]+");
Untuk menggunakan corak ini untuk penyingkiran diakritik:
String normalizedString = Normalizer.normalize(inputString, Normalizer.Form.NFD); String strippedString = diacriticsAndFriendsPattern.matcher(normalizedString).replaceAll("");
Selain diakritik, beberapa aksara khas juga mungkin perlu dikendalikan semasa pemudahan rentetan. Aksara ini mungkin bukan diakritik tetapi masih boleh memberi kesan kepada pemprosesan teks. Contohnya, aksara seperti '<' (kurang daripada), '>' (lebih besar daripada), dan '$' (tanda dolar) mungkin perlu diganti atau dialih keluar untuk aplikasi tertentu.
Kelas Java berikut menyediakan kaedah penyederhanaan rentetan lanjutan yang mengendalikan kedua-dua diakritik dan aksara bukan diakritik tambahan :
public class StringSimplifier { // ... (code snippet for StringSimplifier class) ... }
Kaedah SimplifiedString menormalkan rentetan input, mengalih keluar diakritik dan melakukan penyederhanaan aksara bukan diakritik tambahan berdasarkan pemetaan prakonfigurasi.
Mengalih keluar tanda diakritik boleh berguna dalam pelbagai aplikasi, seperti:
Dengan memahami prinsip penyingkiran diakritik dan menggunakan alatan seperti penormalan Unikod dan ungkapan biasa, pembangun boleh memudahkan teks dengan berkesan untuk pemprosesan dan pencarian data yang lebih baik.
Atas ialah kandungan terperinci Bagaimanakah saya boleh mengalih keluar Tanda Diakritik daripada Teks di Jawa?. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!