如何移除花式文字、還原成一般字母
如何把風格化的 Unicode 轉回一般字母,以及為什麼這個轉換沒辦法總是完美還原。
你為什麼可能需要這麼做
風格化文字會破壞搜尋、排序和無障礙。如果你要把一個名字貼進表單、把一份清單匯入試算表,或是讓一段舊簡介重新能讀,你就需要把一般字母拿回來。
轉換是怎麼運作的
大多數風格化字元都有一份有記載的相容性分解:Unicode 記錄了 U+1D400 是一般字母 A 的粗體呈現形式。套用這份對應,就能可靠地把數學字母集、全形字、圓圈與方框字母、上標與下標還原成一般文字。
像刪節線和底線這類組合符號,是附加在基底字母上的獨立字元,所以移除它們不過就是把符號剝掉而已。
哪裡會有損失
一概而論的正規化並不安全,這就是為什麼這個工具不會對你貼上的所有東西直接套用 NFKC。
- 完整的相容性正規化也會改寫你可能想留著的字元,例如連字、某些間距,以及某些中日韓字形。
- 顛倒文字用的是因為形狀相似而挑出來的無關字元;它沒有正式的反向對應,所以還原只能盡力而為。
- 沒有分解形式的字元——大多數裝飾符號——沒有一般文字的對應形式,會被移除或原樣保留,由你選擇。
確認之後再送出
這個工具會顯示轉換前後的對照預覽,並明確報告它改動了多少字元。複製之前請先讀一下,尤其是拉丁文以外書寫系統的文字。