Javascript - 标准化带重音的希腊字符-6ren

Javascript - 标准化带重音的希腊字符

转载作者：数据小太阳更新时间：2023-10-29 05:54:57

30

4

我正在尝试对希腊文本应用某种规范化(使用小写、删除重音并将 ς 替换为 σ)。例如，我希望“ἀντίθεσις”(希腊复调)和“αντίθεσις”(现代希腊语)成为“αντιθεσισ”。我跑过 unicode-table.com并写下我应该替换哪些字符。

Greek and Coptic (Range: 0370— 03FF) 
ΆΑά -> α
ΈΕέ -> ε
ΉΗή -> η
ΊΪΙίΐ -> ι
ΌΟό -> ο
ΎΫΥΰϋύ -> υ
ΏΩώ -> ω

Greek Extended (Range: 1F00— 1FFF)
ἀἁἂἃἄἅἆἇὰάᾀᾁᾂᾃᾄᾅᾆᾇᾰᾱᾲᾳᾴᾶᾷἈἉἊἋἌἍἎἏᾈᾉᾊᾋᾌᾍᾎᾏᾸᾹᾺΆᾼ -> α
ἐἑἒἓἔἕὲέἘἙἚἛἜἝῈΈ -> ε
ἠἡἢἣἤἥἦἧὴήᾐᾑᾒᾓᾔᾕᾖᾗῂῃῄῆῇἨἩἪἫἬἭἮἯᾘᾙᾚᾛᾜᾝᾞᾟῊΉῌ -> η
ἰἱἲἳἴἵἶἷὶίῐῑῒΐῖῗἸἹἺἻἼἽἾἿῘῙῚΊ -> ι
ὀὁὂὃὄὅὸόὈὉὊὋὌὍῸΌ -> ο
ὐὑὒὓὔὕὖὗὺύῠῡῢΰῦῧὙὛὝὟῨῩῪΎ -> υ
ὠὡὢὣὤὥὦὧὼώᾠᾡᾢᾣᾤᾥᾦᾧῲῳῴῶῷὨὩὪὫὬὭὮὯᾨᾩᾪᾫᾬᾭᾮᾯῺΏῼ -> ω
ῤῥῬ -> ρ

我想知道是否有一种聪明的方法来进行这些替换并避免逐个字符地检查字符串。

第一次尝试(感谢 @Tyblitz)

normal = 'Αντίθετα με αυτό που θεωρεί η πλειοψηφία, το Lorem Ipsum δεν είναι απλά ένα τυχαίο κείμενο. Οι ρίζες του βρίσκονται σε ένα κείμενο Λατινικής λογοτεχνίας του 45 π.Χ., φτάνοντας την ηλικία του πάνω από 2000 έτη.';

pol = 'Μήγαρις ἔχω ἄλλο στὸ νοῦ μου πάρεξ ἐλευθερία καὶ γλώσσα;';

console.log(normalizeGreek(normal));
console.log(normalizePolytonicGreek(pol));

function normalizeGreek(text) {
    text = text.replace(/Ά|Α|ά/g, 'α')
        .replace(/Έ|Ε|έ/g, 'ε')
        .replace(/Ή|Η|ή/g, 'η')
        .replace(/Ί|Ϊ|Ι|ί|ΐ|ϊ/g, 'ι')
        .replace(/Ό|Ο|ό/g, 'ο')
        .replace(/Ύ|Ϋ|Υ|ύ|ΰ|ϋ/g, 'υ')
        .replace(/Ώ|Ω|ώ/g, 'ω')
        .replace(/Σ|ς/g, 'σ');
    return text;
}


function normalizePolytonicGreek(text) {
    text = text.replace(/Ά|Α|ά|ἀ|ἁ|ἂ|ἃ|ἄ|ἅ|ἆ|ἇ|ὰ|ά|ᾀ|ᾁ|ᾂ|ᾃ|ᾄ|ᾅ|ᾆ|ᾇ|ᾰ|ᾱ|ᾲ|ᾳ|ᾴ|ᾶ|ᾷ|Ἀ|Ἁ|Ἂ|Ἃ|Ἄ|Ἅ|Ἆ|Ἇ|ᾈ|ᾉ|ᾊ|ᾋ|ᾌ|ᾍ|ᾎ|ᾏ|Ᾰ|Ᾱ|Ὰ|Ά|ᾼ/g, 'α')
        .replace(/Έ|Ε|έ|ἐ|ἑ|ἒ|ἓ|ἔ|ἕ|ὲ|έ|Ἐ|Ἑ|Ἒ|Ἓ|Ἔ|Ἕ|Ὲ|Έ/g, 'ε')
        .replace(/Ή|Η|ή|ἠ|ἡ|ἢ|ἣ|ἤ|ἥ|ἦ|ἧ|ὴ|ή|ᾐ|ᾑ|ᾒ|ᾓ|ᾔ|ᾕ|ᾖ|ᾗ|ῂ|ῃ|ῄ|ῆ|ῇ|Ἠ|Ἡ|Ἢ|Ἣ|Ἤ|Ἥ|Ἦ|Ἧ|ᾘ|ᾙ|ᾚ|ᾛ|ᾜ|ᾝ|ᾞ|ᾟ|Ὴ|Ή|ῌ/g, 'η')
        .replace(/Ί|Ϊ|Ι|ί|ΐ|ἰ|ἱ|ἲ|ἳ|ἴ|ἵ|ἶ|ἷ|ὶ|ί|ῐ|ῑ|ῒ|ΐ|ῖ|ῗ|Ἰ|Ἱ|Ἲ|Ἳ|Ἴ|Ἵ|Ἶ|Ἷ|Ῐ|Ῑ|Ὶ|Ί/g, 'ι')
        .replace(/Ό|Ο|ό|ὀ|ὁ|ὂ|ὃ|ὄ|ὅ|ὸ|ό|Ὀ|Ὁ|Ὂ|Ὃ|Ὄ|Ὅ|Ὸ|Ό/g, 'ο')
        .replace(/Ύ|Ϋ|Υ|ΰ|ϋ|ύ|ὐ|ὑ|ὒ|ὓ|ὔ|ὕ|ὖ|ὗ|ὺ|ύ|ῠ|ῡ|ῢ|ΰ|ῦ|ῧ|Ὑ|Ὓ|Ὕ|Ὗ|Ῠ|Ῡ|Ὺ|Ύ/g, 'υ')
        .replace(/Ώ|Ω|ώ|ὠ|ὡ|ὢ|ὣ|ὤ|ὥ|ὦ|ὧ|ὼ|ώ|ᾠ|ᾡ|ᾢ|ᾣ|ᾤ|ᾥ|ᾦ|ᾧ|ῲ|ῳ|ῴ|ῶ|ῷ|Ὠ|Ὡ|Ὢ|Ὣ|Ὤ|Ὥ|Ὦ|Ὧ|ᾨ|ᾩ|ᾪ|ᾫ|ᾬ|ᾭ|ᾮ|ᾯ|Ὼ|Ώ|ῼ/g, 'ω')
        .replace(/ῤ|ῥ|Ῥ/g, 'ρ')
        .replace(/Σ|ς/g, 'σ');
    return text;
}

第二次尝试:

查看我的 answer下面使用 String.prototype.normalize() 并阻止您保留包含 unicode 表中所有希腊重音字符的列表。

最佳答案

我还找到了以下使用的解决方案:String.prototype.normalize()

normal = 'Αντίθετα με αυτό που θεωρεί η πλειοψηφία, το Lorem Ipsum δεν είναι απλά ένα τυχαίο κείμενο. Οι ρίζες του βρίσκονται σε ένα κείμενο Λατινικής λογοτεχνίας του 45 π.Χ., φτάνοντας την ηλικία του πάνω από 2000 έτη.';

pol = 'Μήγαρις ἔχω ἄλλο στὸ νοῦ μου πάρεξ ἐλευθερία καὶ γλώσσα;';

console.log(normalizeGreek(normal));
console.log(normalizePolytonicGreek(pol));

function normalizeGreek(text) {
    return text.normalize('NFD').replace(/[\u0300-\u036f]/g, "");
}


function normalizePolytonicGreek(text) {
    return text.normalize('NFD').replace(/[\u0300-\u036f]/g, "");
}

工作原理+示例:

在 .normalize('NFD') 中，重音字符被分解为:

Angular 色本身
后跟等效的组合变音符(参见:range [0300-036f])

删除这些标记很容易，使用:.replace(/[\u0300-\u036f]/g, "")

a = "ἄ"
console.log(a);             // prints: ἄ
console.log(Array.from(a)); // prints: [ "ἄ" ]

b = a.normalize('NFD')
console.log(b);             // prints: ἄ 
console.log(Array.from(b)); // prints: [ "α", "̓", "́" ]

c = a.normalize('NFD').replace(/[\u0300-\u036f]/g, "")
console.log(c);             // prints: α
console.log(Array.from(c)); // prints: [ "α" ]

有趣的链接:

关于Javascript - 标准化带重音的希腊字符，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/23346506/

30

4

0

文章推荐： c# - 将 String[] 数组转换为 RedisKey[] 数组

文章推荐： c# - Redis 队列与 MSMQ

文章推荐： c# - 如何在Redis缓存中存储列表元素

MVVM 标准化
某人在 Silverlight posted MVVM 目前缺乏标准化，所以每个人都有自己的风格.. 这就是为什么我和 WPF Disciples 的一些人正在积极讨论每个人都同意的 MVVM 元素。
r - 标准化/缩放数据集
我有以下数据集: dat tests2 * 20 Score 1 13.333333 2 10.666667 3 2.666667 4 9.333333 5 13.3333
c# - “标准化”概率数组
我有一个 double 组，表示某些事件发生的概率，[25,25,25,10,15] 表示事件 A,B..E。这些数字加起来是 100。通过我的分析，我希望能够排除某个事件发生或不发生的可能性。所
google-maps - 免费地址验证/标准化
USPS webtools 很贵，而且 Google Maps 没有某些地址。有没有免费或开源的解决方案？最佳答案根据您的业务性质，或者如果您是非营利或教育机构，有一家在线提供商可为您提供 fre
javascript - 标准化 Javascript 对象
我有一个 json 对象，里面有对象例如 user: {"name": "tim"} 并希望有一种方法将其转换为 "user.name": 'tim' 我已经尝试过:Javascript Recurs
r - 标准化 R 中的数据列
我有一个名为 spam 的数据集，其中包含与垃圾邮件相关的 58 列和大约 3500 行数据。我计划将来对此数据集运行一些线性回归，但我想事先进行一些预处理并将列标准化为均值和单位方差为零。我被告
audio - 如何进行音频扩展/标准化(强调高低之间的差异)
我试图找到一种方法来强调音频中高点和低点之间的差异。我似乎找不到有关如何执行此操作的文档-也许可以使用ffmpeg完成。非常感谢来自对信号处理了解更多的人的一些指导。最佳答案从根本上讲，膨胀器与压
r - 标准化 R 中每行的数据
如何缩放/规范化每行数据(观察)？像 [-1:1] 这样的 z 分数？我看过之前的帖子，其中涉及整个数据集的标准化，如下所示 https://stats.stackexchange.com/ques
c# - 标准化 URI 以仅提取域名的最佳方法是什么？
例如: http://www.google.co.uk www.google.co.uk google.co.uk 将全部转换为: google.co.uk 我本来想使用 System.Uri 类，但
pandas - 标准化 Pandas 数据框中的一列
我可以使用此代码从 json 文件导入数据... import requests from pandas.io.json import json_normalize url = "https://da
string - 标准化 Prolog 原子中的空格字符
规范化 Prolog 原子中空白字符(空格、换行符、制表符)的最佳方法是什么，例如在 SWI-Prolog 中。IE。我想要一个规则: normalize_space_in_atom(+Atom1,
r - 标准化 R 中每行的数据
如何缩放/规范化每行数据(观察)？像 [-1:1] 这样的 z 分数？我看过之前的帖子，其中涉及整个数据集的标准化，如下所示 https://stats.stackexchange.com/ques
java - 标准化 UTC 日期
我正在尝试阅读代码片段，但它对我来说没有任何意义。请帮助我 /** * To make it easy to query for the exact date, we normalize all
nlp - 文本挖掘 - 最常用的词，标准化
我是一名研究人员，拥有大约 17,000 份自由文本文档，其中大约 30-40% 与我的结果相关。是否有一个开源工具可以用来确定与结果相关的最常见的单词(甚至短语，但不是必需的)，并对已经出现的单词的
python - 标准化 numpy 矩阵中的行
我正在尝试使用 L2 范数(单位长度)对 numpy 矩阵的行进行标准化。当我这样做时，我发现了一个问题。假设我的矩阵“b”如下: 现在，当我对第一行进行标准化时，如下所示，它工作正常。但是当我
python - 标准化 ndarray 的切片
我有一个 3 列数组。数组的第一列的值介于 1 和 10 之间。我需要提取第一列为 1 的所有行，并规范化该数组切片的第三列。然后对第一列等于 2 等的所有行重复相同的操作。如果我运行此代码，它会使
python - 标准化 Python 中的数据结构
如果我通过许多不同的文件/脚本使用这个结构当需要更改时，如何才能只更改一个地方，而不必在每个文件中更改它。 u = contents incomingUrl = urlparse(u).query o
c++ - 标准化 1MB 文本文件的最有效方法？
我有 1MB 的文本文件。我想删除空格、换行符、制表符，并以 4KB 迭代方式将 1MB 文件的字符大小写从小写转换为大写。我写了这段代码: for (i = 0, j= 0; i 首先，让我们定
parsing - 标准化 NFL 球队名称
这实际上是一个机器学习分类问题，但我想有一种非常好的快速而肮脏的方法来做到这一点。我想将描述 NFL 球队的字符串(例如“San Francisco”或“49ers”或“San Francisco 4
mysql - 标准化 : is it done good?
我正在创建游戏评论数据库。我对此很陌生，但我正在尽力。关于数据库的一点点:系统很简单，用户填写 php 表单，在其中插入他的姓名、电子邮件，然后选择反馈是好还是坏并留下评论/建议。我正在添加照片的视觉

首页

博学

6Ren·AI

商城

Javascript - 标准化带重音的希腊字符

第一次尝试(感谢 @Tyblitz)

第二次尝试:

工作原理+示例:

有趣的链接: