- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
最佳答案
简短的回答
在您了解 normalize 的作用之后,这实际上非常简单:
WITH data AS(
SELECT 'Ãâíüçãõ' AS text
)
SELECT
REGEXP_REPLACE(NORMALIZE(text, NFD), r'\pM', '') nfd_result,
REGEXP_REPLACE(NORMALIZE(text, NFKD), r'\pM', '') nfkd_result
FROM data
Row nfd_result nfkd_result
1 Aaiucao Aaiucao
á
.
U+00E1
或喜欢
U+0061U+0301
这是
a
的 unicodes和
´
.
´
具有类 230),用于断言应如何表示最终字形。
U+0061U+0301
和其他与
U+00E1
(两者都是
á
),它们应该被认为是等效的!事实上,它是以不同方式表示的同一个字形。
normalize
是在做。 Unicode 为每个字符定义了一种规范形式,因此,在规范化时,最终结果应该是这样的:如果我们有两个具有相同字形的不同代码点的字符串,我们仍然可以将两者视为相等。
U+0061U+0301
转换成
U+00E1
),或者我们可以分解(这将是另一种方式周围,将
U+00E1
转换为
U+0061U+0301
)。
WITH data AS(
SELECT 'Amélie' AS text
)
SELECT
text,
TO_CODE_POINTS(NORMALIZE(text, NFC)) nfc_result,
TO_CODE_POINTS(NORMALIZE(text, NFD)) nfd_result
FROM data
nfd
列还有一个代码点。现在你已经知道那是什么了:
´
与
e
分开.
ffi
(这与 ffi 不同。这种类型的字符被称为
ligature )也被构成它的字母分解(因此等价性丢失,因为对于某些应用程序,ffi 可能与 ffi 不同,因此名称兼容表)。
regex
只匹配它们以从字符串中删除(这是由表达式
\pM
完成的,它只匹配变音符号):
WITH data AS(
SELECT 'café' AS text
)
SELECT
REGEXP_REPLACE(NORMALIZE(text, NFD), r'\pM', '') nfd_result
FROM data
关于unicode - 如何在标准 SQL 中使用 Unicode 规范化删除变音符号(例如重音符号)?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/48509104/
我正在寻找一种方法来支持不区分大小写 + 重音不区分搜索的良好性能。到目前为止,我们在使用 MSSql 服务器时没有遇到任何问题,在 Oracle 上我们必须使用 OracleText,而现在我们在
这个问题已经有答案了: Trouble with UTF-8 characters; what I see is not what I stored (5 个回答) 已关闭 5 年前。 我刚刚将一个我
我正在寻找一种在 Linux 中使用反引号 (`)/波形符 (~) 键和其他一些键创建键盘快捷键的方法。在理想情况下: 按下波形符没有任何作用 按下波形符的同时按另一个键会触发(可自定义的)快捷方式
我有一个由术语组成的数组,其中一些包含重音字符。我像这样做一个 preg grep $data= array('Napoléon','Café'); $result = preg_grep('~' .
我使用 TextBox 在 DataGridView 中进行过滤 image .这是完美的工作。表格的单元格包含 1250 个拉丁字符。我想搜索忽略单元格中单词的重音。例子。如果是文本框 "knjaz
我在 Vim 中遇到一个奇怪的映射问题。我使用的是 Azerty 键盘。 在我的 .vimrc 中,我有以下命令可以在段落之间快速移动。 nnoremap _ { vnoremap _ { nnore
我尝试读取一个utf8编码的vcf文件,结果是: { "name": "=4A=61=76=69=65=72=20=4C=75=6A=C3=A1=6E", "tel":
我的数据库中有两个表,info 和 comment,它们的结构如下: info (id(int(10)), name(varchar(80)), ...19 other columns.., phon
我使用 QtWebkit 制作了一个应用程序。在同一个 html 页面中,在 Windows 上使用重音符号(西类牙语)时可以正常工作,但在 Linux (Ubuntu) 上则不起作用。 我不明白为什
我有(例如)两个字符串: $a = "joao"; $b = "joão"; if ( strtoupper($a) == strtoupper($b)) { echo $b; } 我希望它是
这个问题在这里已经有了答案: 关闭 10 年前。 Possible Duplicate: invalid multibyte char (US-ASCII) with Rails and Ruby
我重写 URL 以包含用户生成的旅游博客的标题。 我这样做是为了 URL 的可读性和 SEO 目的。 http://www.example.com/gallery/280-Gorges_du_Tod
我最近安装了新的 Windows 10 build 14393,我想使用新的 linux 子系统。所以我决定学习 ncurses,但我找不到如何从 getch 中获取带有重音符的字符的 UTF-8 代
我是一名优秀的程序员,十分优秀!