- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
作为联系人管理系统的一部分,我有一个庞大的姓名数据库。人们经常编辑这个,结果我们遇到了以不同形式存在的同一个人的问题(John Smith 和 Jonathan Smith)。我研究了单词相似度,但很容易想到根本不相似的名称变体(Richard vs Dick)。我想知道是否有一个常见的英文名字变体列表,我可以用它来检测和更正此类错误。
最佳答案
我会爬取所有关于人名的维基百科页面(有可用的维基百科数据转储),例如 http://en.wikipedia.org/wiki/Teresa (来自 http://en.wikipedia.org/wiki/Category:English_given_names ),并创建一个索引,您可以使用该索引来建议人们正确的形式(您将根据数据库中名字变体的数量对它们进行排名)。不幸的是我不知道。这样的数据库。
关于database - 名字拼写的变化,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/3809257/
我想通过用语言环境拼写数字来本地化数字,最后使用了 ICU4J。我在许多地区都取得了成功,但似乎没有在格鲁吉亚、土耳其或阿拉伯语等地区完成。 ULocale locale = new ULocale(
我正在研究具有端点的 swagger API 规范: /authorizations 我也想为这个端点定义一个替代拼写(授权)。这可能吗?或者我是否需要为每个拼写定义一个单独的路由? /authori
我正在研究具有端点的 swagger API 规范: /authorizations 我也想为这个端点定义一个替代拼写(授权)。这可能吗?或者我是否需要为每个拼写定义一个单独的路由? /authori
我使用 Yahoo BOSS 的时间很短。这是一个简单的搜索 API,但拼写建议支持确实不那么强大。周围的人是否有任何关于在 BOSS 上获得更好的拼写建议的想法。 最佳答案 不幸的是,甚至在几年后,
问题如下:我正在编写一个强力解密器来破解一些 super secret 代码(这是一场竞赛,而不是犯罪),结果证明这是不可能的:树中的节点太多需要被搜查。为了克服这个问题,我认为检查中间“解决方案”以
关闭。这个问题需要更多focused .它目前不接受答案。 想改进这个问题吗? 更新问题,使其只关注一个问题 editing this post . 关闭 8 年前。 Improve this qu
我是一名优秀的程序员,十分优秀!