- iOS/Objective-C 元类和类别
- objective-c - -1001 错误,当 NSURLSession 通过 httpproxy 和/etc/hosts
- java - 使用网络类获取 url 地址
- ios - 推送通知中不播放声音
我正在设计一个指标来衡量搜索词何时“模棱两可”。接近 1 的分数意味着它是模棱两可的(“Ajax”可以是一种编程语言、清洁解决方案、希腊英雄、欧洲足球俱乐部等),而接近 0 的分数意味着它非常清楚用户想要什么意思(“Lady Gaga”可能只意味着一件事)。此指标的部分是我有一个可能的解释列表以及这些解释来自过去数据的频率,我需要将其转换为 0 到 1 之间的数字。
例如:假设术语是“猫”——在一百万次试验中,850,000 次用户指的是会喵喵叫的毛茸茸的东西,80,000 次用户指的是那个名字的音乐剧,其余的都是事物的缩写意味着微不足道的次数。我会说这应该有一个低歧义分数,因为即使有多种可能的含义,但到目前为止,一个是首选的含义。相比之下,假设这个词是“ friend ”——在一百万次试验中,500,000 次用户指的是他们一直在一起的人,450,000 次他们指的是那个名字的电视节目,其余的是其他含义.这应该得到更高的歧义分数,因为不同的含义在频率上更接近。
TLDR:如果我按降序对数组进行排序,我需要一种方法来获取快速下降到接近 0 的数字的数组,以及下降较慢到接近 1 的数字的数组。如果数组是 [1,0,0,0...] 这应该得到满分 0 如果它是 [1/n,1/n,1/n...] 这应该得到满分共 1 个。有什么建议吗?
最佳答案
您要查找的内容听起来与 Entropy 非常相似信息论中的度量。它是衡量随机变量基于每个结果的概率的不确定性的指标。它由:
H(X) = -sum(p(x[i]) * log( p(x[i])) )
其中 p(x[i])
是第 i
种可能性的概率。因此,在您的情况下,p(x[i])
将是某个搜索短语对应于实际含义的概率。在猫的例子中,你会:
p(x[0]) = 850,000 / (850,000+80,000) = 0.914
p(x[1]) = 80,000 / (850,000+80,000) = 0.086
H(X) = -(0.914*log2(0.914) + 0.086*log2(0.086)) = 0.423
对于 Friends 案例,您将有:(假设只有一个其他类别)
H(X) = -(0.5*log2(0.5) + 0.45*log2(0.45) + 0.05*log2(0.05)) = 1.234
这里的数字越大意味着不确定性越大。
请注意,我在这两种情况下都使用以 2 为底的对数,但如果您使用等于可能性数的底数的对数,则可以得出 0 到 1 的比例。
H(X) = -(0.5*log3(0.5) + 0.45*log3(0.45) + 0.05*log3(0.05)) = 0.779
另请注意,最模棱两可的情况是所有可能性都具有相同的概率:
H(X) = -(0.33*log3(0.33) + 0.33*log3(0.33) + 0.33*log3(0.33)) = 1.0
最明确的情况是只有一种可能性:
H(X) = -log(1) = 0.0
因为您希望最模糊的项接近 1,您可以只使用 1.0-H(X)
作为您的指标。
关于arrays - 设计指标的建议,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/8981528/
在 C 中: int a[10]; printf("%p\n", a); printf("%p\n", &a[0]); 产量: 0x7fff5606c600 0x7fff5606c600 这是我所期望
我一直在尝试运行此循环来更改基于数组的元素的位置,但出现以下错误。不太确定哪里出了问题。任何想法或想法!谢谢。 var population = [[98, 8, 45, 34, 56], [9, 1
我正在尝试获取一个 Ruby 数组数组并将其分组以计算其值。 数组有一个月份和一个 bool 值: array = [["June", false], ["June", false], ["June"
所以我们的目标是在遇到某个元素时将数组分割成子数组下面的示例 array.split("stop here") ["haii", "keep", "these in the same array bu
在this问题已经回答了两个表达式是相等的,但在这种情况下它们会产生不同的结果。对于给定的 int[] 分数,为什么会这样: Arrays.stream(scores) .forEac
我认为我需要的是哈希数组的数组,但我不知道如何制作它。 Perl 能做到吗? 如果是这样,代码会是什么样子? 最佳答案 perldoc perldsc是了解 Perl 数据结构的好文档。 关于arra
我遇到了这个问题,从 API 中我得到一个扩展 JSON,其中包含一个名为坐标的对象,该对象是一个包含数组 o 数组的数组。 为了更清楚地看这个例子: "coordinates": [
postgres 中有(v 9.5,如果重要的话): create table json_test( id varchar NOT NULL, data jsonb NOT NULL, PRIM
我用 echo "${array[@]}" 和 echo "${array[*]}" 得到了相同的结果。 如果我这样做: mkdir 假音乐; touch fakemusic/{Beatles,Sto
我正在尝试创建 typealias 对象的数组数组 - 但我收到“表达式类型不明确,没有更多上下文”编译错误。这是我的代码: typealias TestClosure = ((message: St
如果您在 Python 中创建一维数组,使用 NumPy 包有什么好处吗? 最佳答案 这完全取决于您打算如何处理数组。如果您所做的只是创建简单数据类型的数组并进行 I/O,array模块就可以了。 另
当我将数组推送到只有一个数组作为其唯一元素的数组数组时,为什么会得到这种数据结构? use v6; my @d = ( [ 1 .. 3 ] ); @d.push( [ 4 .. 6 ] ); @d.
在 Julia 中,我想将定义为二维数组向量的数据转换为二维矩阵数组。 如下例所述,我想把数据s转换成数据t,但是至今没有成功。 我该如何处理这个案子? julia> s = [[1 2 3], [4
C 没有elementsof 关键字来获取数组的元素数。所以这通常由计算 sizeof(Array)/sizeof(Array[0]) 代替但这需要重复数组变量名。1[&Array] 是指向数组后第一
所以,假设我有一个像这样的(愚蠢的)函数: function doSomething(input: number|string): boolean { if (input === 42 || in
我有以下数组: a = [1,2,3,4,5,6,7,8,9,10,11,12,13,14,15,16] 我将它用于一些像这样的视觉内容: 1 2 3 4 5 6 7 8 9 10
我想知道数组中的 .toList 与 .to[List] 之间有什么区别。我在spark-shell中做了这个测试,结果没有区别,但我不知道用什么更好。任何意见? scala> val l = Arr
我很难获得完全相同对象的多个元素的当前元素索引: $b = "A","D","B","D","C","E","D","F" $b | ? { $_ -contains "D" } 替代版本: $b =
我正在尝试使用来自我的 API 的 v-select 执行 options,我将数据放在数组数组中。 Array which I got from API 它应该是一个带有搜索的 select,因为它
这个问题在这里已经有了答案: String literals: pointer vs. char array (1 个回答) 4 个月前关闭。 当我执行下一个代码时 int main() {
我是一名优秀的程序员,十分优秀!