- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我已经实现了 k 均值聚类来确定 300 个对象中的聚类。我的每一个对象有大约30个维度。距离是使用欧几里得度量计算的。
我需要知道
最佳答案
OP 中的两个问题是不同的主题(即答案中没有重叠),因此我将尝试一次回答一个问题,紧接着列表中的第 1 项。
How would I determine if my [clustering] algorithms works correctly?
k-means 与其他无监督 ML 技术一样,缺乏良好的诊断测试选择来回答诸如“k-means 返回的聚类分配对于 k=3 或 k=5 更有意义吗?”之类的问题
尽管如此,有一种被广泛接受的测试可以产生直观的结果并且易于应用。这个诊断指标就是这个比率:
质心间分离/簇内方差
随着该比率值的增加,聚类结果的质量也会提高。
这很直观。第一个指标是每个聚类与其他聚类的距离有多远(根据聚类中心测量)?
但是质心间分离本身并不能说明全部情况,因为两种聚类算法可以返回具有相同质心间分离的结果,尽管其中一种显然更好,因为聚类“更紧密”(即半径更小) ;换句话说,簇边缘有更多的分离。第二个指标——集群内方差——解释了这一点。这只是每个簇计算的平均方差。
总之,质心间分离与簇内方差之比是一种快速、一致且可靠的技术,用于比较不同聚类算法的结果,或比较相同聚类算法的结果算法在不同的可变参数下运行,例如迭代次数、距离度量的选择、质心数量(k 值)。
期望的结果是紧密(小)的簇,每个簇都远离其他簇。
计算很简单:
对于质心间分离:
计算聚类中心之间的两两距离;然后
计算这些距离的中值。
对于簇内方差:
对于每个簇,计算给定簇中每个数据点的距离其聚类中心;下一页
(对于每个簇)计算上述步骤中距离序列的方差;然后
对这些方差值求平均值。
这就是我对第一个问题的回答。这是第二个问题:
Is Euclidean distance the correct method for calculating distances? What if I have 100 dimensions instead of 30 ?
首先,一个简单的问题——随着维度/特征的增加,欧几里得距离是一个有效的度量吗?
欧几里得距离是完全可扩展的——适用于二维或两千维。对于任意一对数据点:
按元素减去它们的特征向量,
对结果向量中的每个项目进行平方,
对结果求和,
取该标量的平方根。
这个计算序列中没有任何地方涉及规模。
但是欧几里得距离是否适合您的问题的相似性度量,取决于您的数据。例如,它是纯数字(连续)吗?或者它是否也有离散(分类)变量(例如,性别?男/女)如果您的维度之一是“当前位置”,并且在 200 个用户中,100 个用户的值为“旧金山”,另外 100 个用户的值为“波士顿”,你不能真正说,平均而言,你的用户来自堪萨斯州的某个地方,但这就是欧几里得距离的作用。
无论如何,由于我们对此一无所知,我只会给您一个简单的流程图,以便您可以将其应用于您的数据并确定适当的相似性指标。
根据您的数据确定适当的相似性指标:
关于machine-learning - 选择适当的相似性度量并评估 k 均值聚类模型的有效性,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/8102515/
目前,由于生成变量的评估,我的Makefile遇到了问题。我降低了复杂性,仅保留了导致问题的基本要素。 读取Makefile时, $(LIST)被评估为文件列表。 在步骤1中,其中一个文件被删除。 在
为什么这 eval 没有调用alert("Summer") ? eval('(caption="Summer";alert(caption))'); 和《夏天》里的台词有关系吗? 最佳答案 Uncau
我正在努力让以下工作正常进行。最初似乎可以工作,但不知何故它停止工作了 var setCommonAttr = "1_row1_common"; var val = document.getEleme
eval('({"suc":true})') 以上错误,应该是: eval('{"suc":true}') 为什么? 最佳答案 当尝试评估时,解释器会看到大括号并认为它是一个 block 开头。将其括
我的页面 A 发出了 ajax 调用并引入了片段 B。该片段被添加到 DOM 中,并且该片段中的所有脚本都经过了评估。在该代码片段中,我有 2 个脚本标签: function doOptions()
这里是javascript代码: var test = { "h" : function (a) {return a;}, "say" : "hello" }; 第一次运行: test
我正在查看一些工作代码,并遇到了这一行: eval("\$element = \"$element\";"); 我真的很困惑为什么任何 PHP 开发人员都会写这一行。除了给自己设置一个变量之外,这还有
谁能帮我解决以下问题: 我有这样的代码: if(cond1 && cond2 && .. && cond10) 这里,cond1 是昂贵的操作,其输出是 boolean 值。 现在我的问题是,当 co
**摘要:**华为AppCube应用魔方顺利通过信通院评估,被认证为具备 “低代码开发平台通用能力”的企业服务平台。 本文分享自华为云社区《华为AppCube通过中国信通院“低代码开发平台通用能力要求
我正在尝试通过 PHP 从图像的 EXIF 数据中获取焦距。 这是我目前得到的代码: $exif = exif_read_data("$photo"); $length10 = $exif['Foca
我想使用id =“key”将一个类添加到元素中,但是为什么不起作用?我是js的初学者:这是代码: audio.classList.add('yellow'); 这是错误: null is not an
这是我的 XML: QueWay Password Recovery 现在我想用 php 用 xpath 选择文本“QueWay”。到目前为止我所拥有的一切都很好: $xml =
使用下面的代码,即使我输入的数字大于 18,我也会得到这个结果。 运行:你今年多大? 21你还没有达到成年年龄!构建成功(总时间:3 秒) 我是java新手,正在尝试自学,有人可以帮忙吗? impor
我正在阅读 http://www.cran.r-project.org/doc/manuals/R-lang.pdf手册第 4.3 章,我就是不明白。也许有人可以给我一个快速的解释,为什么 R 的行为
在这个实现中,每次都会评估 hand 并返回另一个列表吗? foreach (Card card in hand.Cards) { } 我们应该用下面的实现替换上面的实现吗? var cards =
我正在制作 LINQ lambda 表达式: Expression> add = (x, y) => x + y; 但现在我将如何评估它,比如说找到 2+3? 最佳答案 这应该适合你: var su
我正在制作一个语言解释器,我已经到了需要评估 if 语句的地步。起初我认为这很简单,我能够让我的解释器评估简单的 if 条件,10 == 10 但是当我试图让它评估更复杂的条件时, 10 == 10
我正在尝试以下代码,该代码向 RDD 中的每一行添加一个数字,并使用 PySpark 返回 RDD 列表。 from pyspark.context import SparkContext file
在阅读了很多关于 Lisp eval-when 运算符的文档后,我仍然无法理解它的用途,我知道使用这个运算符我可以控制表达式的计算时间,但我做不到找出任何可能适用的示例? 最好的问候,utxee. 最
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 要求我们推荐或查找工具、库或最喜欢的场外资源的问题对于 Stack Overflow 来说是偏离主题的,
我是一名优秀的程序员,十分优秀!