java - R 和 Java + WEKA 在计算最近邻方面的差异

转载作者：行者123 更新时间：2023-11-30 10:34:23

25

4

我正在调试一个库和另一个涉及计算 k 最近邻的实现。我用一个我很难理解的例子来提出问题。

首先我会用一个玩具示例来解释演示，然后显示将导致问题的输出。

任务

此处的演示读取一个包含 10 个二维数据点的 csv 文件。任务是找到所有数据点到第一个数据点的距离，并以非递减顺序列出所有点和到第一个数据点的距离。

基本上，这是基于 kNN 的算法的一个组成部分，我在执行 Java 版本(库的组成部分)和用 R 编写它时发现了差异。为了证明差异，请考虑以下代码。

代码一:Java + WEKA

以下代码使用 Java 和 WEKA .我用过LinearNNSearch计算最近的邻居。使用它的原因是因为 LinearNNSearch在我正在调试和/或与 R 代码进行比较的特定库中使用。

import weka.core.converters.CSVLoader;
import weka.core.Instances;
import weka.core.DistanceFunction;
import weka.core.EuclideanDistance;
import weka.core.Instances;
import weka.core.neighboursearch.LinearNNSearch;
import java.io.File;

class testnn
{
  public static void main (String args[]) throws Exception
  {
    // Load csv
    CSVLoader loader = new CSVLoader ();
    loader.setSource (new File (args[0]));

    Instances df = loader.getDataSet ();

    // Set the LinearNNSearch object
    EuclideanDistance dist_obj = new EuclideanDistance ();

    LinearNNSearch lnn = new LinearNNSearch ();
    lnn.setDistanceFunction(dist_obj);
    lnn.setInstances(df);
    lnn.setMeasurePerformance(false);

    // Compute the K-nearest neighbours of the first datapoint (index 0).
    Instances knn_pts = lnn.kNearestNeighbours (df.instance (0), df.numInstances ());

    // Get the distances.
    double [] dist_arr = lnn.getDistances ();

    // Print
    System.out.println ("Points sorted in increasing order from ");
    System.out.println (df.instance (0));
    System.out.println ("V1,\t" + "V2,\t" + "dist");
    for (int j = 0; j < knn_pts.numInstances (); j++)
    {
      System.out.println (knn_pts.instance (j) + "," + dist_arr[j]);
    }
  }
}

代码 2:R

为了计算距离，我使用了 dist .使用 daisy也得到了相同的答案。

// Read file
df <- read.csv ("dat.csv", header = TRUE);

// All to all distances, and select distances of points from  first datapoint (index 1)
dist_mat <- as.matrix (dist (df, diag=TRUE, upper=TRUE, method="euclidean"));
first_pt_to_all <- dist_mat[,1];

// Sort the datapoints and also record the ordering
sorted_order <- sort (first_pt_to_all, index.return = TRUE, decreasing = FALSE);

// Prepare dataset with the datapoints ordered in the non-decreasing order of the distance from the first datapoint
df_sorted <- cbind (df[sorted_order$ix[-1],], dist = sorted_order$x[-1]);

// Print
print ("Points sorted in increasing order from ");
print (df[1,]);

print (df_sorted);

输出

为了便于比较，我将两个输出并排放置。两个表都以非递减顺序显示点数。

左侧表 由 R 生成，R 输出中最左边的列表示原始数据点索引。
右边的表是由 Java + WEKA 生成的。

     R                                              Java + WEKA[1] "Points sorted in increasing order from "   Points sorted in increasing order from         V1       V21 0.560954 0.313231                      0.560954,0.313231         V1        V2      dist              V1,        V2,     dist5  0.866816  0.476897 0.3468979          0.866816,0.476897,0.328072192806562410 0.262637  0.554558 0.3837079          0.262637,0.554558,0.378716589166753164  1.038752  0.396173 0.4849436          1.038752,0.396173,0.435172447975437752  0.330345 -0.137681 0.5064604          1.053889,0.486349,0.47951843598170837  1.053889  0.486349 0.5224507          1.113799,0.42203,0.5067820099662626  1.113799  0.422030 0.5634490          0.330345,-0.137681,0.54482564343594638  0.416051 -0.338858 0.6679947          0.416051,-0.338858,0.74118410200528563  0.870481 -0.302856 0.6894709          0.870481,-0.302856,0.74255417675631349  1.386459  0.425101 0.8330507          1.386459,0.425101,0.7451474897289354

问题

距离明显不同，一些数据点排序也不同。

可视化

我绘制了 10 个点并根据它们的排序顺序对它们进行了编号，由图中的数字表示。

黑色文本表示从 R
红色文本表示从 Java + WEKA 生成的排序数据集中绘制的点

因此 4、5 和 6 不同。如果两个数据点等距，那么这可以解释不同的排序，但没有两个点与第一个数据点等距。

数据集

"V1", "V2"0.560954,0.3132310.330345,-0.1376810.870481,-0.3028561.038752,0.3961730.866816,0.4768971.113799,0.422031.053889,0.4863490.416051,-0.3388581.386459,0.4251010.262637,0.554558

问题

为什么 dist 列中的距离不同，从而导致最近邻点的排序不同？
您是否可以在代码或我使用库的方式中找出任何错误？我是否正确使用了这些(尤其是 WEKA)？

如果有什么不清楚或需要更多信息，请发表评论。

最佳答案

如评论中所述，R 距离是正确的。问题是 WEKA 默认值。你用过:

EuclideanDistance dist_obj = new EuclideanDistance ();

WEKA 中的欧几里德距离具有带默认值的参数。其中之一是 DontNormalize=FALSE，即默认情况下，WEKA 在计算距离之前对数据进行归一化。我对 Java 帮助不大，所以我将在 R 中执行此操作。如果缩放数据，使每个变量的最小值为零，最大值为一，您将获得 WEKA 提供的距离度量。

NData = Data
NData[,1] = (NData[,1]-min(NData[,1]))/(max(NData[,1])-min(NData[,1]))
NData[,2] = (NData[,2]-min(NData[,2]))/(max(NData[,2])-min(NData[,2]))
dist(NData)

这些距离与您为 WEKA 显示的距离相匹配。要获得与 R 相同的结果，请查看 WEKA 中 EuclideanDistance 的参数。

关于java - R 和 Java + WEKA 在计算最近邻方面的差异，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/41680764/

25

4

0

文章推荐： javascript - 更大的 jQuery 项目的结构及其原因

文章推荐： javascript - native 对象的怪异行为是由什么引起的？

文章推荐： javascript - 定义没有值的关联数组

文章推荐： java - Log4J:将 Stderr 消息重定向到主日志文件

weka - 正确分类实例的含义 weka
我最近开始使用 weka，我正在尝试使用朴素贝叶斯将推文分为正面或负面。因此，我有一个训练集，其中包含我为其指定标签的推文，以及一个包含所有带有“正面”标签的推文的测试集。当我运行朴素贝叶斯时，我得到
weka - Weka 中的缺失值——
我正在使用来自 UCI 的成人数据 Here ，当我将它转换为excel文件时==>然后在weka中导入 weka 无法识别缺失值(它告诉 Missing:0 (0%))，但成人数据包含带有“？”的
weka - WEKA 实例预测和混淆矩阵结果之间的区别？
我对数据挖掘并不陌生，所以我完全被 WEKA 结果难住了。希望得到一些帮助。提前致谢! 我有一个具有二进制分类(S，H)的数字向量数据集。我训练了一个 NaiveBayes 模型(尽管方法真的无关紧要
weka - Weka 上多层感知器建模结果的解释
我正在使用 Weka 上的多层感知器生成功率模型，Weka 是一个统计工具箱。 Weka 显示了以下生成的功率模型，但是，我不知道如何解释它。如何使用 Weka 生成的模型计算预测值？我想知道如何用
weka - WEKA 中的类别索引是什么？
我必须在我的 java 代码中使用 WEKA 进行预测。基本上我必须研究给定的代码并重用它。 testdata.setClassIndex(data.numAttributes() - 1); 我无法
weka - 在 Weka 中加载管道分隔文件
您好，我正在尝试使用 java CSVLoader 在 weka 中加载管道分隔文件。看起来 CSVLoader 只加载逗号和制表符。有什么办法可以更改这些加载器上的分隔符吗？有没有人在 Weka
weka - 从命令行输出 Weka 中的混淆矩阵
我已经使用 Weka 3.7.9 将随机森林模型保存到一个文件中，现在我正在尝试针对其他(非常大的)集合(在 Amazon EC2 中的一些大型机器上)对其进行评估。我正在使用以下命令行: > jav
weka - 在分类之后但在评估之前添加 weka 实例？
假设 X是原始的、标记的(即带有训练标签的)数据集，并且 Process(X)返回一组 Y实例已用属性编码并转换为像 Y.arff 这样的对 Weka 友好的文件。还假设Process()有一些“
weka - 删除 Weka 中的缺失值
我正在使用 Weka 中的数据集进行包含缺失值的分类。据我了解，当使用像 NaiveBayes 这样的分类器时，Weka 会自动用训练数据的众数或均值(使用过滤器 unsupervised/attri
weka - 为什么 Weka 不允许我启动关联规则生成？
我已经为我想在 Weka 中使用的数据集创建了一个 arff 文件。该文件被格式化为稀疏 arff 文件。无论如何，我已经成功加载了数据。然后我切换到关联选项卡并设置我的参数。但是，“开始”按钮不会启
weka - 如何从命令行使用 weka 计算最近邻居？
我有一个 csv 文件，其中每一行都是代表数据点的数字向量。我想从命令行使用 weka 来计算 csv 文件中每个数据点的最近邻。我知道如何从命令行进行 k 最近邻分类，但这不是我想要的。我想要真正的
weka - 使用 Weka 过滤属性
我有一个关于在 WEKA 中过滤属性的简单问题。假设我有 30 个类的 500 个属性和每个类的 100 个样本，这等于 3000 行和 500 列。这会导致时间和内存问题，您可以猜到。如何过滤在
weka - ARFF (Weka) 中的缺失值
Weka 中的分类器(例如决策树)将如何解释“？” (表示 ARFF 文件中的缺失值)在学习阶段？Weka 会用一些预定义的值(例如“0”或“false”)替换它，还是会以某种方式影响训练过程？最佳
weka - 如何在 Weka 分类器中使用 svm？
我正在尝试在 Weka 中使用 SVM 分类器。我下载了weka-3-7-13版本。当我单击分类器选项卡时，SVM 不在列表中。如何在这个工具中使用 SVM？请帮助我克服这个问题。最佳答案在 W
weka - 用于文本分类的 Mallet 与 Weka
就目前而言，这个问题不适合我们的问答形式。我们希望答案得到事实、引用或专业知识的支持，但这个问题可能会引起辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开，visit the he
weka - 在 WEKA 中使用带贝叶斯网络的 FilteredClassifier
我正在从命令行运行 WEKA 以创建用于训练的贝叶斯网络模型，然后使用该模型在单独的数据集上进行测试。贝叶斯网络使用带有简单估计器的 TAN 搜索选项。我的培训命令行调用如下所示: java -cp
weka - 如何解释 Weka Logistic 回归输出？
请帮助解释 Weka 库中由 weka.classifiers.functions.Logistic 生成的逻辑回归结果。我使用来自 Weka 示例的数字数据: @relation weather
weka - Weka 中的 10 折交叉验证
对于 Weka 中可用的 10 折交叉验证和传统的 10 折交叉验证之间的区别，我有点困惑。我理解 K 折交叉验证的概念，但是从我读到的 10 -Weka 中的折叠交叉验证有点不同。在 Weka F
weka - 了解 Weka 中的成本敏感评估(成本矩阵)
我正在使用 Weka 3.7.1 我正在尝试使用 weka 分析棒球运动预测。我想使用成本矩阵，因为在我赌博的体育博彩中，不同结果的成本是不一样的。我的数据集很简单:它是一组具有标称类 {WIN,LO
weka - 如何忽略一个功能，同时将其作为 Weka GUI 中功能集的一部分包含在内
我正在使用 Weka GUI 在在线帖子上运行 NaiveBayes 分类器。我正在尝试跟踪错误预测的实例(在线帖子)，以便我可以进一步了解如何改进功能。目前，我有一个解决方法:我生成包含唯一 ID

首页

博学

6Ren·AI

商城

java - R 和 Java + WEKA 在计算最近邻方面的差异

任务

代码一:Java + WEKA

代码 2:R

输出

问题

可视化

数据集

问题