- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在尝试从 WEKA 获得精确的预测,并且我需要增加其预测数据输出的小数位数。
我的 .arff 训练集如下所示:
@relation TrainSet
@attribute TimeDiff1 numeric
@attribute TimeDiff2 numeric
@attribute TimeDiff3 numeric
@attribute TimeDiff4 numeric
@attribute TimeDiff5 numeric
@attribute TimeDiff6 numeric
@attribute TimeDiff7 numeric
@attribute TimeDiff8 numeric
@attribute TimeDiff9 numeric
@attribute TimeDiff10 numeric
@attribute LBN/Distance numeric
@attribute LBNDiff1 numeric
@attribute LBNDiff2 numeric
@attribute LBNDiff3 numeric
@attribute Size numeric
@attribute RW {R,W}
@attribute 'Response Time' numeric
@data
0,0,0,0,0,0,0,0,0,0,203468398592,0,0,0,32768,R,0.006475
0.004254,0,0,0,0,0,0,0,0,0,4564742206976,4361273808384,0,0,65536,R,0.011025
0.002128,0.006382,0,0,0,0,0,0,0,0,4585966117376,21223910400,4382497718784,0,4096,R,0.01389
0.001616,0.003744,0,0,0,0,0,0,0,0,4590576115200,4609997824,25833908224,4387107716608,4096,R,0.005276
0.002515,0.004131,0.010513,0,0,0,0,0,0,0,233456156672,-4357119958528,-4352509960704,-4331286050304,32768,R,0.01009
0.004332,0.006847,0.010591,0,0,0,0,0,0,0,312887472128,79431315456,-4277688643072,-4273078645248,4096,R,0.005081
0.000342,0.004674,0.008805,0,0,0,0,0,0,0,3773914294272,3461026822144,3540458137600,-816661820928,8704,R,0.004252
0.000021,0.000363,0.00721,0,0,0,0,0,0,0,3772221901312,-1692392960,3459334429184,3538765744640,4096,W,0.00017
0.000042,0.000063,0.004737,0.01525,0,0,0,0,0,0,3832104423424,59882522112,58190129152,3519216951296,16384,W,0.000167
0.005648,0.00569,0.006053,0.016644,0,0,0,0,0,0,312887476224,-3519216947200,-3459334425088,-3461026818048,19456,R,0.009504
我正在尝试获取响应时间的预测,这是最右边的列。如您所见,我的数据精确到小数点后第六位。
但是,WEKA 的预测只到了第 3 个。以下是名为“predictions”的文件的结果:
inst# actual predicted error
1 0.006 0.005 -0.002
2 0.011 0.017 0.006
3 0.014 0.002 -0.012
4 0.005 0.022 0.016
5 0.01 0.012 0.002
6 0.005 0.012 0.007
7 0.004 0.018 0.014
8 0 0.001 0
9 0 0.001 0
10 0.01 0.012 0.003
正如你所看到的,这极大地限制了我预测的准确性。对于小于 0.0005 的非常小的数字(例如第 8 行和第 9 行),它们将显示为 0,而不是更准确的较小十进制数。
我在“简单命令行”上使用 WEKA,而不是 GUI。我构建模型的命令如下所示:
java weka.classifiers.trees.REPTree -M 2 -V 0.00001 -N 3 -S 1 -L -1 -I 0.0 -num-decimal-places 6 \
-t [removed path]/TrainSet.arff \
-T [removed path]/TestSet.arff \
-d [removed path]/model1.model > \
[removed path]/model1output
([已删除路径]:出于隐私考虑,我刚刚删除了完整路径名)
如您所见,我找到了用于创建模型的“-num-decimal-places”开关。
然后我使用以下命令进行预测:
java weka.classifiers.trees.REPTree \
-T [removed path]/LUN0train.arff \
-l [removed path]/model1.model -p 0 > \
[removed path]/predictions
我无法在此处使用“-num-decimal 位”开关,因为 WEKA 由于某种原因不允许在这种情况下使用它。 “predictions”是我想要的预测文件。
所以我执行这两个命令,它不会改变预测中的小数位数!还只有 3 个。
我已经看过这个答案 Weka decimal precision 以及 pentaho forum 上的这个答案,但是没有人提供足够的信息来回答我的问题。这些答案暗示改变小数位数可能是不可能的?但我只是想确定一下。
有人知道解决这个问题的方法吗?理想的解决方案是在命令行上,但如果您只知道如何在 GUI 中执行此操作,那也没关系。
最佳答案
我刚刚想出了一个解决方法,即简单地将数据缩放/乘以 1000,然后得到您的预测,然后在完成后将其乘回到 1/1000 以获得原始比例。有点不合常理,但它确实有效。
编辑:另一种方法:来自 http://weka.8497.n7.nabble.com/Changing-decimal-point-precision-td43393.html 的 Peter Reutemann 的回答:
This has been around for a long time. ;-) "-p" is the really old-fashioned way of outputting the predictions. Using the "-classifications" option, you can specify what format the output is to be in (eg CSV). The class that you specify with that option has to be derived from "weka.classifiers.evaluation.output.prediction.AbstractOutput": http://weka.sourceforge.net/doc.dev/weka/classifiers/evaluation/output/prediction/AbstractOutput.html
Here is an example of using 12 decimals for the prediction output using Java: https://svn.cms.waikato.ac.nz/svn/weka/trunk/wekaexamples/src/main/java/wekaexamples/classifiers/PredictionDecimals.java
关于machine-learning - WEKA 更改预测中的小数位数,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/50725361/
我最近开始使用 weka,我正在尝试使用朴素贝叶斯将推文分为正面或负面。因此,我有一个训练集,其中包含我为其指定标签的推文,以及一个包含所有带有“正面”标签的推文的测试集。当我运行朴素贝叶斯时,我得到
我正在使用来自 UCI 的成人数据 Here ,当我将它转换为excel文件时==>然后在weka中导入 weka 无法识别缺失值(它告诉 Missing:0 (0%)), 但成人数据包含带有“?”的
我对数据挖掘并不陌生,所以我完全被 WEKA 结果难住了。希望得到一些帮助。提前致谢! 我有一个具有二进制分类(S,H)的数字向量数据集。我训练了一个 NaiveBayes 模型(尽管方法真的无关紧要
我正在使用 Weka 上的多层感知器生成功率模型,Weka 是一个统计工具箱。 Weka 显示了以下生成的功率模型,但是,我不知道如何解释它。 如何使用 Weka 生成的模型计算预测值?我想知道如何用
我必须在我的 java 代码中使用 WEKA 进行预测。基本上我必须研究给定的代码并重用它。 testdata.setClassIndex(data.numAttributes() - 1); 我无法
您好,我正在尝试使用 java CSVLoader 在 weka 中加载管道分隔文件。看起来 CSVLoader 只加载逗号和制表符。有什么办法可以更改这些加载器上的分隔符吗? 有没有人在 Weka
我已经使用 Weka 3.7.9 将随机森林模型保存到一个文件中,现在我正在尝试针对其他(非常大的)集合(在 Amazon EC2 中的一些大型机器上)对其进行评估。我正在使用以下命令行: > jav
假设 X是原始的、标记的(即带有训练标签的)数据集,并且 Process(X)返回一组 Y实例 已用属性编码并转换为像 Y.arff 这样的对 Weka 友好的文件。 还假设Process()有一些“
我正在使用 Weka 中的数据集进行包含缺失值的分类。据我了解,当使用像 NaiveBayes 这样的分类器时,Weka 会自动用训练数据的众数或均值(使用过滤器 unsupervised/attri
我已经为我想在 Weka 中使用的数据集创建了一个 arff 文件。该文件被格式化为稀疏 arff 文件。无论如何,我已经成功加载了数据。然后我切换到关联选项卡并设置我的参数。但是,“开始”按钮不会启
我有一个 csv 文件,其中每一行都是代表数据点的数字向量。我想从命令行使用 weka 来计算 csv 文件中每个数据点的最近邻。我知道如何从命令行进行 k 最近邻分类,但这不是我想要的。我想要真正的
我有一个关于在 WEKA 中过滤属性的简单问题。 假设我有 30 个类的 500 个属性和每个类的 100 个样本,这等于 3000 行和 500 列。这会导致时间和内存问题,您可以猜到。 如何过滤在
Weka 中的分类器(例如决策树)将如何解释“?” (表示 ARFF 文件中的缺失值)在学习阶段?Weka 会用一些预定义的值(例如“0”或“false”)替换它,还是会以某种方式影响训练过程? 最佳
我正在尝试在 Weka 中使用 SVM 分类器。我下载了weka-3-7-13版本。当我单击分类器选项卡时,SVM 不在列表中。 如何在这个工具中使用 SVM?请帮助我克服这个问题。 最佳答案 在 W
就目前而言,这个问题不适合我们的问答形式。我们希望答案得到事实、引用或专业知识的支持,但这个问题可能会引起辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开,visit the he
我正在从命令行运行 WEKA 以创建用于训练的贝叶斯网络模型,然后使用该模型在单独的数据集上进行测试。贝叶斯网络使用带有简单估计器的 TAN 搜索选项。我的培训命令行调用如下所示: java -cp
请帮助解释 Weka 库中由 weka.classifiers.functions.Logistic 生成的逻辑回归结果。 我使用来自 Weka 示例的数字数据: @relation weather
对于 Weka 中可用的 10 折交叉验证和传统的 10 折交叉验证之间的区别,我有点困惑。我理解 K 折交叉验证的概念,但是从我读到的 10 -Weka 中的折叠交叉验证有点不同。 在 Weka F
我正在使用 Weka 3.7.1 我正在尝试使用 weka 分析棒球运动预测。我想使用成本矩阵,因为在我赌博的体育博彩中,不同结果的成本是不一样的。我的数据集很简单:它是一组具有标称类 {WIN,LO
我正在使用 Weka GUI 在在线帖子上运行 NaiveBayes 分类器。我正在尝试跟踪错误预测的实例(在线帖子),以便我可以进一步了解如何改进功能。 目前,我有一个解决方法:我生成包含唯一 ID
我是一名优秀的程序员,十分优秀!