- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在尝试构建段落 vector 并使用 Java 中的 DeepLearning4J 框架对其进行一些推理。当我将段落 vector 构建到 ZIP 文件夹中时,我可以通过使用行号来获得相似性,如下所示:
SentenceIterator sentenceIterator = new BasicLineIterator(new File(inputFilePath));
AbstractCache<VocabWord> abstractCache = new AbstractCache<VocabWord>();
TokenizerFactory tokenizerFactory = new DefaultTokenizerFactory();
tokenizerFactory.setTokenPreProcessor(new CommonPreprocessor());
LabelsSource labelsSource = new LabelsSource("LINE_");
ParagraphVectors paragraphVectors = new ParagraphVectors.Builder()
.minWordFrequency(1)
.iterations(5)
.epochs(1)
.layerSize(100)
.learningRate(0.025)
.labelsSource(labelsSource)
.windowSize(5)
.iterate(sentenceIterator)
.trainWordVectors(false)
.vocabCache(abstractCache)
.tokenizerFactory(tokenizerFactory)
.sampling(0)
.build();
paragraphVectors.fit();
double similarity1 = paragraphVectors.similarity("LINE_9835", "LINE_100");
System.out.println("Similarity: " + similarity1);
WordVectorSerializer.writeParagraphVectors(paragraphVectors, outputParagraphVectorsFilePath);
变量inputFilePath
指的是包含一些信息的文本文档。变量outputParagraphVectorsFilePath
指的是磁盘上要存储 vector 的位置。该函数有效并且相似性准确。问题出现如下:
TokenizerFactory tokenizerFactory = new DefaultTokenizerFactory();
tokenizerFactory.setTokenPreProcessor(new CommonPreprocessor());
ParagraphVectors paragraphVectors = WordVectorSerializer.readParagraphVectors(new File(inputFilePath));
paragraphVectors.setTokenizerFactory(tokenizerFactory);
paragraphVectors.getConfiguration().setIterations(1);
INDArray inferredVectorA = paragraphVectors.inferVector("This is my world .");
INDArray inferredVectorA2 = paragraphVectors.inferVector("This is my world .");
INDArray inferredVectorB = paragraphVectors.inferVector("This is my way .");
System.out.println("Cosine similarity A/B:" + Transforms.cosineSim(inferredVectorA, inferredVectorB));
System.out.println("Cosine similarity A/B2:" + Transforms.cosineSim(inferredVectorA, inferredVectorA2));
inputFilePath
变量指的是包含 vector 的 ZIP 文件夹在磁盘上的位置。当我运行这个函数时,我得到以下信息:
Cosine similarity A/B:1.0
Cosine similarity A/B2:1.0
即使我改变 vector 并将它们与其他 vector 进行比较,我也会得到相同的 1.0。难道我做错了什么?任何帮助将不胜感激。
最佳答案
根据this在 GitHub 上发布的问题中,余弦相似度不准确的主要原因是 dl4j
和 nd4j
使用的版本不正确。我的项目中使用的版本是0.7.1
。更新到 0.9.1
后,我能够得到准确的答案。以下是一些重要的准则:
关于java - 余弦相似度始终为 1.0,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/49582972/
我有一个例程,它将接受 union 参数 d、theta、a 和 alpha 作为输入,并将生成相应的 4x4 齐次矩阵作为输出。我已经测试了我的矩阵乘法,它确实工作正常。我将从输入中得到 5 个矩阵
我有以下代码使用预先计算的内存表执行 Sin/Cos 函数。在下面的例子中,表格有 1024*128 个项目,涵盖了从 0 到 2pi 的所有 Sin/Cos 值。我知道我可以使用 Sin/Cos 对
问题是不言自明的。我看过几个 pi 的例子,但没有看到 trigo 函数。也许可以使用泰勒级数 as done here但我不完全确定如何在 python 中实现它。特别是如何存储这么多数字。我应该提
我开始学习 Python 中的数学模块,并试图围绕 Python 中的正弦、余弦和正切的三角函数。 我花了一些时间学习更多关于三角学的知识,并了解了直角三角形的基本公式是如何工作的: 正弦函数: si
我一个月前才开始学习这门 C++ 类(class)。现在我被分配去写一个程序来计算这个。我不知道我做错了什么。 #include #include float gatherl1(); float
这个问题在这里已经有了答案: Python cos(90) and cos(270) not 0 (3 个答案) 关闭 9 年前。 有没有办法获得角度(以弧度为单位)的精确正切/余弦/正弦? mat
这个问题在这里已经有了答案: Java Math.cos(Math.toRadians()) returns weird values (4 个答案) 关闭 10 年前。 我正在编写一个程序,我必须
我做了一个简单的计算器作为我的第一个android程序,现在我想给它添加trigonometry,log等函数。在 C 中,我们必须包含 math library 才能这样做,我似乎无法弄清楚你是如何
我正面临 objective-c 中 cos 函数的奇怪问题。我安装了带有 iOS 4.3 SDK 的 xcode 4.1.1。 我正在计算一个数的余弦值: y= cos(x*M_PI/180) 这将
尝试将以下 php 方法转换为在 .less 样式表中使用: 在 Less 中,如何在不使用特定语言的 cos()/sin() 函数的情况下实现正弦/余弦方法? .rotate(@deg) {
可以使用 iPhone 3GS 或 Pandora 的人请测试我刚刚编写的以下组装程序吗? 它应该在 NEON 矢量 FPU 上非常快速地计算正弦和余弦。我知道它编译得很好,但没有足够的硬件我无法测试
我为泰勒级数编写了以下函数来计算余弦。 double cosine(int x) { x %= 360; // make it less than 360 double rad = x
我是一名优秀的程序员,十分优秀!