- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在训练在 python 上对 MNIST 进行一些 PCA 重建,并将它们与我在 maltab 中的(旧)重建进行比较,我碰巧发现我的重建不一致。经过一番调试后,我决定打印每个组件主要组件的独特特征,以揭示它们是否相同,但我惊讶地发现它们不相同。我打印了所有组件的总和,但得到了不同的数字。我在 matlab 中做了以下工作:
[coeff, ~, ~, ~, ~, mu] = pca(X_train);
U = coeff(:,1:K)
U_fingerprint = sum(U(:))
%print 31.0244
在 python/scipy 中:
pca = pca.fit(X_train)
U = pca.components_
print 'U_fingerprint', np.sum(U)
# prints 12.814
为什么 twi PCA 没有计算出相同的值?
<小时/>我所有的尝试和解决这个问题:
我发现这一点的原因是,当我重建 MNIST 图像时,Python 重建结果与原始图像更加接近。我在 python 中遇到了 0.0221556788645
的错误,而在 MATLAB 中遇到了大小为 29.07578
的错误。为了弄清楚差异来自哪里,我决定对数据集进行指纹识别(也许它们的标准化方式不同)。因此,我获得了 MNIST 数据集的两个独立副本(通过除以 255 进行标准化)并获得了指纹(将数据集中的所有数字相加):
print np.sum(x_train) # from keras
print np.sum(X_train)+np.sum(X_cv) # from TensorFlow
6.14628e+06
6146269.1585420668
它们(本质上)是相同的(一个副本来自tensorflow MNIST,另一个副本来自Keras MNIST,请注意,MNIST 训练数据集大约少了 1000 个训练集,因此您需要附加缺失的训练集)。令我惊讶的是,我的 MATLAB 数据具有相同的指纹:
data_fingerprint = sum(X_train(:))
% prints data_fingerprint = 6.1463e+06
这意味着数据集完全相同。很好,所以标准化数据不是问题。
在我的 MATLAB 脚本中,我实际上是手动计算重建,如下所示:
U = coeff(:,1:K)
X_tilde_train = (U * U' * X_train);
train_error_PCA = (1/N_train)*norm( X_tilde_train - X_train ,'fro')^2
%train_error_PCA = 29.0759
所以我认为这可能是问题所在,因为我正在使用 python 提供的接口(interface)来计算重建,如下所示:
pca = PCA(n_components=k)
pca = pca.fit(X_train)
X_pca = pca.transform(X_train) # M_train x K
#print 'X_pca' , X_pca.shape
X_reconstruct = pca.inverse_transform(X_pca)
print 'tensorflow error: ',(1.0/X_train.shape[0])*LA.norm(X_reconstruct_tf - X_train)
print 'keras error: ',(1.0/x_train.shape[0])*LA.norm(X_reconstruct_keras - x_train)
#tensorflow error: 0.0221556788645
#keras error: 0.0212030354818
这会导致不同的误差值 0.022 与 29.07,差异令人震惊!
因此,我决定在我的 python 脚本中编写精确的重建公式:
pca = PCA(n_components=k)
pca = pca.fit(X_train)
U = pca.components_
print 'U_fingerprint', np.sum(U)
X_my_reconstruct = np.dot( U.T , np.dot(U, X_train.T) )
print 'U error: ',(1.0/X_train.shape[0])*LA.norm(X_reconstruct_tf - X_train)
# U error: 0.0221556788645
令我惊讶的是,它与我使用该接口(interface)计算的 MNIST 错误有相同的错误。因此,我得出的结论是,我并没有像我想象的那样对 PCA 产生误解。
所有这些都促使我检查主成分的实际位置,令我惊讶的是 scipy 和 MATLAB 的 PCA 值具有不同的指纹。
有人知道为什么或发生了什么事吗?
<小时/>正如 Warren 所建议的,主成分分析分量(特征向量)可能具有不同的符号。通过添加幅度中的所有组件来进行指纹打印后,我发现它们具有相同的指纹:
[coeff, ~, ~, ~, ~, mu] = pca(X_train);
K=12;
U = coeff(:,1:K)
U_fingerprint = sumabs(U(:))
% U_fingerprint = 190.8430
对于Python:
k=12
pca = PCA(n_components=k)
pca = pca.fit(X_train)
print 'U_fingerprint', np.sum(np.absolute(U))
# U_fingerprint 190.843
这意味着差异一定是由于 (pca) U 向量的符号不同造成的。我觉得这很令人惊讶,我认为这应该会产生很大的影响,我什至不认为它会产生很大的影响。我想我错了?
最佳答案
我不知道这是否是问题所在,但肯定可能是。主成分向量就像特征向量:如果将向量乘以 -1,它仍然是有效的 PCA 向量。 matlab 计算的某些向量可能具有与 python 计算的向量不同的符号。这将导致截然不同的金额。
例如,matlab文档中有这样的例子:
coeff = pca(ingredients)
coeff =
-0.0678 -0.6460 0.5673 0.5062
-0.6785 -0.0200 -0.5440 0.4933
0.0290 0.7553 0.4036 0.5156
0.7309 -0.1085 -0.4684 0.4844
我有自己的 python PCA 代码,并且使用与 matlab 中相同的输入,它会生成以下系数数组:
[[ 0.0678 0.646 -0.5673 0.5062]
[ 0.6785 0.02 0.544 0.4933]
[-0.029 -0.7553 -0.4036 0.5156]
[-0.7309 0.1085 0.4684 0.4844]]
因此,不要简单地对系数数组求和,而是尝试对系数的绝对值求和。或者,在求和之前确保所有向量具有相同的符号约定。例如,您可以通过将每一列乘以该列中第一个元素的符号(假设它们都不为零)来做到这一点。
关于matlab - 为什么 Scipy 和 MATLAB 的主成分值不一致?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/38782093/
我听说过两种数据库架构。 大师级 主从 master-master不是更适合现在的web吗,因为它就像Git一样,每个单元都有整套数据,如果一个宕机也无所谓。 主从让我想起了 SVN(我不喜欢它),你
我们当前将 MySQL 配置为支持故障转移:Site1 Site2。当它们被设置为主/主时。在给定时间点,应用程序服务器仅主动写入一个站点。我们想要设置一个新的故障转移站点。然后我们将拥有 Site
我听说过两种数据库架构。 大师-大师 主从 master-master 不是更适合当今的网络吗,因为它就像 Git,每个单元都有整套数据,如果其中一个发生故障,也没关系。 主从让我想起 SVN(我不喜
我正在创建一个标记为类别的表,其中主类别(父列)包含 0,子类别包含父类别的 ID。我听说这叫引用。我的问题:这张表的结构正确吗?或者是否有更好的方法,例如实现遍历树或类似方法? CREATE TAB
我正在阅读一份关于 C++ 与 C 的文档。该文档说与 C 相比,C++ 编写得非常紧凑。一个例子是,C 允许 main() 函数类型为 void。另一方面,C++ 不允许这样做,他给出了标准中的以下
C main函数和Java main函数有什么区别? int main( int argc, const char* argv[] ) 对比 public static void main(Strin
我一直摸不着头脑,但运气不好。设计器有一个包含 3 栏的站点、两个侧边栏和一个主要内容区域。 专为桌面设计,左栏、主要内容、右栏。但是,在较小的设备上,我们希望首先堆叠主要内容。 所以通常情况下,你可
我一直在阅读有关 Jenkins 主/从配置的信息,但我仍然有一些问题: 是不是真的没有像 Jenkins 主站那样安装和启动从站 Jenkins?我假设我会以相同的方式安装一个主 Jenkins 和
据我了解,Viemodel中MVVM背后的概念包括业务逻辑和/或诸如暴露于 View 的数据的主/明细关系之类的事物 因此,正如我发现的那样,有很多ORM生成器,例如模型的telerik a.o以及另
我们有一个群集,其中包含3个主分区,每个主分区有2个副本。主/副本分片的总文档数相同;但是,对于同一查询/文档,我们得到3个不同的分数。当我们将preference = primary添加为查询参数时
我有一个非常大/旧/长时间运行的项目,它使用相对于启动目录的路径访问文件资源(即应用程序仅在从特定目录启动时才工作)。当我需要调试程序时,我可以从 eclipse 启动它并使用“运行配置”->->“工
谁能向我解释一下为什么我在这段代码上遇到段错误?我一直试图弄清楚这一点,但在各种搜索中却一无所获。当我运行代码而不调用 main(argc, argv) 时,它会运行。 Slave 仅将 argv 中
使用 xcode 中的默认项目作为主从应用程序,如果我在折叠委托(delegate)中放置 print 调试语句,当我旋转设备时它似乎永远不会被触发(事实上我永远无法触发它)。 我编辑的代码位于 Ap
是否有任何产品可以使 mysql 主/从故障转移过程更容易?一些可以自动发生的事情,而不是手动修复它。 最佳答案 [...稍后...;) 你所说的“更容易”是什么?MySQL 有很多解决方案: MyS
我有两个 mysql 数据库。我想做主/主复制。 复制以一种方式进行。然而,反过来说却不然。该错误表明它无法与用户“test@IPADDRESS”连接。 如何将用户名更改为 repl?从未进行过测试,
我正在尝试在 MySQL 中运行以下查询: GRANT REPLICATION SLAVE ON *.* TO 'replication'@’10.141.2.%’ IDENTIFIED BY ‘sl
我正在尝试使用 Android 提供的主/详细流程模板创建一个应用程序,并且我正在尝试将多个操作栏菜单项添加到操作栏的主要部分和详细信息部分。这就是我要实现的目标: (来源:softwarecrew.
我正在寻找一个跨平台的 C++ master/worker 库或工作队列库。一般的想法是我的应用程序将创建某种任务或工作对象,将它们传递给工作主机或工作队列,这将依次在单独的线程或进程中执行工作。为了
我似乎看到很多人在他们的 MySQL 模式中任意分配大尺寸的主/外键字段,例如 INT(11) 甚至 WordPress 使用的 BIGINT(20)。 如果我错了,请纠正我,但即使是 INT(4)
如果我有一个可以与多个键相关联的用户,正确的表设置应该是: 一个表有两列,例如: UserName | Key 没有主键且用户可以有多行,或者: 具有匹配标识符的两个表 Table 1 Us
我是一名优秀的程序员,十分优秀!