python - Python中sklearn包中的Gaussianmixture有什么问题？-6ren

python - Python中sklearn包中的Gaussianmixture有什么问题？

转载作者：行者123 更新时间：2023-12-01 01:00:24

24

4

我正在 python 中使用 sklearn 的高斯混合(GM)来识别星团的成员。 GM用两个组件调整，其他为默认。如图所示，一颗恒星(带有红点)显然不是星团成员，但显示为成员。中间图表中聚集的红点可能是我的成员。但左上角的单个红点不应该是成员。因为距离这个中间群体还不够近。

My cluster image

我的Python代码是

import numpy as np
from numpy import array
import pandas as pd
from sklearn.mixture import GaussianMixture

import matplotlib.pyplot as plt
from matplotlib import style
import matplotlib.colors as mtcolor

style.use("seaborn-white")
clist = ["gray", "red"]
cmap = mtcolor.ListedColormap(clist)

eX = pd.read_csv("mysatrs.csv", usecols=['col1', 'col2', 'col3']).values

col0m = (eX[:,0] >= -5) & (eX[:,0] <= 5)
col1m = (eX[:,1] >= -5) & (eX[:,1] <= 5)
col2m = (eX[:,2] > 0)

X = eX[col0m & col1m & col2m]

plt.figure(figsize=(6,6))

hcgmm = GaussianMixture(n_components=2)
gmmfit = hcgmm.fit(X)
gmmprd = gmmfit.predict(X)
hcprobs = gmmfit.predict_proba(X)
hcmns = hcgmm.means_

plt.scatter(X[:,0], X[:,1], c=gmmprd, s=3, cmap=cmap)
plt.show()

GM是否应该再做一次调整？

最佳答案

TLDR:每次运行时得到的拟合都会改变，尝试几次并保留最好的一个(最低的 hcgmm.bic())。您的数据似乎具有三个维度，我猜另一个维度正在抛出问题(包括链接或绘制它会有所帮助)。

如果有人想要更长的示例，这里有一个 MWE。首先我们提取包并生成一些数据:

import numpy as np
import matplotlib.pyplot as plt
from sklearn.mixture import GaussianMixture

background = np.random.randn(50,2) * 5
cluster = np.random.randn(50,2)

plt.scatter(background[:,0], background[:,1])
plt.scatter(cluster[:,0], cluster[:,1])

这给出了类似于OP的东西:

然后我可以安装 GMM正如OP所做的那样:

gmm = GaussianMixture(n_components=2)
fit = gmm.fit(X)

并绘制结果:

plt.scatter(X[:,0], X[:,1], c=fit.predict(X))

但大多数情况下我都会感到很不舒服。但运行几次后，我得到了这个:

这表明我们可以(至少有时)恢复合理的分区。 BIC这种拟合度为 993.5，而我经常得到 >1000 的值，在视觉上看起来很糟糕。

如果我使用上述随机数据运行 fit 1000 次，我可以生成 CDF看起来像:

(x/y 轴方向错误，x 是概率，y 是 BIC 值)，这表示它将在大约 10% 的时间内恢复良好的分区。尝试其他随机抽奖表明情况有所不同，但我的成功率没有超过约 40%。

鉴于您只有几个点和组件，您可以尝试一种计算量更大的方法。我预计贝叶斯 MCMC 混合模型在这里会做得更好。

我刚刚记得 Rand index是检查分区准确性的简单方法。我们可以生成大量测试数据，对其进行拟合并通过以下操作获得 BIC 和 Rand 指数:

from sklearn.metrics import adjusted_rand_score

true_labels = (np.random.random(100) < 0.5).astype(int)
ix_a, = np.nonzero(true_labels == 0)
ix_b, = np.nonzero(true_labels == 1)

gmm = GaussianMixture(n_components=2)

def test():
    X = np.empty((len(true_labels), 2), float)
    X[ix_a,:] = np.random.randn(len(ix_a), 2) * 5
    X[ix_b,:] = np.random.randn(len(ix_b), 2)

    fit = gmm.fit(X)
    ari = adjusted_rand_score(true_labels, fit.predict(X))
    return fit.bic(X), ari

fits = np.array([test() for _ in range(1000)])

然后绘制结果分布:

这表明我们在 76% 的时间里没有得到任何有用的东西。如果我们有 1000 个数据点(即 X 有 1000 行)，那么它在大多数情况下都会恢复合理的分区。但是，如果我从“Uniform(-10, 10)”分布中绘制背景，例如与:

background = np.random.rand(500,2) * 20 - 10
cluster = np.random.randn(500,2)

它再次严重失败(ARI<0.5 ~ 99.5%)。基本上，GM 模型似乎无法很好地处理非高斯数据。

关于python - Python中sklearn包中的Gaussianmixture有什么问题？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/55847938/

24

4

0

文章推荐： numpy - numba:就地排序数组

文章推荐： jQuery 追加函数在 console.log 中给出语法错误

文章推荐： r - 在一个窗口中绘制多个 csv 文件

问题
关闭。这个问题是off-topic .它目前不接受答案。想要改进这个问题？ Update the question所以它是on-topic用于堆栈溢出。关闭 12 年前。 Improve thi
问题
我有一个动态网格，其中的数据功能需要正常工作，这样我才能逐步复制网格中的数据。假设在第 5 行中，我输入 10，则从第 6 行开始的后续行应从 11 开始读取，依此类推。如果我转到空白的第一行并输入
问题
我有一个关于我的按钮消失的问题我已经把一个图像作为我的按钮用这个函数动画 function example_animate(px) { $('#cont
php - 将现有帐户链接到 Facebook - 问题/问题
我有一个具有 Facebook 连接和经典用户名/密码登录的网站。目前，如果用户单击 facebook_connect 按钮，系统即可运行。但是，我想将现有帐户链接到 facebook，因为用户可以选
iOS map View 问题/问题
我有一个正在为 iOS 开发的应用程序，该应用程序执行以下操作加载和设置注释并启动核心定位和缩放到位置。 map 上有很多注释，从数据加载不会花很长时间，但将它们实际渲染到 map 上需要一段时间。
ruby-on-rails - Heroku，问题/问题
我被推荐使用 Heroku for Ruby on Rails 托管，到目前为止，我认为我真的会喜欢它。只是想知道是否有人可以帮助我找出问题所在。我按照那里的说明在该网站上创建应用程序，创建并提交
Android WebView setCertificate 问题 SSL 问题
我看过很多关于 SSL 错误的帖子和信息，我自己也偶然发现了一个。我正在尝试使用 GlobalSign CA BE 证书通过 Android WebView 访问网页，但出现了不可信错误。对于大多
c++ - Glew 问题， Unresolved external 问题
我想开始使用 OpenGL 3+ 和 4，但我在使用 Glew 时遇到了问题。我试图将 glew32.lib 包含在附加依赖项中，并且我已将库和 .dll 移动到主文件夹中，因此不应该有任何路径问题。
问题？
我已经盯着这两个下载页面的源代码看了一段时间，但我似乎找不到问题。我有两个下载页面，一个 javascript 可以工作，一个没有。工作:http://justupload.it/v/lfd7不是
jquery - 初级 jQuery 问题(FF/IE 问题)
我一直在使用 jQuery，只是尝试在单击链接时替换文本字段以及隐藏/显示内容项。它似乎在 IE 中工作得很好，但我似乎无法让它在 FF 中工作。我的 jQuery: $(function() {
Android ndk 问题 socket 和 std 问题
我正在尝试为 NDK 编译套接字库，但出现以下两个错误: error: 'close' was not declared in this scope 和 error: 'min' is not a m
java - Selenium 问题 : Select. deselectAll() 导致 iframe 问题
我正在使用 Selenium 浏览器自动化框架测试网站。在测试过程中，我切换到特定的框架，我们将其称为“frame_1”。后来，我在 Select 类中使用了 deselectAll() 方法。不久之
连接到 Heroku PostgreSQL 的 Python 问题 - SSL 问题
我正在尝试通过 Python 创建到 Heroku PostgreSQL 数据库的连接。我将 Windows10 与 Python 3.6.8 和 PostgreSQL 9.6 一起使用。我从“ht
python - 在 Pandas 中创建新列的 np.where() 问题(可能是 NaN 问题？)
我有一个包含 2 列的数据框，我想根据两列之间的比较创建第三列。所以逻辑是:第 1 列 val = 3，第 2 列 val = 4，因此新列值什么都没有第 1 列 val = 3，第 2 列 va
css - 如何调试 iphone 5 中的 css 问题(ui 问题)？
我想知道如何调试 iphone 5 中的 css 问题。我尝试使用 firelite 插件。但是从纵向旋转到横向时，火石占据了整个屏幕。有没有其他方法可以调试 iphone 5 中的 css 问题
CSS 问题，input[id]+label，:hover, 和 :checked 问题
所以我有点难以理解为什么这不起作用。我正在尝试替换我正在处理的示例站点上的类别复选框。我试图让它做以下事情:未选中时以一种方式出现，悬停时以另一种方式出现(选中或未选中)选中时以第三种方式出现(而不是
javascript - 1 javascript/css 问题 2 perl cgi 问题
Javascript CSS 问题: 我正在使用一个文本框来写入一个 div。我使用以下 javascript 获取文本框来执行此操作: function process_input(){
algorithm - NP 中的语言(问题)和 P 中的语言(问题)之间的多项式时间减少
你好，我很难理解 P、NP 和多项式时间缩减的主题。我试过在网上搜索它并问过我的一些 friend ，但我没有得到任何好的答案。我想问一个关于这个话题的一般性问题: 设 A,B 为 P 中的语言(或
python-3.x - 该算法(解决 leetcode 问题 650)(问题 2)的时间复杂度是多少？
你好，我一直在研究 https://leetcode.com/problems/2-keys-keyboard/并想到了这个动态规划问题。您从空白页上的“A”开始，完成后得到一个数字 n，页面上应该
ios - Xcode Server Bot 问题 : warning. 生成服务错误。问题:路径 'some/path' 的存档格式不正确
我正在使用 Cocoapods 和 KIF 在 Xcode 服务器上运行持续集成。我已经成功地为一个项目设置了它来报告每次提交。我现在正在使用第二个项目并收到错误: Bot Issue: warnin

首页

博学

6Ren·AI

商城

python - Python中sklearn包中的Gaussianmixture有什么问题？