tensorflow - Tensorflow 的 K-Means

tensorflow - Tensorflow 的 K-Means - 图断开错误

转载作者：行者123 更新时间：2023-12-05 06:47:32

26

4

我正在尝试编写一个运行 KMeans 的函数在数据集上并输出聚类质心。我的目标是在自定义中使用它 keras层，所以我使用 TensorFlow以张量作为输入数据集的 KMeans 实现。

然而，我的问题是，即使作为独立函数，我也无法使其正常工作。问题来自于 KMeans接受提供小批量而不是普通张量的生成器函数，但是当我使用闭包来执行此操作时，我得到一个 graph disconnected错误:

import tensorflow as tf                                           # version: 2.4.1
from tensorflow.compat.v1.estimator.experimental import KMeans

@tf.function
def KMeansCentroids(inputs, num_clusters, steps, use_mini_batch=False):
    # `inputs` is a 2D tensor

    def input_fn():
        # Each one of the lines below results in the same "Graph Disconnected" error. Tuples don't really needed but just to be consistent with the documentation
        return (inputs, None)
        return (tf.data.Dataset.from_tensor_slices(inputs), None)
        return (tf.convert_to_tensor(inputs), None)
            
    kmeans = KMeans(
            num_clusters=num_clusters,
            use_mini_batch=use_mini_batch)
        
    kmeans.train(input_fn, steps=steps)     # This is where the error happens
    return kmeans.cluster_centers()

>>> x = tf.random.uniform((100, 2))
>>> c = KMeansCentroids(x, 5, 10)

准确的错误是:

ValueError:Tensor("strided_slice:0", shape=(), dtype=int32)must be from the same graph asTensor("Equal:0", shape=(), dtype=bool)(graphs are FuncGraph(name=KMeansCentroids, id=..) and <tensorflow.python.framework.ops.Graph object at ...>).

如果我使用 numpy数据集并在函数内部转换为张量，代码就可以正常工作。
另外，制作 input_fn()直接返回tf.random.uniform((100, 2)) (忽略输入参数)，将再次工作。这就是为什么我猜测 tensorflow 不支持闭包，因为它需要在开始时构建计算图。
但我不知道如何解决这个问题。可能是由于 KMeans 是 compat.v1.experimental 而导致的版本错误模块？

请注意 documentation of KMeans input_fn() 的状态:

The function should construct and return one of the following:

A tf.data.Dataset object: Outputs of Dataset object must be a tuple (features, labels) with same constraints as below.

A tuple (features, labels): Where features is a tf.Tensor or a dictionary of string feature name to Tensor and labels is a Tensor or a dictionary of string label name to Tensor. Both features and labels are consumed by model_fn. They should satisfy the expectation of model_fn from inputs.

最佳答案

您面临的问题更多是关于在创建的图形之外调用张量。基本上，当您调用 .train 函数时，将创建一个新图，其中包含 input_fn 中定义的图和 model_fn 中定义的图。

kmeans.train(input_fn, steps=steps)

并且，之后所有来自这些函数之外的张量都将被视为局外人，不会成为这个新图表的一部分。这就是为什么您在尝试使用外部张量时遇到 graph disconnected 错误。要解决此问题，您需要在这些图中创建必要的张量。

import tensorflow as tf                                        
from tensorflow.compat.v1.estimator.experimental import KMeans

@tf.function
def KMeansCentroids(num_clusters, steps, use_mini_batch=False):
    def input_fn(batch_size):
        pinputs = tf.random.uniform((100, 2))
        dataset = tf.data.Dataset.from_tensor_slices((pinputs))
        dataset = dataset.shuffle(1000).repeat()
        return dataset.batch(batch_size)

    kmeans = KMeans(
            num_clusters=num_clusters,
            use_mini_batch=use_mini_batch)
    
    kmeans.train(input_fn = lambda: input_fn(5), 
                 steps=steps)     
    
    return kmeans.cluster_centers()

c = KMeansCentroids(5, 10)

这里有更多信息供阅读，1 .仅供引用，我用几个版本的 tf > 2 测试了您的代码，我认为这与版本错误或其他问题无关。

在这里为 future 的读者重新提及。在 Keras 层中使用 KMeans 的替代方法:

关于tensorflow - Tensorflow 的 K-Means - 图断开错误，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/67088567/

26

4

0

文章推荐： sql - 每月随机选择 1-3 个值

文章推荐： reactjs - React UseEffect setState 不会重新渲染

文章推荐： firebase - 在 React native 中检查用户是否在线

文章推荐： python - NURBS 曲面到水密 STL

k-means - 如何使用TensorFlow实现k-means？
入门教程使用内置的梯度下降优化器非常有意义。但是，k均值不仅可以插入梯度下降中。似乎我不得不编写自己的优化程序，但是鉴于TensorFlow原语，我不确定如何执行此操作。我应该采取什么方法？最佳答
algorithm - K-Means++ 的流程是什么，我想知道 K-Mean 和 K-Means++ 之间的确切区别？
我想知道 K-Mean 和 K-Means++ 算法之间的区别。如果有人了解 K-Means++ 算法的流程，您能举例说明一下吗？虽然，我了解 K-Mean 算法，但发现如何实现 K-Means++
Python- Pandas : difference between monthly mean of day-mean values and monthly mean per se
我有不同的数据帧均值计算值。通常，我想它们应该是一样的。或者有什么区别: daily1 = daily_above_zero['2011-2'].mean() daily1 Out[181]: P_S
r - geom_smooth : what is its meaning (why is it lower than the mean? )
我有关于人们每周上类旅行次数的数据。随着行程的距离，我对两个变量之间的关系感兴趣。 (预计频率会随着距离的增加而下降，本质上是一种负相关。)Cor.test 支持这个假设:-0.08993444，p
k-means - 证明 k-means 总是收敛的？
我了解 k-means 算法步骤。但是我不确定该算法是否会始终收敛？或者观察总是可以从一个质心切换到另一个质心？最佳答案该算法总是收敛(按定义)但不一定是全局最优 . 算法可能会从质心切换到质
r - mean(rnorm(100,mean=0,sd=1)) 不是 0；并且 sd(rnorm(100,mean=0,sd=1)) 不是 1。为什么？
(添加了可重现的示例。) 我对 rnorm 函数有点困惑。我期待 mean(rnorm(100,mean=0,sd=1))为0；和 sd(rnorm(100,mean=0,sd=1))为 1。但给出
r - 为什么 mean() 和 mean(aggregate()) 返回不同的结果？
我想计算一个平均值。这是带有示例数据的代码: # sample data Nr <- c(1, 2, 3, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17,
python - pandas number >mean() 或
我有一个像这样的数据框: Id F M R 7 1 286 907 12 1 286 907 17 1 186 1271 21 1 296 905 30 1

algorithm - K-means 和顺序 K-means 的结果相同吗？
如果我们将 K-means 和顺序 K-means 方法应用于具有相同初始设置的相同数据集，我们会得到相同的结果吗？解释你的理由。个人认为答案是否定的，顺序K-means得到的结果取决于数据点的呈现
javascript - MEAN.js 和 MEAN.io 的区别
我想使用 MEAN JavaScript 堆栈，但我注意到有两个不同的堆栈，它们有自己的网站和安装方法:mean.js 和 mean.io。所以我开始问自己这个问题:“我用哪一个？”。所以为了回答这
mean-stack - 在 cloud9 上安装 MEAN 堆栈的最佳方法是什么？遵循手册时的错误消息
似乎有多种方法可以安装 Mean Stack (mean.io) 的所有模块。但是，在 c9.io 中执行此操作的最佳方法是什么？我一直在尝试很多事情，但我似乎并没有全部掌握。 c9.io 有专门的
mean.io - 使用 Mean.io - 如何禁用 JS 文件聚合
在开发过程中，我希望加载原始(未聚合).js 文件。 Mean.io 文档说: All javascript within public is automatically aggregated wit
mean-stack - 将角度 Material 添加到 mean.io 应用程序
我正在尝试添加 angular-material到 mean.io应用。在我的自定义包中，我使用 bower 来安装 angular-material，现在我有一个 .../public/asset
python - df.mean() 和 df ['column' ].mean() 结果的差异
我只运行以下三行: df = pd.read_hdf('data.h5') print(df.mean()) print(df['derived_3'].mean()) 第一个 print 列出了每一
algorithm - 我们应该使用 k-means++ 而不是 k-means 吗？
k-means++算法有助于原始k-means算法的以下两点: 原始的 k-means 算法在输入大小的 super 多项式的最坏情况下运行时间，而 k-means++ 声称是 O(log k)。与
apachebench - Apache 工作台 : Mean vs Mean across all concurrent requests
这两个字段有什么区别？ : 每个请求的时间(平均) 每个请求的时间(平均，跨所有并发请求) 它们每个是如何计算的？示例输出: Time per request: 3953.446 [ms
mean-stack - MEAN 堆栈的 IDE [ MongoDb,Express,AngularJs,NodeJs ]
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。想改进这个问题？将问题更新为 on-topic对于堆栈溢出。 7年前关闭。 Improve this qu
cluster-analysis - "k means"和 "fuzzy c means"目标函数有什么区别？
我想看看是否可以根据它们所处理的目标函数来比较两者的性能？最佳答案顺便说一句，Fuzzy-C-Means (FCM) 聚类算法也称为Soft K-Means。目标函数实际上是相同的，唯一的区别是
python - nltk k-means 聚类或纯 python 的 k-means
虽然我看到了很多与此相关的问题，但我并没有真正得到答案，可能是因为我是使用 nltk 集群的新手。我确实需要对聚类新手进行基本解释，特别是关于 NLTK K 均值聚类的向量表示以及如何使用它。我有一个
node.js - 向 Mean.io 初学者解释 Mean.io 示例包的身份验证如何工作
我在学习mean.io来自 this tutorial video ，它显示了示例包(由 mean package mymodule 创建。它也在 docs 的“包”下进行了描述)。我想帮助了解给定的

首页

博学

6Ren·AI

商城

tensorflow - Tensorflow 的 K-Means - 图断开错误