python - 如何加速基于仅生成结果(右侧)是数据集的一个元素的关联规则的 Apriori 框架？-6ren

python - 如何加速基于仅生成结果(右侧)是数据集的一个元素的关联规则的 Apriori 框架？

转载作者：太空宇宙更新时间：2023-11-03 14:50:16

32

4

我有一个包含 600 000 行和 15 列的 csv 文件 "Col1, Col2 ... COl15"。我想生成关联规则，其中只有右侧只有来自 col15 的值。我正在使用 here 中的先验实现

它以这种方式计算每个项目集的 minSupport :

oneCSet = returnItemsWithMinSupport(itemSet,
                                        transactionList,
                                        minSupport,
                                        freqSet)
    print "reached line 80"
    currentLSet = oneCSet
    k = 2
    while(currentLSet != set([])):
        print k
        largeSet[k-1] = currentLSet
        currentLSet = joinSet(currentLSet, k)
        currentCSet = returnItemsWithMinSupport(currentLSet,
                                                transactionList,
                                                minSupport,
                                                freqSet)
        currentLSet = currentCSet
        k = k + 1

def returnItemsWithMinSupport(itemSet, transactionList, minSupport, freqSet):
        """calculates the support for items in the itemSet and returns a subset
       of the itemSet each of whose elements satisfies the minimum support"""
        _itemSet = set()
        localSet = defaultdict(int)
        #print itemSet

        for item in itemSet:
            #print "I am here", list(item)


            for transaction in transactionList:
                if item.issubset(transaction):
                    freqSet[item] += 1
                    localSet[item] += 1
        print "Done half"
        for item, count in localSet.items():
            support = float(count)/len(transactionList)

            if support >= minSupport:
                _itemSet.add(item)

        return _itemSet

但是对于我拥有的许多行，这会花费很多时间，因为我希望 RHS 被限制为仅具有来自特定列(Col15)的值，我可以通过某种方式减少频繁项集？另一种方法是在最后过滤规则，但它具有相同的时间复杂度。或者是否有其他一些实现/库可以帮助我加快速度？

最佳答案

根据第 15 列中的值拆分您的数据集，这将是您右侧的 RHS。因此，如果您在该列中有 5 个不同的值，那么您现在将获得 5 个数据集。删除每一个的最后一列，它现在是常量。
通过 Apriori 在每个子集上仅计算其他列上的频繁项集(不是关联规则)(更快!)。但是您仍然需要比您链接的随机 github 版本更好的实现。它只需要 FIM，不需要规则!
将带有分区键的频繁项集组合成关联规则(FIS -> RHS)，并像关联规则一样使用您的首选指标进行评估。

这要快得多，因为它不会生成跨越多个 col15 键的频繁项集。在每个分区内，所有剩余数据都与您的目标相关。此外，它还适用于未修改 Apriori FIM 生成。

关于python - 如何加速基于仅生成结果(右侧)是数据集的一个元素的关联规则的 Apriori 框架？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/46321403/

32

4

0

文章推荐： c# - Lambda 解释和它是什么以及一个很好的例子

文章推荐： php - PayPal nvp SetExpressCheckout 在本地开发机器上失败

文章推荐： c# - 如何在同一网址上使用 [FromBody] 和 [FromForm]？

文章推荐： ssl - 使用 let's encrypt 在 lamp web 服务器 ec2 aws 上配置 https

r - Apriori 生成的编写规则
我正在处理一些大型交易数据。我一直在使用 read.transactions 和 apriori(arules 包的一部分)来挖掘频繁的项目配对。我的问题是:生成规则时(使用“inspect()”)
dataset - Apriori 算法的超市数据集
'我必须开发一款供“ future 商店”超市业务分析师使用的软件，该软件对超市销售交易的给定过渡数据执行关联规则挖掘，并通过准备 Combo 来准备折扣策略。该软件利用数据挖掘算法，即 Aprior
python - Apriori 算法即使对于少量数据也能显示大量结果
我正在尝试先验算法，它花费的时间比预期的时间长，这是代码。 import pandas as pd dataset = pd.read_csv("data.csv", header=None) tra
java - Apriori 算法给出内存位置
我的应用程序需要通过Apriori 算法获取关联。为了获得结果，我使用 Weka 依赖项。虽然我想获得关联，但它会打印内存位置。我也附上了输出。谢谢。这是我的代码: public class Ap
algorithm - Apriori 算法运行时间
1994 年引入的基本 Apriori 算法的时间复杂度是多少？如果可能，请引用引用论文/文章来支持响应。谢谢。最佳答案 Markus England 的这篇论文详分割析了 Apriori 的复杂性
algorithm - Apriori 算法中的字典顺序
我使用 Apriori 算法有一段时间了，我问我有关频繁项集候选生成的步骤。如果我想将两个频繁的 3 项集连接到一个(候选)4 项集，则连接项集中必须有 2 个相同的项和另一个不同的项。比如我可以
algorithm - Apriori 的最小置信度和最小支持度
Apriori algorithm 的最小置信度和最小支持值的合适值是多少？？你怎么能调整它们？它们是固定值，还是会在算法运行期间发生变化？如果您以前使用过此算法，您使用的是什么值？最佳答案我建
database - Apriori 算法的数据集
我打算开发一个用于市场购物篮分析的应用程序(使用先验算法)，我发现了一个包含超过 90,000 条交易记录的数据集。问题是这个数据集中没有项目的名称，只包含项目的条形码。我刚刚开始这个项目并研究先
Scala/Spark Apriori 实现速度极慢
我们正在尝试实现 Apriori algorithm在 Scala 中使用 Spark(您不需要知道回答这个问题的算法)。计算Apriori算法项集的函数是freq() .代码是正确的，但每次迭代后
python - 元组是另一个元组的子集 - Apriori 算法
我正在尝试实现先验算法。在最后步骤之一中，我从产品列表生成了两个元组数组。 >>> arr1 = array([(2421,), (35682,), (30690,), ..., (18622,),
hadoop - Apriori 和关联规则与 Hadoop
是否可以使用 map-reduce 创建 Apriori 应用程序？我刚开始，但不清楚如何根据之前的运行创建下一个候选集。有没有人有这方面的经验？最佳答案看看 Apache Mahout 可能会有
data-mining - 如何在 Apriori 算法中找到最小支持度
当给出支持度和置信度的百分比值时，如何在 Apriori 算法中找到最小支持度。例如，当支持度和置信度分别为 60% 和 60% 时，最小支持度是多少？最佳答案支持度和置信度是衡量规则有趣程度的度
rapidminer - Rapidminer 中的 W-apriori
我需要在 Rapidminer 中使用先验算法创建关联规则，但我似乎无法让它工作。我正在使用 5.3.1 weka 扩展。我已经使用内置的 FP-Growth 和 Create Associatio
评估 elat 和 apriori 项集时删除具有空值的行
我正在 R 中工作，并且有一个如下所示的数据集 [1, 2, 3, ""] [1, 2, "", 4] [1,"", "", ""] 我正在将这些值读入事务对象，然后将它们传递给 eclat 或 ap
python - Python 中的 Apriori 结果
我正在尝试在 python 中运行先验算法。我的具体问题是，当我使用 apriori 函数时，我将 min_length 指定为 2。但是，当我打印规则时，我得到的规则仅包含 1 项。我想知道为什么
r - 如何从 apriori R(关联规则)中提取信息
我正在 R 中进行一些关联规则挖掘并想提取我的结果以便我可以构建报告我的结果是这样的: > inspect(rules[1:3]) lhs rhs
r - 如何从 R 中的 apriori 调用中获取常见项集的频率？
问题: apriori arules的功能包从输入事务中推断关联规则，并报告每条规则的支持、置信度和提升。关联规则源自频繁项集。我想获取输入事务中最频繁的项集。具体来说，我想获得具有给定最小支持的所有
python - 使用 pandas 训练 apriori 数据集不显示结果
我已经根据先验算法创建了数据框和列表，我也创建了规则。但结果没有出来，也没有显示任何错误。下面是代码: df = pd.read_csv('itemlist.csv', header = None)
java - Weka Apriori 算法快速 vector 输出内存位置值
我使用weka依赖项通过Apriori算法获取关联规则。下面是我的代码。当我获取值时，快速 vector 显示内存位置值。如果有人能给我一个答案来获取关联规则，我将非常感激。 package com.
python - 如何加速基于仅生成结果(右侧)是数据集的一个元素的关联规则的 Apriori 框架？
我有一个包含 600 000 行和 15 列的 csv 文件 "Col1, Col2 ... COl15"。我想生成关联规则，其中只有右侧只有来自 col15 的值。我正在使用 here 中的先验实现

首页

博学

6Ren·AI

商城

python - 如何加速基于仅生成结果(右侧)是数据集的一个元素的关联规则的 Apriori 框架？