python - 如何获得朴素贝叶斯中的特征重要性？-6ren

python - 如何获得朴素贝叶斯中的特征重要性？

转载作者：行者123 更新时间：2023-11-30 08:25:24

26

4

我有一个评论数据集，其类别标签为正面/负面。我正在将朴素贝叶斯应用于该评论数据集。首先，我正在转换成词袋。这里 sorted_data['Text'] 是评论，final_counts 是稀疏矩阵

count_vect = CountVectorizer() 
final_counts = count_vect.fit_transform(sorted_data['Text'].values)

我将数据分为训练数据集和测试数据集。

X_1, X_test, y_1, y_test = cross_validation.train_test_split(final_counts, labels, test_size=0.3, random_state=0)

我正在应用朴素贝叶斯算法，如下

optimal_alpha = 1
NB_optimal = BernoulliNB(alpha=optimal_aplha)

# fitting the model
NB_optimal.fit(X_tr, y_tr)

# predict the response
pred = NB_optimal.predict(X_test)

# evaluate accuracy
acc = accuracy_score(y_test, pred) * 100
print('\nThe accuracy of the NB classifier for k = %d is %f%%' % (optimal_aplha, acc))

这里 X_test 是测试数据集，其中 pred 变量告诉我们 X_test 中的向量是正类还是负类。

X_test 形状为(54626 行，82343 维)

pred 的长度为 54626

我的问题是我想获取每个向量中概率最高的单词，以便我可以通过单词了解为什么它预测为正类或负类。那么，如何得到每个向量中概率最大的单词呢？

最佳答案

您可以使用 coefs_ 或 feature_log_prob_ 属性从拟合模型中获取每个单词的重要性。例如

neg_class_prob_sorted = NB_optimal.feature_log_prob_[0, :].argsort()[::-1]
pos_class_prob_sorted = NB_optimal.feature_log_prob_[1, :].argsort()[::-1]

print(np.take(count_vect.get_feature_names(), neg_class_prob_sorted[:10]))
print(np.take(count_vect.get_feature_names(), pos_class_prob_sorted[:10]))

打印每个类(class)最有预测性的 10 个单词。

关于python - 如何获得朴素贝叶斯中的特征重要性？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/50526898/

26

4

0

文章推荐： javascript - 使用 Express 提供 react 路线

文章推荐： java - NullPointerException 是从哪里来的？

文章推荐： java - UnsatisfiedLinkError 无法加载库

从 ggpairs 中删除 *(重要性)
在 GGally::ggpair 的最新版本中，相关值用 * 显示，如下图所示。我想删除 *s 并保留相关值。我看过 ggpairs 代码，但它对我来说并不明显。 GGally::ggpairs(d
从 ggpairs 中删除 *(重要性)
在 GGally::ggpair 的最新版本中，相关值用 * 显示，如下图所示。我想删除 *s 并保留相关值。我看过 ggpairs 代码，但它对我来说并不明显。 GGally::ggpairs(d
machine-learning - 获取SVM分类中的属性权重/重要性
我正在尝试使用在 weka 库中实现的 SVM 分类来对一些数据进行分类。我的分类代码如下所示: BufferedReader reader = new BufferedReader(new File
java - Lucene 目录中文件修改日期方法的目的/重要性？
我已经为 jdbm 构建了 Lucene Directory 实现，一个嵌入式Java数据库。 Directory API 的一部分是与"file"修改日期相关的两个方法:touchFile 和 fi
python - String.strip() 重要性
我的任务是编写一个函数，将文件中单词的长度与整数进行比较，然后返回所有符合该大小的单词。我得到的答案几乎相同，除了我没有像他们那样包含 string.strip() : def get_words(d
python - XGBoost 包中的特征分数(/重要性)是如何计算的？
xgb.importance 命令返回由 f score 衡量的特征重要性图。这个f分数代表什么，它是如何计算的？输出: Graph of feature importance 最佳答案这是一个
r - R 中 Ranger 的 SHAP 重要性
有一个二元分类问题:如何获得 Ranger 模型变量的 Shap 贡献？示例数据: library(ranger) library(tidyverse) # Binary Dataset df %
java - 与其他 'server' 应用程序相比，servlet 的用途、重要性
如今 servlet 在哪里使用？我知道 servlet 是在面向请求/响应的服务器(例如支持 Java 的 Web 服务器)中运行的模块。但是现在我没有听到任何人使用 servlet。这可能是因为

首页

博学

6Ren·AI

商城

python - 如何获得朴素贝叶斯中的特征重要性？