python - sklearn.preprocessing.OneHotEncoder : using drop and handle

python - sklearn.preprocessing.OneHotEncoder : using drop and handle_unknown ='ignore'

转载作者：行者123 更新时间：2023-12-03 17:01:27

26

4

我有一些 pandas.Series – s ，下面 - 我想单热编码。我通过研究发现'b'级别对于我的预测建模任务并不重要。我可以像这样从我的分析中排除它:

import pandas as pd
from sklearn.preprocessing import OneHotEncoder

s = pd.Series(['a', 'b', 'c']).values.reshape(-1, 1)

enc = OneHotEncoder(drop=['b'], sparse=False, handle_unknown='error')
enc.fit_transform(s)
# array([[1., 0.],
#        [0., 0.],
#        [0., 1.]])
enc.get_feature_names()
# array(['x0_a', 'x0_c'], dtype=object)

但是当我去改造一个新系列时，一个包含 'b'和一个新的水平， 'd' ，我收到一个错误:

new_s = pd.Series(['a', 'b', 'c', 'd']).values.reshape(-1, 1)
enc.transform(new_s)

Traceback (most recent call last): File "", line 1, in File "/Users/user/Documents/assets/envs/data-science/venv/lib/python3.7/site-packages/sklearn/preprocessing/_encoders.py", line 390, in transform X_int, X_mask = self._transform(X, handle_unknown=self.handle_unknown) File "/Users/user/Documents/assets/envs/data-science/venv/lib/python3.7/site-packages/sklearn/preprocessing/_encoders.py", line 124, in _transform raise ValueError(msg) ValueError: Found unknown categories ['d'] in column 0 during transform

这是可以预料的，因为我设置了 handle_unknown='error'以上。但是，我想完全忽略除 ['a', 'c'] 之外的所有类。在拟合和随后的转换步骤中。我试过这个:

enc = OneHotEncoder(drop=['b'], sparse=False, handle_unknown='ignore')
enc.fit_transform(s)
enc.transform(new_s)

Traceback (most recent call last): File "", line 1, in File "/Users/user/Documents/assets/envs/data-science/venv/lib/python3.7/site-packages/sklearn/preprocessing/_encoders.py", line 371, in fit_transform self._validate_keywords() File "/Users/user/Documents/assets/envs/data-science/venv/lib/python3.7/site-packages/sklearn/preprocessing/_encoders.py", line 289, in _validate_keywords "handle_unknown must be 'error' when the drop parameter is " ValueError: handle_unknown must be 'error' when the drop parameter is specified, as both would create categories that are all zero.

scikit-learn 似乎不支持这种模式。有谁知道一个 scikit-learn-compatible 模式来完成这个任务？

最佳答案

它看起来像 sklearn.preprocessing.LabelBinarizer 可以适用于这个用例，因为它没有任何参数指定是出错还是忽略新类:

>>> import pandas as pd
>>> from sklearn.preprocessing import LabelBinarizer
>>> s = pd.Series(['a', 'b', 'c']).values.reshape(-1, 1)
>>> enc = LabelBinarizer()
>>> enc.fit_transform(s)
array([[1, 0, 0],
       [0, 1, 0],
       [0, 0, 1]])
>>> enc.classes_
array(['a', 'b', 'c'], dtype='<U1')
>>> new_s = pd.Series(['a', 'b', 'c', 'd']).values.reshape(-1, 1)
>>> enc.transform(new_s)
array([[1, 0, 0],
       [0, 1, 0],
       [0, 0, 1],
       [0, 0, 0]])

关于python - sklearn.preprocessing.OneHotEncoder : using drop and handle_unknown ='ignore' ，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/60008477/

26

4

0

文章推荐： cocoa - 如何设置NSTextView的段落属性宽度

文章推荐： ios - 编辑属性字符串时会调用哪种替换方法？

python - 如何将自己的类别添加到 OneHotEncoder
我有格式的数据，例如 ['1', '5' '6', '5', '2']，其中每个标签可以是 0-9 之间的任意数字的字符。我的数据的性质是名义上的分类，因此它是无序的，随后，我使用 scikit On
python - OneHotEncoding 蛋白质序列
我有一个下面列出的原始序列数据帧，我正在尝试使用单热编码，然后将它们存储在一个新的数据帧中，我正在尝试使用以下代码进行操作，但无法存储，因为我得到了之后输出如下: 代码: onehot_encoder
python - OneHotEncoder 对属于同一类别的多个列进行处理
我有多列由分类变量组成，这些变量的形式为 0-4 之间的整数值。但是，所有列都属于同一类别。我尝试使用 scikit learn 中的 OneHotEncoder，但它不会处理列中缺失的类别，这在我在
python - 无法将分类数据转换为数字 OneHotEncoder
我有一个简单的代码，可以将分类数据转换为 python 中的一种热编码: a,1,p b,3,r a,5,t 我尝试使用 python OneHotEncoder 转换它们: from sklearn
python - OneHotEncoded 功能在输入到分类器时导致错误
我正在尝试准备数据以输入决策树和多项朴素贝叶斯分类器。这就是我的数据的样子(pandas 数据框) Label Feat1 Feat2 Feat3 Feat4 0 1
python - OneHotEncoder 类别参数
在 sklearn 0.22 中，categorical_features 参数将被删除，因此以下代码不再可执行: import numpy as np from sklearn.preprocess
python - OneHotEncoder 只有一个特征是字符串
我希望将我仅有的一个特征转换为单独的二进制特征: df["pattern_id"] Out[202]: 0 3 1 3 ... 7440 2 7441 2 7442
Python OneHotEncoder 使用许多虚拟变量或更好的做法？
我正在构建一个神经网络，并且正准备对许多独立(分类)变量使用 OneHotEncoder。我想知道我是否正在使用虚拟变量正确地处理这个问题，或者因为我的所有变量都需要虚拟变量，所以可能有更好的方法。
python - onehotencoder 的用法
我是Python新手。我之前只有VBA代码。最近开始使用python进行数据挖掘，但使用python时遇到了问题我在使用 onehotencoder 正确转换我的类别功能时遇到问题，这是我的代码 f
python - OneHotEncoder - 仅编码一些分类变量列
假设我有一个包含以下列名称的 pandas 数据框: '年龄'(例如 33、26、51 等) '资历'(例如'初级'、'高级'等) “性别”(例如“男”、“女”) '薪水'(例如 32000、4000
python - 具有字符串分类值的 OneHotEncoder
我有以下 numpy 矩阵: M = [ ['a', 5, 0.2, ''], ['a', 2, 1.3, 'as'], ['b', 1, 2.3, 'as'], ] M =
python - 将 OneHotEncoder 用于决策树分类器中的分类特征
我是 Python 中 ML 的新手，对于如何使用分类变量实现决策树感到非常困惑，因为它们由 party 和 ctree 在中自动编码R。我想制作一棵具有两个分类独立特征和一个依赖类的决策树。我
python - 为 onehotencoder 变量创建管道不起作用
我有一个问题，我试图将转换应用于我的分类特征“国家”和我的其余数字列。我怎么能做到这一点，因为我在下面尝试: preprocess = make_column_transformer( (nu
scikit-learn - OneHotEncoder 的分类特征问题
我想对数据集中 10 个特征中的 3 个分类特征进行编码。我用 preprocessing来自 sklearn.preprocessing这样做如下: from sklearn import prep
python - 应用于空字段时出现 OneHotEncoding 错误
该代码包括将 OneHotEncoding 技术应用于 binetflow 文件的两个字段:Proto 和 State。我必须对 5 个文件执行此操作。我能够将下面的代码完美地应用到前两个代码中。当到
Python Pandas OneHotEncoder 类别
我正在阅读有关 Python 中的 One Hot Encoding 的内容，其中有一行我无法解释其含义。代码如下: ohe=preprocessing.OneHotEncoder(dtype=np.
python - 让 OneHotEncoder 管理转换步骤中看不见的值
我正在使用sklearn.preprocessing.OneHotEncoder对表单的分类数据进行编码 A=array([[1,4,1],[0,3,2]]) B=array([[1,4,7],[0,
python - 如何使用 OneHotEncoder categorical_features
我在使用 OneHotEncoder 仅编码分类列并忽略连续列时遇到问题。无论我在 categorical_features 中指定什么，编码器都会对所有列进行编码。例如: enc = preproc
python - 使用 OneHotEncoder 拆分调查数据
我有一个包含调查结果的数据框，其中有选项 A-E，并且可以选择多个选项 - 选择可以是“A”或“A;C;D”等。我将使用这些数据进行一些机器学习，并希望通过 OneHotEncoder 运行它，最终
python - 从 OneHotEncoder 获取对应的特征
在使用 OneHotEncoder 转换特征后，我尝试对数据集中的某些特征进行一些数据分析，输出显示特征 13 和特征 21 是最重要的特征，但我如何知道这些特征对应哪些特征到？最佳答案您可以使用

首页

博学

6Ren·AI

商城

python - sklearn.preprocessing.OneHotEncoder : using drop and handle_unknown ='ignore'