python - 用于交叉列列表的一致 ColumnTransformer-6ren

python - 用于交叉列列表的一致 ColumnTransformer

转载作者：行者123 更新时间：2023-12-04 15:25:59

26

4

我想用sklearn.compose.ColumnTransformer始终如一(不是并行的，因此，第二个转换器应该只在第一个转换器之后执行)以这种方式交叉列列表:

log_transformer = p.FunctionTransformer(lambda x: np.log(x))
df = pd.DataFrame({'a': [1,2, np.NaN, 4], 'b': [1,np.NaN, 3, 4], 'c': [1 ,2, 3, 4]})
compose.ColumnTransformer(n_jobs=1,
                         transformers=[
                             ('num', impute.SimpleImputer() , ['a', 'b']),
                             ('log', log_transformer, ['b', 'c']),
                             ('scale', p.StandardScaler(), ['a', 'b', 'c'])
                         ]).fit_transform(df)

所以，我想用 SimpleImputer为 'a' , 'b' ，然后 log为 'b' , 'c' ，然后 StandardScaler为 'a' , 'b' , 'c' .

但:

我得到 (4, 7) 的数组形状。

我仍然得到Nan在 a和 b列。

那么，我该如何使用 ColumnTransformer对于不同的列以 Pipeline 的方式?

更新:

pipe_1 = pipeline.Pipeline(steps=[
    ('imp', impute.SimpleImputer(strategy='constant', fill_value=42)),
])

pipe_2 = pipeline.Pipeline(steps=[
    ('imp', impute.SimpleImputer(strategy='constant', fill_value=24)),
])

pipe_3 = pipeline.Pipeline(steps=[
    ('scl', p.StandardScaler()),
])

# in the real situation I don't know exactly what cols these arrays contain, so they are not static: 
cols_1 = ['a']
cols_2 = ['b']
cols_3 = ['a', 'b', 'c']

proc = compose.ColumnTransformer(remainder='passthrough', transformers=[
    ('1', pipe_1, cols_1),
    ('2', pipe_2, cols_2),
    ('3', pipe_3, cols_3),
])
proc.fit_transform(df).T

输出:

array([[ 1.        ,  2.        , 42.        ,  4.        ],
       [ 1.        , 24.        ,  3.        ,  4.        ],
       [-1.06904497, -0.26726124,         nan,  1.33630621],
       [-1.33630621,         nan,  0.26726124,  1.06904497],
       [-1.34164079, -0.4472136 ,  0.4472136 ,  1.34164079]])

我明白为什么我有 cols 重复， nans而不是缩放值，但是当 cols 不是静态的时，我该如何以正确的方式解决这个问题？

UPD2:

当列更改其顺序时可能会出现问题。所以，我想用 FunctionTransformer对于列选择:

def select_col(X, cols=None):
    return X[cols]

ct1 = compose.make_column_transformer(
    (p.OneHotEncoder(), p.FunctionTransformer(select_col, kw_args=dict(cols=['a', 'b']))),
    remainder='passthrough'
)

ct1.fit(df)

但是得到这个输出:

ValueError: No valid specification of the columns. Only a scalar, list or slice of all integers or all strings, or boolean mask is allowed

我该如何解决？

最佳答案

ColumnTransformer的预期用途不同的变压器是并行应用的，而不是顺序应用的。为了实现您想要的结果，想到了三种方法:
第一种方法:

pipe_a = Pipeline(steps=[('imp', SimpleImputer()),
                         ('scale', StandardScaler())])
pipe_b = Pipeline(steps=[('imp', SimpleImputer()),
                         ('log', log_transformer),
                         ('scale', StandardScaler())])
pipe_c = Pipeline(steps=[('log', log_transformer),
                         ('scale', StandardScaler())])
proc = ColumnTransformer(transformers=[
    ('a', pipe_a, ['a']),
    ('b', pipe_b, ['b']),
    ('c', pipe_c, ['c'])]
)

这第二个实际上不起作用 ，因为 ColumnTransformer将重新排列列并忘记名称*，以便后面的列将失败或应用于错误的列。当 sklearn 最终确定如何传递数据帧或特征名称时，这可能会被挽救，或者您现在可以针对您的特定用例对其进行调整。 (* ColumnTransformer 已经有 get_feature_names ，但通过管道传递的实际数据没有该信息。)

imp_tfm = ColumnTransformer(
    transformers=[('num', impute.SimpleImputer() , ['a', 'b'])],
    remainder='passthrough'
    )
log_tfm = ColumnTransformer(
    transformers=[('log', log_transformer, ['b', 'c'])],
    remainder='passthrough'
    )
scl_tfm = ColumnTransformer(
    transformers=[('scale', StandardScaler(), ['a', 'b', 'c'])
    )
proc = Pipeline(steps=[
    ('imp', imp_tfm),
    ('log', log_tfm),
    ('scale', scl_tfm)]
)

第三，可能有办法使用 Pipeline切片功能有一个“主”管道，你可以为每个功能削减它......这主要像第一种方法一样工作，在较大管道的情况下可能会节省一些编码，但似乎有点hacky。例如，在这里您可以:

pipe_a = clone(pipe_b)[1:]
pipe_c = clone(pipe_b)
pipe_c.steps[1] = ('nolog', 'passthrough')

(如果不克隆或以其他方式深度复制 pipe_b ，最后一行将更改 pipe_c 和 pipe_b 。切片机制返回一个副本，因此 pipe_a 并不严格需要被克隆，但我已经让它感觉更安全。不幸的是你不能提供一个不连续的切片，所以 pipe_c = pipe_b[0,2] 不起作用，但你可以像我上面所做的那样将单个切片设置为 "passthrough" 以禁用它们。)

关于python - 用于交叉列列表的一致 ColumnTransformer，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/62225230/

26

4

0

文章推荐： ruby-on-rails - 减少cancan中的ability.rb负载

文章推荐： docusignapi - 调用函数 getDocument 时无法下载文档

gcc - 如何使用单个 GCC(交叉)编译器(交叉)编译为 ARM 硬浮点和软浮点 (softfp)？
我想使用单个(交叉)编译器来编译不同 ARM 调用约定的代码:因为我总是想使用浮点和 NEON 指令，所以我只想选择硬浮点调用约定或软浮点(softfp)调用约定。我的编译器默认为硬浮点，但它支持我
Java共享(交叉)依赖管理
假设我正在构建一个依赖于两个库的 java 应用程序:A 和 B。A 和 B 都依赖于库 C。管理 A 和 B 使用相同版本的最佳方法是什么所以他们不冲突？我正在使用 Gradle。最佳答案从 G
交叉(错误符号)图像下的android按钮文本
我想在按钮的文本上添加图像。如果我将图像添加为按钮的背景，它就会添加到文本下方。预期结果作为图像添加。请帮忙更新:我需要以编程方式执行此操作。最佳答案在 XML 中， * 在代码中
css - 如何制作汉堡菜单的动画 - 交叉
我已经开始使用 CSS3 制作动画了。我尝试创建一个动画汉堡菜单，但结果有点难看。顶部和底部的条向右平移一点。所以旋转动画不是很流畅和正确。这是结果 => 这是我的代码: /* HTML */
python - 如何使用opencv或python检测2条相交(交叉)的曲线？
给定一个具有2条相交曲线的图像，如下图所示，我如何使用opencv或python检测和区分2条曲线？ (所以我需要2条单独的曲线) 最佳答案您可以扫描每一列，并从连接的零件中识别出簇。伪算法: l
gcc - 交叉 mingw 编译因未知伪操作而失败
我正在尝试在 redhat 集群(x86_64 主机)上设置 cross-mingw。我没有 root 访问权限，并且可用的 mingw 二进制文件不起作用(坏 glibc 版本等)。我正在阅读本教程
java - JavaFX 中的图像碰撞/交叉
我正在尝试在javaFX中开发一个游戏，当两个图像相交时，分数将被更新，并且障碍物将不可见。但不幸的是，在游戏中分数不断更新。我想我无法在游戏中正确地使图像不可见。以下是相关类的完整代码: pac
css - 固定位置展开并从右侧主 div 交叉
pikastar dot com 是网站，当向下滚动它然后在导航菜单展开固定位置时它 > 将穿过主 div。我该如何修复它。 #topNav.sticky { box-shadow: 0 10
c++ - 交叉 g++ 编译器链接器错误
我正在使用 Eclipse为 ARM 处理器交叉编译 g++ 项目。我在 Windows 环境中使用 yagarto 工具链。我对 C 项目没有问题，但是对于 C++，我一直收到错误: libc.a(
ruby - 如何从两个哈希数组中获取联合/交叉/差异并忽略一些键
我想从两个哈希数组中获取并集/交集/差集，例如: array1 = [{:name =>'Guy1', :age => 45},{:name =>'Guy2', :age => 45}] array2
Grails - 交叉 Controller 代码，在每个请求上执行
有没有办法在调用任何 Controller 操作之前执行一些代码？我需要根据 get 参数的值设置 session 变量，而不考虑调用哪个 Controller 。当然，一旦这个处理完成，请求需要
python - 交叉 3D 网格 python
我刚开始使用 3D 网格，面向用于有限元分析。我想在立方体状矩阵中模拟 Material 的夹杂物(任何形状，但主要对球体和椭圆体感兴趣)。这些夹杂物不应彼此重合。所以我想为python使用某种包，
sharedpreferences - Xamarin Forms Sharedpreferences 交叉
我想知道以跨平台方式操作应用程序设置的最佳解决方案是什么。在 iOS 中，我们可以在设置屏幕中更改应用程序外部的设置，但在 windows phone 和 android 中我们没有。所以，我的想
javascript - knockout 交叉 View 模型
var barcodeNum = ko.observable(""); VelocityMeetings.scan = function (params) { var errorMessage = k
r - 将(交叉)表转换为 ListView
这个问题在这里已经有了答案: Transforming data.frame in R (2 个答案) 关闭10 年前。过去我问过一个关于如何create cross tables from a
javascript - Angularjs - 交叉 Controller 工厂更新
我有两个共享同一个工厂的 Controller 。其中一个 Controller 正在更新工厂变量。其他人应该注意该变化并稍后显示。我是这样尝试的: http://plnkr.co/edit/q1N
mysql - SQL - 交叉 'Crossed' 表
标题不好，但这是我发现的将我的问题与简单的表格交叉区分开来的方式，因为我之前的研究总是让我接触到这类主题。我有几个表 - 为了简化起见，我们只用 3 个表来命名它们:A、B、C。我想将它们全部放在一
mysql - SELECT JOIN 与条件 (OR) 交叉
我需要做这样的事情(在 MySQL 中)，我使用 UNION 的尝试直到现在才奏效。理论上: SELECT * FROM tableA A JOIN tableB B ON A.tableAId =
c++ - SDL 交叉 header 渲染
注意:使用SDL 2.0，Cross header class问题我在类之间进行交叉引用，主要是我的类初始化渲染器和我的纹理类引用渲染初始化。现在，我已经能够运行该程序，直到我开始放入纹理类，代码也
javascript - 检查数组中匹配字母的算法(之前，之后，交叉)
我有一个这样的字母数组 var letters = ["Y", "X", "A", "Y", "O", "H", "A", "O", "O"]; 我创建了一个循环来

首页

博学

6Ren·AI

商城

python - 用于交叉列列表的一致 ColumnTransformer