- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
我试图在 Python 中估算缺失值,而 sklearn
似乎没有超出平均(均值、中值或众数)估算的方法。 Orange imputation model似乎提供了一个可行的选择。但是,Orange.data.Table
似乎无法识别 np.nan
或者插补失败。
import Orange
import numpy as np
tmp = np.array([[1, 2, np.nan, 5, 8, np.nan], [40, 4, 8, 1, 0.2, 9]])
data = Orange.data.Table(tmp)
imputer = Orange.feature.imputation.ModelConstructor()
imputer.learner_continuous = Orange.classification.tree.TreeLearner(min_subset=20)
imputer = imputer(data )
impdata = imputer(data)
for i in range(0, len(tmp)):
print impdata[i]
输出是
[1.000, 2.000, 1.#QO, 5.000, 8.000, 1.#QO]
[40.000, 4.000, 8.000, 1.000, 0.200, 9.000]
知道我错过了什么吗?谢谢!
最佳答案
问题似乎是 Orange 中的缺失值表示为 ?
或 ~
。奇怪的是,Orange.data.Table(numpy.ndarray)
构造函数没有推断出 numpy.nan
应该转换为 ?
或 ~
并将它们转换为 1.#QO
。下面的自定义函数 pandas_to_orange()
解决了这个问题。
import Orange
import numpy as np
import pandas as pd
from collections import OrderedDict
# Adapted from https://github.com/biolab/orange3/issues/68
def construct_domain(df):
columns = OrderedDict(df.dtypes)
def create_variable(col):
if col[1].__str__().startswith('float'):
return Orange.feature.Continuous(col[0])
if col[1].__str__().startswith('int') and len(df[col[0]].unique()) > 50:
return Orange.feature.Continuous(col[0])
if col[1].__str__().startswith('date'):
df[col[0]] = df[col[0]].values.astype(np.str)
if col[1].__str__() == 'object':
df[col[0]] = df[col[0]].astype(type(""))
return Orange.feature.Discrete(col[0], values = df[col[0]].unique().tolist())
return Orange.data.Domain(list(map(create_variable, columns.items())))
def pandas_to_orange(df):
domain = construct_domain(df)
df[pd.isnull(df)]='?'
return Orange.data.Table(Orange.data.Domain(domain), df.values.tolist())
df = pd.DataFrame({'col1':[1, 2, np.nan, 4, 5, 6, 7, 8, 9, np.nan, 11],
'col2': [10, 20, 30, 40, 50, 60, 70, 80, 90, 100, 110.]})
tmp = pandas_to_orange(df)
for i in range(0, len(tmp)):
print tmp[i]
输出是:
[1.000, 10.000]
[2.000, 20.000]
[?, 30.000]
[4.000, 40.000]
[5.000, 50.000]
[6.000, 60.000]
[7.000, 70.000]
[8.000, 80.000]
[9.000, 90.000]
[?, 100.000]
[11.000, 110.000]
我想对缺失值进行正确编码的原因是我可以使用 Orange 插补库。然而,库中的预测树模型似乎只做简单的均值插补。具体来说,它为所有缺失值归因相同的值。
imputer = Orange.feature.imputation.ModelConstructor()
imputer.learner_continuous = Orange.classification.tree.TreeLearner(min_subset=20)
imputer = imputer(tmp )
impdata = imputer(tmp)
for i in range(0, len(tmp)):
print impdata[i]
这是输出:
[1.000, 10.000]
[2.000, 20.000]
[5.889, 30.000]
[4.000, 40.000]
[5.000, 50.000]
[6.000, 60.000]
[7.000, 70.000]
[8.000, 80.000]
[9.000, 90.000]
[5.889, 100.000]
[11.000, 110.000]
我一直在寻找适合模型(例如 kNN)的完整案例,并使用拟合模型来预测缺失案例。 fancyimpute
(a Python 3 package)执行此操作但在我的 300K+ 输入上抛出 MemoryError
。
from fancyimpute import KNN
df = pd.DataFrame({'col1':[1, 2, np.nan, 4, 5, 6, 7, 8, 9, np.nan, 11],
'col2': [10, 20, 30, 40, 50, 60, 70, 80, 90, 100, 110.]})
X_filled_knn = KNN(k=3).complete(df)
X_filled_knn
输出是:
array([[ 1. , 10. ],
[ 2. , 20. ],
[ 2.77777784, 30. ],
[ 4. , 40. ],
[ 5. , 50. ],
[ 6. , 60. ],
[ 7. , 70. ],
[ 8. , 80. ],
[ 9. , 90. ],
[ 9.77777798, 100. ],
[ 11. , 110. ]])
我可能会找到解决方法或将数据集拆分成 block (不太理想)。
关于python - 使用预测模型估算缺失值,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/39320135/
我编写了一个 Android 应用程序,它使用 Azure 来执行用户通过 Google、Twitter 和 Facebook 的登录;它使用 Microsoft.WindowsAzure.Mobil
我想将 AdomdClient 引用添加到 C# 项目,但它不在引用列表中。客户端列在程序集文件夹 C:\Windows\Assembly 中。 计算机上安装了 SQL Server 2012。 最佳
我正在学习“绘图应用程序”的教程。当我在 Firefox 上启动我的应用程序时,Firebug 告诉我“在语句之前缺少 ;” 我在第 9 行调用函数的位置。我只是不明白应该将这些“;”放在哪里. va
我想将 AdomdClient 引用添加到 C# 项目,但它不在引用列表中。客户端列在程序集文件夹 C:\Windows\Assembly 中。 计算机上安装了 SQL Server 2012。 最佳
我在 Firebug 中不断收到关于 onClick 事件的错误。 我已经尝试了 "和 ' 的各种不同组合,但无济于事。在添加 onClick 事件之前,这工作正常。 有人能发现我可能做错了什么吗?
Visual Studio 2015 告诉我找不到 WSASetSocketSecurity。 该 dll 存在并且还包括似乎没问题。 我的包括: windows.h stdio.h Wincrypt
我需要访问 eloquent 的 whereHasNot方法(此处添加: https://github.com/laravel/framework/commit/8f0cb08d8ebd157cbfe
跟随宠物物体检测的 TF 教程:https://github.com/tensorflow/models/blob/master/research/object_detection/g3doc/run
构建路径 > 添加库 > JUnit 无法添加 JUnit3 或 JUnit4 组件。 我在.log 中看到这样的消息 !MESSAGE No property tester contributes
我正在运行此脚本来查看网络上的摄像机: gst-launch udpsrc port=1234 ! "application/x-rtp, payload=127" ! rtph264depay !
我正在使用http://java.sun.com/jsp/jstl/fmt用于从 Spring 配置中设置的 Message Resource Bundle 输出消息的标签库。消息解析也可以放在 Co
我正在将 Ninject 与 MVC4 连接起来,并让它工作到尝试实际解决依赖关系的程度。但是,我收到以下异常: Method not found: 'System.Web.Http.Services
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 这个问题似乎与 help center 中定义的范围内的编程无关。 . 关闭 9 年前。 Improve
我在启动 ASP.NET MVC5 应用程序时遇到问题。到目前为止一切正常。启动应用程序时出现以下错误: Could not load file or assembly 'Microsoft.Appl
我已经使用以下方法创建了一个环境: conda create --prefix C:\Users\Dell\Dropbox\DjangoProjects\webenv python=3.6 执行后:c
我们有一个遗留的 Web 窗体应用程序,我们最近将其从网站项目转换为 Web 应用程序项目。 Web 窗体项目是解决方案的“启动”项目。 有一个 MVC 项目是对 Web 窗体项目的引用。 在 MVC
使用某种字体,我使用Java的FontLayout来确定它的上升、下降和行距。 (参见 Java 的 FontLayout 教程 here) 在我的具体案例中,我使用的是 Arial Unicode
我正在尝试在 linux 下编译 qt ffmpeg 包装器简单编码/解码示例 QTFFmpegWrapper source # Set list of required FFmpeg librari
我正在使用来自开发人员 android 页面的 SlidingTabLayout.java。在我使用 slidingTabLayout.setDistributeEvenly(true); 使 sli
我正在尝试使用 v360 filter 将 180° 鱼眼视频转换为普通/常规视频的 FFmpeg . 这是我尝试过的命令:ffmpeg -i in.mp4 -vf "v360=input=fishe
我是一名优秀的程序员,十分优秀!