- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
我注意到这是一个 issue on GitHub already .有没有人有将 Pandas DataFrame 转换为 Orange Table 的代码?
明确地说,我有下表。
user hotel star_rating user home_continent gender
0 1 39 4.0 1 2 female
1 1 44 3.0 1 2 female
2 2 63 4.5 2 3 female
3 2 2 2.0 2 3 female
4 3 26 4.0 3 1 male
5 3 37 5.0 3 1 male
6 3 63 4.5 3 1 male
最佳答案
Orange 包的文档没有涵盖所有细节。根据 lib_kernel.cpp
,Table._init__(Domain, numpy.ndarray)
仅适用于 int
和 float
。
他们确实应该为 pandas.DataFrames
提供 C 级接口(interface),或者至少提供 numpy.dtype("str")
支持。
更新:添加table2df
,df2table
int和float使用numpy大大提高了性能。
将这段脚本保存在你的橙色 python 脚本集合中,现在你的橙色环境中已经配备了 pandas。
用法:a_pandas_dataframe = table2df( a_orange_table )
, a_orange_table = df2table( a_pandas_dataframe )
注意:此脚本仅适用于Python 2.x,引用@DustinTang 的answer用于 Python 3.x 兼容脚本。
import pandas as pd
import numpy as np
import Orange
#### For those who are familiar with pandas
#### Correspondence:
#### value <-> Orange.data.Value
#### NaN <-> ["?", "~", "."] # Don't know, Don't care, Other
#### dtype <-> Orange.feature.Descriptor
#### category, int <-> Orange.feature.Discrete # category: > pandas 0.15
#### int, float <-> Orange.feature.Continuous # Continuous = core.FloatVariable
#### # refer to feature/__init__.py
#### str <-> Orange.feature.String
#### object <-> Orange.feature.Python
#### DataFrame.dtypes <-> Orange.data.Domain
#### DataFrame.DataFrame <-> Orange.data.Table = Orange.orange.ExampleTable
#### # You will need this if you are reading sources
def series2descriptor(d, discrete=False):
if d.dtype is np.dtype("float"):
return Orange.feature.Continuous(str(d.name))
elif d.dtype is np.dtype("int"):
return Orange.feature.Continuous(str(d.name), number_of_decimals=0)
else:
t = d.unique()
if discrete or len(t) < len(d) / 2:
t.sort()
return Orange.feature.Discrete(str(d.name), values=list(t.astype("str")))
else:
return Orange.feature.String(str(d.name))
def df2domain(df):
featurelist = [series2descriptor(df.icol(col)) for col in xrange(len(df.columns))]
return Orange.data.Domain(featurelist)
def df2table(df):
# It seems they are using native python object/lists internally for Orange.data types (?)
# And I didn't find a constructor suitable for pandas.DataFrame since it may carry
# multiple dtypes
# --> the best approximate is Orange.data.Table.__init__(domain, numpy.ndarray),
# --> but the dtype of numpy array can only be "int" and "float"
# --> * refer to src/orange/lib_kernel.cpp 3059:
# --> * if (((*vi)->varType != TValue::INTVAR) && ((*vi)->varType != TValue::FLOATVAR))
# --> Documents never mentioned >_<
# So we use numpy constructor for those int/float columns, python list constructor for other
tdomain = df2domain(df)
ttables = [series2table(df.icol(i), tdomain[i]) for i in xrange(len(df.columns))]
return Orange.data.Table(ttables)
# For performance concerns, here are my results
# dtndarray = np.random.rand(100000, 100)
# dtlist = list(dtndarray)
# tdomain = Orange.data.Domain([Orange.feature.Continuous("var" + str(i)) for i in xrange(100)])
# tinsts = [Orange.data.Instance(tdomain, list(dtlist[i]) )for i in xrange(len(dtlist))]
# t = Orange.data.Table(tdomain, tinsts)
#
# timeit list(dtndarray) # 45.6ms
# timeit [Orange.data.Instance(tdomain, list(dtlist[i])) for i in xrange(len(dtlist))] # 3.28s
# timeit Orange.data.Table(tdomain, tinsts) # 280ms
# timeit Orange.data.Table(tdomain, dtndarray) # 380ms
#
# As illustrated above, utilizing constructor with ndarray can greatly improve performance
# So one may conceive better converter based on these results
def series2table(series, variable):
if series.dtype is np.dtype("int") or series.dtype is np.dtype("float"):
# Use numpy
# Table._init__(Domain, numpy.ndarray)
return Orange.data.Table(Orange.data.Domain(variable), series.values[:, np.newaxis])
else:
# Build instance list
# Table.__init__(Domain, list_of_instances)
tdomain = Orange.data.Domain(variable)
tinsts = [Orange.data.Instance(tdomain, [i]) for i in series]
return Orange.data.Table(tdomain, tinsts)
# 5x performance
def column2df(col):
if type(col.domain[0]) is Orange.feature.Continuous:
return (col.domain[0].name, pd.Series(col.to_numpy()[0].flatten()))
else:
tmp = pd.Series(np.array(list(col)).flatten()) # type(tmp) -> np.array( dtype=list (Orange.data.Value) )
tmp = tmp.apply(lambda x: str(x[0]))
return (col.domain[0].name, tmp)
def table2df(tab):
# Orange.data.Table().to_numpy() cannot handle strings
# So we must build the array column by column,
# When it comes to strings, python list is used
series = [column2df(tab.select(i)) for i in xrange(len(tab.domain))]
series_name = [i[0] for i in series] # To keep the order of variables unchanged
series_data = dict(series)
print series_data
return pd.DataFrame(series_data, columns=series_name)
关于python - 将 Pandas DataFrame 转换为 Orange Table,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/26320638/
文档的某些部分有import Orange,其他部分有import Orange,并且它们似乎具有不同的模块组织。有什么区别? 谢谢! URI 最佳答案 Orange是2.5中引入的新的顶级命名空间,
我刚刚在我的 Windows 7 工作站上安装了 Orange 3.3.9。我正在尝试使用 Orange 中的“SQL 表”小部件连接到远程 MSSQL 服务器实例。 当我双击 SQL 表小部件时,我
在测试和评分小部件中,我们可以更改目标类(如果我们进行分类)。 Image 但我想使用 Python 脚本小部件进行测试和评分。 Orange.evaluation.Precision(results
我的orange-canvas安装在Anaconda python2环境下的Mint14上。 “可视化”部分中出现的工具有:属性统计、马赛克显示、筛分图和维恩图。 X-Y 散点图模块尤其是我需要的模块
这个问题在这里已经有了答案: How are strings compared? (7 个答案) 关闭 3 年前。 "banana " False 尽管它们仍然由 6 个字符组成。我看不懂他们?你能
我想为 scientific analysis 使用橙色包.使用 Python 2.7.3 在 x86_64 Ubuntu 12.04 上安装,使用 sudo easy_install orange
我似乎无法保存我的任何模型,也无法保存他们训练中创建的任何数据。我错过了什么?输入是在约 200 个类别中创建的 >15,000 张图像。 最佳答案 您的 Save Data (3) 小部件不会保存任
我是 Python 和 Orange 数据挖掘工具的初学者。我一直在尝试一些按预期工作的例子。 KMeans 聚类也可以正常工作。但是当我尝试文档中给出的层次聚类的标准示例时 http://orang
我使用 Orange 数据挖掘创建了一个我很满意的模型。我想将此模型用作实时分类的 Web 服务,是否可以选择使用我经过训练的模型将此 Orange 流程用作 Web 服务? 最佳答案 不,您无法将通
这里对 groovy 还是个新手,但我正在尝试从我的 map 列表中的每个 map 中获取所有值,这些 map 的键等于“Oranges” def resultSet = [ ["Oranges":1
我有一个包含很多属性的文件,我只想使用其中的几个属性。例如,我如何选择具有特定名称的三个属性? 文档仅讨论属性的随机采样和所需属性的列表索引。 list_of_attr=[Orange.data.va
如何在橙色 Canvas 中安排工作流程的执行? 例如,我有一个预测模型,该模型使用通过 Twitter Widget(文本分析插件)收集的推文,然后预测某些行为以使用 Python bot (Pyt
我打算使用orange用于 kmeans 聚类。我已经完成了教程,但我仍然有几个问题想问: 我正在处理高维向量的聚类。1)是否实现了余弦距离?2)我不想给空值加零。我尝试在空字段中不包含任何零,但收到
我有一个维度为 (878049, 6) 的数据集。 看起来像这样: 我想提取将类别列与其他列链接起来的关联规则。因此,从文档中我尝试了以下 Orange-Associate : In: import
我在类里面学习数据挖掘,但在使用 Orange 库时遇到了问题。我从 Weka 来到 Orange 并试图找到 J4.8 和 C4.5 算法,但我找不到它们列出。 谷歌搜索将我带到一个页面,上面说它有
我正在使用 Orange(在 Python 中)执行一些数据挖掘任务。更具体地说,用于聚类。尽管我已经阅读了教程并阅读了大部分文档,但我仍然遇到问题。文档和教程中的所有示例都假设我有一个制表符分隔的表
我正在使用 Orange Datamining 在 Iris 数据集上训练模型。我使用随机梯度下降节点进行训练,我希望提取网络相应的权重和偏差。 我对此很陌生,所以我对 SGD 是神经网络的看法可能是
这个问题在这里已经有了答案: What does a space mean in a CSS selector? i.e. What is the difference between .clas
我想得到这样的东西:oranges 但是没有输出显示。我尝试通过控制台打印,但它不起作用。 var array2 = ["Banana", ["Apples", ["Oranges"], "Blueb
如何将默认的 WAMP 服务器 + PHP 橙色样式错误报告更改为普通文本格式? 我希望看到以下格式的错误报告: 最佳答案 您在第一张图片中的内容是从 xdebug 输出的。 .至于第二个,我不知道是
我是一名优秀的程序员,十分优秀!