- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
我正在比较两个数据集以查找某些列上的重复条目。
我首先在 SAS 中使用以下查询使用 PROC SQL 命令完成了此操作(我认为是真实结果):
proc sql;
CREATE TABLE t1 AS
SELECT a.*, b.*
FROM
local AS a INNER JOIN neighbor AS b
ON a.surname1 = b.surname2
AND a.yob1 = b.yob2
AND a.cob1 = b.cob2;
quit;
我将此结果输出到 csv,给出 output_sas.csv
我也在 Python 中使用 SQLite3 使用相同的查询完成了此操作:
conn = sqlite3.connect(file_path + db_name)
cur = conn.cursor()
cur.execute("""
CREATE TABLE t1 AS
SELECT a.*, b.*
FROM
local AS a INNER JOIN neighbor AS b
ON a.surname1 = b.surname2
AND a.yob1 = b.yob2
AND a.cob1 = b.cob2
""")
我将其输出到 csv,给出 output_python.csv
。
输出应该是相同的,但实际上不是:
output_sas.csv
比 output_python.csv
多包含 123 条记录。
在 SAS 输出文件中,yob1
和 yob2
列中有 123 条包含空格 ""
的记录,例如, sas_data.csv
中的 123 条记录如下所示:
yob1 yob2 cob1 cob2 surname1 surname2
"" "" 1 1 xx xx
"" "" 2 2 yy yy
.
.
.
# Continues for 123 records
我发现这种差异是由于 yob1
和 yob2
列,在上面的 123 条记录中包含空格。 output_python.csv
文件中缺少这 123 个记录对。
[注:在这项工作中,长度为零的字符串对应一个缺失值]
SAS 中的 PROC SQL 例程正在评估空格是否相等,即 ""== ""-> TRUE
。
Python SQLite 代码似乎在做相反的事情,即 ""== ""->
错误
即使 ""== ""-> True
在 Python 中也会发生这种情况。
为什么会这样?我需要更改什么才能使 SQLite 输出与 PROC SQL 输出相匹配?
注意:两个例程都使用相同的输入数据集。它们完全相等,我什至手动修改 Python 代码以确保 yob1
和 yob2
列包含 ""
缺失值。
目前我的 SAS PROC SQL 代码使用 data1.sas7bdat
,命名为 local
和 data2.sas7bdat
,命名为 邻居
。
为了在 Python 和 SAS 中使用相同的数据集,我将它们导出到 csv 并读入 Python。
如果我这样做:
import pandas as pd
# read in
dflocal = pd.read_csv(csv_path_local, index_col=False)
dfneighbor = pd.read_csv(csv_path_neighbor, index_col=False)
Pandas 将缺失值转换为 nan
。我们可以使用 isnull()
来查找每一列中 nan 值的数量:
# find null / nan values in yob1 and yob2 in each dataset
len(dflocal.loc[dflocal.yob1.isnull()])
78
len(dfneighbor.loc[dfneighbor.yob2.isnull()])
184
为了解决空值问题,我随后通过运行将 nan
显式转换为长度为零的字符串 ""
:
dflocal['yob1'].fillna(value="", axis=0, inplace=True)
dfneighbor['yob2'].fillna(value="", axis=0, inplace=True)
我们可以通过测试已知的 nan
来测试值是否更新:
dflocal.iloc[393].yob1
`""`
type(dflocal.iloc[393].yob1)
str
所以它们是长度为0的字符串。
然后通过以下方式将这些读入 SQL:
dflocal.to_sql('local', con=conn, flavor='sqlite', if_exists='replace', index=False)
dfneighbor.to_sql('neighbor', con=conn, flavor='sqlite', if_exists='replace', index=False)
然后执行相同的 SQLite3 代码:
conn = sqlite3.connect(file_path + db_name)
cur = conn.cursor()
cur.execute("""
CREATE TABLE t1 AS
SELECT a.*, b.*
FROM
local AS a INNER JOIN neighbor AS b
ON a.surname1 = b.surname2
AND a.yob1 = b.yob2
AND a.cob1 = b.cob2
""")
即使我进行了此显式更改,我仍然 得到相同的缺失 123 个值,尽管空值已更改为长度为零的字符串 ""
.
可能的解决方案:
但是,如果我改为使用 na_filter=False
参数导入数据集,这会为我完成从 null
到 ""
的转换.
dflocal = pd.read_csv(csv_path_local, index_col=False, na_filter=False)
dfneighbor = pd.read_csv(csv_path_neighbor, index_col=False, na_filter=False")
# find null / nan values in yob1 and yob2 in each dataset
len(dflocal.loc[dflocal.yob1.isnull()])
0
len(dfneighbor.loc[dfneighbor.yob2.isnull()])
0
当我将这些数据集导入我的数据库并通过相同的 SQL 代码运行时:
conn = sqlite3.connect(file_path + db_name)
cur = conn.cursor()
cur.execute("""
CREATE TABLE t1 AS
SELECT a.*, b.*
FROM
local AS a INNER JOIN neighbor AS b
ON a.surname1 = b.surname2
AND a.yob1 = b.yob2
AND a.cob1 = b.cob2
""")
万岁,我得到了与 SAS 代码相同的输出!
但为什么第一个解决方案不起作用?我在这两种情况下都做同样的事情(第一种情况是使用 fill_na
手动完成,第二种情况是使用 na_filter=False
)。
最佳答案
在 SAS 中,实际上并没有字符空值的概念。它更像是一个空字符串。然而,在大多数 SQL 实现中(包括 SQlite,我假设),空值和空字符串是不同的。
SAS 中的空白值确实被评估为 ""= ""
,即 true
然而,在您的普通 DBMS 中,您所谓的“空值”通常是 null
值,而不是空字符串 (""
)。 并且 null=null
不是真的。您不能将空值与任何内容进行比较,包括空值。
您可以做的是将您的 SQlite 更改为
CREATE TABLE t1 AS
SELECT a.*, b.*
FROM
local AS a INNER JOIN neighbor AS b
ON a.surname1 = b.surname2
AND coalesce(a.yob1,'') = coalesce(b.yob2,'')
AND a.cob1 = b.cob2
当 yob
为 null 时,coalesce 函数会将 yob
替换为空字符串。
但是请注意,如果 yob1
为 null 而 yob2
实际上是一个空字符串,添加这些合并函数将改变 null= ''
条件(不为真)转换为 ''=''
为真。如果那不是你想要的,你也可以这样写:
CREATE TABLE t1 AS
SELECT a.*, b.*
FROM
local AS a INNER JOIN neighbor AS b
ON a.surname1 = b.surname2
AND (a.yob1 = b.yob2
OR (a.yob1 is null AND a.yob2 is null)
)
AND a.cob1 = b.cob2
关于python - SQLite 和 PROC SQL 在评估空格时的区别,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/45588358/
平时很少在jquery中用到this。查看代码时发现用到了,就调试出this的值,心想原来如此。还是挺有用的。这里总结一下this与$(this)的区别和使用。 $(this)生成的是什么?
使用单例类和应用程序范围的托管 bean 来保存应用程序数据有区别吗? 我需要查找某些 JNDI 资源,例如远程 bean 接口(interface),因此我为自己编写了一个单例来缓存我的引用并且只允
如果您仔细查看包含的图片,您会注意到您可以使用 Eclipse IDE 重构 Groovy 代码并将方法转换为闭包,反之亦然。那么,闭包到底是什么,它与方法有什么不同呢?有人可以举一个使用闭包的好例子
vagrant box repackage有什么区别( docs ) 和 vagrant package ( docs )? 我意识到 vagrant package仅适用于 VirtualBox 提
我想看看是否有人可以解释为什么以下代码适用于 valueOf 但不适用于其他代码。 import java.math.BigDecimal; public class Change { publ
这个问题已经有答案了: 已关闭12 年前。 Possible Duplicates: What is Closures/Lambda in PHP or Javascript in layman te
This question already has answers here: Vagrant, Docker, Puppet, Chef (3个答案) 2年前关闭。 docker和chef有什么共同
以下代码在95%的机器上产生相同的输出,但是在几台机器上却有所不同。在 Debug模式下,输出: Changing from New to Fin OK 但在 Release模式下: Changing
////Creating Object var Obj; // init Object Obj= {}; 它们之间有什么区别两个? 有没有可能把它变成一个单行? 这样使用有什么好处吗?
我想找出定时器服务之间的区别。我应该使用哪个以及何时使用。我正在使用 Jboss 应用服务器。 1) java.ejb.Schedule。 @Schedule注解或配置自xml。 2) javax.e
我发现在 C++ 中可以通过三种不同的方式将对象传递给函数。假设我的类(class)是这样的: class Test { int i; public: Test(int x);
有什么区别。 public class Test { public static void main(String args[]) { String toBeCast = "c
如果我有一列,设置为主索引,设置为INT。 如果我不将其设置为自动递增,而只是将唯一的随机整数插入其中,与自动递增相比,这是否会减慢 future 的查询速度? 如果我在主索引和唯一索引为 INT 的
这两种日期格式有什么区别。第一个给出实际时间,第二个给出时间购买添加时区偏移值。 NSDateFormatter * dateFormatter = [[NSDateFormatter alloc]
如果有一个函数,请说foo: function foo() { console.log('bar'); } 那么在 JavaScript 中,从另一个函数调用一个函数有什么区别,如下所示: f
关闭。这个问题是opinion-based 。目前不接受答案。 想要改进这个问题吗?更新问题,以便 editing this post 可以用事实和引文来回答它。 . 已关闭 4 年前。 Improv
代码是什么: class Time { private: int hours; int minutes; int seconds; pu
我知道这是非常基本的,但有人介意解释一下这两个数组声明之间的区别吗: #include array myints; ...和: int myints[5]; ...以及为什么 myints.size
我学会了如何根据 http://reference.sitepoint.com/css/specificity 计算 css 特异性但是,基于this reference,我不明白伪类(来自c)和伪元
为什么在运行 2) 时会出现额外的空行?对我来说 1 就像 2。那么为什么 2) 中的额外行? 1) export p1=$(cd $(dirname $0) && pwd) #
我是一名优秀的程序员,十分优秀!