【发布时间】:2019-12-09 15:34:59
【问题描述】:
我不是 SQL 专家,但我最近开始在 Python 中将 sqlite3 模块与数据库一起使用,并与 pandas 及其 read_sql_query() 一起使用它们是一个非常好的工具。
现在,比如说,我有一个看起来像这样的数据库(我只是为了演示目的而编造的)。
age iq married
===============
91 77 0
54 124 1
31 124 0
32 95 0
74 34 0
18 56 0
43 42 0
78 56 0
91 77 1
任务是,这可能会有点令人困惑。我想选择与married=1(包括已婚人士本身)具有相同智商的所有行(人)。所以我希望结果看起来像这样:
age iq married
===============
91 77 0
54 124 1
31 124 0
91 77 1
即使在一般情况下,假设我的限制更加严格,并且想要选择所有与已婚者具有相同 iq 和 age 的人。在这种情况下,结果将如下所示:
age iq married
===============
54 124 1
91 77 0
91 77 1
可能有大量其他列可以忽略或不能忽略。
现在我当然可以迭代地这样做,首先选择已婚的,然后比较 (age,iq) 的元组,但这有点无聊。问题是,有没有一种巧妙的方法可以用pandas.read_sql_query() 一次性完成?
所以简而言之,我正在尝试做这样的事情(我知道这只是选择已婚的,但这只是一个例子):
import sqlite3
import pandas as pd
connection = sqlite3.connect('people.db')
mydata = pd.read_sql_query(
"""
SELECT *
from People
WHERE married=1 ... *some magic here*
GROUP BY *foo*
HAVING *bar*
""", connection)
我真的无法想出任何“魔法”来让它做我想做的事情(可能是因为对所有 SQL 命令和条件了解不足)。也许有一种方法可以使用嵌套的SELECT 命令和一些类似IN 的东西来做到这一点,但我不太确定。
我觉得必须有一个简单的方法(或者我错了,迭代起来更容易),所以我问社区!
【问题讨论】:
-
我建议您提供一个更能代表您的实际用例的示例。
-
老实说,基本上就是这样,但是数据库中有几 GB 并且我需要比较三个标准,而不是一两个。说,
age,iq,dob,我认为这真的没那么重要。
标签: python mysql sql pandas sqlite