【发布时间】:2011-07-21 11:41:20
【问题描述】:
我正在尝试像这样使用 Beautiful Soup 来抓取表单字段 ID
for link in BeautifulSoup(content, parseOnlyThese=SoupStrainer('input')):
if link.has_key('id'):
print link['id']
让我们假设它返回类似的东西
username
email
password
passwordagain
terms
button_register
我想将它写入 Sqlite3 DB。
我将在我的应用程序中做的是...使用这些表单字段的 ID 并尝试执行 POST 可能是。问题是.. 有很多这样的网站,我已经抓取了它们的表单字段 ID。所以关系是这样的……
Domain1 - First list of Form Fields for this Domain1
Domain2 - Second list of Form Fields for this Domain2
.. and so on
我不确定的是……我应该如何设计我的专栏来实现这种目的?如果我只创建一个包含两列的表可以吗 - 比如说
COL 1 - Domain URL (as TEXT)
COL 2 - List of Form Field IDs (as TEXT)
要记住的一件事是......在我的应用程序中,我需要做这样的事情......
伪代码
If Domain is "http://somedomain.com":
For ever item in the COL2 (which is a list of form field ids):
Assign some set of values to each of the form fields & then make a POST request
谁能指导一下?
于 2011 年 7 月 22 日编辑 - 我的以下数据库设计是否正确?
我决定采用这样的解决方案。大家觉得呢?
我将有如下三张表
表 1
Key Column (Auto Generated Integer) - Primary Key
Domain as TEXT
示例数据类似于:
1 http://url1.com
2 http://url2.com
3 http://url3.com
表 2
Domain (Here I will be using the Key Number from Table 1)
RegLink - This will have the registeration link (as TEXT)
Form Fields (as Text)
示例数据类似于:
1 http://url1.com/register field1
1 http://url1.com/register field2
1 http://url1.com/register field3
2 http://url2.com/register field1
2 http://url2.com/register field2
2 http://url2.com/register field3
3 http://url3.com/register field1
3 http://url3.com/register field2
3 http://url3.com/register field3
表 3
Domain (Here I will be using the Key Number from Table 1)
Status (as TEXT)
User (as TEXT)
Pass (as TEXT)
示例数据类似于:
1 Pass user1 pass1
2 Fail user2 pass2
3 Pass user3 pass3
你觉得这个桌子设计好不好?或者有什么可以改进的?
【问题讨论】:
标签: python sql database sqlite