【发布时间】:2015-02-24 21:05:08
【问题描述】:
好的,我不知道是我措辞不好还是什么,但我似乎找不到任何类似的东西来解决我的问题。
所以我有一个二维列表,每一行代表一个案例,每一列代表一个特征(用于机器学习)。另外,我有一个单独的列表(列)作为标签。
我想从 2D 列表中随机选择行来训练分类器,同时使用其余行来测试准确性。因此,我希望能够知道我用于训练的所有行索引以避免重复。
我认为问题有两个部分: 1)如何随机选择 2) 如何获取索引
再次,我不知道为什么我无法通过搜索在这里找到好的信息(也许我只是很烂)
抱歉,我还是社区的新手,所以我可能犯了很多格式错误。如果您有任何建议,请告诉我。
这是我用来获取二维列表的部分代码
#273 = number of cases
feature_list=[[0]*len(mega_list)]*273
#create counters to use for index later
link_count=0
feature_count=0
#print len(mega_list)
for link in url_list[:-1]:
#setup the url
samp_url='http://www.mtsamples.com'+link
samp_url = "%20".join( samp_url.split() )
#soup it for keywords
samp_soup=BeautifulSoup(urllib2.urlopen(samp_url).read())
keywords=samp_soup.find('meta')['content']
keywords=keywords.split(',')
for keys in keywords:
#print 'megalist: '+ str(mega_list.index(keys))
if keys in mega_list:
feature_list[link_count][mega_list.index(keys)]=1
mega_list:包含所有关键字的列表
feature_list:二维列表,mega_list 中的任何单词,该特定单元格设置为 1,否则为 0
【问题讨论】:
标签: python search random machine-learning indices