【发布时间】:2011-11-03 03:37:46
【问题描述】:
我正在尝试解析文件中的一些输入文本,这些文本最初是从 Twitter API 中获取的。该文件是纯文本,在这种情况下我实际上并没有获取 JSON。这是输入文本的 sn-p:
.....HootSuite</a>", "text": "For independent news reports on the crisis in #Japan,
see @DemocracyNow News Archive: http://ow.ly/4ht9Q
#nuclear #Fukushima #rdran #japon", "created_at": "Sat Mar 19.....
基本上我需要抓住这个:
"text": "For independent news reports "on" the crisis in #Japan, see @DemocracyNow
News Archive: http://ow.ly/4ht9Q #nuclear #Fukushima #rdran #japon"
这是我试图开始工作的两个,但我遇到了一些问题:
re.findall('"text":[^_]*',line)
re.findall('"text":[^:}]+',line)
第一个可以让我在我想要的部分之后抓取所有内容,直到“创建”。第二个也可以,但是当文本包含“:”时,它直到信息结束才会出现
有人对 RegEx 有一些经验,可以为我指明正确的方向吗?
【问题讨论】:
-
如果您从 Twitter API 获取它,我们可以假设您获取的是 JSON 吗?为什么不直接提取 JSON 值? pypi.python.org/pypi/simplejson
-
这不是一个坏主意,好点。这是一整行数据(尽我所能粘贴) {"favorited": false, "truncated": false, "source": "web", "text": "West Ham 回击马刺队。托特纳姆热刺主场失利将是重返冠军联赛的严重挫折。", "created_at": "Sat Mar 19 14:19:19 +0000 2011", "retweeted": false,, "class": "政治”,“实体”:,“in_reply_to_status_id_str”:空,“id_str”:“49112718128594945”,“in_reply_to_screen_name”:空,“用户”:{“follow_request_sent”:空,“profile_use_background_image”:真,“id”:21619519 , }
标签: python regex parsing findall