【问题标题】:Parsing SEC tabular data解析 SEC 表格数据
【发布时间】:2020-03-03 07:04:21
【问题描述】:

我的要求是解析 SEC 表格数据。请在下图中找到示例表格数据。 我正在使用 Python。我发现表格数据是以 XBRL 格式存储的。一开始,我尝试像使用 lxml 模块解析 XML 一样解析 XBRL 数据。后来我意识到它是一个复杂的解析模型,我们有很多用于解析 XBRL 文档的库。我浏览了不同的库,如 python-xbrl、xbrl,以及安装的服务器(raptorXMLXBRL 服务器)来解析 XBRL 文档。但没有一个按预期工作。正如我之前提到的,我的目标是从 SEC 获取表格数据。我们可以在this 链接中找到示例文档。您能否建议我一个用于解析表格数据的流程/模块。提前致谢。

【问题讨论】:

    标签: python-3.x xml xbrl


    【解决方案1】:

    和您一样,我尝试使用 python 中可用的任何工具解析 xbrl 文档,但没有取得多大成功。因此,解决该问题的一种方法是获取 xbrl 文件基础的 html 文件。

    所以,要使用您的示例链接,前 10K 的 url 有

    https://www.sec.gov/ix?doc=/Archives/edgar/data/1551152/000155115220000007/abbv-20191231x10k.htm
    

    只需从 url 中去掉 /ix?doc= 字符串,就剩下

    https://www.sec.gov/Archives/edgar/data/1551152/000155115220000007/abbv-20191231x10k.htm

    这是相同的 10k 文件,但采用 html 格式。从那里您可以使用普通的 html 工具来提取您感兴趣的任何数据。

    【讨论】:

    • 我可以确认。删除 /ix?doc= 部分会删除蓝色菜单栏,留下简单的 html 文档,并使其更容易提取。
    猜你喜欢
    • 2017-03-03
    • 2018-08-31
    • 2017-05-18
    • 1970-01-01
    • 1970-01-01
    • 2013-03-21
    • 1970-01-01
    • 1970-01-01
    • 2021-11-15
    相关资源
    最近更新 更多