【发布时间】:2017-08-20 12:52:59
【问题描述】:
我通过 RStudio、.Rnw 脚本、knitr 和 LaTeX 以 PDF 格式输出的几个文档有很长的索引。 readLines可以读入R每个文档的索引(一个“file.ind”文件),我将它们全部组合成一个字符向量。
向量如下所示,但 PDF 文档在 \item 术语(我称之为“主要”术语)下缩进了 \subitem 术语(我称之为“次要”术语)。组合向量有 20 多个主要项(例如 Data 和 Statistics)和 2,000 个次要项(例如'分布、钟形曲线、正态、20)。一个主要术语可以有 5 到 50 多个次要术语。
\item Data
\subitem distribution, bell curve, normal, 20
\subitem absolute number, 111
\subitem arithmetic mean, 21
\subitem big data, 137
\subitem binary, 110
\subitem categorical, 130
\item Statistics
\subitem count, 53
\subitem data, 53, 129
\subitem data, missing, 135
\subitem digits, 53
编程挑战是“填写”初级学期直到下一个初级学期开始,然后填写第二个初级学期直到下一个初级学期开始,依此类推。或者,R 如何创建一个看起来像这样有两列的对象?
Primary Secondary
Data distribution, bell curve, normal, 20
Data absolute number, 111
Data arithmetic mean, 21
Data big data, 137
Data binary, 110
Data categorical, 130
Statistics count, 53
Statistics data, 53, 129
Statistics data, missing, 135
Statistics digits, 53
我的目标是将修改后的组合索引保存在 Excel 中,以便我可以更轻松地标准化命名约定、检测缺失的术语、修复拼写错误等等。
感谢您的指导。
【问题讨论】: