【问题标题】:Is information a subset of data?信息是数据的子集吗?
【发布时间】:2010-03-13 15:41:34
【问题描述】:

我很抱歉,因为我不知道这是属于 mathoverflow 的数学问题,还是属于这里的计算机科学问题。

也就是说,我相信我了解基本的difference between data, information, and knowledge。我的理解是,信息既包含数据,也包含意义。我不清楚的一件事是信息是否数据。信息被认为是一种特殊的数据,还是完全不同的东西?

【问题讨论】:

    标签: information-theory


    【解决方案1】:

    datainformationknowlege 是基于价值的概念,用于以主观方式对一般的“简洁性”和特定信息集的“有用性”。
    这些词没有确切的含义,因为它们与信息处理的基本目的和方法有关;在信息论领域,这些根本没有任何意义,因为这三个都是同一个东西:“信息”的集合(在信息论的意义上)。
    然而,它们在上下文中很有用,可以总结信息集的一般性质,如下面的松散解释。

    信息是获得(或有时是从数据中得出的),但它可以更丰富、更清晰(其中一些值已被纠正)和“更简单”(其中一些不相关的数据已被纠正)删除)。因此,在集合论的意义上,信息不是数据的子集,而是一个单独的集合[通常在某种程度上与数据相交但也可以有自己的元素]。

    知识(有时称为洞察)是又一个层次,它基于信息,也不是信息的[集合论]子集。 Indeed Knowledge 通常不会直接引用信息元素,而是讲述有关信息/数据的“元故事”。

    沿着数据 -> 信息 -> 知识链,较高级别是较低级别的子集的毫无根据的想法可能源于以下事实:[通常]存在 减少 [IT 感知] 信息量。但是定性地这个信息是不同的,因此没有真正的[集合论]子集关系。

    示例

    • 来自华尔街的原始证券交易所数据是... 数据
      “数据的海洋”!有人很难直接从这些数据中找到他/她需要的东西。这些数据可能需要标准化。例如,价格信息有时可能以 1/32 美元精度的文本字符串表示,在其他情况下,价格可能以 1/8 美元精度的真正二进制整数形式出现。此外,指示买方 ID 或卖方 ID 的字段也可能包含拼写错误,因此指向错误的卖方/买方。等等。

    • 根据上述内容制作的电子表格是... 信息
      对数据应用了各种处理:
      -清理/更正各种值
      - 交叉引用(例如查找相关代码,例如添加一列以在买家 ID 列旁边显示个人/公司的实际名称)
      - 当与同一事件有关的重复记录(但说来自不同来源)用于相互证实,但也合并为一个记录时,合并。
      -聚合:例如对给定股票的所有交易价值求和(而不是显示所有单独的交易。
      所有这些(以及一些)将数据转化为信息,即易于使用的 [IT 感] 信息主体,人们可以在其中快速找到一些“数据”,例如 IBM 股票的开盘价和收盘价2009 年 6 月 8 日。
      请注意,虽然使用起来更方便,部分更准确/更精确,而且还归结起来,但其中并没有真正的 [IT 感知] 信息,这些信息无法通过相对简单的方式(如果只是艰苦的话)从原始信息中定位或计算出来) 进程。

    • 财务分析师的报告可能包含... 知识
      例如,如果报告显示 [虚假示例],每当石油价格超过某个阈值时,黄金的价值就会开始下跌,但随后又迅速飙升,大约在咖啡和茶价格稳定的时候。这种特殊的洞察力构成了知识。这些知识可能一直都隐藏在数据中,但只有在应用一些花哨的统计分析和/或需要人类专家的帮助才能找到或确认此类模式时才会变得明显。

    顺便说一下,在信息论意义上的“信息”一词中,“数据”、“信息”和“知识”都包含[IT意义上的]信息。
    有人可能会走上滑坡,说“随着我们沿着链条往上走,熵会减少”,但这只是大致正确,因为

    • 熵减少与“对人类的有用性”没有直接或系统的联系
      (一个典型的例子是压缩文本文件的熵少,但阅读起来并不有趣)
    • 实际上存在信息丢失(除了熵损失)
      (例如,当汇总数据时,有关单个记录的 [IT 感知] 信息会丢失)
    • 特别是在信息 -> 知识的情况下,抽象水平发生了变化

    最后一点(如果我还没有把每个人都弄糊涂的话……)是data->info->knowledge 链实际上相对与 [IT 意义上的预期用途/目的] 信息。
    ewernli 在下面的评论中提供了拼写检查器的示例,即当重点是英语正字法时,华尔街天才最有见地的论文只是一串单词,实际上是“原始数据” ,其中一些需要改进(沿着正字法目的链。
    同样,使用数千篇报纸文章的语言学家通常(我们希望...)至少包含一些见解/知识(在一般意义上),可能只考虑这些文章的原始数据,这将帮助他/她自动创建法语-德语词典(这将是信息),当他从事该项目时,他可能会发现两种语言之间常用词使用的系统语义转变,从而深入了解不同的文化。

    【讨论】:

    • 但是财务报告,比如 ppt 文件,本身就是原始数据,比如拼写检查。拼写检查将产生信息,人类将解释它并获得知识,例如“我总是犯这个或那个错误”。这是元循环:)
    • @ewernli。好点。我的意思是掩饰这一点,很容易就这个话题写了一个可能令人困惑的“宣言”,但你的评论促使我简要讨论了目的的相对性。谢谢!
    • ?很高兴看到导致-1的原因......我很可能歪曲了某些东西,或者可能在其他东西上完全错误;很高兴知道...
    • 'entropy' 和 'spreadsheet' 一起使用?自动-1。在这里投反对票还有其他充分的理由,但我只能投一次。
    • 让我们更具体一些。这个答案假设信息是由一个人处理的,他首先看到数据,然后理解信息并应用知识。这种以人类为中心的观点具有误导性,因为就我们谈论基本概念而言,人脑与上述拼写检查器没有什么不同。
    【解决方案2】:

    首先定义信息和数据,非常谨慎。

    什么是信息,什么是数据,很大程度上取决于上下文。一个极端的例子是你在一个聚会上的照片,你通过电子邮件发送。对您来说,它是信息,但对于 ISP,它只是要传递的数据。

    有时只需添加正确的上下文即可将数据更改为信息。

    所以,回答您的问题:不,信息不是数据的子集。至少可以是以下。

    1. 添加上下文时的超集

    2. 一个子集,大海捞针问题

    3. 数据的函数,例如在摘要中

    可能还有更多的情况。

    【讨论】:

    • 我会更进一步,将数据-信息-知识分类称为伪劣哲学,假装具有深刻的含义,但根本没有精确的含义。大多数情况下,它被用来掩饰对信息处理和决策缺乏真正的理解。
    • @ima John Smith 就上下文在限定数据、信息和洞察力中的重要性提出了一个很好的观点。然而,对于所有相关的(与上下文相关的)这三个概念(我们甚至称这些类别,因为你使用了分类这个词)可能是,它们非常有用和真实,并且不仅仅用于帮助人们伪造一些真实的对信息处理的理解...
    • 你的回答正是我心目中的伪劣哲学。感谢您提供示例。
    【解决方案3】:

    这就是我的看法……

    数据是肮脏和原始的。你可能会吃得太多。

    ... Jason ... 27 ... Denton ...
    

    信息是您需要的、有组织且有意义的数据。

    Jason.age=27
    Jason.city=Denton
    

    知识就是为什么会有 wiki、博客:跟踪见解和经验。请注意,这些是人类(和社区)属性。除了可能是一个奇怪的科学项目,Facebook 上没有计算机告诉人们它相信什么。

    【讨论】:

      【解决方案4】:

      信息是数据的增强

      • 数据是惰性的
      • 信息可操作

      请注意,没有数据的信息只是一种意见;-)

      【讨论】:

        【解决方案5】:

        如果您有某种方式来表示使其成为信息的附加内容,则信息可能是数据。试图“理解”书面文本的程序可能会将输入文本转换为允许对该文本含义进行更复杂处理的格式。当在整个处理系统的上下文中理解时,这种转换格式是一种表示信息的数据。从系统外部它表现为数据,而在系统内部它是正在被理解的信息。

        【讨论】:

          猜你喜欢
          • 1970-01-01
          • 1970-01-01
          • 2021-01-23
          • 1970-01-01
          • 1970-01-01
          • 2012-09-28
          • 2014-07-17
          • 2018-09-11
          • 1970-01-01
          相关资源
          最近更新 更多