【问题标题】:How to use a CSV as input data for a Tensorflow neural network?如何使用 CSV 作为 Tensorflow 神经网络的输入数据?
【发布时间】:2016-11-13 01:57:15
【问题描述】:

我目前正在尝试通过稍微更改MNIST for ML Beginners code 来编写神经网络。我有一个这样组织的 CSV:

Image_Name |Nevus? |Dysplastic Nevus?| Melanoma? asdfgjkgdsl.png |1 |0 |0

一个图像名称,它是一个热门的结果。每个图像都是 1022 x 767,我也想使用每个像素的颜色作为输入。因此,我将 MNIST 代码更改为具有 2,351,622 个输入(1022 像素宽 * 767 像素高 * 每个像素 3 种颜色)和 3 个输出。

# from tensorflow.examples.tutorials.mnist import input_data
# mnist = input_data.read_data_sets("MNIST_data/", one_hot=True)

def main():
    x = tf.placeholder(tf.float32, [None, 2351622])
    W = tf.Variable(tf.zeroes([2351622, 3]))
    b = tf.Variable(tf.zeroes([3]))

    y = tf.nn.softmax(tf.matmul(x, W) + b)

    y_ = tf.placeholder(tf.float32, [None, 3])
    cross_entropy = tf.reduce_mean(-tf.reduce_sum(y_ * tf.log(y), reduction_indices=[1]))
    train_step = tf.train.GradientDescentOptimizer(0.5).minimize(cross_entropy)

    init = tf.initialize_all_variables()
    sess = tf.Session()
    sess.run(init)

    for i in range(1000):
    example, label = sess.run([features, col5])
        # batch_xs, batch_ys = mnist.train.next_batch(100)
        # sess.run(train_step, feed_dict={x: batch_xs, y_: batch_ys})

    correct_prediction = tf.equal(tf.argmax(y,1), tf.argmax(y_,1))
    accuracy = tf.reduce_mean(tf.cast(correct_prediction, tf.float32))
    print(sess.run(accuracy, feed_dict={x: mnist.test.images, y_: mnist.test.labels}))

注释行是我必须替换的行,才能将我的数据加载到神经网络中。为每个图像(我发现)获取 230 万输入的最简单方法是:

from PIL import Image
import numpy as np

list(np.array(Image.open('asdfgjkgdsl.png')).ravel().flatten())

如何将此数据集加载到 TensorFlow 中以用于训练神经网络?

【问题讨论】:

    标签: python csv tensorflow


    【解决方案1】:

    可能推荐的方式是准备一系列tf_records文件。 MNIST 中有一个这样做的例子。然后,您创建一个队列。为了节省空间,最好将输入保持为 png 格式并在运行时使用 decode_png

    简而言之,先转换(应该写多个文件):

    def _bytes_feature(value):
        return tf.train.Feature(bytes_list=tf.train.BytesList(value=[value]))
    
    def convert():
        writer = tf.python_io.TFRecordWriter(output_filename)
        for filename, nv, dnv, mn in parse_csv(...):
           fs = {}
           png_data = read_image_as_np_array(filename)
           image_name = 'data/image/png'
           fs['png_data'] = _bytes_feature(png_data)
           fs['label'] = _bytes_feature([nv, dnv, mn])
           example = tf.train.Example(features=tf.train.Features(feature=fs))
           writer.write(example.SerializeToString())
        writer.close()
    

    然后,阅读它:(将其放入队列中)

    reader = tf.TFRecordReader()
    _, serialized_example = reader.read(filename_from_queue)
    features_def = {
      'png_data': tf.FixedLenFeature([], tf.string),
      'label': tf.FixedLenFeature([3], tf.uint8)
    }
    features = tf.parse_single_example(serialized_example, features=feature_def)
    image = tf.image.decode_png(features['png_data'])
    ...
    

    您也可以使用tf.TextLineReader 代替逐行读取。

    【讨论】:

      猜你喜欢
      • 2018-05-03
      • 2018-10-27
      • 2017-12-25
      • 1970-01-01
      • 2017-06-13
      • 1970-01-01
      • 2020-09-10
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多