【发布时间】:2019-07-18 16:52:11
【问题描述】:
我想使用我自己的数据来为machine translation system using Transformers 训练模型。 TFDS(Tensorflow 数据集)中已经有一组数据集可用,并且还可以选择 add a new dataset 到 TFDS。但是如果我不必等待那些添加请求和东西并直接训练我的数据怎么办?
在示例 colab 笔记本中,他们使用以下内容创建训练和验证数据:
examples, metadata = tfds.load('ted_hrlr_translate/pt_to_en', with_info=True,
as_supervised=True)
train_examples, val_examples = examples['train'], examples['validation']
我相信 TFDS 做了很多预处理来适应管道,它是 Dataset 类型的。
type(train_examples)
tensorflow.python.data.ops.dataset_ops._OptionsDataset
但是对于像下面这样的自定义 CSV 数据,我如何创建与此模型兼容的“数据集”?
import pandas as pd
# initialize list of lists
data = [['tom', 10], ['nick', 15], ['juli', 14],['tom', 10], ['nick', 15]]
# Create the pandas DataFrame
df = pd.DataFrame(data, columns = ['Name', 'Age'])
# print dataframe.
df
【问题讨论】:
标签: python-3.x tensorflow tensorflow2.0 machine-translation