【问题标题】:FastText and Datasets in Azure ML with PythonAzure ML 中的 FastText 和数据集与 Python
【发布时间】:2020-02-07 20:05:44
【问题描述】:
我正在 Azure ML 中使用 FastText(不是 gensim 版本)运行实验(使用 Pytorch 创建的定制模型),但遇到了问题:
在实验中,我在数据集中有一个(相当大的)文本文件,需要用它来训练 FastText,但 fasttext.train_unsupervised 只将文件名作为输入。
请问,如何在 Azure ML 数据集的上下文中使用 FastText?
提前致谢!
【问题讨论】:
标签:
python-3.x
azure
fasttext
【解决方案1】:
嗯,刚刚发现:
您可以将 Azure ML 数据集挂载为目录,并以这种方式从中读取 FastText:
import fasttext
from azureml.core import Dataset
from azureml.core.workspace import Workspace
ws = Workspace.from_config()
dset = Dataset.get_by_name(workspace=ws, name='thenameofyourdataset')
dset.mount('afoldernameyoujustinvented')
embedding = fasttext.train_unsupervised('afoldernameyoujustinvented/myfilename.txt')
换句话说:您将数据集挂载到一个虚拟文件夹并使用该虚拟文件夹,就好像它是(并且可能在幕后是)一个包含数据集中文件的真实文件夹。
干杯!