【问题标题】:FastText and Datasets in Azure ML with PythonAzure ML 中的 FastText 和数据集与 Python
【发布时间】:2020-02-07 20:05:44
【问题描述】:

我正在 Azure ML 中使用 FastText(不是 gensim 版本)运行实验(使用 Pytorch 创建的定制模型),但遇到了问题:

在实验中,我在数据集中有一个(相当大的)文本文件,需要用它来训练 FastText,但 fasttext.train_unsupervised 只将文件名作为输入。

请问,如何在 Azure ML 数据集的上下文中使用 FastText?

提前致谢!

【问题讨论】:

    标签: python-3.x azure fasttext


    【解决方案1】:

    嗯,刚刚发现:

    您可以将 Azure ML 数据集挂载为目录,并以这种方式从中读取 FastText:

    import fasttext
    from azureml.core import Dataset
    from azureml.core.workspace import Workspace
    
    ws = Workspace.from_config()
    dset = Dataset.get_by_name(workspace=ws, name='thenameofyourdataset')
    
    dset.mount('afoldernameyoujustinvented')
    embedding = fasttext.train_unsupervised('afoldernameyoujustinvented/myfilename.txt')
    

    换句话说:您将数据集挂载到一个虚拟文件夹并使用该虚拟文件夹,就好像它是(并且可能在幕后是)一个包含数据集中文件的真实文件夹。

    干杯!

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2017-07-03
      • 2017-05-25
      • 2018-08-25
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多