【发布时间】:2018-07-21 08:52:22
【问题描述】:
我正在尝试使用 PHP-ML 实现情绪分析。我有一个大约 15000 个条目的训练数据集。我有代码工作,但是,我必须将数据集减少到 100 个条目才能工作。当我尝试运行完整的数据集时,出现此错误:
Fatal error: Allowed memory size of 134217728 bytes exhausted (tried to allocate 917504 bytes) in C:\Users\<username>\Documents\Github\phpml\vendor\php-ai\php-ml\src\Phpml\FeatureExtraction\TokenCountVectorizer.php on line 95
我拥有的两个文件是 index.php:
<?php
declare(strict_types=1);
namespace PhpmlExercise;
include 'vendor/autoload.php';
include 'SentimentAnalysis.php';
use PhpmlExercise\Classification\SentimentAnalysis;
use Phpml\Dataset\CsvDataset;
use Phpml\Dataset\ArrayDataset;
use Phpml\FeatureExtraction\TokenCountVectorizer;
use Phpml\Tokenization\WordTokenizer;
use Phpml\CrossValidation\StratifiedRandomSplit;
use Phpml\FeatureExtraction\TfIdfTransformer;
use Phpml\Metric\Accuracy;
use Phpml\Classification\SVC;
use Phpml\SupportVectorMachine\Kernel;
$dataset = new CsvDataset('clean_tweets2.csv', 1, true);
$vectorizer = new TokenCountVectorizer(new WordTokenizer());
$tfIdfTransformer = new TfIdfTransformer();
$samples = [];
foreach ($dataset->getSamples() as $sample) {
$samples[] = $sample[0];
}
$vectorizer->fit($samples);
$vectorizer->transform($samples);
$tfIdfTransformer->fit($samples);
$tfIdfTransformer->transform($samples);
$dataset = new ArrayDataset($samples, $dataset->getTargets());
$randomSplit = new StratifiedRandomSplit($dataset, 0.1);
$trainingSamples = $randomSplit->getTrainSamples();
$trainingLabels = $randomSplit->getTrainLabels();
$testSamples = $randomSplit->getTestSamples();
$testLabels = $randomSplit->getTestLabels();
$classifier = new SentimentAnalysis();
$classifier->train($randomSplit->getTrainSamples(), $randomSplit->getTrainLabels());
$predictedLabels = $classifier->predict($randomSplit->getTestSamples());
echo 'Accuracy: '.Accuracy::score($randomSplit->getTestLabels(), $predictedLabels);
还有 SentimentAnalysis.php:
<?php
namespace PhpmlExercise\Classification;
use Phpml\Classification\NaiveBayes;
class SentimentAnalysis
{
protected $classifier;
public function __construct()
{
$this->classifier = new NaiveBayes();
}
public function train($samples, $labels)
{
$this->classifier->train($samples, $labels);
}
public function predict($samples)
{
return $this->classifier->predict($samples);
}
}
我对机器学习和 php-ml 还是很陌生,所以我不确定如何推断问题出在哪里,或者是否有办法在没有大量内存的情况下解决这个问题。我能说的最多的是错误发生在索引文件第 22 行的 TokenCountVectorizer 中。有没有人知道是什么导致了这个问题或以前遇到过这个问题?
PHP-ML 的链接在这里:http://php-ml.readthedocs.io/en/latest/
谢谢
【问题讨论】:
-
在文章下有其中一个提示 - “如果您尝试针对完整数据集(14,000 行)运行,您可能会注意到该过程的内存密集程度。尝试实现模型持久性,这样它就不会不必在每次跑步时都接受训练。”我也成功地从 csv 文件中删除了 90% 的数据。
标签: php machine-learning memory php-ml