是的,这绝对是可能的。我建议使用无头浏览器,例如 Selenium 或 Puppeteer。有几个步骤可以做到这一点:
1) 自动登录 Google(如果需要)
2) 自动导航到 Google Takeout 并下载数据
3 解析数据
4)编写一个脚本,以便您可以定期自动化整个过程。
在编写网络爬虫时还有几点需要注意:
在无头模式下运行浏览器时,提供的 HTML 可能与运行非无头模式的浏览器不同。换句话说,DOM 元素上的属性可以以不同的方式命名,并且由于您使用这些属性来自动执行选择和单击等操作 - 您的代码将需要更改。出于这个原因,通过浏览器检查元素是一个很好的起点,但在无头模式下运行时,您可能需要调整属性的名称,这有助于开始此操作。例如,以下代码摘录显示了为 Puppeteer 以两种方式编写的用于登录 Google 的相同代码。一种是无头的,一种是非无头的:
无头模式:
(async () => {
const browser = await puppeteer.launch();
const page = await browser.newPage();
await page.goto('https://takeout.google.com');
await page.waitForSelector('input[type=email]')
await page.type('input[type=email]', process.env.GOOGLE_USER)
await page.click('#next')
await page.waitForSelector('#Passwd', { visible: true })
await page.type('#Passwd', process.env.GOOGLE_PWD);
await page.waitForSelector('#signIn', { visible: true })
await page.click('#signIn');
await page.waitForNavigation()
await browser.close();
})();
非无头模式:
(async () => {
const browser = await puppeteer.launch({ headless: false, slowMo: 50 })
const page = await browser.newPage()
await page.goto('https://takeout.google.com');
await page.waitForSelector('input[type="email"]')
await page.type('input[type="email"]', process.env.GOOGLE_USER)
await page.click('#identifierNext')
await page.waitForSelector('input[type="password"]', { visible: true })
await page.type('input[type="password"]', process.env.GOOGLE_PWD)
await page.waitForSelector('#passwordNext', { visible: true })
await page.click('#passwordNext')
await page.waitForNavigation()
await browser.close()
})()