【发布时间】:2021-01-21 02:43:30
【问题描述】:
我有一个 HTML 格式的大文本,需要使用 Amazon Translate API 翻译成不同的语言(它必须是 AWS,没有使用其他服务的选项)。
亚马逊每次调用最多可以翻译 5000 个字符,因此我需要将大文本“拆分”成句子。
在 HTML 中,我有许多标签,例如 DIV、IMG、链接、粗体和斜体标签等。
这是我的实际做法:
- 获取 HTML 文本并通过 Python HTMLParser 传递它
- 如果打开标签是
<p>获取数据(使用handle_data函数) - “拆分”总共少于 5000 个字符的句子中的数据
- 翻译每个“少于 5000 个字符”的句子块并将它们加入一个大的翻译文本中
- 用翻译后的文本重构 HTML
这里的问题是我不知道如何重构 HTML,并识别<p> 中的<a>, <b>, <i>, <img> 等标签。
还有其他方法或解决方案吗?
如果你有示例代码,那就太好了,因为我不知道如何覆盖解析器的 handle 函数
提前致谢。
【问题讨论】:
-
遇到了类似的挑战:stackoverflow.com/a/66075042/1717535
标签: python html amazon-web-services translation