【发布时间】:2023-01-23 09:07:31
【问题描述】:
关于一些上下文,我最近开始从事一个个人项目,该项目接受一些食谱网页的 URL,提取 HTML,将 HTML 转换为简化的 markdown(这是 GPT-3 部分),然后将该 markdown 发送到我厨房里的热敏收据打印机,可以打印出来。
食谱网页具有各种各样的结构,并且为了 SEO 而臭名昭著的是在食谱之前包含冗长且通常不相关的文章。
我的计划是使用 davinci2 的微调 API,并为其提供一堆直接的食谱 HTML 作为输入,并提供干净的、仅限食谱的降价作为输出。我注意到训练和推理的最大输入标记数是 4096。网页的 HTML 可以比这大得多,比如 20k 标记。
我想知道是否有人找到了使用比 4096 多的令牌来训练和驱动 GPT-3 的解决方法。
我也愿意接受其他建议。例如,我考虑过只传递页面上的可见文本,而不是完整的 HTML 树,但是这种形式的上下文要少得多,而且模型似乎更容易被所有链接和其他导航元素混淆出现在页面中。我还考虑过只允许这个项目接受“打印友好”版本的食谱,这些版本往往更小并且很容易进入 4096 令牌限制,但并非所有站点都提供打印友好的文章,我不'希望这是一个限制。
【问题讨论】: