【发布时间】:2023-03-19 20:36:01
【问题描述】:
我想分享我对 WebElement 的 text 属性的观察。我有一个pdf链接:
文件名有三个空格,当我尝试获取标签 中包含的元素的 text 属性时,只收到来自额外空格的截断字符串:
“03057895_05-01-2015_platform express 阵列感应 sp gr hsts 中子密度 log.pdf”
找出这个问题对我来说非常关键,因为我使用文本来识别下载的文件名并监控文件的下载状态。
任何人以前遇到过类似的事情,或者可能知道为什么它会以这种方式工作?
【问题讨论】:
-
我不知道这在 Selenium 中是如何处理的,但是在 html 中一般不会保留空格,所以如果为您清理了未渲染的部分,我不会感到惊讶。 . .你能不能不使用链接中的href,因为它必须是正确的,而且我认为会更可靠
-
嗯...你没有明白我的意思。我的抱怨是 text 属性在这种情况下具有不可预测的行为。虽然这个额外的空格是 html 的问题,但我认为 selenium 应该返回实际结果,而不需要任何隐式操作。 --附言我没有使用 href,我正在尝试提取标签 的文本,因为下载后它将是一个文件名,因此这成为我的问题,导致 text 返回不存在的文件名
-
不,我想我没有误解。那是空白不重要且不一定保留的区域,尤其是在询问渲染器时
-
<a>标签之间的部分正是 selenium 正在“渲染”的部分,也是空白不可靠的区域。如果您想要实际名称,唯一安全的做法是获取a标记的href部分并对其进行处理。
标签: python html selenium dom selenium-webdriver