【发布时间】:2021-08-22 00:24:45
【问题描述】:
我正在寻找一种在 Google 的 BigQuery 中存储由 (T5) 等语言模型生成的嵌入的方法。
embedding 采用 Numpy 数组或张量的形式。
我找到了 3 种方法:
- TFRecord,将其写入 TFRecord 文件并存储到云存储中
- 将 numpy 数组转换为字符串并作为字符串列存储在表中
- 存储到模式为 REPEAT 的列中。 (不确定这样是否可以保留嵌入向量条目的顺序)
希望任何人都可以提出一些建议或其他方法。
非常感谢
【问题讨论】:
-
将其存储为字符串的序列化或 jsonized 值。
-
使用哪种方法来序列化数组? np.array2string() 或 np.tobytes() ?
标签: google-cloud-platform google-bigquery embedding huggingface-transformers