这份资料解决的问题
M3同时支持稠密向量、词汇稀疏表示和多向量检索,不能把三者都称为同一种向量搜索。论文讨论不同语言、文档长度和检索任务如何协同训练。建设中文知识库时,可据此设计短查询长文档、跨语言查询、编号精确检索三套测试,再决定是否需要混合检索和重排。
原始研究资料
原文题名:M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation。
作者:Chen, Jianlv、Xiao, Shitao、Zhang, Peitian、Luo, Kun、Lian, Defu、Liu, Zheng。
原始发表入口:M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation。本页上方提供完整、未经删改的原始PDF,可在线阅读或直接下载。中文文字是独立导读,不冒充全文译文;实验设置、算法公式、消融结果和附录以完整PDF为准。
引用与许可
原始文献及本文引用请保留作者、题名、原发表机构与原文地址。原文采用CC BY 4.0许可,本地副本保留原有署名和出版信息。
来源:原作者 · arXiv。第三方内容版权归原作者或发布机构所有;本站仅在许可证或明确授权允许时提供本地原文。
- 原文语言
- EN
- 原文更新时间
- 2024-02-05
- 许可证
- CC BY 4.0
- 文件校验
- eb38e53565da260d…




