less than 1 minute read

我们有 1 篇论文被 EMNLP 2026 Main Conference 录用!该工作提出了面向生成式检索语义 ID 的三元组级评价指标及相应优化目标,用于更准确地评价并提升码本质量。论文详细信息如下。


Beyond Codebook Uniformity: Triplet-Level Metrics and Triplet-Driven Semantic IDs for Generative Retrieval

Authors: Xiang Tan, Dongliang Liao, Junwu Du, Haijun Wu, Run He, Shuquan Man, Ziqian Zeng, Huiping Zhuang

摘要:

生成式检索通过语义 ID(SID)来表示物品,并由序列模型逐步生成对应的 SID,其中码本的质量直接影响最终的检索效果。然而,现有评价方法主要关注码本整体的编码分布,难以判断每个 SID 是否真正表达了对应物品的语义,以及能否区分相似物品。针对这一问题,该工作基于大规模用户行为数据构建查询中心的样本关系,并提出 Overlap 和 Pairwise Overlap Ranking(POR)两项指标,用于衡量 SID 之间的语义接近程度及其排序能力。在此基础上,进一步提出可微软重叠损失(DSOL),将这些评价指标直接用于码本优化。实验表明,该方法在电商检索和工业视频搜索任务上均能提升检索性能与 SID 的语义区分能力。

Paper: [待补充]


Updated: