LLM 语义表征在搜索排序模型中的实践与演进
在大语言模型技术的推动下,搜索引擎正经历第三次范式跃迁:从早期基于关键词的文本匹配,到依赖行为统计的个性化搜索,再到如今具备复杂意图理解与认知决策能力的智能搜索。搜索排序作为连接用户需求与供给的核心环节,其技术演进直接影响着用户体验与商业转化。本文将聚焦服务零售搜索场景,深入探讨如何利用 LLM 语义表征弥补传统排序模型在语义理解层面的不足,并详细阐述从单点验证到体系构建再到跨场景复用的完整迭代路径。
概述
服务零售场景具有鲜明的特殊性:品类长尾分散、商品描述非结构化、用户 Query 意图复杂多样。传统精排模型高度依赖文本匹配特征,面对“宠物SPA+洗澡”与“萌宠清洁护理套餐”这类表面毫无文字重叠、实则语义高度相关的查询对时,往往力不从心。这种语义 Gap 在生活服务、休闲娱乐等垂类搜索中尤为突出。
第三阶段:跨场景迁移
在表征与排序模型的耦合方式上,团队对比了四种方案:底层拼接交叉统计特征(+7bp)、底层拼接 LLM 相似度+交叉统计特征(+18bp)、LLM 相似度放在输出塔前(+8bp)、PEPNet 门控注入(+25bp)。PEPNet 门控机制将语义相似度作为“门控信号”调制模型其他特征的权重——高语义匹配时放大相关特征贡献,低匹配时抑制。这种自适应调节比固定位置的拼接更灵活。实验还发现,语义特征(LLM 表征)与统计特征(交叉特征)叠加后产生了比预期更强的增益效应,两者从不同角度刻画了用户-商品匹配关系,形成互补。
Embedding 质量的天花板在负例质量,不在 Backbone
“行业共识”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
特征注入方式的演进
三期迭代沉淀了若干跨阶段的指导性经验。其一,中等参数量是当前阶段的最优平衡点,但随着推理优化技术的成熟,这一平衡点会上移;本质的认知是选择效果最优的模型而非最大的模型,并定期重新评估。其二,难负样本的质量直接决定了表征质量的上限——Embedding 质量的天花板在负例质量,不在 Backbone。其三,Embedding 场景的 Prompt 做减法比做加法有效。其四,表征迁移的核心风险不在模型,而在覆盖率。最后,语义特征和统计特征是互补的,而非替代的——前者从内容理解角度刻画匹配关系,后者从行为模式角度捕捉偏好。
核心洞察与经验沉淀
基于三期迭代积累的经验,后续有四个值得关注的方向:一是负例质量提升,采用 false-negative mask、focal-style 难度重加权等技术进一步优化;二是将连续 Embedding 量化成分层离散语义 ID(Semantic ID),打通语义表征和 ID 特征的壁垒;三是针对下挂场景专项重训表征模型;四是构建 Producer→Consumer 闭环,让排序信号回灌表征训练,进一步缩短离在线 Gap。
如有侵权,请联系删除。
