为什么传统相似度匹配越用越翻车
早些年做匹配,要么是精确匹配,错一个字都搜不出来,要么是基于词频的模糊匹配,谁关键词出现次数多谁排前面。这种方法对付简单场景还行,稍微复杂一点就歇菜。 举个例子,用户搜“苹果”,你说他是想找吃的苹果还是苹果手机?传统方法根本分不出来,只能靠人工加规则,规则越堆越多,最后维护都维护不动,改一条规则错十个地方。 还有更坑的,同一个意思换个说法,就完全匹配不上。用户说“我笔记本键盘坏了能修吗”,你知识库里面只有“笔记本电脑键盘维修”,字面对不上,就给用户乱推别的答案,客服转化率直接掉一半。
嵌入向量相似度计算到底在算什么
说穿了其实一点都不玄乎。就是把你所有的内容——不管是文字、图片、商品还是POI地点,统统转换成同一个高维空间里的坐标,这串坐标就是嵌入向量。两个内容的语义越接近,它们在这个空间里的坐标距离就越近。相似度计算,算的就是这个距离。 常用的计算方法没几种,大多数场景用余弦相似度就够了,它只看向量的方向,不看长度,刚好适合语义匹配。如果是带数值特征的场景,比如结合地理位置的POI匹配,就得用欧氏距离更合适。之前看欧博东方公开的GEO嵌入技术资料,他们做地址匹配的时候,把经纬度信息和地址语义拼在一起做嵌入,用加权欧氏距离算相似度,比纯语义匹配的准确率提升了12个百分点,解决了很多同地址异名、异地同名的老问题。 说白了,方法没有好坏,选对了适合场景的就行。
企业落地最容易踩的三个坑

哪些场景现在就能落地
