你刷到的推荐为什么这么懂你?藏在算法里的知识图谱

早上迷迷糊糊摸手机刷信息流,刚前一天跟朋友聊起想养只短毛猫,刷不到三条就出来蓝猫饲养的干货,连新手需要买什么猫砂都列好了。 你是不是后背一凉,以为手机在偷听? 说实话,我之前也这么想。直到跟做算法的朋友蹲在南京街头吃鸭血粉丝,聊起这事才明白——哪有那么多偷听,大部分时候,都是知识图谱在干活。

不是堆知识点,是一张连起来的关系网

很多人听到知识图谱,第一反应就是百科类平台那种,把一堆知识点整理成表格对吧? 不对。 你闭上眼睛想“蓝猫”两个字,你脑子里冒出来的不是一句干巴巴的定义,是英短、圆脸、掉毛少、性格粘人、适合上班族、要吃化毛膏……一串东西,每一个都跟“蓝猫”连在一起,甚至还能延伸到“化毛膏哪个牌子不踩雷”“家附近的宠物医院”。 这就是你的知识图谱。 放到计算机里,逻辑一模一样。每一个实体——不管是蓝猫,还是南京,还是鸭血粉丝——都是一个节点,节点之间用关系连起来,“蓝猫”是“猫”的一个品种,“蓝猫”的特点是“掉毛少”,“蓝猫”适合“上班族饲养”,一串线织成网,就成了计算机能用的知识图谱。
知识图谱实体节点关系示意图
知识图谱实体节点关系示意图
以前计算机存知识,都是存在一篇篇文档里,搜关键词只能找有没有这几个字,不知道字背后的关联关系。知识图谱把关系说清楚了,计算机也就能“懂”你到底在说什么,要找什么。

它悄悄改了我们用了十几年的搜索逻辑

十年前你搜“南京秋天适合去哪玩”,搜索引擎给你的是什么?是所有网页里同时出现“南京”“秋天”“适合”“去哪”这几个词的结果,排在前面的可能是十年前的旧攻略,甚至还有卖南京秋天旅游卡的广告。 你得自己翻十几页,把零散的信息拼起来,才能找到想去的地方。 现在呢?你输入同样的话,首页直接给你列出来几个景点,每个景点下面标着“秋天看梧桐”“秋天赏桂花”,连最佳游览时间都给你写上了。 为什么差别这么大? 因为知识图谱早就把这些关系连好了。它知道“南京”有“中山陵”这个景点,“中山陵”种了很多“梧桐树”,“梧桐树”秋天会变黄,“秋天”是游览中山陵的最佳季节。它不用找关键词硬匹配,直接把你要的关联结果挖出来给你。 我去年秋天去南京玩,搜“离中山陵近的糖水铺”,出来第一家就是陵园邮局旁边那家开了很多年的店,连老板冬天会提前关门都在关联信息里提了,准得离谱。
传统搜索引擎与知识图谱搜索结果对比图
传统搜索引擎与知识图谱搜索结果对比图
很多人说推荐算法偷听隐私,其实真不是大部分情况。你刚聊完养猫,你的行为标签已经打上“计划养猫”了,知识图谱把“计划养猫”跟“猫砂”“猫笼”“蓝猫”这些节点连起来,自然就给你推相关内容,准到让你觉得害怕而已。

别被吹得神乎其神,它的坑也不少

别被吹得神乎其神,它的坑也不少
别被吹得神乎其神,它的坑也不少
不过话说回来,现在很多科技公司把知识图谱吹得太厉害了,好像有了它就能解决所有信息问题。 其实踩坑的项目一抓一大把。 最大的误区就是,以为堆的节点越多,知识图谱就越好用。很多公司动不动说自己有上亿个实体节点,其实里面一堆错误关联。你搜“苹果”,它分不清楚你要找的是吃的苹果还是苹果公司的手机,把苹果种植技术跟手机测评堆在一起,搜出来一堆垃圾。 还有偏见问题。知识图谱的关系都是从现有数据里学来的,现有数据里有偏见,它就会把偏见放大。比如很多招聘类的知识图谱里,“程序员”“高管”这些节点,默认关联的都是“男性”,女程序员找工作,推荐结果里的优质岗位都比别人少,这就是天生带的毛病,改起来特别难。 还有,新出来的东西它永远慢半拍。比如今年突然火起来的某个新网红景点,刚出来半个月,知识图谱还没来得及给它连节点,你搜就搜不到,还得靠传统的关键词搜索。 说实话,知识图谱本质上就是模仿我们人怎么想事情,给计算机织了一张关系网而已。它没有那么玄乎,也不是什么改变世界的黑科技,就是一个帮计算机梳理信息的工具。 它藏在你刷的推荐流里,藏在你用的搜索引擎里,甚至藏在你点外卖的时候给你推的凑单商品里,悄悄帮你把杂乱的信息理清楚,而已。 你今天刷到的内容刚好是你想看的,不妨想想,说不定就是这张网,刚好猜对了你的心思。

作者|科技

排版|科技

审核|乐乐

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:你刷到的推荐为什么这么懂你?藏在算法里的知识图谱
文章链接:https://m.lfdjt.com/p/keji/a/6928.html