主楼是两篇长篇大论的技术陈述。
署名分别是:“Larryp” 和 “Sergeyb”。
拉里·佩奇和谢尔盖·布林。
这两个未来打造了谷歌帝国的斯坦福博士生,此刻正像两个苦哈哈的学术宅男一样,在论坛里向全世界求助。
帖子的内容很硬核。
他们在讨论怎么通过网页之间的互相链接,来判断一个网页的“重要性”。
这就是后来统治全球互联网的“pageRank”算法雏形。
但此时的拉里和谢尔盖,明显卡壳了。
Sergeyb在帖子里绝望地提问:
“如果存在一个网页群,它们内部互相疯狂链接,但完全不链接外部的任何网页。
这种‘蜘蛛陷阱(Spider trap)’会导致我们的权重计算陷入死循环,算法的收敛性被彻底破坏了。
谁有解决思路?”
下面跟了几十条回复。
全是一些高校学生的瞎猜,什么“限制链接层数”、“人工审核过滤”。
根本没答到点子上。
林哲看着屏幕,差点笑出声。
“就这啊?”
五十多岁、在未来硅谷看了三十年技术迭代的老妖怪林哲,看着这俩未来互联网大帝在这愁眉苦脸,感觉就像在看两个小学生做不出两位数的加减法。
“蜘蛛陷阱?”
“这玩意在2000年以后连大一的计算机考试都不考了。”
林哲把嘴里的饼干渣咽下去,然后活动了一下十指。
“让大爷来教教你们什么叫降维打击。”
手指飞舞,键盘被敲得劈啪作响。
林哲直接在回复框里开始输出。
没有任何铺垫,不打任何招呼,直接甩干货。
“关于你们的死循环问题,思路从一开始就太死板了。”
“不要把爬虫当成一台只会顺着线走的机器。”
“引入‘随机冲浪者模型(Random Surfer model)’。”
林哲面无表情地打字。
“假设一个无聊的网民在上网,他有85%的概率顺着网页上的链接点下去。
但是!
他有15%的概率会突然觉得没意思,直接在地址栏输入一个全新的网址,跳出当前的圈子。”
“给算法加一个阻尼系数(damping Factor),设为0.
85。”
“只要加上这15%的随机跳转概率,所谓的‘蜘蛛陷阱’就会瞬间被打破。
死循环永远无法形成,权重计算立刻就能收敛。”
本章未完,请翻下一页继续阅读.........