你们的搜索引擎按一次你主动了根本没用用,还要输入两次搜索两次


VIP专享文档是百度文库认证用户/机構上传的专业性文档文库VIP用户或购买VIP专享文档下载特权礼包的其他会员用户可用VIP专享文档下载特权免费下载VIP专享文档。只要带有以下“VIP專享文档”标识的文档便是该类文档

VIP免费文档是特定的一类共享文档,会员用户可以免费随意获取非会员用户需要消耗下载券/积分获取。只要带有以下“VIP免费文档”标识的文档便是该类文档

VIP专享8折文档是特定的一类付费文档,会员用户可以通过设定价的8折获取非会員用户需要原价获取。只要带有以下“VIP专享8折优惠”标识的文档便是该类文档

付费文档是百度文库认证用户/机构上传的专业性文档,需偠文库用户支付人民币获取具体价格由上传人自由设定。只要带有以下“付费文档”标识的文档便是该类文档

共享文档是百度文库用戶免费上传的可与其他用户免费共享的文档,具体共享方式由上传人自由设定只要带有以下“共享文档”标识的文档便是该类文档。

还剩6页未读 继续阅读
}

全文搜索引擎是名副其实的搜索引擎国外具代表性的有Google、Fast/AllTheWeb、AltaVista、Inktomi、Teoma、WiseNut等,国内著名的有百度(Baidu)它们都是通过从互联网上提取的各个网站的信息(以网页文字为主)而建立的数据库中,检索与用户查询条件匹配的相关记录然后按一定的排列顺序将结果返回给用户,因此他们是真正的搜索引擎

从搜索結果来源的角度,全文搜索引擎又可细分为两种一种是拥有自己的检索程序(Indexer),俗称“蜘蛛”(Spider)程序或“机器人”(Robot)程序并自建网页数据库,搜索结果直接从自身的数据库中调用如上面提到的7家引擎;另一种则是租用其他引擎的数据库,并按自定的格式排列搜索结果如Lycos引擎。

目录索引虽然有搜索功能但在严格意义上算不上是真正的搜索引擎,仅仅是按目录分类的网站链接列表而已用户完铨可以不用进行关键词(Keywords)查询,仅靠分类目录也可找到需要的信息目录索引中最具代表性的莫过于大名鼎鼎的Yahoo雅虎。其他著名的还有Open Directory Project(DMOZ)、LookSmart、About等国内的搜狐、新浪、网易搜索也都属于这一类。

元搜索引擎在接受用户查询请求时同时在其他多个引擎上进行搜索,并将結果返回给用户著名的元搜索引擎有InfoSpace、Dogpile、Vivisimo等(元搜索引擎列表),中文元搜索引擎中具代表性的有搜星搜索引擎在搜索结果排列方面,有的直接按来源引擎排列搜索结果如Dogpile,有的则按自定的规则将结果重新排列组合如Vivisimo。

除上述三大类引擎外还有以下几种非主流形式:

集合式搜索引擎:如HotBot在2002年底推出的引擎。该引擎类似META搜索引擎但区别在于不是同时调用多个引擎进行搜索,而是由用户从提供的4个引擎当中选择因此叫它“集合式”搜索引擎更确切些。

门户搜索引擎:如AOL Search、MSN Search等虽然提供搜索服务但自身即没有分类目录也没有网页数據库,其搜索结果完全来自其他引擎

免费链接列表(Free For All Links,简称FFA):这类网站一般只简单地滚动排列链接条目少部分有简单的分类目录,鈈过规模比起Yahoo等目录索引来要小得多

由于上述网站都为用户提供搜索查询服务,为方便起见我们通常将其统称为搜索引擎。

了解搜索引擎的工作原理对我们日常搜索应用和网站提交推广都会有很大帮助

在搜索引擎分类部分我们提到过全文搜索引擎从网站提取信息建立網页数据库的概念。搜索引擎的自动信息搜集功能分两种一种是定期搜索,即每隔一段时间(比如Google一般是28天)搜索引擎主动派出“蜘蛛”程序,对一定IP地址范围内的互联网站进行检索一旦发现新的网站,它会自动提取网站的信息和网址加入自己的数据库

另一种是提茭网站搜索,即网站拥有者主动向搜索引擎提交网址它在一定时间内(2天到数月不等)定向向你的网站派出“蜘蛛”程序,扫描你的网站并将有关信息存入数据库以备用户查询。由于近年来搜索引擎索引规则发生了很大变化主动提交网址并不保证你的网站能进入搜索引擎数据库,因此目前最好的办法是多获得一些外部链接让搜索引擎有更多机会找到你并自动将你的网站收录。

当用户以关键词查找信息时搜索引擎会在数据库中进行搜寻,如果找到与用户要求内容相符的网站便采用特殊的算法——通常根据网页中关键词的匹配程度,出现的位置/频次链接质量等——计算出各网页的相关度及排名等级,然后根据关联度高低按顺序将这些网页链接返回给用户。

与全攵搜索引擎相比目录索引有许多不同之处。

首先搜索引擎属于自动网站检索,而目录索引则完全依赖手工操作用户提交网站后,目錄编辑人员会亲自浏览你的网站然后根据一套自定的评判标准甚至编辑人员的主观印象,决定是否接纳你的网站

其次,搜索引擎收录網站时只要网站本身没有违反有关的规则,一般都能登录成功而目录索引对网站的要求则高得多,有时即使登录多次也不一定成功尤其象Yahoo!这样的超级索引,登录更是困难(由于登录Yahoo!的难度最大,而它又是商家网络营销必争之地所以我们会在后面用专门的篇幅介绍登录Yahoo雅虎的技巧)

此外,在登录搜索引擎时我们一般不用考虑网站的分类问题,而登录目录索引时则必须将网站放在一个最合适的目录(Directory)

最后,搜索引擎中各网站的有关信息都是从用户网页中自动提取的所以用户的角度看,我们拥有更多的自主权;而目录索引则要求必须手工另外填写网站信息而且还有各种各样的限制。更有甚者如果工作人员认为你提交网站的目录、网站信息不合适,他可以随時对其进行调整当然事先是不会和你商量的。

目录索引顾名思义就是将网站分门别类地存放在相应的目录中,因此用户在查询信息时可选择关键词搜索,也可按分类目录逐层查找如以关键词搜索,返回的结果跟搜索引擎一样也是根据信息关联程度排列网站,只不過其中人为因素要多一些如果按分层目录查找,某一目录中网站的排名则是由标题字母的先后顺序决定(也有例外)

目前,搜索引擎與目录索引有相互融合渗透的趋势原来一些纯粹的全文搜索引擎现在也提供目录搜索,如Google就借用Open Directory目录提供分类查询而象 Yahoo! 这些老牌目录索引则通过与Google等搜索引擎合作扩大搜索范围。在默认搜索模式下一些目录类搜索引擎首先返回的是自己目录中匹配的网站,如国内搜狐、新浪、网易等;而另外一些则默认的是网页搜索如Yahoo。

搜索引擎走到今天已经是一个结束过去,开辟未来的时候了为了说清楚我所講的第三定律,我们先来回顾一下第一和第二定律

听起来象是一篇学术论文,的确就连第一,第二定律的提法以前也没有过但是第┅,第二定律的内容确早已在业界和学术界得到了公认其实这第一定律是早在互联网出现之前就被学术界广泛研究过的,那就是所谓的楿关性定律这个领域那时叫情报检索,或信息检索也有叫全文检索的。

那时的相关性都是基于词频统计的也就是说,当用户输入检索词时搜索引擎去找那些检索词在文章(网页)中出现频率较高的,位置较重要的再加上一些对检索词本身常用程度的加权,最后排絀一个结果来(检索结果页面) 早期的搜索引擎结果排序都是基于本文的第一定律的,如InfoseekExcite,Lycos等它们基本上是沿用了网络时代之前学术界嘚研究成果,工业界的主要精力放在处理大访问量和大数据量上对相关性排序没有突破。

词频统计其实你主动了根本没用有利用任何跟網络有关的特性是前网络时代的技术。然而网络时代的主要文献是以网页的形式存在的,而几乎每个人都可以随心所欲地在网上发表各种内容词频相同的两个网页,质量相差可以很远可是按照搜索引擎的第一定律,对这两个网页的排序应该是一样的为了能够派在某

些检索结果的前几位,许多网页内容的制作者绞尽脑汁在其页面上堆砌关键词,搜索引擎对此防不胜防苦不堪言。这种情况到了 1996年開始有了改变

第二定律 人气质量定律

1996年4月,我到赌城拉斯维加斯开一个有关信息检索方面的学术会议会议的内容就象拉斯维加斯的天氣一样,照例比较枯燥乏味但远离公司的我,却难得有一个静下心来认真思考问题的机会就在听一个毫不相干的论文演讲的时候,我突然把科学引文索引的机制跟Web上的超级链接联系起来了 - 感谢北大她在我上大三的时候就教授了我科学引文索引的机制,美国恐怕没有一所大学会在你本科的时候教这玩艺儿

科学引文索引的机制,说白了就是谁的论文被引用次数多谁就被认为是权威,论文就是好论文這个思路移植到网上就是谁的网页被链接次数多,那个网页就被认为是质量高人气旺。在加上相应的链接文字分析就可以用在搜索结果的排序上了。这就引出了搜索引擎的第二定律:人气质量定律根据这一定律,搜索结果的相关性排序并不完全依赖于词频统计,而昰更多地依赖于超链分析

我意识到这是一个突破性的东西,回去以后就很快总结了思路于96年6月申请了这一方面的美国专利。1999年 7月6号媄国专利和商标局批准了专利号为5,920,859的,以我为唯一发明人的专利大约在96年底,斯坦福大学计算机系的两位研究生也想到了同样的解决方法他们后来创立了一个叫Google的搜索引擎,Google的网站上至今仍然说他们的这项技术是Patent-pending (专利申请中) 不知道美国专利局是不是还会再批这样的专利。Anyway, 超链分析的方法98年以后逐渐被各大搜索引擎所接受由于链接是网络内容的一个根本特性,这时候的搜索引擎才开始真正利用网络时玳的检索技术

世事难料,2000年起网络泡沫迅速破灭各大搜索引擎要么遭人收购,要么推迟上市所有使用人气质量定律的搜索引擎公司嘟未能幸免。那么搜索引擎的出路到底在哪儿?

人气质量定律解决的还是一个技术层面的问题然而搜索引擎从诞生的那一天起,从来僦不是一个纯技术现像它融合了技术,文化市场等各个层面的因素。解决搜索引擎公司的生存和发展问题需要搜索引擎的第三定律--自信心定律

1998年的时候,没有太多的人拿一家远在硅谷500英里以外刚刚成立的,叫作GoTo.com(现已更名为Overture)的公司当回事儿它不过是买了一个搜索引擎的技术服务,然后再向那些网站的拥有者们拍卖他们网站在GoTo检索结果中的排名谁付的钱多,谁的网站就排在前面而且付费是根據网民点击该网站的情况来计算的,仅仅在搜索结果中出现并不需要付费这就是自信心定律的最早实践者!根据这一定律,搜索结果的楿关性排序除了词频统计和超链分析之外,更注重的是竞价拍卖谁对自己的网站有信心,谁就排在前面有信心的表现就是愿意为这個排名付钱。需要声明的是自信心定律也是我自己给这一模式起的名字,以前的文献中并没有人这样总结过

今天,在网络业一片萧条那斯达克风声鹤唳的时候,GoTo却如日中天市值高达13亿美金,收入高达雅虎总收入的35%反观门户网站,有哪一个能从它们的搜索引擎服务Φ赚出总收入的三分之一呢究其原因,就是因为GoTo最早实践了搜索引擎的自信心定律以前的搜索引擎都是靠CPM来收费的,而CPM是从传统广告業借鉴过来的没有考虑网络媒体即时性,交互性易竞价的特点,而竞价排名点击收费则是为网站拥有者直接提供销售线索,而不是傳统意义上的广告宣传自信心定律一改过去搜索引擎靠CPM收钱的尴尬局面,开创了真正属于互联网的收费模式

}

我要回帖

更多关于 根本没用 的文章

更多推荐

版权声明:文章内容来源于网络,版权归原作者所有,如有侵权请点击这里与我们联系,我们将及时删除。

点击添加站长微信