baidu,google是怎么收集信息的??

来源:百度知道 编辑:UC知道 时间:2024/05/10 12:17:11
这么多的东西是怎么弄来的,真想不通。。
那它怎么知道有什么什么网站呢..

还有比如打出 一个字 搜索出一大堆东西..这又是咋弄的?

用蜘蛛程序,当搜索引擎发现了未收录的或有更新的网页时就向该URL派出蜘蛛程序,蜘蛛程序就找到该网页的所有链接并顺着链接往下找到子网页。一般新开的网站会向搜索引擎提交信息,让搜索引擎派蜘蛛程序来从而把网站录如数据库。也可以在别的网页发布自己网页的链接,提高被蜘蛛找的几率。

到他们的网站提交网站信息,或和别的已经审核过的网站做链接也可以!

网页是在很多网站中的,baidu,google,yahoo要做的只是将他们建立连接,方法如下
■ 全文搜索引擎
在搜索引擎分类部分我们提到过全文搜索引擎从网站提取信息建立网页数据库的概念。搜索引擎的自动信息搜集功能分两种。一种是定期搜索,即每隔一段时间(比如Google一般是28天),搜索引擎主动派出“蜘蛛”程序,对一定IP地址范围内的互联网站进行检索,一旦发现新的网站,它会自动提取网站的信息和网址加入自己的数据库。
另一种是提交网站搜索,即网站拥有者主动向搜索引擎提交网址,它在一定时间内(2天到数月不等)定向向你的网站派出“蜘蛛”程序,扫描你的网站并将有关信息存入数据库,以备用户查询。由于近年来搜索引擎索引规则发生了很大变化,主动提交网址并不保证你的网站能进入搜索引擎数据库,因此目前最好的办法是多获得一些外部链接,让搜索引擎有更多机会找到你并自动将你的网站收录。

当用户以关键词查找信息时,搜索引擎会在数据库中进行搜寻,如果找到与用户要求内容相符的网站,便采用特殊的算法——通常根据网页中关键词的匹配程度,出现的位置/频次,链接质量等——计算出各网页的相关度及排名等级,然后根据关联度高低,按顺序将这些网页链接返回给用户

■ 目录索引
与全文搜索引擎相比,目录索引有许多不同之处。

首先,搜索引擎属于自动网站检索,而目录索引则完全依赖手工操作。用户提交网站后,目录编辑人员会亲自浏览你的网站,然后根据一套自定的评判标准甚至编辑人员的主观印象,决定是否接纳你的网站。

其次,搜索引擎收录网站时,只要网站本身没有违反有关的规则,一般都能登录成功。而目录索引对网站的要求则高得多,有时即使登录多次也不一定成功。尤其象Yahoo!这样的超级索引,登录更是困难。(由于登录