纪录我们在网路上奔波的历程!
»新帖子
当我开始拥有一个关于“我”的 AI 模型
AI 是在帮我进化,还是在驯化我?
从调用模型到受控长期计算主体:AI ToC 产品演进的内在线
Chatbot 开始分配流量:消费互联网正在进入“意图入口”时代
AI 正在把人类的知识库变成“人工糖精”
AI 交互数据投影:从 Cursor 缓存到人机协作过程治理
从贴吧到 AI Agent:网络不是连接人,而是重新分割人
从变量赋值到概率约束:AI Native软件正在重写可靠性的来源
别再迷信 AI 经验模板:大模型应用真正缺的,是“条件可复现”
不要把 AI 做成“一个会很多事的人”
AI与人的决策偏差:从信息代理到信任代理
你看到的不是信息,而是你构建出来的意义
历史日志归档(日历)
loverty twitter
» 微信公众号
搜索公众号ID:hasiblog
搜索引擎的盲点
2005年4月25日
搜索引擎并不能索引整个互联网的网页,这是公认不讳的常识。通常不能索引部分
不可见网页
(
The invisible web
)。今天
Wendy Boswell
在blog中补充了如下类型的资源:局域网(Private networks, intranets);不能很好地索引带有Web Forms站点(如 ColdFusion or CGI );不能处理好需要登陆的站点(Password-protected)等;
我还要在补充两点就是,1 搜索引擎spider现在还不能很好处理多媒体文件的例如页面内容只有flash或者image的页面;2 还不能很好处理互联网上丰富的多文档资源,尽管目前主流的搜索引擎都只是对pdf,excel,mp3,doc,rtf,ppt等文档资源进行解析,而解析的质量也不是很好,对于xml,CAJ(CNKI数据格式),CHM等文档的解析和识别还没有起步。这里是我以前探讨关于《
信息发现与invisible web
》的post。
ps:
今天利用
asp wiki engine
搭建了一个搭建
搜索引擎百科
,欢迎有兴趣的人一
起来建设之
。
This Written at 2005-04-25 by loverty.
« 在线广告赚大钱
AOl也提供关键词广告 »
<< Home
© 2026 哈斯日志 · 静态托管于 Cloudflare Workers
💬 问我问题
AI助手
×
你好!我是哈斯日志的AI助手
我可以基于当前页面的内容回答你的问题。
有什么想了解的吗?
刚刚
发送