不想让页面进搜索结果,是页面里写排除标记还是文件里写排除规则

📅 2026-10-10 👁️ 0

先分清要挡的是哪一层:文件里的排除规则拦的是抓取,页面里的排除标记拦的是索引。想让页面不进搜索结果,用页面级排除标记,同时保证抓取方还能读到这个页面;只在 robots 文件里写一条禁止规则并不等于不会被收录,协议层面的公开文档就明确写过,被 robots 文件屏蔽的页面如果还有其他来源指向它,仍可能被收录。两者管的是两件事。

两者管的是两件不同的事

抓取控制决定「这个地址能不能被读到」,索引控制决定「读到的内容要不要出现在结果里」。robots 文件里的 Disallow 作用于前者:路径被屏蔽后,抓取方不会去请求这个地址。页面里的排除标记(常见的 noindex 一类写法)作用于后者:抓取方仍然请求并读取页面,从响应里的标记或响应头得知这篇不要进入索引。公开文档里那句「爬虫仍需要访问资源才能读取头部信息和元标签」说的就是这个依赖关系——排除标记要生效,页面必须可达。

只写文件排除规则为什么会漏

因为屏蔽抓取会让排除标记读不到。路径一旦在文件里被禁止,抓取方拿不到页面内容,也就看不到页面里写的排除意图;而这篇如果仍然被其他页面链接着,索引侧可以凭链接与已有的URL 信息保留一条记录,呈现为「无摘要」的那种结果。看起来像「明明屏蔽了还在」,实际是把抓取拦掉之后,索引层失去了判断依据。所以只在文件里写规则,效果是不可控的,而不是更强。

预览页和带参数地址该用哪一种

站内的草稿链接带预览参数才能访问,这类地址属于要挡索引的一类:它对外可读,但内容还没定稿,被收入索引就会出现旧版本或半成品页面。合理的分工是这样:预览与未发布内容用页面级排除标记,配合参数化地址不进站点地图;成批的后台目录、附件目录这类不需要被抓取的路径,用文件级规则挡抓取来省配额。站内的 robots 配置负责生成与维护文件层面的规则,而索引层面的意图要落在页面上。

配置顺序与验证方法

目的 用哪一种 前提条件 常见误用
单篇不要出现在结果里 页面级排除标记 该页面仍可被抓取读取 只在文件里禁止该路径
预览与带参数地址 页面级排除标记 参数地址不写进清单 当正式页一起推送
整个后台目录省配额 文件级排除规则 该目录无需要索引的内容 用它当不收录的手段
下线已收录内容 排除标记或返回正确状态码 等重新抓取生效 直接屏蔽抓取

顺序上先定页面级意图,再定文件级范围,避免后者把前者挡住。验证要等重新抓取,改完不会立刻在结果里变化;同时检查伪静态与站点地图这两处:清单里如果还带着这条地址,或者站内仍有链接指向它,索引侧就有继续保留它的理由。已下线的正式文档应从清单里移除,而不是留在里面靠排除标记互相抵消。

常见问题

问:加了排除标记但结果里还在,是没生效吗? 答:先看这条路径是否被文件规则屏蔽了抓取——读不到页面就读不到标记。其次看重新抓取是否发生过,索引层面的变化有延迟。

问:整站测试期怎么挡? 答:测试环境用访问控制或文件级规则都可以;一旦这个域名要正式对外,再逐项改成页面级意图,避免正式内容因为文件规则而读不到排除标记。

问:带参数的地址要逐个写规则吗? 答:不必。参数地址的处理原则是不进入清单、不给正式索引意图,比逐条写排除规则更省事,也更不容易漏。

相关文章

拦不拦 AI 抓取,是写在排除规则里还是另开一道口子

控制 AI 类抓取程序时,Robots 排除规则表达的是意图而不是强制:它按路径与程序标识下发,靠抓取方自觉遵守,管不到已经被外链带出的地址,也不是访问控制。需要强制时收口要落在服务端鉴权与路径不可公开读取上;防止内容被整段搬走另有干扰码与防采集这一层,三件事不要混成一层。

2026-10-09

模型说明文件里标注为可选的那一段,什么时候真的会被跳过

面向大模型的站点说明文件里,只有写站点名称的那一行是必需的,其余段落都允许省略;条目行由必需的链接加可选的冒号后说明组成。标注为可选的段落是给读取方在上下文不够长时让路的,被跳过时损失的是次要信息,不是主干入口,因此主干链接要放在非可选段落里,站内这份文件由内容模块自动生成并保持同步。

2026-10-09

子站和分站要不要各自放一份密钥文件,推送时归属怎么算

多站点做链接主动推送时,密钥文件证明的是主机归属而不是站点品牌:公开提交通道把每个子域视为独立主机,要求分别为每个子域创建和管理单独的密钥文件,放置位置是站点根目录或同一主机上可公开访问的文件夹。因此子站各放一份、按主机核对可访问性,共用一份会在归属校验这一步失败。

2026-10-09

主动推送一次能提交多少条地址,两个通道给的数为什么不一样

主动推送的单次条数上限在不同通道之间差别很大,原因是两个数回答的不是同一个问题:一条通道给的是单次请求能装多少条地址,另一条给的是每次提交操作的上限并叠加按账号浮动的每日额度。量纲不同就不能直接比大小。批量提交要按通道能力切批排队,而不是把整站地址一次塞进一个请求。

2026-10-09

安全版本发布后为什么会强制自动更新,而不是等管理员手动升级

官方对高危安全版本启用强制自动更新,是因为修复窗口不能指望每个站点的管理员同时在线:漏洞公开后,从补丁发布到被批量利用之间往往只剩很短的间隔,把节奏交给个人决策会让大量站点停在没有防护的版本上。强制更新解决的是覆盖面,不等于修复完成——升级前要留备份,升级后还要按公告轮换服务端密钥、修改管理员口令。

2026-10-09

打开网站返回 502,先查程序还是先查网关这一层

先看这个响应是谁发出的。502 表示作为网关或代理的服务器从上游收到了无效响应,也就是说请求走到了网关、网关试图转发了,问题出在网关到程序这一段;如果网关完全拿不到响应,返回的是 504 那一类。排查按三步:绕过网关直连源站端口,看网关的错误日志,看程序进程与端口监听。部署形态决定了这三步在哪台机器上做。

2026-10-10

接口被刷时,限速该配在网关层还是配在程序里

两层都要,但拦的不是同一件事。网关层限速按来源地址与请求速率工作,不看业务身份,能在请求进入程序之前把量压下来;程序层限速才知道调用方是谁、在做什么动作,可以按登录、评论、后台等接口分别设定。以 nginx 的限速模块为例,速率以每秒请求数表示,突发量默认是零,超限请求的返回码可以配置。先弄清被刷的是哪类接口,再决定配在哪一层。

2026-10-10

上传目录为什么要去掉脚本执行权限,在哪一层挡

因为上传目录里的文件内容来自访客,路径却是服务器可读可访问的位置。去掉脚本执行权限的意义是:即使有脚本文件被写进来,它也只会作为静态内容返回,不会被当作程序运行。这类限制更适合在 Web 服务器配置里按路径单独匹配来做,规则是前缀取最长、正则按出现顺序首个命中,因此要给上传目录写一条能稳定命中的配置。改完后核对备份,避免误伤正常附件访问。

2026-10-10