隐形蜘蛛劫持检测工具
获取实时URL作为Googlebot和常规浏览器,并比较每个返回的内容——标题、元描述、robots、规范链接、h1、结构化数据、hreflang、字数——以检测隐形蜘蛛劫持,无论是刻意的还是机器人检测或支付墙中间件的意外副作用。
输入
从服务器获取两次——一次作为Googlebot,一次作为常规桌面浏览器。
输出
| 严重性 | 字段 | 问题 |
|---|---|---|
| No data yet | ||
| 字段 | Googlebot | 浏览器 | 匹配 |
|---|---|---|---|
| No data yet | |||
使用指南
隐形蜘蛛劫持检测工具做什么
输入一个实时URL,此工具从服务器获取两次——一次使用谷歌真实的Googlebot用户代理,一次使用常规桌面浏览器用户代理——并比较每个版本返回的内容:标题标签、元描述、robots指令、规范URL、h1标题、schema.org结构化数据、hreflang标签和大约字数。隐形蜘蛛劫持是指决定页面排名的爬虫看到与真实访问者不同的内容——无论是刻意的黑帽SEO技巧还是机器人检测、支付墙或将Googlebot用户代理特殊处理的地理定位中间件的意外副作用。
如何使用
- 输入要检查的页面的完整URL。
- 单击比较Googlebot vs浏览器。页面从服务器获取两次(跨域HTML无法从浏览器读取,伪造爬虫的用户代理不是客户端JavaScript可以做的事情)。
- 查看隐形蜘蛛劫持风险问题表中需要修复的任何内容,以及Googlebot对比浏览器表中的完整并排比较。
标记的内容
- 标题、元robots、规范URL(错误)——这些直接控制排名对象和排名URL。此处的不匹配是最重要的差距类型,也是搜索引擎最可能因隐形蜘蛛劫持而惩罚的。
- 元描述、h1内容、结构化数据类型(警告)——这些形成页面的理解和显示方式,而不是是否排名。
- hreflang数、图像数、字数(信息/警告)——次要信号;大的字数差距(>15%)被标记为警告,因为它通常意味着内容正在选择性地从爬虫隐藏或显示给爬虫。
为什么会发生这种情况
大多数网站无论用户代理如何都提供字节相同的HTML,所以差距通常意味着"未发现隐形蜘蛛劫持风险"。此工具捕获的差距出现在进行UA嗅探的网站上:向匹配爬虫字符串的任何内容提供精简页面的机器人检测或广告欺诈层、向Googlebot显示完整文章以进行索引的支付墙同时将真实访问者通过关卡、或仅对非机器人流量运行的地理/区域设置重定向。所有三者对谷歌的读取方式相同:排名内容不是人们实际看到的内容。
范围
两个获取都读取原始HTML响应——任何一方都没有无头浏览器渲染,因此在初始HTML加载后两者之间不同的JavaScript注入内容不会显示在这里。对于不同的UA对——Googlebot智能手机vs桌面,以捕获移动优先索引平价差距——请参阅移动优先索引检查器。对于基于Accept-Language而不是用户代理的差异,请参阅区域设置隐形蜘蛛劫持检查器。
隐私
URL仅由我们的服务器获取以比较两个响应,未存储。对私有或本地网络地址的请求被阻止。
Use it from code
From 3 credits per callREST API
curl -X POST https://api.iotools.cloud/v1/tool/cloaking-checker \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"url": "https://example.com/"
}'Swap in your own key from your account. The tool's fields are the body — no wrapper.
Ask an AI agent
Use the IOTools `cloaking-checker` tool (Cloaking Checker) on this input:
YOUR_INPUT_HEREPaste this at any agent connected to the IOTools MCP server, then add your input.