文章目录
一、你的爬虫可能一次都没被拦,但数据已经不对了
做采集的人对”被反爬”有一套很成熟的条件反射:请求返回 403、跳出验证码、账号被风控、IP 进黑名单。看到这些信号,我们知道该换 IP、该降频、该补指纹。
但 2026 年 8 月发生的这件事,一个信号都没有。
请求照常返回 200,页面结构没变,标题和摘要都在,日志干干净净。唯一的变化是:你解析出来的那个链接,指向的不再是目标网站,而是一串你看不懂的谷歌中转地址。
这才是这次事件真正值得警惕的地方——它不阻止你抓取,它让你抓到的东西失去意义。
二、先把事实还原清楚
中文圈这几天的报道,基本都是同一篇稿子的转载,信息停留在”谷歌 8 月底上线了 goto 跳转”。这个说法不准确,而且漏掉了后续几天最关键的几条信息。完整的时间线是这样的:
2026 年 6 月下旬,已经有从业者在社交平台上发现,谷歌搜索结果的链接被改写成了一种带 goto 参数的形式,目标地址被编码藏在参数里。
7 月初,Search Engine Roundtable 首次公开报道了这一测试。此时它还只是小范围出现,多数人当作一次普通的 A/B 实验。
8 月 26 日,谷歌正式向媒体确认了这项措施。官方的表述相当克制:公司长期以来一直在部署技术手段应对不断演变的滥用行为,并会定期采取行动保护自身服务与用户。
8 月下旬至今,排名监测平台 Nozzle 的 Derek Perkins 观察到,这项变更在多个住宅 IP 服务商环境下的覆盖率已接近 100%。
这里有两个流传很广的说法需要纠正:
第一,这不是”突然上线”,而是测试了两个月后的全量推开。 把它当成一次突发事件,会误判它的性质——它是一次深思熟虑的基础设施调整,不是临时的封堵动作。
第二,”谷歌官方承认此举针对 AI 爬虫”是不成立的。 谷歌从头到尾没有点名任何对象,只说了”应对滥用”。”针对 AI 公司和第三方 SEO 工具”是行业根据技术效果做出的推断。这个推断很可能是对的,但推断和官方声明是两回事——把它写成既定事实,是很多中文报道这次犯的错。
三、技术上到底改了什么
改动本身一句话就能说清:从”链接里直接写目标地址”,改成”链接里写一个编码后的凭据,点击后由谷歌服务器把你转过去”。
以前,一个搜索结果的 HTML 里,href 就是目标网站的真实网址。抓取工具下载一次结果页,就能一次性拿到这一页所有结果的落地地址。一次请求,几十个链接。
现在,href 变成了 google.com/goto?url= 加一长串编码字符。真实地址仍然在这串字符里,但它使用的是 Protocol Buffers(Protobuf)——谷歌自研的一种二进制序列化格式,比 JSON 更紧凑、更快,但解码需要预先定义好的结构说明。换句话说,你没法像 base64 那样随手解开它,而谷歌又在持续调整这个结构的具体形态。
于是抓取工具只剩一条路:逐条跟随跳转,让谷歌自己告诉你每个链接通向哪里。
顺带说一句,这次影响的范围不止自然搜索结果。有服务商反馈,视频结果、新闻结果、AI 概览等多种结果类型都出现了同样的中转链接。如果你的采集只覆盖了自然结果就以为万事大吉,建议再查一遍其他入口。
四、算一笔账:为什么这次成本会失控
这是本文最想让你看到的部分,也是所有”反爬升级”类文章都跳过的部分。
Perkins 给出了一个非常直观的量化数字:解析一个五页的排名结果,需要 500 到 1000 次请求。
我们把它放进真实业务场景里:
假设你在做一个中等规模的关键词排名监控,1 万个关键词,每天跑一次,每个关键词看前五页。
- 改动之前:1 万关键词 × 5 页 = 5 万次请求。
- 改动之后:1 万关键词 × (500 至 1000)= 500 万至 1000 万次请求。
请求量放大了 100 到 200 倍。
这个数字带来的连锁反应,比数字本身更麻烦:
成本层面。 按流量计费的代理服务,账单会随请求数成比例上涨。原本一个月几百块能跑完的任务,现在可能要几万。
风控层面。 这是更致命的一环。一个 IP 在短时间内向谷歌发起几百次跳转请求,行为模式和真实用户相差十万八千里。换句话说,请求量的暴涨本身,就会把你送进风控。 你为了拿到数据而加大请求,加大请求又让你更快被拦,这是一个闭环。
时效层面。 每天的采集窗口是有限的。请求量翻两个数量级,意味着原来两小时跑完的任务现在要跑几天,数据的时效性直接归零。
有人会想到用 HEAD 请求——只要响应头、不要正文,成本能降到零头。这条路已经被注意到并被堵上了。最省钱的那条捷径,恰恰是被优先关掉的那条。
五、三种应对方式,两种是错的
面对这种情况,我见过三类反应:
错误一:加大并发,硬扛过去
最直觉、也最危险。请求量放大 100 倍的前提下继续提速,等于主动向风控系统申报自己是自动化程序。结果通常是几小时内 IP 大面积失效,然后陷入”封了就换、换了再封”的消耗战。
错误二:无脑升级 IP 池
“换个更好的住宅代理就行了”——这是行业里最常见的答案,也是每一篇代理服务商软文的结论。
但我必须说一句同行不太愿意说的实话:这次的问题,光靠代理 IP 解决不了。
原因很简单:goto 跳转不是 IP 层的对抗,是结构层的变更。 它不判断你的 IP 是住宅还是机房,不看你的 ASN,不检查你的地理位置。无论你用什么 IP 去抓,拿到的都是编码后的中转链接。IP 质量再高,也变不出解析逻辑。
分清楚这一点很重要。代理 IP 能解决的,是请求能不能发出去、发出去像不像真人、地域结果准不准确;它解决不了的,是你的解析逻辑本身已经失效。混淆这两件事,就会在错误的方向上持续投钱。
正解:重构采集架构,而不是加固单点
真正有效的思路是承认这是一次架构层面的变化,然后从三个方向同时调整:
第一,重新定义”必须采集”的边界。 请求成本涨了 100 倍之后,”什么都抓一遍”不再是可行策略。把关键词按商业价值分级,核心词保持每日监控,长尾词降到每周甚至每月,这一步通常能砍掉七成以上的请求量,且几乎不损失决策价值。
第二,把请求分布做得像真实流量。 请求量必然上升的前提下,唯一能做的是让这些请求在时间、地域、IP 之间尽可能自然地分散开。集中在一小时内从少数出口发出去的一百万次请求,和均匀分布在全天、来自大量真实住宅网络的一百万次请求,在风控系统眼里是完全不同的两件事。这一层,恰恰是高质量代理资源真正的价值所在——不是”突破”什么,而是让合理的请求以合理的方式被接受。
第三,把数据校验做成常规流程。 后面第二篇文章会专门讲这个。简单说:你需要一套机制,能在数据结构再次变化时第一时间告诉你,而不是等到三周后老板问”排名怎么掉了”。
六、一个绕不开的维度:合规
中文讨论里几乎没人提这一点,但它可能比技术问题更值得管理层关注。
2026 年 7 月 20 日,美国加州北区联邦法院驳回了谷歌针对搜索数据服务商 SerpApi 提起的 DMCA 诉讼。法院认为,对于不含受版权保护内容的搜索结果,谷歌的主张不成立。8 月 10 日,谷歌提交了修正起诉状,把论点收窄到了”许可内容”——即结果页中来自内容授权合作方的那部分素材。对方随即再次提出驳回申请,案子仍在进行中。
把这条线和技术变更放在一起看,图景就清楚了:谷歌在法庭和技术两条战线上同时推进对搜索结果访问权的控制。 技术措施是当下就生效的,法律边界是正在被重新划定的。
对企业意味着什么:
- “公开可见”不等于”可以随意商业化使用”,这个边界正在被具体化,且各国口径不同。
- 采集项目应当在立项阶段就明确数据用途、留存周期和使用范围,而不是等到收到律师函才开始梳理。
- 涉及核心业务的数据,官方 API 和商业授权数据源的性价比正在上升——不是因为它们变便宜了,而是因为自建采集的真实成本(请求成本 + 维护成本 + 合规风险)正在快速上涨。
七、结语:从”IP 对抗”到”资源效率”
如果要用一句话总结这次事件对行业的意义,我会这样说:
过去十年,采集的核心矛盾是”能不能拿到”;从现在开始,核心矛盾是”以什么代价拿到”。
在请求成本被放大两个数量级的环境下,衡量代理资源的标准也必须跟着变。“IP 池有多大”已经不是最重要的指标了,”每一次请求的成功率有多高”才是。 因为在新的成本结构下,一次失败的请求不只是浪费一次流量,它还会推高你被风控识别的概率,进而拖垮整批任务。
易路代理在这件事上的定位很明确:我们不承诺帮你”突破”任何平台的技术措施——那既不现实,也不是一家正规服务商该做的承诺。我们做的是把基础网络这一层做扎实,让你的每一次合规请求都尽可能被正常接受。如果你正在重新评估现有的采集架构,建议先用真实业务跑一轮再做决定。易路代理提供免费试用,你可以直接用自己的目标关键词、目标城市、目标站点做验证,而不是看参数表做判断——在请求成本已经被放大的今天,”这批 IP 在我的场景下成功率是多少”这个问题,只有实测能回答。
具体到产品:
- 动态住宅 IP(按流量计费):适合需要大量分散请求、避免轨迹集中的采集场景。请求量上涨之后,出口分散度的重要性远超以往。
- 动态手机 IP(按流量计费):来自移动网络,在移动端结果核验、移动端体验验证这类场景下更贴近真实用户环境。
- 静态住宅 IP(按条数计费):适合需要长期保持同一出口身份的任务,比如需要维持会话状态或长期绑定的监控项目。
资源覆盖全球大部分国家和地区,支持城市级定位——在需要核验”某个城市的用户看到的结果是什么样”的场景下,这一点是刚需。
最后提醒一句:如果你现在就想知道自己的监控数据有没有受影响,不用等下一次报表。我们整理了一份五步自查清单,十分钟就能跑完,可以直接判断你的数据是”真的变了”还是”只是看不见了”。
(本文所引用的时间节点与技术细节,均来自谷歌官方回应及 Search Engine Roundtable、Search Engine Land、Nozzle、SerpApi 等公开信息源。文中关于谷歌动机的分析属行业解读,谷歌官方并未就针对对象作出说明。)