爬虫的钥匙:Codex 处理常规网站,掌握 F12 请求头到底够不够

10次阅读
没有评论

很多人把爬虫想得很玄。其实大多数常规网站,一条 F12 + 复制请求头,就够 Codex 帮你写出能跑的爬虫。但它只是一把”钥匙”,不是”万能钥匙”。这篇讲清基础套路和边界:什么时候 F12 请求头够用,什么时候必须上浏览器自动化。

「一、先搞清楚:爬虫到底在爬什么」

【爬虫的本质:替浏览器发请求】

爬虫干的事,说穿了就一句:替浏览器把”请求”发出去,再把”响应”接住。人话解释:请求就是浏览器向服务器要数据时说的话,响应就是服务器回的话。

大多数常规网站,数据并不是直接写在网页里的,而是由网页里的 JS 向接口要 JSON。人话解释:接口是服务器开的”数据窗口”,JSON 是网站传数据的”标准信封”,按固定格式装字段。

所以爬虫要做的,就是找到那个接口,模拟浏览器发请求,再把 JSON 拆开取字段。

【F12 在看什么:Network 与请求头】

F12 开发者工具的 Network(网络)面板,让你看到浏览器到底发了哪些请求、带了哪些头。

请求头(headers)是请求的”自我介绍”:我是谁(User-Agent)、我从哪来(Referer)、我接受什么格式(Accept)。服务器就靠它判断你是不是正常浏览器。

理解这一点,就理解了”F12 刷新请求头”为什么能当基础门槛——你只是把浏览器的”自我介绍”原样抄了一遍。

「二、Codex 写爬虫的标准套路」

【四步走】

第一步:F12 打开 Network,刷新页面,找到返回目标数据的接口(看 Preview 或响应体里有没有你要的字段)。

第二步:右键这个请求,复制为 cURL。人话解释:cURL 是浏览器能一键导出的”标准请求写法”,包含网址、请求头、Cookie 全套信息。

第三步:把 cURL 贴给 Codex,说清楚”把这段转成 Python requests 爬虫,解析出 X 字段”。

第四步:本地跑起来,把结果存成 CSV 或 JSON。整个链路,Codex 十分钟内能给你第一版。

这段在做什么:用 F12 复制来的请求头发一个 GET,把返回的 JSON 解析成列表:

import requests
url = "https://example.com/api/list"
headers = {
    "User-Agent": "Mozilla/5.0 ...",    # 你是谁
    "Referer": "https://example.com/",  # 你从哪来
}
data = requests.get(url, headers=headers).json()
print([item["title"] for item in data["list"]])

【为什么”F12 刷新请求头”就是基础门槛】

大多数常规网站(新闻、博客、公开数据页)没有强反爬,只要请求头像正常浏览器,服务器就放行。

这也是”掌握 F12 刷新请求头即可”这句话真正成立的场景:常规网站 = 不需要登录 + 返回纯 JSON + 没有签名参数。

「三、钥匙打不开的门」

【登录态:Cookie 会过期】

很多数据要登录才看得到。请求头里的 Cookie,人话解释:服务器发给你的”临时通行证”,登录后才发。

F12 能复制到 Cookie,但它有有效期;登录态一变,爬虫立刻失效,得重登再换。

【JS 渲染:响应里根本没有数据】

有些网站服务器只返回空壳 HTML,数据由浏览器里的 JS 现算现填。你翻遍 Network 也找不到目标接口。

这种场景请求头救不了你,只能让真实浏览器跑起来——Playwright/CDP 就是干这个的。人话解释:CDP 是 Chrome 给外部程序开的”遥控器”,能像真人一样点页面、等渲染、拿数据。

【签名参数:请求头凑不齐】

部分接口要求带上签名(sign)、时间戳、加密参数,服务器会校验”这个请求是不是正规客户端发的”。

少了签名,请求头再全也被拒。而破解签名通常要逆向 JS,成本直接上一个台阶。

【频率风控:不封你封谁】

就算请求头齐全,短时间高频请求也会触发风控:封 IP、弹验证码、限速。

这是”会不会写”之外的另一道门槛——技术上能爬到,业务上未必让你爬。

▸ 小贴士:小贴士:判断一个接口是否常规,最快看三点:要不要登录、要不要签名参数、返回是不是纯 JSON。三个都不占,F12 + 请求头基本够用。

所以答案是什么?

对”大多数常规网站”,答案是肯定的:掌握 F12 + 请求头,就是 Codex 写爬虫的基础办法,够用。

但这里有一个前提:一旦碰上登录态、JS 渲染、签名参数、频率风控这四样里的任何一样,光靠请求头就不够了,得升级到 Playwright/CDP 浏览器自动化,甚至分布式方案。

一句话总结:F12 + 请求头是 Codex 爬虫的”入门钥匙”,能打开大多数常规网站的门;打不开的门,说明它本来就不是常规网站。

写在最后

如果你接下来要用 Codex 写第一个爬虫,下一步建议:打开 F12 的 Network,挑一个返回 JSON 的接口,右键复制为 cURL,贴给 Codex 让它生成 requests 代码——先跑通最简单的,再谈复杂场景。

你踩过最坑的反爬是哪一种?评论区聊聊。

爬虫的钥匙:Codex 处理常规网站,掌握 F12 请求头到底够不够

Myclaw

一线技术开发兼数据分析从业者,专注技术实操与人文思考。关注数据工程、企业数字化转型和AI应用落地。


最新文章(5 篇)

正文完
 0
评论(没有评论)