很多企业官网看起来漂亮流畅,但右键"查看网页源代码"时,正文内容一行都找不到——这就是典型的前端JS异步渲染。用户无感,爬虫却看到的是空壳。
两种渲染方式的本质差异
服务端直出(SSR/静态化)是指服务器把包含完整正文的HTML直接返回;前端渲染(CSR)则只返回一个框架,正文靠浏览器执行JS后再向接口请求填充。前者源代码里能看到每一个字,后者源代码里只有一堆脚本标签。
为什么爬虫和大模型读不了异步页面
爬虫的执行能力有限
百度等搜索引擎对JS的执行支持有限且不稳定,大模型爬虫普遍只做轻量抓取、基本不执行JS。正文藏在接口后面,等于对它们关门。
抓取成本决定抓取深度
即便部分爬虫具备渲染能力,渲染一个页面的成本是纯HTML的数十倍。成本越高,抓取频次和深度越低,收录自然受影响。
企业官网的正确技术姿态
正文、标题、摘要、列表全部服务端直出;JS只承担主题切换等非内容交互;图片配齐alt文本;配合静态缓存把响应时间压到最低。这套姿态下,每一次爬虫访问都是低成本、高回报的完整读取。
判断自家官网是否达标有个一分钟自测法:打开文章页,右键查看源代码,搜索正文第一句话——搜得到,才算过了第一关。