网站地图 - XML地图 - 设为首页 - 加入收藏
您的当前位置:主页 > 国内 > 正文

僵尸先生

火车头使用Post方法采集Ajax页面教程_我的网站

蜘蛛侠1

A |     

     阿里云优惠券 先领券再下单        前面有写过一篇瀑布流的采集方法,今天在添加一个POST方法来采集Ajax刷新页面的教程。    之前的文章请看:火车头采集动态加载Ajax数据(无分页瀑布流网站)    如果遇到POST方法来架子Ajax数据,这和我之前写的是两个类型,瀑布流是直接刷新出数据的页面。    采集网站分析    采集任何一个新站前我们都要对他进行一番分析才好下手。    列表页分析    这个网站的列表页,前面并不是通过Ajax加载的。    고(故) 장미란씨 실종 사건을 허위 종결한 혐의를 받는 제주서부경찰서 소속 부 경장이 25일 제주지방법원에서 구속 전 피의자 심문(영장실질심사)을 마친 뒤 이동하고 있다. /사진=뉴스1 고(故) 장미란씨 실종 사건 등을 허위 종결한 혐의를 받는 부 경장이 실종자와 연락한 적이 있다고 속인 탓에, 경찰이 통화기록을 찾는 데만 3주의 시간을 보낸 것으로 나타났다.26일 뉴스1에 따르면 경찰은 지난 5월15일 장미란씨에 대한 1차 실종 신고를 접수했고, 이어 7월19일 2차 실종 신고를 받았다.2차 신고가 접수됐을 때 부 경장은 "1차 신고 당시 장씨와 연락이 닿았다"고 주장했지만, 정작 통화한 기록은 확인되지 않았다. 부 경장이 휴대전화와 사무실 전화 등 어떤 방법으로 실종자와 연락했는지 확답을 내놓지 못했기 때문이다.이에 경찰은 부 경장의 거짓말을 의심하면서도 장씨 소재 파악이 우선이라고 판단, 실종자와의 통화 내역을 찾는 데 주력했다. 이후 3주 동안이나 통화기록을 찾지 못한 경찰은 지난 11일에야 부 경장을 직위해제하고, 지난 14일 직무유기 등 혐의로 입건했다.경찰 관계자는 "다른 방식으로 부 경장이 장씨와 통화했을 가능성을 염두에 두고, 근무환경에서 통화가 가능한 통수신 방법을 전부 확인했다"며 "그럼에도 통화 확인이 안 돼 허위 종결 가능성이 있다고 보고 수사를 의뢰한 것"이라고 밝혔다.장미란씨는 지난 5월12일 밤 10시15분쯤 제주시 한림읍에서 장기 투숙 중이던 숙소를 나간 뒤 연락이 끊겼다. 이후 사흘 뒤인 5월15일 오후 장씨의 남자친구가 경찰에 실종 신고했다.그러나 사건을 담당한 제주서부경찰서 소속 부 경장은 장씨와 실제로 연락하지 않았음에도, 신고자에게 "장씨와 연락이 닿았으나 위치를 알려주고 싶어 하지 않는다"고 거짓으로 설명한 뒤 신고 접수 약 2시간30분 만에 사건을 종결했다.부 경장은 경찰 내부 실종자 관리 시스템에서도 장씨 자료를 삭제하면서 해제 사유를 '교통사고 사망'으로 허위 입력한 것으로 파악됐다.장씨에 대한 수색은 가족이 지난달 19일 서울의 한 경찰서에 다시 신고하면서 재개됐다. 장씨는 실종 104일 만인 이달 24일 머물던 숙소에서 직선거리로 약 400m 떨어진 야자수 농장에서 숨진 채 발견됐다.부 경장은 또 다른 60대 남성의 실종 사건도 당사자 소재를 확인한 것처럼 허위로 종결한 혐의를 받고 있다. 이 남성 역시 실종 신고 51일 만에 숨진 채 발견됐다. 부 경장은 직무유기와 공전자기록 위작·행사, 위계에 의한 공무집행방해 등 혐의로 지난 25일 구속됐다.。

B | CTRL+U可以直接看到列表内容,通过浏览器也看不到相关请求地址。

C |     

    因为习惯原因,我直接看了下尾页列表页。然后顺手CTRL+U看看网站代码结构有没有大的变化。防止后期采集出错。结果就发现无法看到列表内容。

D | 浏览器可以看到一个通过post请求的地址。    

    这时候就意识到这网站列表页可能后面的应该全是通过Ajax加载的。    通过笨方法,手动访问页面看看Ajax加载大概是哪些。最后找到大概从2200页左右开始Ajax加载。

E |     那我们采集的时候,前面的列表页就可以使用普通方式去采集(速度更快)。    2200页开始到尾页就通过post请求Ajax页面数据。    抓包获取Post数据    这个Ajax地址我在浏览器看不到任何跟页码有关的数据。最后只能使用抓包工具看一下详细的请求内容了。    

    使用抓包工具Fiddler    Fiddler下载地址:OneDrive-Fiddler-Setup_v5.0.20204.45441.zip    安装设置完成后我们打开浏览器。重新访问一下采集页面,Fiddler会抓到很多请求地址。    查看分析Post数据    Ctrl+F 我们搜索那个Ajax地址    
火车头使用Post方法采集Ajax页面教程
    Fiddler会以黄色将搜索到的结果显示出来,我们点击一下他。    
火车头使用Post方法采集Ajax页面教程
    在Fiddler右侧会显示这个请求地址的相关详细信息。    
    信息顶部可以看到是post请求方法。    可以看到有我们请求的页码相关内容。    
    访问不同页码的页面,经过研究发现规律。    
    currentPageIndex的值和页码相关,值等于页码减一。

F | 我们访问6139页时,currentPageIndex值是6138。    这就找到了规律,我们打开火车头采集器。    火车头采集器配置分页设置    起始网址填入Ajax请求地址    

    点“高级模式”。

G |     

    点“分页设置”,http请求方式“post”。    
    把我们Fiddler抓包获取的内容填进去。

H |     

    将currentPageIndex值的内容替换成火车头采集器的“分页”标签。    
    下面填入页码。    页面地址是从2200到6140,上面我们分析得出post请求内容的currentPageIndex值是实际页码减一。所以这里面我们填2199到6139.    
    网址获取选项设置    为了筛选出我们需要的内容,我们设置一下网址获取选项。    打开浏览器F12开发工具,预览一下Ajax获取的内容。    
    可以看到链接的形式是    自考成考报名条件有哪些?    完整的链接地址是    https://域名/chengrenzikao/20200611152022.html    那我们就可以使用下面的规则提取地址。    
    我们测试一下网址采集。    测试网址采集    点击测试可能提示“post请求必须选择网页编码”我们在火车头其他设置中将编码选为“UTF8”即可。    
    可以看到已经正确获取到了链接。不放心可以复制链接实际访问一下看看是否正确。    
    注意事项    采集过程注意运行线程和请求间隔时间。教程在测试时因为开的线程较多,频率过高导致对方网站开启了防CC设置。拉黑了我一个服务器IP,此教程写完用了两台服务器。    我们实际采集可以只开1个线程,并设置合适的间隔时间,比如1000ms到1500ms左右。    本文来自2号站长网,转载请注明出处:https://www.zz2zz.com/331414.html
        
    

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!。

Current article:http://n4eu.sunaichitikouchua.bond/list_3g1t84c/g5l.html

Published on:14:55:21


注:凡本网注明来源非本站的作品,均转载自其它媒体,并不代表本网赞同其观点和对其真实性负责。
本站致力于帮助文章传播,希望能够建立合作关系。
若有任何不适的联系以下方式我们将会在24小时内删除。联系方式:
Copyright © 2018 我的网站 版权所有