阅读排行

Python爬虫获取JSESSIONID登录网站

在使用Python对一些网站的数据进行采集时，经常会遇到需要登录的情况。这些情况下，使用FireFox等浏览器登录时，自带的调试器（快捷键F12）就可以看到登录的时候网页向服务器提交的信息，把这部分信息提取出来就可以利用Python 的 urllib2 库结合Cookie进行模拟登录然后采集数据，如以下代码：

#coding=utf-8
import urllib
import urllib2
import httplib
import cookielib
url = ‘http://www.xxx.net/‘
cookie = cookielib.CookieJar()
cj=urllib2.HTTPCookieProcessor(cookie)
#设置登录参数，使用浏览器的调试器等抓包工具得到
postdata=urllib.urlencode({‘JSESSIONID‘:‘1F616774D9548C1E8AF12A65B470B663‘, ‘username‘:‘admin‘,‘password‘:‘admin‘})
#生成请求
request=urllib2.Request(url, postdata)
#设置代理
request.set_proxy(‘xx.xx.xx.xx:xx‘,‘http‘)

#登录
opener=urllib2.build_opener(cj)
urllib2.install_opener(opener) 

html=opener.open(request)
print html.read()

#打开数据页面开始采集数据
s = urllib2.urlopen(‘http://www.xx.net‘).read()

可以留意到，提交的数据包含了一个JSESSIONID参数，百度一下就知道，通常Tomcat服务器生成一个新的会话的时候就会产生这个ID，并且包含在登录页面的HEAD里面，如下图：

某些服务器使用固定一个JSESSIONID就可以重复登录，但某些就不行，应该是服务器可以设置的。对于固定JSESSIONID可以登录的，上面的代码就可以应付了，但动态改变的就需要先获取本次会话的JSESSIONID，然后再提交登录：

#获取Tomcat服务器产生的JSESSIONID
request = urllib2.Request(url)
set_cookie = urllib2.urlopen(request).info()[‘Set-Cookie‘]
json_id = set_cookie.split(‘;‘)[0]#JSESSIONID=3037DCDF69A6454FC525E38C41E6B611
json_id = json_id.split(‘=‘)[-1]
print json_id

本文出自 “自由自我” 博客，请务必保留此出处http://hhuayuan.blog.51cto.com/1630327/1619513

文章来自：http://hhuayuan.blog.51cto.com/1630327/1619513